第43章 一二十层楼那么高
第43章 一二十层楼那么高 (第2/2页)他把文件分块下载,然后打开查看,这才发现这些资料压根不能直接用于训练。
网页里充斥着导航栏,广告,版权声明,推荐链接之类的内容。
另外一篇文章可能被不同的网站转载几十上百次,标题只是稍作修改,内容几乎完全一致,百家号的泛滥导致去重工作是天量。
论坛帖子则有大量无意义的回复。
千禧年的回复,“我顶”、“沙发”、“路过”、“露珠好人”。
再加上中文文本本身的复杂度。
简体繁体异体字混杂,全角半角符号不统一,网页编码错误会把一段正常文字变成乱码。
火星文就不说了。
有些内容看上去是中文,实际上是机器翻译的语句,语法正确,表达方式却格外怪异。
种种问题堆叠在一起,赵元任找不到切入点。
这就好像已经被猫打乱的毛球,所有的线头混在一起,你压根找不到最初的那根线头。
晚上十点,马辽起身,“走?”
赵元任看了眼自己处理后的文本,数据量比上午减少了百分之四十,心想已经够了,但他很快打开公共仓库看了眼,顾彦平的已经清洗完了。
还写了一篇文档给他们看:“数据清洗第一天。”
他下意识道:“算了,马里奥,你先走吧,我再看看。”
“......别指望靠规则去判断内容质量,格式混乱的内容不一定就没有价值,格式标准的内容也可能全是垃圾。
以这篇内容为例,这是标准的垃圾内容...”
接下来是举例,一篇营销软文,前面在讲失眠危害,中间列几个毫无意义的常识,最后开始推销保健品。
“这种格式标准,如果按照我们过去的处理逻辑,那么规则一定会认为它质量很高,然而事实是,这就是垃圾。
因此我们需要专门训练一个分类模型,需要做数据标注。
分类模型,Boss已经写好了,大家可以看看,明天我们需要分出人手来做数据标注。”
赵元任把分类模型读完之后,惊讶于模型的优美简洁,更震惊于后续的工作。
要把全部语料抽样,然后再组织人工进行质量评分,要分成十档。
“走!”他看马辽还没有走,于是保存,关机,起身一气呵成。
“不得不说,老板的代码写的是真优美。”马辽摇头晃脑地吐槽道。
赵元任说:“你没看到这模型暗示的任务量吗?那是会死人的!
人工做数据标注,我们别的活都别干了,全来干这得了。”
“放心,不可能让你们干这活,大概率是找外包来干,把规则制定好。”
“那我就放心了。”
赵元任接着好奇问道:“不是,那你说BetaCode的数据清洗和数据处理是谁做的?那时候Boss应该找不起外包吧。”
马辽说:“未必就不是Boss自己做的,一个可用的代码模型,背后的数据采集、预处理和训练,至少光是从我们两个负责的板块来看,Boss的水平是真的高。”
“有多高?”
“大概一二十层楼那么高吧。”