中文互联网基础语料4.0发布,数据量120GB
「中文互联网基础语料4.0正式发布,数据量达120GB,并已在中文互联网语料资源平台上线。该语料由协会联合国家互联网应急中心及百度、科大讯飞、知乎等单位共建,经严格数据加工处理形成,用户注册认证后可下载或联系获取,为大模型训练提供可信数据支撑。」
中文互联网基础语料4.0正式向社会发布,数据量为120GB,并同步在“中文互联网语料资源平台”上线。这意味着国内高质量中文语料供给体系中又新增了一批可直接用于大模型训练的公开资源。
从获取方式看,用户可登录中国网络空间安全协会官网,点击“中文互联网语料资源平台”链接,通过注册、认证等程序后,即可下载相关数据或联系获取。对于需要构建中文训练集、微调数据集的研究团队与开发者而言,这一流程提供了相对明确的入口。
据公开信息,这批语料由中国网络空间安全协会联合国家互联网应急中心,会同百度、中科闻歌、开普云、拓尔思、科大讯飞、知乎等单位共同建设。相关工作建立在中文互联网基础语料1.0、2.0和3.0的前期发布基础之上,依托协会人工智能安全治理专委会建立的语料共建共享机制,汇聚了一批新的高质量可信数据,并经过一系列严格细致的数据加工处理措施,最终形成4.0版本。
与单一机构自行采集的语料相比,这种多方协同、分版本迭代的建设路径有其现实意义。一方面,参与方覆盖搜索、媒体内容、知识服务、语音与自然语言处理等多个领域,语料来源相对多元;另一方面,共建共享机制使得数据在进入训练流程之前,能够经历较为系统的加工与质量把关,从而在文本规范性、内容可信度等维度上具备更好的可用性。对于模型预训练、领域微调以及中文评测集构建等场景,120GB的体量也提供了较为充足的基础素材。
网安协会负责人表示,中文互联网基础语料4.0是社会各界协同共建高质量中文语料的重要阶段性成果,进一步丰富了国内高质量中文语料供给体系。下一步,协会将继续联合国家互联网应急中心等单位,联动各行业领域深化中文互联网基础语料建设,持续为人工智能产业高质量发展筑牢数据底座。从版本演进节奏看,基础语料的持续更新有望形成长效机制,为后续更大规模、更多领域的模型训练提供稳定支撑。
来源:Heooo AI工具导航