9月15日下午,在济南召开的2026年国家网络安全宣传周人工智能安全治理分论坛上,中文互联网基础语料4.0正式向社会发布。这批数据集规模达到120GB,并在“中文互联网语料资源平台”同步上线,旨在为大模型训练和人工智能发展提供可信数据支撑。

多方共建的可信语料
中文互联网基础语料4.0是在中央网信办指导下,由中国网络空间安全协会联合国家互联网应急中心,会同百度、中科闻歌、开普云、拓尔思、科大讯飞、知乎等单位共同完成。项目组依托网安协会人工智能安全治理专委会建立的语料共建共享机制,在前期1.0、2.0、3.0版本基础上汇聚了一批新的高质量可信数据,并经过一系列严格细致的数据加工处理措施后形成公开发布版本。
获取路径并不复杂:用户登录中国网络空间安全协会官网,点击“中文互联网语料资源平台”链接,通过注册、认证等程序,即可下载或联系获取相关数据。协会负责人表示,中文互联网基础语料4.0是社会各界协同共建高质量中文语料的重要阶段性成果,进一步丰富了国内高质量中文语料供给体系。下一步,协会将继续联合国家互联网应急中心等单位,联动各行业领域深化中文互联网基础语料建设,持续为人工智能产业高质量发展筑牢数据底座。
从2.0到4.0,改的是“可信”二字
这不是第一次发布。中文互联网基础语料2.0于2025年1月发布,规模120GB、数据3800万条;3.0于2025年9月在同主题分论坛上发布,数据量仍为120GB,主要变化是扩大优质中文网站信源范围、加强违法不良信息过滤。此次4.0据公开报道数据量依旧为120GB——从2.0到4.0,GB数基本画了一条横线,真正升级写在别处。
据官方表述,语料加工有一套固定工序:信源筛选、内容过滤、数据去重,自3.0起又强化了违法不良信息过滤。对大模型团队而言,这套工序对应三件现实的事:来源可溯、内容合规、版权风险可控。企业采买语料要过法务审查,一份需注册认证才能下载、有机构背书的语料,替买家省掉了最麻烦的一段尽调。
稀缺的不是数据量,是“干净可商用”
中文语料的价值,更体现在结构性缺口上。中国工程院院士高文曾在2024年给出一个数字:全球通用大模型训练集中,中文语料占比仅1.3%。相关论文估算,英文文本数据规模约为中文的8倍,且公开渠道批量获取高质量中文语料的难度不小。另一面,国内多数大模型训练数据里中文占比已超过六成——中文数据并不少,真正稀少的是干净、可商用、来路清楚的那部分。
当预训练逐渐逼近数据极限,竞争正从堆量转向清洗、配比与来源合规。中文互联网基础语料这一版本序列所做的,是把公共语料供给的底线一版一版往上抬。对于需要合规语料的团队来说,这份经过机构背书、注册认证才能获取的语料,价值正在于“可信”二字。

