王桂荣在第八届数字中国建设峰会高质量数据集合数据标注主题交流活动上的发言
发布时间:2026-08-19 15:32 文章来源:峰会组委会秘书处

建设高质量数据集促进人工智能产业发展

中国电子信息产业集团有限公司党组成员、副总经理

王桂荣

尊敬的各位领导、各位专家,下午好!非常荣幸能代表中国电子在此进行交流,主题是高质量数据集的建设。今天,我想与大家探讨的核心问题是:在人工智能时代,数据如何发挥其作用。

请看我旁边的表格,它列出了原生的基础大模型和基于医疗行业定制的适应性大模型。我今天想重点讨论的,正是关于行业大模型的问题。在座的各位专家可能都有所体会,无论是国务院总理还是企业总经理,甚至是CFO,都对人工智能的发展感到迫切。然而,企业投资数千万开发了十几个大模型后,发现它们的效果并不理想,有的模型有效,有的则不然。

根据我个人的实践以及我们观察到的客户实践,行业大模型训练出的结果,相较于基础大模型,性能提升可能仅在5%到8%之间。很少有企业能够训练出比基础模型高出10个百分点以上的行业大模型。

那么,为什么会是这样的结果呢?关键在于投入。今天我想重点分享的观点,实际上体现在我右边的两张图中。过去,大家在AI领域的投入主要集中在算力上,基础大模型和中间件也有所投入,但投入到数据上的资金却相对有限。原因在于,企业未能真正挖掘出自身有价值的数据。而未能挖掘的原因,是多方面的。

过去,许多企业在信息化、数字化项目上投入巨资,例如花费1000万建设,其中800万用于硬件,这样的数字化建设几乎注定失败。当前,如果想成功实施行业大模型,数据投入至关重要。据DeepSeek的回答,数据投入应达到60%,豆包也给出了相似的见解。我咨询了一些专家,他们认为未来五年,每年在数据上的投入应增加10个百分点。

在核心观点阐述完毕后,我们目前面临许多问题,包括规模、质量、成本和周期等。高质量数据集的构建并非易事。许多人提出要建设高质量数据集,但具体应该是什么样子呢?原始数据大家可能都见过,但高质量数据集、问答对应该是什么样子呢?我这里展示了一个列表,相信很多人已经有所了解。有了这些数据集,我们要做的就是将左边的原始数据转化为右边的高质量数据集,这需要分几步完成呢?就像把大象放进冰箱一样,我们业界普遍认为需要经过三个步骤:加工、标注和评测,最后是管理和入库。

今天,我重点汇报的是第二步和第三步。在此过程中,我们还讨论了一个重要观点。正如夏局长所言,现在标注产业正从劳动密集型向知识密集型转变。我国有8个基地,这些基地位于一些发展水平不是很高的地区,原本是想利用劳动密集的优势,但现在看来,知识密集和劳动密集需要相结合。我展示的片子重点强调的是,针对复杂任务,人和机器需要结合,而简单任务则可以依赖机器完成。基于这一理念,去年,前蚂蚁金服的副总裁加入中国电子后,我们在高质量数据集的能力建设上取得了显著进展。这位同事带领团队实现了三个“一”:一套工具、一批数据、一套指标,使得数据标注更快、规模更大、质量更高。

一套工具,包括智能标注,正如夏局长所讲,将复杂任务分解为多个简单的标注任务,简单任务由机器完成,更复杂一些的任务则需要人工参与。

第二个是数据合成,现在数据资源消耗殆尽,需要数据合成,数据合成是工具集中非常关键的一个环节。第三个是自动化评测,问答对的结果需要评测,消耗一个结果,但自动化评测不能完全依赖人工,因此自动化评测也非常重要。过去,评测是由许多研究所,如信通院,来颁发证书,而现在的人工智能时代的评测是与生产流程紧密结合的。

举个例子,虽然我们可能不知道什么是正确的,但一定知道什么是错误的。违反重力学定理的,违反基本常识的,这些都是错误的。比如,吃了头孢类药物后不能饮酒,喝了酒不能开车,这些常识是可以固化在所有评测中的。

我们还构建了一批数据集,中国电子也构建了自己的数据集,这些数据集是合成的,并且拥有自主知识产权。过去,我们对数据产权有所顾虑,但现在合成的数据集也是有产权的。

我们还建立了一套指标体系。我们参与了国家标准的制定,牵头了许多行业标准的制定,基于这些标准,我们形成了自身86个评测指标,这些指标能够服务于动态数据质量的构建。

最后,在客户的指导下,我们进行了一些实践,包括文本数据、结构化数据、多模态数据的实践,并取得了一些成果。我们希望未来能通过五种方式服务于客户,推动人工智能产业和数据集的高质量发展,谢谢大家!

(以上内容根据嘉宾发言速记整理)

扫一扫在手机上查看当前页面