从知识到行动:AI迈向具身智能时代,数据如何重塑智能未来?

   发布时间:2026-07-21 18:01 作者:李娜

在2026世界人工智能大会(WAIC)“语料筑基、智生时代”论坛上,人工智能领域的数据议题迎来全新视角。与会专家指出,随着技术演进,数据形态正从互联网文本向物理世界交互数据转型,高质量语料建设已从企业探索阶段迈向产业协同新阶段,成为支撑智能发展的关键基础设施。

国家数据局在论坛上披露的数据显示,截至今年6月,全国已建成12万个高质量数据集,总量突破1565PB,其中七个数据标注试点城市的标注规模超119PB,累计服务425个大模型研发。局长刘烈宏宣布,未来将通过六大行动构建人工智能数据供给体系,涵盖强基扩容、标注攻坚、提质增效等关键领域。这一战略布局标志着数据治理正式上升为国家层面的基础设施建设工程。

复旦大学副校长姜育刚通过技术演进史揭示数据需求变迁:早期AI依赖有限数据开展统计学习,互联网时代催生深度学习突破,大模型时代则需要海量多模态数据支撑。他特别强调,当AI开始与机器人结合进入物理世界,传统互联网数据已无法满足需求,真实环境中的操作数据、环境反馈数据成为新焦点。为此,他提出三层数据体系:顶层为机器人真机操作数据,中层是人类施教的结构化数据,底层则是互联网、仿真和合成数据。

针对具身智能的数据建设,姜育刚指出四大趋势:操作机构从简单夹爪向多指灵巧手演进,传感器数据增加触觉和力觉维度,采集视角转向机器人第一视角,同时重视人类介入数据和失败案例。这些变化预示着数据采集将从被动收集转向主动设计,需要构建包含失败经验的完整训练闭环。

上海人工智能实验室领军科学家乔宇用“冰山模型”阐释数据核心地位:模型和算力决定智能发展速度,而数据决定智能上限。他警示,互联网高质量文本数据即将耗尽,未来竞争将聚焦高知识密度、强交互性的长程数据。实验室研发的MinerU文档解析引擎已能将复杂科学文献转化为AI可用数据,其开源版本在GitHub获得超7万星标,并与国产算力平台完成适配。

乔宇提出的“数据进化”理念引发关注。他主张建立可验证、可筛选的数据体系,通过模型与数据的飞轮效应实现持续迭代。实验室建设的OpenDataLab平台已汇聚180TB开源数据,覆盖40余种模态,为金融、医疗等领域提供支撑。这种动态进化机制,或将破解AI数据枯竭的终极难题。

产业层面的变革同样深刻。上海库帕思科技董事长山栋明观察到,企业竞争焦点正从流量转向数据资产。他预测,随着Agent成为主要交互载体,企业数字化架构将转向“厚底座、薄应用”模式,以算法、算力和数据构建统一底座,快速生成面向不同场景的智能体。这种转变将重塑商业估值体系,数据质量将成为决定企业竞争力的核心指标。

论坛发布的系列成果印证了产业协同趋势:语料数据标准体系、科学数据服务倡议、跨领域语料征集机制等举措,正在构建覆盖标准制定、平台建设、生态培育的完整链条。从互联网语料到科学数据,从数字空间到物理世界,数据要素正突破传统边界,成为推动人工智能迈向新阶段的核心驱动力。

 
 
更多>同类内容
全站最新
热门内容
本栏最新