在近期举办的WAIC京东论坛上,一场关于人工智能从数字领域向物理世界拓展的深度探讨引发行业关注。这场以“AI进入物理世界:模型、数据、终端与场景”为主题的论坛,聚焦具身智能、智能终端与真实场景的融合,揭示了人工智能技术从感知生成迈向决策行动的演进路径。京东集团副总裁段楠在演讲中指出,互联网数据作为数字世界的载体,难以支撑模型理解物理世界的复杂交互逻辑,人工智能要实现更高水平的通用性,必须突破数字边界,构建物理世界的学习能力。
段楠提出,物理AI的发展需要重新定义传统数字AI的Scaling Law(规模法则)。在数据维度上,模型不仅要处理海量文本图像,更要从真实世界中学习三维空间结构、物理属性及运动规律;在学习机制上,需通过持续交互获得动态反馈,形成适应环境变化的进化能力;在模型架构上,需突破空间重建、物理建模等基础能力,实现跨硬件、跨任务、跨场景的泛化应用。他特别强调,硬件协同的规模化是物理AI落地的关键,从数据采集、模型训练到终端部署,都需要硬件层面的系统性支持。
京东探索研究院将技术演进划分为三个阶段:数字智能阶段以语言、代码和多模态模型为基础,实现数字内容的自主处理;附身智能阶段通过可穿戴设备、智能座舱等终端,构建人与设备、设备间的实时交互网络;物理智能阶段则将模型部署至机器人等硬件,赋予其环境感知、状态预测和行动决策能力。目前研究院已形成覆盖图像、视频、语音和具身智能的模型矩阵,各模型通过能力互补构建起完整的物理世界认知体系。
在具体技术突破方面,京东今年4月开源的JoyAI-Image-Edit模型通过整合图像空间理解与编辑功能,在评测中展现出超越闭源模型的性能,验证了“生成辅助理解”的技术范式。6月推出的JoyAI-Echo长视频生成模型支持分钟级音视频联合生成,在内容一致性、多模态记忆等方向取得创新;同期开源的JoyAI-VL-Interaction实时交互模型,实现了对视频流的持续感知与动态响应,推动多模态模型从单次输入处理向环境持续感知升级。
论坛首次披露的JoyAI-Video-Edit实时视频编辑模型,可实现超过30帧/秒的流式视频处理,其技术不仅为视频生成领域开辟新方向,更为附身智能的全模态交互和具身智能的数据合成提供底层支持。另一款语音交互模型JoyAI-Talker采用原生预训练架构,支持低延迟的语义级交互,并能精细控制情绪、语气等表达特征,为智能设备赋予更自然的共情能力。段楠透露,高共情语音交互将成为研究院持续迭代的重点方向。
在数据与仿真层面,京东4月开源的EgoLive具身智能数据集覆盖仓储、家庭等300余种操作任务,已收到全球数百家机构的数据申请。基于该数据集训练的JoyAI-RA操作模型,验证了数据规模扩大与模型能力提升的正相关关系。同步推出的JoyAI-Sim仿真架构,通过人类操作数据与机器人数据的双向转换,有效缓解了真实操作数据获取难题,为虚实协同训练提供了基础设施。
据介绍,京东正依托零售、物流等多元业务场景,构建面向产业需求的评测数据集与平台,计划下半年发布覆盖真实任务的评测体系。该平台将通过数据、模型、仿真与真实任务的闭环验证,推动技术价值在产业场景中的落地转化。段楠透露,研究院将于今年9月至10月推出新一代物理基础模型,并在数据规模化、评测平台建设等领域持续突破,加速人工智能从数字世界向物理世界的范式迁移。















