← 返回信息流
AI 资讯量子位·14 小时前

WAIC观察:AI在物理世界竞争白热化

原标题:逛了趟WAIC,我只想说,AI在物理世界都快卷疯了……

速览

WAIC(世界人工智能大会)上,AI在物理世界的应用展示竞争异常激烈,各大厂商纷纷推出落地产品。会议现场气氛热烈,参会者感叹AI技术正快速渗透到现实场景,物理世界成为AI竞争的新战场。这反映了AI从模型竞赛转向应用落地的趋势。

AI 深度解读

背景

2026年WAIC(世界人工智能大会)现场人潮涌动,热度堪比上海的盛夏天气。展会第三天依然一票难求,甚至有黄牛将票价炒到3000元。与去年大家更多讨论“AI还能做点啥”不同,今年一个极为显著的变化是:AI已经从屏幕里走了出来,开始向工厂、家庭、药房、穿戴设备等真实生产场景“疯狂流动”。具身智能、世界模型、AI Coding、Token经济、AI硬件等过去一年最火的技术概念,几乎全部被搬到了现场。在这一众展商中,京东以全新的姿态亮相——首次集体展示了JoyAI全系列大模型、具身数据采集与训练链路,以及以JoyInside为底座打造的京东AI Home,标志着物理AI从概念走向系统化落地。

核心内容

京东在WAIC上端出了一整套面向物理世界的JoyAI模型“全家桶”,覆盖语音、图像、视频、实时交互和具身智能,旨在打通从感知、理解、决策到执行的完整闭环。

视觉能力方面:京东此前开源的JoyAI-Image-Edit、JoyAI-Echo和JoyAI-VL-Interaction模型,分别对应了视觉能力向物理世界延伸的不同维度。JoyAI-Image-Edit实现了视角变换、空间漫游与几何一致性编辑,让AI从处理平面像素走向理解空间结构。JoyAI-Echo通过跨模态记忆维持长视频的一致性。JoyAI-VL-Interaction则将理解和响应压缩至毫秒级,可一边观察实时画面一边交互、调用Agent。今年WAIC上,京东还展示了多模态领域的最新研究成果——实时视频编辑模型JoyAI-Video-Edit,用户可自定义画面并在预览过程中实时修改,让视频生成具备更强的即时反馈与动态调整能力。

语音交互方面:京东亮相了语音生成基础模型JoyAI-Voice,并同步发布新的语音交互模型JoyAI-Talker。该模型能够识别用户的情绪与真实意图,根据不同人的表达习惯调整回应,同时具备低延迟交互和随时打断能力,使人与物理AI的交互从一次性下达指令变成持续沟通。

具身操控方面:京东的JoyAI-RA移动操控基础模型,通过统一训练框架让不同机器人与人类操作经验在同一套动作表达中完成对齐,再结合仿真训练和真实环境验证,持续修正模型在现实中的执行偏差,解决了从决策到行动的转换。

数据采集与训练:京东认为数据时长只能反映采集规模,真正决定训练价值的是动作、轨迹、任务结果和场景变化能否被准确记录和理解。目前京东已发动60万人参与数据采集,建设了全球最大具身数据采集中心,预计2年内采集1000万小时人类真实数据。围绕数据采集、仿真训练与真机验证,京东构建了全球首个覆盖采、存、标、训、评、仿、测的全链路具身数据基础设施。在WAIC上,京东开源了行业最大的人类第一视角数据集EgoLive,包含2000小时视频、65866个Episode,覆盖346项真实世界任务。使用第一视角数据和机器人数据后,任务准确率实现两位数的提升。现场,参观者戴上京东自研的超高清采集终端JoyEgoCam,在货架前完成一次真实作业,数据随后经过自动标注、质量优化和结构化处理,送入数字孪生环境中训练、评测,再部署到实体机器人上,完整展示了具身数据从采集到训练再到真机验证的闭环。

家庭场景落地:京东将自研JoyAI大模型的能力封装成给智能硬件使用的AI大脑——JoyInside。它更像连接模型与硬件的一层AI System,将JoyAI的感知、理解、记忆和交互能力接进具体设备,处理家庭场景中的语音识别、意图理解、长期记忆和多设备协同。京东科技AI创新业务附身智能负责人曾表示,在京东看来,家里的台灯、床垫、空调、机器人和AI玩具可以被看成一台拆散了的“积木式机器人”,每台设备负责一种感知或行动,JoyInside让它们逐渐理解家庭成员需求并相互配合。WAIC现场展示了搭载JoyInside的智能睡眠床垫,能持续捕捉睡眠体征并主动询问;JoyInside AI投影台灯则通过无屏漫反射投影与多模态扫题批改,识别纸面题目和书写内容,将模型生成的讲解与反馈直接投射到桌面,实现实时答疑和订正。目前接入JoyInside的智能硬件对话轮次平均提升超过120%,合作范围覆盖近200个家电家居、机器人和AI玩具品牌,预计今年将接入超过千万台终端设备。

关键要点

  • 京东在WAIC上首次集体亮相JoyAI全系列大模型,包括视觉、语音、实时交互、具身操控等方向,覆盖物理AI所需的能力。
  • 实时视频编辑模型JoyAI-Video-Edit是本次展示的多模态新成果,支持用户自定义画面并实时修改。
  • 语音交互模型JoyAI-Talker能识别情绪与意图,具备低延迟和打断能力,支持持续沟通。
  • 具身操控基础模型JoyAI-RA通过统一训练框架,实现机器人与人类操作经验的对齐,结合仿真与真机验证修正执行偏差。
  • 京东已发动60万人参与数据采集,建设全球最大具身数据采集中心,预计2年内采集1000万小时人类真实数据。
  • 京东构建了全球首个覆盖采、存、标、训、评、仿、测的全链路具身数据基础设施。
  • 在WAIC上开源了行业最大的人类第一视角数据集EgoLive(2000小时、65866个Episode、346项任务),使用第一视角数据后任务准确率提升两位数。
  • JoyInside是连接模型与硬件的AI System,将JoyAI能力接入智能设备,实现感知、理解、记忆和交互。
  • 已接入JoyInside的智能硬件对话轮次平均提升超过120%,合作覆盖近200个品牌,预计今年接入超千万台终端设备。
  • 京东将家庭设备视为“积木式机器人”,通过JoyInside实现多设备协同,台灯、床垫等传统设备升级为物理AI终端。

意义与影响

京东在WAIC上的展示,标志着物理AI从概念验证进入系统化落地阶段。对于一家从零售起家的厂商而言,物理世界从来都不抽象——货物流动、仓库运转、设备协同、用户需求本就是京东过去二十多年每天处理的问题。通过将模型、数据、基础设施、终端与业务场景贯通,京东形成了一套物理AI的持续循环运行机制:在真实环境中感知与行动,在执行过程中获得反馈,再将反馈沉淀为数据,推动模型进一步迭代。这一模式不仅降低了AI进入工厂、家庭等复杂场景的门槛,也为行业提供了可复用的数据采集、训练与部署范式。尤其是JoyInside作为开放平台,通过与近200个品牌合作,加速了物理AI在终端设备上的渗透,使AI从云端走向用户触手可及的现实世界。当AI的能力边界从数字内容的理解与生成,延伸到物理世界的环境感知、实时决策与具体执行,物理AI终于等来了它最理想的样子。

查看原文 →qbitai.com