当AI学会“不说话”丨唐探

2026-09-10 17:07:18来源:四川在线编辑:卢丽嘉

四川在线记者 唐泽文 发自北京

9月9日,京东全球科技探索者大会在北京举行。

我自己都没想到,整个探索者大会上,最让我印象深刻的,是一副看上去并不起眼的AI眼镜。

戴上它之后,视力障碍的人走到十字路口,眼镜不会等他开口问“前面有车吗”,而是在一辆车靠近时,就会说:“注意,左后方有电动车正在接近。”

而不需要提示的时候,它并不会一直“聒噪”。

这副眼镜接入的,是京东今年6月开源的JoyAI-VL-Interaction全模态交互模型。真正让我记住它的,不是它“看见了什么”,而是它“学会了什么时候不开口”。

它解决了一个此前几乎没人认真对待的问题——AI不能一直说话。

今天的多模态大模型,大多遵循一种逻辑:用户提问,模型回答。你问,它答。

这种“回合制”交互在写文案、查资料时够用,但真实世界不是一张静态截图。它一直在变化,而且变化发生时,人未必有空开口。更麻烦的是,如果一个AI时时刻刻都在主动说话:提醒你左后方有车、右前方有台阶、头顶有树枝——它不会显得更智能,只会更烦。

JoyAI-VL-Interaction把“沉默”设计成了一个需要学习的动作。每秒都在做判断:继续观察,保持沉默,还是主动回应。遇到复杂任务,交给后台Agent处理,自己继续盯着眼前。这套“前台实时助手+后台智能大脑”的协作机制,让AI从“你问我才答”的客服,变成了一位懂时机的同伴。

这事儿听起来很小。但可能是人机交互的一次重要转向——AI不再只是等人提问的工具,而开始学习如何“在场”。

图灵奖得主杨立昆将世界模型定义为“能预测行动后果的内部模拟器”。斯坦福的李飞飞则将其视作实现空间智能的核心路径。2026年被很多人称作“世界模型元年”——从语言大模型的爆发到物理世界智能的探索,AI正在完成从“理解数字信息”到“推演物理规律”的跨越。

就在这次大会上,京东还发布了实时可交互世界模型JoyAI-EchoWM。它既能根据用户移动和视角变化持续生成世界,也能同步生成720P视频、环境音、音乐和语音。在交互式世界模型评测WBenchNavigation中,它以81.6分排名第一。

京东技术矩阵布局很有意思。算力方面,京东云已与合作伙伴规划建设国产十万卡智算集群。数据方面,1000万小时具身智能数据采集行动正在推进中。模型方面,已形成覆盖多模态模型、世界模型和具身模型的JoyAI基础模型矩阵。京东集团技术委员会主席曹鹏在大会上说:“京东的AI不是在论文里诞生的,是在生产线、仓库、配送站,一单一单磨出来的。”

这话有几分道理。京东的AI确实有一个大多数公司没有的东西——一个每天都在运转的物理世界供应链。场景产生数据,数据训练模型,模型驱动终端,任务反馈再推动AI进化。

就在大会前不久,李飞飞创办的WorldLabs发布了全球首个多模态世界模型——Atlas。

Atlas最核心的能力,是把文字、图像、视频和3D信息放进统一的空间上下文。只需一张或几张图片,它就能重建三维场景、生成新的观察视角,并让相机沿指定轨迹在其中移动,同时保持空间结构的一致性。与主要生成二维画面的传统视频模型不同,Atlas将文本、图像、视频、相机位姿和三维深度信息纳入同一个模型框架。

李飞飞本人将这一时刻称为“里程碑”。

其实早在今年3月,国内空间智能团队影溯开源的世界模型InSpatio-World就已经具备了类似能力——输入一段普通视频,就能构建一个可以继续探索的动态4D场景。到了8月,影溯的InSpatio-Curious在WorldArena2.0榜单中以66.11分位列77个参评模型第一。

Atlas和InSpatio-World虽然技术路径不同,但指向了同一种变化:世界模型正在从“生成一段看起来合理的视频”,走向“围绕一个持续存在的空间状态,生成不同位置、不同视角下的观测结果”。

而这恰恰是“世界模型”与“视频生成模型”的本质区别——前者在构建一个可以进入、可以探索、可以交互的世界,后者只是在生成一段画面。

整个脉络联系起来看,我认为,AI正在从“数字空间”走向“物理空间”

谁参数量更大、谁上下文更长、谁推理能力更强已经是过去式。下一阶段的竞争,是谁能让AI真正理解物理世界的运行规律,并能与真实环境进行闭环互动。

需要警醒的是,这个互动,很难。

今年的世界人工智能大会上,智元机器人联合创始人、高级副总裁姚卯青指出,当前世界模型训练存在两大瓶颈:一是数据类型错配——互联网视频多含娱乐性甚至反物理内容,而机器人需要推拉拧拽、柔性物体、流体等丰富交互的真实数据;二是数据不足——国际领先大语言模型预训练数据已达100万亿Token,而物理世界数据信息密度远低于文本。

李飞飞的Atlas目前仍处于面向少数合作伙伴的早期访问阶段,WorldLabs尚未公开完整的模型参数、训练数据及第三方测试结果。从“技术验证”到“规模商用”,世界模型还有很长的路要走。

但不管怎样,这段路,大家当下已经开始走了。

希望,这副懂得“不说话”的AI眼镜,能成为AI从“识别世界”走向“理解世界”的那个转折点。

    编辑推荐