你还没开口,AI就先开口了:京东这个开源模型,学会“该说话时才说话”

你有没有过这种时刻:手上沾着面粉,锅里水快溢出来了,小孩正往灶台边跑。你手忙脚乱的时候忽然想起,要是能问一句AI就好了。可等你擦干手、打开手机、打完字,那个该提醒你的瞬间,早就过去了。

现实世界不会暂停等你提问。而你现在用的AI,不管是聊天框里的,还是视频通话里的,本质上都守着同一条规矩:你问一句,它答一句;你不说话,它就安安静静待着。

你还没开口,AI就先开口了:京东这个开源模型,学会“该说话时才说话”

京东6月干了一件事,开源了一个叫JoyAI-VL-Interaction的实时视频交互模型。它的做法跟过去完全不一样:不等你问,它一直在看,该开口的时候,自己开口。

 

现在的AI,为什么关键时刻总慢半拍

要理解京东这次做了什么,得先看清今天所有大模型的一个共同毛病:它们是”轮次制”的。

什么叫轮次制?就是你问一句它答一句,你不触发它就不响应。哪怕你打开某些App的视频通话功能,看起来你们在实时对话,底下跑的还是问答系统。

这套设计原本就是用来做对话的,不是用来待在一个一直变化的真实世界里。所以关键时刻它总慢半拍:监控里事故发生了,它二十秒后才反应;直播里观众想要的产品一闪而过,它根本没跟上。

这不是算得不够快,是从设计那天起,就没打算让它主动。

京东推的是另一种思路:交互模型

“交互模型”这个概念,是Thinking Machines Lab最近提出来的。思路很朴素:让模型像个人一样待在场景里,一直在看现在发生了什么,自己判断这一秒值不值得开口,该说就说,不该说就闭嘴,遇到搞不定的难题就甩给后台更强的模型。

京东的JoyAI-VL-Interaction,是第一个把这种模型连同训练方法、数据、整套系统一起全栈开源的。8B参数规模,视觉优先,把”看画面”这件事放在第一位。

JoyAI-VL-Interaction overview

 

这个模型每秒只干一件事:自己决定这一秒是说话、保持沉默,还是把任务委托给后台模型。三选一,自己做主。

你还没开口,AI就先开口了:京东这个开源模型,学会“该说话时才说话”

它到底能干什么

你还没开口,AI就先开口了:京东这个开源模型,学会“该说话时才说话”

把”交互能力”直接训练进模型,而不是外挂一层调度程序,会自然长出一批传统助手做不到的能力。官方展示了九类,我挑几个好懂的:

  • • 实时翻译:视频里字幕一条条蹦出来,它实时翻,一条不落。
  • • 监控预警:有人摔倒、出现异常,它当场报警,比同类产品快二十秒。
  • • 实时计数:健身动作、飞镖中靶这种重复动作,它一下一下帮你数。
  • • 时间感知:让它”二十秒后提醒”或”每三秒响应一次”,它能掐准节奏。
  • • 长程记忆:记住几分钟前画面里某个细节,不会看完就忘。
  • • 委托解题:遇到画图表、做证明这种难题,它甩给后台模型,自己还能同时跟你聊天。
    你还没开口,AI就先开口了:京东这个开源模型,学会“该说话时才说话”

这些任务,轮次制模型一个都做不好,不管它单次答得多快。

两个关键技术,说人话

光说能力不够,背后有两处设计值得一聊。

你还没开口,AI就先开口了:京东这个开源模型,学会“该说话时才说话”

第一处,语音没有揉进模型里。它被做成了可插拔的输入输出,模型唯一的活就是看画面、判断时机,职责单一。语音进来走流式识别,出去走流式合成,谁都能换成自己的。

第二处叫AdaCodec,一个预测式的视频编码器。直觉是这样的:画面没怎么变的时候,它只用很少的”篇幅”来表示;等场景真发生变化了,才把完整细节补上去。这样消耗是慢慢涨,而不是每一帧都涨一截,模型才能撑住长时间实时,不会越看越卡。

训练数据是400多万条逐秒标注的片段,每一条都标好了”什么时候该说话、该沉默、该委托”,然后再用强化学习精调。整个行为是学出来的,不是写死的规则。

你还没开口,AI就先开口了:京东这个开源模型,学会“该说话时才说话”

评测成绩:小模型在主场打赢大产品

评测做得挺扎实,也好懂。58个真实的事件驱动场景,每一个都同时录下JoyAI-VL-Interaction和豆包或Gemini的视频通话,然后人工逐对比较,既比说的好不好,也比说的及不及时。

结果:对豆包总胜率77.6%,对Gemini是87.9%。最能拉开差距的几个场景,恰恰都是最吃时间的,监控预警对两家都是全胜,实时翻译和实时计数几乎不输。

你还没开口,AI就先开口了:京东这个开源模型,学会“该说话时才说话”

团队也很坦诚:豆包和Gemini背后是远比它大的模型,还经过好多年产品打磨,开放聊天、个人风格那种长尾知识,8B的小模型确实打不过。它只是在”实时在场、视觉触发主动性、对时间的感觉”这几块,也就是交互模型自己的优势区,这个小开源模型反倒领先了。

一个8B的开源小模型,能在自己的主场打赢那些被重度优化的大产品,想想还挺带劲。

开源的不是黑盒,是一整套能跑起来的东西

光有模型还不够,京东这次放出来的是完整的四件套:8B的模型权重、训练方法、400多万条逐秒标注的数据,还有整套能直接部署的系统。

你还没开口,AI就先开口了:京东这个开源模型,学会“该说话时才说话”

整套系统跑在标准的vLLM推理框架上,设计思路很清楚:模型是唯一决定”什么时候行动”的部分,其他所有组件都可插拔。流式语音识别、流式语音合成、长程记忆模块、可视化界面,还有一个”桥接器”让模型把难题交给任意后台模型或API,拿到答案再折回来,而且整个过程里,模型还在继续盯着画面。

任何一个组件你都能换成自己的,不用推倒重来。对做具身智能、安防监控、直播、陪伴类应用的开发者来说,这是一个能直接拿去改的起点,不是个黑盒demo。代码在GitHub上,搜”jd-opensource”组织下的JoyAI-VL-Interaction就能找到。

最后几句话

团队在报告最后写了一个画面,我觉得挺打动人的。

你累了一天回到家,还没开口,一个声音就先注意到你,说:”我看你今天挺累的,这一天一定很辛苦。”

这种不需要你开口请求、主动给你的”在场感”,是交互模型能做到、而轮次制模型永远做不到的。这扇通向”实时在场”的大门,京东这次算是给撬开了。

本文由作者【东哥说AI】,微信公众号:【东哥说AI】,原创/授权 发布于平台,未经许可,禁止转载。

行业动态

我发现 ChatGPT 网页版支持Skills了,还悄悄送了一台“云电脑”

2026-7-27 11:29:38

行业动态

Opus 5和GPT-5.6 Sol胜负已分,别再问谁更强

2026-7-27 13:50:00

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧