你说”这个怎么弄”,指着屏幕,它能结合画面和手势秒懂你说的”这个”是哪个;旁人在旁边闲聊,它知道不是在跟自己说话,不瞎搭茬;你装电脑忘了插供电线,它眼睛一直盯着,主动提醒你。字节跳动 8 月 5 日发布的 SeedRealtime,把音频、视频、文本融进同一个端到端模型,让 AI 不再是一个回合等一次的答题机器,而是一个能持续观察环境、判断时机、自然插话的”在场者”。豆包 App 已全量上线,迄今最大规模的全双工落地。
先搞懂它是什么
SeedRealtime 是字节跳动 Seed 团队于 2026 年 8 月 5 日发布的原生音视频全双工大模型。核心定位很明确:用一个统一的端到端架构,替代传统 AI 通话背后那一长串接力系统(ASR 听→模型想→TTS 说)。
官网:https://seed.bytedance.com/en/seedrealtime

以往你视频打电话给 AI,本质上是一套流水线:先把声音转成文字,再截图看画面,模型综合处理,最终合成语音念出来。每个环节的反应再快,串在一起就慢半拍,而且每转一次就丢一点信息。SeedRealtime 不做接力,它把声音、画面、时序和表达压进同一个模型,让感知、理解、决策、表达在连续的信息流上同步进行。
字节选在 4 月先发了纯语音全双工 Seeduplex,验证了”不靠外挂 VAD 判断轮次”这条路走得通,4 个月后直接叠上视频,成了现在的 SeedRealtime。这分两步走的策略很务实:语音先跑通用户愿不愿意用,再叠视觉。

目前 SeedRealtime 已通过豆包 App 全量上线,月活 3.82 亿的用户规模(2026 年 6 月 QuestMobile 数据),让它在全双工赛道上成了第一个真正大规模落地的产品。
到底强在哪
前面搞清了它是干嘛的,接下来看看这三个核心能力是不是真那么回事。
音视频联合理解。这是最底层的能力差异。模型把声音、画面和时间线深度融合,你的每句话都带着画面上下文被理解。比如你说”这个怎么弄”同时手指着屏幕上某个按钮,它能判断你的手势指向、视线方向和历史操作,确认”这个”到底是什么。碰到 bank 这种同音词,它靠画面区分银行还是河岸,不是靠猜。
主动交互。模型不只是等你开口,它持续观察环境状态变化。官方演示了几个场景:在博物馆里一直盯着镜头,认出你指定的文物后主动开口讲解;你操作咖啡机时,发现步骤不对,根据画面变化实时纠错;你看论文翻页,它一直监测,指定章节一出现就自动提醒。这种”它也在看”的体验,跟传统”你问一句它答一句”完全不是一个物种。
流畅交互节奏。这是用户最能感知到的部分。SeedRealtime 不靠外挂 VAD 判断该不该说话,全由模型在多模态信息流上实时决策。在被问到”卡壳、抢话、误触发”这些老问题时有没有改善,字节披露的端到端人工评测数据:相比传统级联系统,节奏问题减少约 50%,包括抢话、回应迟滞、背景噪声误触发都有明显下降。

需要交代的是,参数量和具体架构细节至今未公布。50% 这一数据同样缺少样本量和评测方法学说明,只能先按官方口径引用。
从下载到产出
参数再漂亮不如跑一遍,打开豆包直接试试视频通话到底什么感觉。
打开豆包 App(更新到最新版),在对话框里点”打电话”按钮,选视频通话。不需要注册新账号,不需要填任何表单,豆包账号直接就能用。接通后你会看到一个实时视频画面,你可以直接对着镜头说需求。
第一印象是反应快了。以前说句话要等上一两秒才有回应,现在它在你话还没完全说完的时候就开始准备了。你停顿一下想一想,它不会急着抢话;你真想问的时候,它马上接上。对话节奏从”回合制”变成了”能插嘴的聊天”。
最有意思的是它的抗干扰能力。旁边有人打电话、电视开着,它基本能判断出哪些话是对它说的,哪些是背景杂音。差评 XPIN 测试了装机场景:全程开视频指导装测试平台,从装内存条提醒注意正反面,到装完显卡发现供电线没插主动补充,甚至角落里最容易被忽略的 CPU 供电线都被发现了。这种全流程跟踪能力,放在以前的 AI 视频通话上想都不敢想。
不过也别期望太高。目前还是手机形态,你得到处举着手机,视频通话也受网络和续航限制。而且它有时还是会反应过度,在你说到一半的时候插嘴。
使用技巧
很多人不知道,这几个骚操作用过才知道有多省心。
-
把手机放支架上,别一直举着。 视频通话需要稳定画面,手抖会导致它看不清。找个手机支架放桌上,比手举着体验好十倍。 -
像跟人说话一样说完整句。 虽然它更智能了,但还是需要完整表达的上下文。说”这个”的时候手指着目标,它能秒懂;只甩一个”这个”没手势,它也蒙。 -
利用记忆功能当临时秘书。 有用户测出来,全程开视频时它记得你随手放的测试机位置。装东西、理东西、找东西的时候开着视频,它可能比你自己记得还清楚。 -
嘈杂环境说”豆包”开头。 在机场、餐厅这些地方,先喊一声唤起注意,再说正事,误触发率会低很多。 -
装机、修东西这种场景最适合它。 双手占着没法打字,光打电话又表达不清步骤,视频通话加全双工是最好的组合。
和同类比怎么样
说再多自己的好,放竞品圈里比比才知道真实水平。
音视频全双工不是字节的独角戏,海内外大厂都在这条赛道上。先看几家主要选手的横向对比:
| 维度 | SeedRealtime | Gemini Live | GPT-Live | Qwen3-Omni |
|---|---|---|---|---|
| 模态 | 音频+视频+文本 | 音频+视频+图像+文本 | 音频+文本 | 音频+视频+文本 |
| 架构 | 统一端到端 | 原生多模态 | 全双工解耦 | 原生多模态 |
| 全双工 | 原生,无外挂 VAD | 原生,全双工 | 全双工 | 半双工为主 |
| 中文优化 | 深度专项优化 | 通用支持,非专项 | 一般 | 深度中文 |
| 落地平台 | 豆包 App | Google Workspace/Meet/Android | ChatGPT | 通义千问 |
| 开放 API | 暂无 | 有 | 有 | 有 |
| 定价 | 免费 | Gemini Advanced 订阅 | ChatGPT Plus/Pro | 免费+API |

SeedRealtime 在”持续在场感”和”中文场景深度”上确实领先,主要体现在三个维度:不依赖外部 VAD 的原生全双工、音视频时序联合建模的指代理解、以及豆包 3.82 亿月活带来的规模化训练反馈。但它的短板也很明显:没有开放 API,开发者没法接入;模态覆盖上,Gemini Live 支持的模态比它多;GPT-Live 和 Qwen3-Omni 都有明确的 API 和定价,SeedRealtime 目前完全是个 to C 产品。
腾讯的 Covo-Audio(7B 开源)和面壁的 MiniCPM-o 4.5(9B 全模态)也在追,但体量和场景覆盖与 SeedRealtime 还不是一个量级。智谱的 GLM-4-Voice 有端到端语音能力,目前还没有加入视频理解。
用户反馈
技术数据是一回事,真实用户的感受可能更说明问题。
-
好评:“不再是个答题机器了。” 差评 XPIN 测试后说豆包”真的在尝试理解你的语气、声音,学会了像人一样和人沟通”。装机场景中豆包持续跟踪全流程、主动提醒遗漏线缆的表现,用户评价”简直就是 AI 磕了哆啦 A 梦的记忆面包”。 -
好评:“终于不再乱搭话。” 夕小瑶科技说的测评认为,豆包更新后环境音和人声持续进入模型,不再因为身旁有人聊天就瞎接茬。在嘈杂环境里”学会了适时沉默”。 -
吐槽:“还是手机形态太局限。” 多位体验者提到,视频通话需要一直举着手机或架着手机,续航、网络、角度都限制使用场景。有用户直言”手机这个形态有点制约未来 AI 的能力”。 -
保守观望:“技术参数和评测数据没公开。” DataNorth 的报道指出,字节没有公布参数量、样本量、基准测试细节,50% 节奏改善的数字目前无法用公开方法学验证。缺少这些数据,做技术选型的团队很难严肃评估。
多维评分
主观感受说完了,按统一标准逐项打分,每项都有场景或数据支撑。
N/A 维度已排除,权重已归一化(价格合理性 N/A,本产品通过豆包 App 免费使用)。
| 维度 | 权重 | 评分 | 一句话解读 |
|---|---|---|---|
| 功能完整性 | 22.2% | ⭐⭐⭐⭐☆ | 三核心能力完整,缺 API 和开发者入口 |
| 价格合理性 | N/A | N/A | 免费产品,通过豆包 App 直接使用 |
| 易用性 | 16.7% | ⭐⭐⭐⭐☆ | 更新豆包直接打视频电话,零门槛 |
| 性能表现 | 16.7% | ⭐⭐⭐⭐☆ | 节奏问题减半,但时延数据未公开 |
| AI 能力 | 16.7% | ⭐⭐⭐⭐⭐ | 统一端到端架构行业领先,没有争议 |
| 生态集成 | 11.1% | ⭐⭐☆☆☆ | 仅豆包 App,无 API/插件/第三方集成 |
| 文档与支持 | 11.1% | ⭐⭐⭐☆☆ | 有官方博客和场景演示,缺技术白皮书 |
| 更新频率 | 5.6% | ⭐⭐⭐⭐☆ | 4 个月从语音到音视频,迭代节奏快 |
综合评分:7.7 / 10
优缺点
看到这里,把好的和不好的摊开说。
优点
-
业界首个原生音视频全双工端到端模型,不靠级联系统凑合 -
音视频联合理解能力强,指代消歧、手势理解、同音词消歧都精确 -
大规模落地,豆包 3.82 亿月活意味着有大量真实数据反馈 -
主动交互和节奏控制比级联系统有明显代差感
缺点
-
没有公开 API,开发者无法接入做二次开发 -
技术细节不透明:参数量、时延基准、评测方法学均未披露 -
限定手机形态,眼镜、车载等场景还没影 -
仅限豆包 App,生态封闭度较高
适用人群
功能、评分都有了,但你适不适合,看完下面几条应该有答案。
-
豆包重度用户。 你已经在高频用豆包,更新后视频通话体验直接上一个台阶,没有任何迁移成本。 -
需要视觉辅助操作的人。 装机、修电器、操作陌生设备,双手占着没法打字,视频通话就是最好的交互方式。 -
外语学习者。 英语不好想看外文菜单、跟外国人交流,豆包能实时结合画面翻译和解释。 -
老人和数字弱势群体。 去大医院不知道在哪取号、怎么签到,全程开视频让豆包带路,比电话里指导直观得多。 -
不适合:需要 API 接入的开发者。 目前纯 to C 产品,想用 SeedRealtime 做二次开发的团队只能等火山引擎后续动作。 -
不适合:极度关注数据隐私的用户。 视频通话意味着你对着摄像头做的事它都在看,隐私边界目前不清晰。
常见问题
写到这你可能还有几个疑问,直接翻这里。
Q1:SeedRealtime 收费吗?
A1:目前完全免费。 通过豆包 App 的视频通话功能使用,无需任何订阅或付费。未来如果开放 API,火山引擎可能会有单独的定价方案,但 C 端短期内不会收费。
Q2:怎么才能用上 SeedRealtime?
A2:把豆包 App 更新到最新版本,点”打电话”选视频通话就行。 不需要额外注册或申请,所有豆包用户都能用。iOS 和安卓均已全量上线。
Q3:SeedRealtime 跟 GPT-4o 的语音模式比,谁更强?
A3:SeedRealtime 多了一个视频维度。 GPT-4o/GPT-Live 的语音全双工体验已经很好了,但它不处理视频流。SeedRealtime 的核心差异在于音视频联合理解,能结合画面理解你的指代。纯语音场景下两者差距不大。
Q4:它能在嘈杂环境里正常工作吗?
A4:可以,比之前的版本好很多。 官方演示和用户测试都显示,在机场、聚会等场景下,它能区分你跟它说话和旁人在闲聊,不会乱搭茬。但极端噪声下还是会有误判。
Q5:视频通话时会消耗很多流量吗?
A5:跟普通视频通话差不多。 本质上是视频流加语音,流量消耗主要在于视频画质。WiFi 环境下基本无感,移动网络建议留意流量用量。
Q6:有 API 可以接入吗?
A6:目前没有。 SeedRealtime 目前是纯 C 端产品。火山引擎尚未公布 API 计划。有开发需求的团队可以先关注字节 Seed 团队和火山引擎的动态。
Q7:它跟 Seeduplex 什么关系?
A7:Seeduplex 是 4 月发布的纯语音全双工模型,SeedRealtime 是在它基础上叠加了视频理解。 字节的策略是先验证语音全双工可行,再扩展到音视频,两步走得很务实。
Q8:视频内容是实时处理的,隐私怎么办?
A8:官方表示数据加密传输,但详细的隐私白皮书尚未公布。 如果你介意 AI 实时看到你在做什么,建议只在需要的时候开启视频通话,不要一直开着。
Q9:跟 Gemini Live 比有什么优势?
A9:中文场景深度优化和 3.82 亿月活的训练反馈是最大优势。 Gemini Live 在全球化和多模态覆盖面上更广,但中文不是它的专项优化方向。在中国市场使用场景下,SeedRealtime 的中文理解和节奏控制更自然。
最终建议
SeedRealtime 代表了 AI 交互从”问答式”到”在场式”的一次关键跳跃。它不再需要你先开口、它再回答,而是能一直看着、听着、等着在恰当的时候帮你一把。
这次发布的时机也很有意思。4 个月前 Seeduplex 先跑通了纯语音,4 个月后就直接端上了音视频全双工,这个迭代节奏说明字节在多模态实时交互上的投入是认真的。而且选择先在豆包 3.82 亿月活上落地,而不是先发 API 或技术论文,这个优先级本身就在说:他们要的是真实用户反馈,而不是技术社区的口碑。
当然,不透明的地方也不少。参数量、时延、评测方法学全都没公开,50% 节奏改善的数字好看但没法交叉验证。没有 API 也意味着想用这套技术做产品的团队暂时只能看着。这也是为什么综合评分定在 7.7 / 10,而不是更高。
如果你的日常场景里有”双手占着又想找人帮忙”的时刻,更新豆包试试视频通话。这可能是你第一次觉得 AI 不是在回答问题,而是在陪你做事。

