对着手机用粤语说了一句”虾饺烧卖凤爪各一笼”,它没写成”瞎搅少卖风爪”,这就是 Hy ASR 3.0 preview 给人的第一印象。腾讯混元把大模型的语言理解能力灌进了语音识别引擎,支持 20 种方言,还能结合上下文自动纠错同音词。元宝已免费接入,腾讯云 API 同步开放。到底有多能打,上手试了才知道。
产品概述
Hy ASR 3.0 preview 是腾讯混元 2026 年 8 月 4 日发布的新一代语音识别模型。名字里的”Hy”取自混元(HunYuan),”3.0″代表第三代架构,而”preview”说明它目前还处于内测期,能用的功能有限,但方向已经很清楚了。

跟传统 ASR 最大的区别在于底座。以前的语音识别模型本质上是一个声学信号到文字的转换器,拼的是谁能在安静环境下把每个字听对。Hy ASR 3.0 直接把底座换成了 Hy3 大语言模型,再加一个自研的无监督语音 Encoder,等于在”听清”的基础上叠加了一层”听懂”的能力。这意味着同音词不再是靠概率模型猜测,而是结合对话上下文来判断”花椒”到底是调料还是人名。
内测链接:https://cloud.tencent.com/document/product/1093/135476 | 混元 AI Studio:https://aistudio.tencent.com/visual
技术架构上采用 MoE 架构,语音 Encoder 用数千万小时级无监督语音数据训练,再和大语言模型联合训练,覆盖了 10 大方言片区和 20 余个二级小片区。后训练阶段还引入了多阶段强化学习,分别针对通用转写准确性和复杂长尾场景做优化。

核心功能
核心技术指标先亮一下:开源评测集上,中文普通话词错误率 3.34%,英语 2.62%,粤语 3.12%,多语种 WER 整体控制在 3% 左右。但这个数字只说了故事的一半,更有意思的是四类场景化能力。
上下文感知纠错。 以前的 ASR 听不懂”我今天想吃花胶鸡”,可能会写成”花椒鸡”。Hy ASR 3.0 会结合上下文判断这是美食话题,自动纠正为正确的同音词。这是大模型底座带来的最直接收益。
方言覆盖。 支持粤语、东北话、河南话、陕西话、成都话、重庆话等 20 种方言。实测普通话和粤语表现不错,但闽南语准确率只有 60% 左右,方言之间的性能落差比较明显。
复杂环境鲁棒性。 地铁站、菜市场、工厂车间这些高噪场景下依然稳定。实测中甚至能准确识别唱歌内容的歌词,歌声的韵律和音调变化比日常语音复杂得多,能做到识别说明声学特征的提取能力确实在线。
热词注入。 支持品牌名、产品名、人名及行业术语的快速适配。这对智能客服、语音搜索等企业场景是刚需,不用重新训练模型就能让 ASR 认识你的业务专有名词。不过内测版 API 中热词功能标注为”即将开放体验”,当前只能在元宝侧体验上下文纠错。

上手体验
最直接的体验入口是元宝 App,打开按住说话就行,免费,不用写一行代码。用普通话正常聊天基本无感,错误率低到不太会注意到这是个 AI 在转写。切换到粤语试了一段”我去广州食早茶,虾饺烧卖凤爪各一笼”,转写准确,连”各一笼”这种口语表达都没翻车。
噪音环境是真正的考验。在地铁站里试了一句”帮我查一下从西二旗到望京的地铁路线”,周围广播声和人声混杂,识别结果只有”西二旗”写成了”西二期”,这个错误情有可原,毕竟同音且上下文线索不足。整体来说,嘈杂环境下的抗造能力比预期好。
开发者接 API 走腾讯云,调用实时语音识别 WebSocket 接口,engine_model_type 参数设成 Hy-ASR-3.0-preview 就行。但目前内测版限制不少:仅支持 1 分钟以内的语音,仅 16k 单声道 PCM 输入,不支持话者分离和 VAD。要做会议转写或多方通话识别的话,这些功能缺口不小。

使用技巧
很多人不知道,用好这个模型其实有不少小窍门,用对了体验直接上一个档次。
-
方言直接用,不用先转普通话。 模型本身支持 20 种方言混合输入,说粤语的人和说东北话的人可以用自己最舒服的方式表达。 -
同音词靠上下文”喂”给它。 如果要说专业术语或容易混淆的词,前面加一句背景语境,比如先说”我在写一篇关于花椒的食谱”再说”放花椒”,识别准确率会更高。 -
噪音环境下语速放慢一点。 模型虽然抗噪能力强,但极端嘈杂环境配合正常语速还是偶有漏字,稍微放慢半拍效果明显改善。 -
API 接入时先确认功能可用性。 热词注入和上下文传入在内测版 API 中标注为”即将开放”,别等到接了才发现核心功能还没上线。
竞品对比
语音识别赛道今年 7-8 月突然热闹起来,阿里发了 Qwen-Audio-3.0-ASR-Flash,云知声升级了 U2-ASR,OpenAI 推出 GPT-Live,腾讯则拿出了 Hy ASR 3.0。四家路线差异不小,直接看表。
| 维度 | 腾讯 Hy ASR 3.0 preview | 阿里 Qwen-Audio-3.0-ASR-Flash | 科大讯飞 ASR | 云知声 U2-ASR |
|---|---|---|---|---|
| 技术路线 | MoE + Hy3 LLM 底座 + 无监督语音 Encoder | 大模型 + 上下文一致性与语音润色 | 传统声学模型 + 行业深耕 | 单模型多语种覆盖 |
| 中文 WER | 3.34%(普通话) | 1.7%(离线,Artificial Analysis 评测) | 3.2%(安静环境) | 6.58%(CER,工业级测试集) |
| 语种/方言 | 中英 + 20 种方言 | 30 种语言 | 中英 + 重点方言 | 13 种语言 |
| 核心差异点 | 上下文语义理解 + 抗噪 | 长音频处理 + 行业词召回(医疗 95.36%) | 市场份额第一(23.4%) | 多语种单模型覆盖 |
| 定价 | API ¥0.85-1.00/小时,元宝免费 | 百炼平台,三版本分级定价 | 按调用量计费 | 企业定制 |
| 成熟度 | preview 内测,功能受限 | 正式版,生态完善 | 成熟商用 | 商用版 |
阿里的优势在数据透明和长音频场景,30 种语言、医疗行业词 95.36% 召回率都是硬指标。科大讯飞靠 23.4% 市场份额和成熟的行业解决方案稳坐头把交椅。Hy ASR 3.0 的差异化来自大模型底座带来的语义理解能力,不是拼谁听得更清,而是拼谁听得更懂。但 preview 状态下的功能缺口(不支持话者分离、上下文和热词 API 未开放)是硬伤,对生产环境来说还要等正式版。
用户反馈
从媒体实测和社交平台反馈来看,口碑集中在两个方向。
正面评价比较一致:噪音环境下的稳定性超出预期,”地铁站里正常说话就能识别”是多个评测的共识;方言支持覆盖面广,粤语体验好评较多;元宝免费接入降低了体验门槛。
槽点也很集中:闽南语等部分方言识别率偏低,实测仅 60% 左右,与官方宣传的”覆盖 10 大方言片区”有落差。API 内测版限制太多,1 分钟上限、仅 PCM 格式、热词和上下文功能未开放,让很多想接入的开发者觉得”预览了个寂寞”。
多维评分
聊了这么多功能和反馈,用一个统一的框架把各项能力拉到同一把尺子上量一量。
| 评分维度 | 权重 | 星级 | 解读 |
|---|---|---|---|
| 功能完整性 | 20% | ★★★☆☆ | 核心转写强,但话者分离/VAD/长音频等缺失 |
| 易用性 | 15% | ★★★★☆ | 元宝端零门槛,API 接入标准 WebSocket |
| 性能表现 | 15% | ★★★★☆ | WER 3.34% 处于第一梯队,抗噪表现好 |
| AI 能力 | 15% | ★★★★☆ | 上下文语义理解是大模型底座的核心优势 |
| 价格合理性 | 10% | ★★★☆☆ | API ¥0.85-1.00/h 中等偏上,元宝端免费加分 |
| 生态集成 | 10% | ★★★☆☆ | 接入元宝和 WorkBuddy,但生态远不如讯飞/阿里 |
| 文档与支持 | 10% | ★★★☆☆ | 文档齐全但内测版功能标注不完整 |
| 更新频率 | 5% | ★★★★☆ | 刚发布,混元团队迭代节奏快 |
综合评分:3.5 / 5 星。语义理解方向正确,但 preview 阶段缺失的核心功能拖了后腿。
优缺点
优点:
-
上下文语义理解是真正的差异化,不只是听清而是听懂 -
20 种方言覆盖,粤语/东北话/河南话等表现扎实 -
复杂噪声环境下的稳定性超出预期 -
元宝端免费接入,零门槛体验 -
MoE + Hy3 大模型底座,架构升级路径清晰
缺点:
-
内测版功能缺失严重:无话者分离、无 VAD、限 1 分钟、仅 PCM -
热词注入和上下文传入,宣传的两大亮点,API 端”即将开放” -
闽南语等方言识别率偏低,方言间性能不均衡 -
定价¥0.85-1.00/小时不算便宜,且无免费音频额度 -
核心参数(参数量/模型规模)未公开,与竞品难以横向比较
适用人群
前面把优缺点都聊透了,接下来看看谁最适合现在入手。
-
想零成本体验最新 ASR 的普通用户。 直接打开元宝按住说话就行,方言和噪音环境的表现会让你对语音输入重新建立信心。 -
做智能客服或语音搜索的产品经理。 20 种方言覆盖 + 抗噪能力,对面向下沉市场或多方言用户群的产品是直接加分项。 -
需要上下文感知转写的开发者。 如果你的场景涉及同音词消歧或专业术语识别,Hy ASR 3.0 的大模型底座比传统 ASR 更适合,但先确认 API 功能已开放再动手。 -
腾讯生态内的产品团队。 元宝、WorkBuddy 等内部产品已经在接入,微信语音、腾讯会议等场景的路线图可以期待。
不适合的场景:需要话者分离的会议转写、超过 1 分钟的音频处理、对闽南语等高要求方言场景。
定价方案
Hy ASR 3.0 preview 通过腾讯云 API 对外提供,按大模型 2.0 计费方案执行。元宝端对用户完全免费。
| 计费方式 | 时长 | 价格 | 单价 |
|---|---|---|---|
| 预付费套餐 | 60 小时 | ¥60 | ¥1.00/h |
| 预付费套餐 | 1,000 小时 | ¥950 | ¥0.95/h |
| 预付费套餐 | 10,000 小时 | ¥9,000 | ¥0.90/h |
| 预付费套餐 | 100,000 小时 | ¥88,000 | ¥0.88/h |
| 预付费套餐 | 300,000 小时 | ¥255,000 | ¥0.85/h |
| 后付费 | 按日结算 | — | ¥1.00/h |
(截至 2026 年 8 月腾讯云官网显示,内测期价格可能调整)
跟阿里 Qwen-Audio-3.0-ASR-Flash 的分级定价相比,Hy ASR 3.0 的起价不算低。但考虑到目前仅支持实时短语音识别,实际使用量级不会太大。正式版上线后如果增加长音频和离线转写能力,价格结构大概率会调整。
FAQ
把这两天被问到最多的问题整理了一下,看看有没有你关心的。
Q1:Hy ASR 3.0 preview 和传统语音识别最大的区别是什么?
A1:底座换成了大语言模型,不只是听清,更能听懂。 传统 ASR 是声学信号到文字的转换器,Hy ASR 3.0 在 Hy3 大模型基础上叠加语音 Encoder,能结合上下文理解语义、自动纠正同音词。
Q2:现在能用了吗?怎么用?
A2:能用,两个入口。元宝 App 免费直接体验;腾讯云 API 接入需申请。 元宝按住说话即可,方言和上下文纠错能力已开放。API 走 WebSocket 接口,engine_model_type 设为 Hy-ASR-3.0-preview。
Q3:支持哪些方言?准确率怎么样?
A3:支持 20 种方言,粤语和官话变体表现好,闽南语偏弱。 粤语 WER 3.12%,东北话、河南话、成都话等实测可用。但闽南语准确率约 60%,方言间性能不均衡。
Q4:API 内测版有什么限制?
A4:限制很多。仅支持 1 分钟以内、16k 单声道 PCM,无话者分离和 VAD。 更关键的是,热词注入和上下文传入这两个核心亮点在 API 端标注为”即将开放体验”——目前只在元宝端可用。
Q5:跟阿里 Qwen-Audio-3.0-ASR-Flash 比谁更强?
A5:各有侧重,不能简单说谁更强。 阿里离线版 WER 1.7% 更低、支持 30 种语言、长音频和行业词数据更透明。腾讯的优势在上下文语义理解和方言覆盖广度。选哪个取决于你的场景偏好精度还是理解能力。
Q6:价格贵吗?有没有免费额度?
A6:起价 ¥1.00/h,无免费音频时长。 批量预付费最低 ¥0.85/h。对比行业算中等偏上,但元宝端对终端用户完全免费。目前没有单独的免费识别时长额度。
Q7:适合做会议转写吗?
A7:目前不太适合。 内测版不支持话者分离和 VAD,单次最长 1 分钟——会议转写的两个基本前提都不满足。等正式版补齐这些功能再评估。
Q8:上下文纠错到底有多准?同音词真的能区分吗?
A8:有上下文线索时很准,缺乏上下文时仍会出错。 比如”花椒”在烹饪场景和”花胶”在美食场景能正确区分,但如果前面没提供足够的语境信息,同音词混淆还是会发生。
结论
Hy ASR 3.0 preview 最大的价值不是那 3.34% 的 WER,这个数字虽然不错,但竞品也能做到。真正有意思的是它代表了语音识别技术路线的一次转向:从”拼谁听得更清”转向”拼谁听得更懂”。
但 preview 就是 preview。话者分离缺失、1 分钟上限、热词和上下文 API 未开放,这些缺口让它在生产环境里的定位有点尴尬。如果你只是想体验一下大模型驱动的语音识别有多强,打开元宝说句话就够了。如果你要接入业务系统,建议等正式版。
语音识别这个老赛道,2026 年夏天突然又好看起来了。

