Hy4 preview 评测:770B 参数、1M 上下文,混元把旗舰价格又往下压了一档

让模型从一堆报销单里揪出哪张发票不合规,这种活儿过去得靠熟手干半天。腾讯混元今天放出来的新旗舰就是冲着这类脏活来的:770B 总参数、1M 上下文、输出 18 元/百万 tokens。参数堆得凶,价格压得低,真正要问的是它干活快不快、交付稳不稳。

产品概述

混元这次端出来的 Hy4 preview,是一代 MoE 旗舰的预览版本。总参数 770B,每个 token 只激活 49B,上下文长度拉到 1M。对照上一代 Hy3 的 295B 总参数,这一代在尺寸上是实打实的翻倍还多,激活参数同样翻了一倍。

模型在 2026 年 8 月 28 日发布,同一天开源权重,HuggingFace、GitHub、ModelScope、GitCode、CNB 全部同步上线,API 则走腾讯云 TokenHub 和 OpenRouter。官方对它的定位直接写在 slogan 里:为生产力而生,主攻软件工程、办公分析、游戏开发、科学研究四条线,不追全能,追能干活。

官网:https://hy.tencent.com/research/hy4-preview | 项目地址:https://github.com/Tencent-Hunyuan/Hy4-preview

Hy4 preview 评测:770B 参数、1M 上下文,混元把旗舰价格又往下压了一档

节奏也值得单独说一句。自今年 2 月重建基础设施以来,混元基本保持每两个月一个大版本的迭代速度,Hy3 preview、Hy3、Hy4 preview 依次落地,中间还穿插了大量外界看不见的基础设施和组织调整。preview 先行、正式版跟进这套打法,本质上是用真实反馈换迭代速度,代价是每一代 preview 都得带着已知问题出门。

规格项 参数
架构 MoE(78 层,首层 dense FFN,其余 77 层 MoE)
总参数 / 激活参数 770B / 49B
专家配置 256 路由专家 + 1 共享专家,每 token 激活 top-8
注意力 Gated DSA(含 IndexCache 跨层稀疏索引复用)
上下文长度 1M
词表大小 120832
附加模块 1 层原生 MTP(10B 总参数 / 0.7B 激活,用于推测解码)
开源协议 Apache 2.0(社区转述,以 HuggingFace 仓库 License 页为准)

Hy4 preview 评测:770B 参数、1M 上下文,混元把旗舰价格又往下压了一档

核心功能

参数只是入场券,真正决定体验的是架构怎么搭、能力往哪儿使劲。先把这代模型的骨架拆开看看。

Hy4 preview 的主干是 78 层,第一层保留标准 dense FFN,剩下 77 层全部换成 MoE,每层挂 256 个路由专家加 1 个共享专家,每个 token 只激活 top-8。注意力部分用了 Gated DeepSeek Sparse Attention,配合 IndexCache 做跨层稀疏索引复用,残差通路则换成 iHC(identity Hyper-Connections)来拓宽层间信息流。额外还内置了一层 MTP 做推测解码。

Hy4 preview 评测:770B 参数、1M 上下文,混元把旗舰价格又往下压了一档

这套结构带来的收益直接体现在 12 项基准上,而且没有一项垫底。Terminal Bench 2.1 拿到 85.4 分,比 Hy3 高出 14.6 分,超过 DeepSeek V4 Pro,与 Claude Opus 5 基本持平。聚焦软件工程实战的 DeepSWE 从 Hy3 的 28.0 跳到 64.3,翻了一倍还多。工具调用马拉松 Toolathlon-Verified 拿到 74.1 分,压过 Qwen 3.8 Max 和 GPT-5.6 Sol,正在逼近 Kimi K3。

软件工程是这代投入最重的方向。官方的说法是增强长程开发任务的理解、规划、调试与验证能力,前端的视觉审美和交互质量也一并提升。有媒体实测让它做谷歌财报汇总页,一句模糊需求下去,模型自己判断去找 SEC 和 IR 资料包,交叉验证网络报道,再用工具校验数字,17 分钟后交付了带图表和重点标注的完整页面。

办公分析这条线走的是脏活路线。一个演示案例是公司财务费用稽核:72 份文件里混着多个版本的制度文件,模型要自己判断哪份现行有效,再结合花名册、预算和历史台账逐笔核对,从一堆报销单里准确挑出 14 张合规的。这种活儿难不在推理,难在上下文里全是干扰项。

游戏开发和科学研究属于两个极端场景。前者靠 MCP 接进 Unreal 5 和团结引擎,一句话出可玩原型,媒体实测做出来的企鹅岛小游戏交互完整、画风统一,但离 3A 还差得远。后者是真的硬:配合 Hyra 模型,把三维 Blaschke–Lebesgue 这个百年几何难题的体积下界从 0.380799 推进到 0.41104,距 Meissner 四面体猜想的 0.41986 只剩约 2% 的差距。

上手体验

看完纸面能力,接下来是把它接进自己的流程里到底顺不顺手。三条路可走,难度依次递增。

最省事的一条路是直接在产品里用。WorkBuddy、CodeBuddy 的国内版和国际版、元宝、ima 都已同步首发,发布当天起还有为期两周的限时免费。选模型、开对话就完事,没有任何配置成本,适合先花半小时摸清它的脾气再决定要不要接进流程。

第二条路是走 API。腾讯云 TokenHub 的控制台建个 Key 就能调,OpenRouter 上也挂了 tencent/hy4-preview,海外业务不用折腾网络。接口是 OpenAI 兼容格式,chat template 里带 thinking mode、reasoning effort 控制和工具调用,从别的模型迁过来基本只需要改一行模型名。

# TokenHub / OpenRouter:OpenAI 兼容调用
pip install openai

python - <<'PY'
from openai import OpenAI
client = OpenAI(base_url="https://api.tokenhub.tencent.com/v1", api_key="YOUR_KEY")
r = client.chat.completions.create(
    model="hy4-preview",
    messages=[{"role""user""content""审阅这份报销单,指出不合规项"}],
    extra_body={"reasoning_effort""medium"},
)
print(r.choices[0].message.content)
PY

Hy4 preview 评测:770B 参数、1M 上下文,混元把旗舰价格又往下压了一档

要自己部署,HuggingFace 上给了 BF16 和 FP8 两套权重,vLLM 和 SGLang 都有快速上手文档。770B 的体量决定了这不是单卡能扛的活,FP8 权重下也需要多机多卡,个人玩家建议直接走 API。实测下来最明显的体感是慢:媒体在 WorkBuddy 里跑财报页面花了 17 分钟,中间模型反复自我验证,等待过程相当煎熬。

使用技巧

用了下,攒下几个很多人不知道的省时间技巧,都是踩过坑才总结出来的。

  • 先压思考深度再谈速度。 chat template 支持 reasoning effort 控制,日常问答和简单改写直接调到 low,长程开发任务再拉到 high,能明显缓解它的过度自我验证倾向。
  • 长任务先让它出计划。 面对多文件、多步骤的需求,先要求它列出执行计划和信源判断依据,确认后再让它动手,比一次性丢过去更少返工。
  • 善用 1M 上下文,但别硬塞满。 缓存命中的输入价只有 0.3 元每百万 tokens,把稳定的制度文件、代码库前段固定下来做前缀缓存,比每次全量重发划算得多。
  • 前端和游戏任务给死约束。 明确指定引擎、框架版本、交互流程和验收标准,它能交付的完成度会高一个档次;反之容易给你一个能跑但粗糙的半成品。
  • 科学计算让它交付可复现物。 官方案例里模型不只给结论,还会封装交互式模拟器并做独立验证,这类任务要求它输出完整求解流程和参数入口,价值最大。

竞品对比

同一个价位段能选的对手不少,摆在一起看差异更清楚。下表价格均为 2026 年 8 月 28 日的公开价目,各来源计价口径不完全一致,只作选型参考。

对比项 Hy4 preview GLM-5.3 Kimi K3 DeepSeek V4 Pro GPT-5.6 Sol
上下文长度 1M 1M 1.05M 1M 1M(阶梯计价)
开源权重 是(Apache 2.0) 是(Moonshot 许可) 是(MIT)
智能分(AA 指数) 暂未收录 60 60 53 61
输入价(美元/百万) 6 元(约 0.84) 1.40 3.00 1.32 2 起
输出价(美元/百万) 18 元(约 2.52) 4.40 15.00 3.96 6 起
缓存命中输入价 0.3 元(约 0.04) 0.26 0.30 0.044 未公开
内部盲测均分(4 分制) 2.99 2.92 2.94 未参与 未参与

真正值得注意的是输出价的站位。18 元一百万 tokens 换算下来约 2.52 美元,只有 Kimi K3 的六分之一,比 GLM-5.3 还低一档,同时还把开源权重交了出去。这跟海外旗舰动辄 6 美元起、长上下文还要再翻一倍的定价逻辑完全不是一个路数,成本敏感的场景差距会非常大。

但也要看到另一面。内部盲测 2.99 对 GLM-5.3 的 2.92、Kimi K3 的 2.94,优势只有零点零几分,胜率 46.8% 和 51.2% 也只是勉强过半。换句话说,它是挤进了第一梯队,但远没到能碾压同价位对手的程度,真要选型,还是得拿自己的任务集跑一遍再下结论。

用户反馈

发布当天的反馈量还不算大,但几个方向已经比较清楚了。先看正面的评价。

有媒体在 WorkBuddy 里接入后做谷歌财报页,模型的表现被评价为同时承担了研究员和前端工程师两个角色:自己找信源、交叉验证、跑工具校验数据,确认可靠后才动手写代码。让它做火星模拟器和太阳系模拟器时,交互控件、地标信息和科学数据比例都对得上,前端效果被形容为超出预期。

开源社区的反应集中在两点。一是 770B 配 Apache 2.0 这个组合,二是有人指出姚顺雨加入后混元的训练节奏明显提速,半年多时间里连着交了三个版本。技术侧的评价则提到 chat template 对 thinking mode、reasoning effort 和工具调用的支持完整,接入成本低。

负面反馈同样集中。最常被提到的是慢:模型在复杂任务上会反复验证自己的输出,导致交付时间被拉长,有实测者形容等待过程比较煎熬。另一个问题是能力缺口,preview 版本还不支持视觉输入,多模态要等正式版才补齐。此外,内部盲测的领先幅度偏小,也被认为说明它的优势还不够稳固。

多维评分

能力和槽点都摆完了,接下来按八个固定维度逐项打分,看看它到底站在哪个位置。

维度 权重 评分 解读
功能完整性 20% ★★★★☆ 代码、办公、科学三条线齐备,多模态缺失扣分
易用性 15% ★★★★☆ 产品内开箱即用,接口 OpenAI 兼容,但响应偏慢
性能表现 15% ★★★★☆ 1M 上下文、自优化后吞吐提升 31.8%,被长思考拖累
AI 能力 15% ★★★★☆ 12 项基准无一项垫底,DeepSWE 翻倍增长
价格合理性 10% ★★★★☆ 输出 18 元,同档位最低梯队,缓存价 0.3 元
生态集成 10% ★★★★☆ 腾讯系产品全覆盖,MCP 可接 Unreal 5 与团结引擎
文档与支持 10% ★★★☆☆ HF 卡片与部署文档完整,中文社区积累刚起步
更新频率 5% ★★★★★ 两个月一个大版本,preview 机制成熟

综合评分:4.2 / 5.0

优缺点

  • 优点
    • 770B 配 49B 激活的 MoE 结构,把旗舰级能力压到了中端价格档位,输出价在同档位里处于最低梯队,长文档场景再叠加 0.3 元的缓存命中价,成本结构相当友好。
    • 代际跃升的幅度是真实可测的,12 项基准里没有一项垫底,DeepSWE 从 28.0 跳到 64.3 实现翻倍,Terminal Bench 2.1 拿到 85.4 分与 Claude Opus 5 基本持平。
    • 开源与生态两手都硬,Apache 2.0 权重配 BF16 与 FP8 双版本,vLLM 和 SGLang 都能跑,同时与 WorkBuddy、CodeBuddy 深度协同,MCP 还能接进 Unreal 5 和团结引擎。
    • 科学研究方向有可查证的硬成果,三维 Blaschke–Lebesgue 问题的体积下界被推进到 0.41104,分子动力学模拟提速 2.0 倍,属于能翻出证明的过程,不是跑分话术。
  • 缺点
    • 长思考拖慢交付节奏,官方已把复杂任务上的过度自我验证列为已知问题,实测中模型会反复回头检查自己的输出,等待时间明显偏长,实时场景要谨慎。
    • 多模态存在明确缺口,preview 版本不支持视觉输入,图像理解类业务现在接不了,只能等后续正式版补齐,选型阶段必须把这个限制算进去。
    • 领先幅度其实很小,内部盲测均分 2.99 对 GLM-5.3 的 2.92 和 Kimi K3 的 2.94,优势只有零点零几分,胜率刚过半,按榜单直接选型容易翻车。
    • 自部署门槛偏高,770B 的体量决定了需要多机多卡集群,个人用户基本只能走 API;同时它仍是 preview 版本,能力还会随正式版变化,长期依赖要考虑版本锁定。

适用人群

不同角色能从这台模型身上拿到的东西差别很大,对号入座更省事。

Agent 与编码场景的开发者。 Terminal Bench 2.1 拿 85.4、DeepSWE 拿 64.3,配合 reasoning effort 控制和工具调用,适合接入编码 Agent 做长程任务。两周免费期正好用来跑自己的评测集。

需要处理长文档的分析岗。 财报稽核、合同审查、制度比对这类任务,1M 上下文加 0.3 元缓存命中价,成本结构比按次调用友好得多。前提是能接受它的响应时间。

用 AI 做前端和轻游戏的团队。 一句话出可玩原型、多轮迭代完善,对做 Demo 和验证玩法的阶段非常合适,别指望它直接产出成品级内容。

科研与工程计算用户。 分子动力学、凝聚态物理、基础数学方向有可复现的成果案例,适合当作研究助手而非结论来源。

不推荐给这两类人。 需要图像理解的多模态场景现在接不了;对响应延迟敏感的实时交互业务,也会被它的长思考拖住。

定价方案

打分归打分,落到预算上才算数。按量计费的账其实很好算。

计费项 价格(每百万 tokens) 备注
输入(命中缓存) 0.3 元 长上下文重复前缀场景优势明显
输入(常规) 6 元 约 0.84 美元
输出 18 元 约 2.52 美元,同档位最低梯队

以上为 2026 年 8 月 28 日官方公布的现价。除了按量计费,WorkBuddy 和 CodeBuddy 在发布后提供两周限时免费,开源权重则可以直接自部署,不产生调用费用。按官方口径,接下来要走的是持续普惠路线,但 preview 期的价格不承诺长期不动,签长期预算前建议留个余量。

FAQ

临上手前,把最常被问到的几个问题集中答一遍,省得你自己去翻文档。

Q1:Hy4 preview 和 Hy4 正式版是什么关系?

A1:preview 是正式版之前的早期版本。 官方明确说明它在预训练和后训练上都还有提升空间,采用先发 preview 收集真实反馈、再推正式版的节奏,与 Hy3 preview 到 Hy3 的路径一致。

Q2:770B 参数、1M 上下文,本地部署需要什么硬件?

A2:个人单卡基本不用想。 HuggingFace 提供 BF16 与 FP8 两套权重,vLLM 和 SGLang 均可部署,但 770B 的体量需要多机多卡集群,个人用户建议直接调用 API 更划算。

Q3:它支持图片、语音这类多模态输入吗?

A3:暂时不支持。 当前 preview 版本没有视觉能力,多模态要在后续正式版补齐,涉及图像理解的业务现在还接不了。

Q4:为什么感觉它干活特别慢?

A4:这是官方列出的已知问题之一。 模型在复杂任务上存在长思考和过度自我验证倾向,会反复检查自己的输出,导致交付时间拉长。可以通过 chat template 的 reasoning effort 参数压低思考深度来缓解。

Q5:和 GLM-5.3、Kimi K3 相比到底选哪个?

A5:按任务类型分,别只看榜单。 Hy4 preview 在内部盲测里均分 2.99,对 2.92 和 2.94 只是微弱领先,胜率刚过半。但它输出价更低且开源权重,成本敏感或需要私有化部署的场景更占优。

Q6:API 在哪里接?兼容什么格式?

A6:腾讯云 TokenHub 和 OpenRouter 都有。 接口是 OpenAI 兼容格式,chat template 支持 thinking mode、reasoning effort 控制和工具调用,从其他模型迁移过来改动很小。

Q7:1M 上下文是真的能用满吗?

A7:长度是真的,成本要自己算。 1M 上下文已写进模型规格,且缓存命中输入价只有 0.3 元每百万 tokens,把固定内容做成前缀缓存能大幅压低长文档场景的开销。

Q8:开源协议允许商用吗?

A8:按社区转述是 Apache 2.0。 该协议对商用友好,但具体条款以 HuggingFace 仓库的 License 页面为准,落地商用前建议自行核对最新版本。

Q9:它在科学研究上的成果可信度如何?

A9:有公开可查的证明,但仍需人工复核。 三维 Blaschke–Lebesgue 问题的完整证明已发布在 GitHub 的 Hyra-results 仓库,分子动力学部分给出了 54.9 ms/step 的具体指标,属于可验证结果。

Q10:适合接入编码 Agent 做长程开发吗?

A10:适合,但要有耐心。 Terminal Bench 2.1 拿 85.4 分,与 Claude Opus 5 基本持平,DeepSWE 从 28.0 涨到 64.3,长程任务能力是这代的主攻方向,代价是响应时间偏长。

Q11:现在有免费额度可以用吗?

A11:有,但有时限。 WorkBuddy 和 CodeBuddy 在发布后开展为期两周的限时免费活动,元宝、ima 等腾讯产品也能直接体验,API 侧则按量计费。

结尾

Hy4 preview 不是那种靠一个爆点出圈的模型。它的卖点很朴素:把旗舰级的能力压到一个中端价格,同时把权重交出去。770B 参数只激活 49B,1M 上下文配 0.3 元的缓存价,这套组合对成本敏感又有长文档需求的团队来说,吸引力是实打实的。

但它的问题同样明确,而且是官方自己承认的。长思考和过度自我验证让交付时间偏长,多模态缺口还在,对同价位对手的优势只有零点零几分。preview 这个词本身就说明了一切:它能干活,但还不是完成品,把它当稳定依赖之前得先想清楚这一点。

如果你的场景是编码 Agent、长文档分析或者科研辅助,现在就值得花两周免费期测一轮自己的任务集,成本几乎为零。反过来,若要实时响应或图像理解,就不必急着上,等正式版补齐多模态、把长思考压下来之后评估,显然是更明智的做法。

AI工具

Lovart 评测:全球首个 AI 设计智能体,真能当半个设计师用吗

2026-8-28 10:20:24

开源项目

Hermes Agent评测:越用越聪明的开源 AI 智能体,我不信

2026-4-4 10:36:11

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧