-
Claude Mythos 5.1 评测:被锁在玻璃箱里的”地表最强”孪生模型
写代码卡了许久找不到根因?做科研想让 AI 直接跑实验验证?Claude Mythos 5.1 就是 Anthropic 为这种高风险专业场景留的"后门"。它和人人可用的 Fable 是同一个模型,只是安全围栏松了一档。基准测试跑出超六成得分,但普通人根本申请不到。 产品概述 Claude Mythos 5.1 是 Anthropic 在 2026 年 9 月 1 日甩出的两张…- 1.3k
- 0
-
Hy4 preview 评测:770B 参数、1M 上下文,混元把旗舰价格又往下压了一档
让模型从一堆报销单里揪出哪张发票不合规,这种活儿过去得靠熟手干半天。腾讯混元今天放出来的新旗舰就是冲着这类脏活来的:770B 总参数、1M 上下文、输出 18 元/百万 tokens。参数堆得凶,价格压得低,真正要问的是它干活快不快、交付稳不稳。 产品概述 混元这次端出来的 Hy4 preview,是一代 MoE 旗舰的预览版本。总参数 770B,每个 token 只激活 49B,上下文长度拉到 …- 1.4k
- 0
-
DeepSeek-V4-Flash-Vision-Exp 评测:DeepSeek 终于长出了眼睛
写 Agent 最怕什么?明明截图就摆在眼前,模型却看不见。DeepSeek 最近给纯文本的 V4 Flash 接上了视觉,一张图最多算 384 个 token,价格和文本版完全一样。它瞄准的不是聊天看图,而是让 Agent 真正能读截图、识图表、看报错。到底值不值得接,上手试一遍再说。 产品概述 DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 在 2026 年 8…- 1.1k
- 0
-
Kimi K3 测评:2.8 万亿参数开源模型,前端编程全球第一,到底值不值?
写个前端页面还得手动改 CSS?丢给 AI 又怕它跑不起来?今天凌晨,月之暗面端出了 Kimi K3,参数规模拉到 2.8 万亿,全球最大开源模型,顺手还拿了前端编程竞技场的第一。48 小时自主设计芯片、一句话生成互动游戏,听着像科幻。但价格也不含糊,输出直逼国际一线水平。到底是不是真材实料,看完这篇你就有数了。 产品概述 7 月 17 日凌晨,月之暗面(Moonshot AI)正式推出 Kimi…- 1.3k
- 0
-
GPT-5.6 评测:三档模型同台,OpenAI 的效率牌打对了吗?
花三倍的钱用 Ultra 模式跑物理模拟,结果还不如 GPT-5.5?GPT-5.6 正式发布第一天,社区就把账单算得明明白白。Sol 是靠谱的日常通勤车,Terra 意外成了性价比黑马,而最贵的 Ultra 模式在特定任务上翻了车。这篇文章把三个版本的功能、价格、竞品对比和真实口碑全摊开,帮你判断该不该上手。 产品概述 2026 年 7 月 10 日,OpenAI 正式向全球开放 GPT-5.6…- 116
- 0
-
Claude Sonnet 5 评测:Agent 能力下放到中端,但真值这个价吗?
让 AI 自己规划任务、调用工具、跑终端,几个月前还只是 Opus 旗舰用户的特权。Anthropic 刚发布的 Claude Sonnet 5 把这种 Agent 能力压到了不到一半的价格,编码跑分直逼旗舰。但新分词器偷偷让 Token 消耗涨了三成,Max 模式跑同样的活反而更贵。第一批用户已经吵翻了天。 产品概述 Claude Sonnet 5(代号 Fennec)是 Anthropic 在…- 918
- 0
-
Claude Fable 5 评测:Anthropic 把神话级模型推向大众,但门票变贵了
代码库大到一个团队要干两个月,它一天跑完。这不是科幻,是 Claude Fable 5 在 Stripe 5000 万行 Ruby 代码上的真实战绩。Anthropic 把原本只给少数机构的 Mythos 级能力公开了,代价是价格翻倍、6 月 23 日后从订阅里踢出去单独收费。它到底强在哪,普通人用不用得起,上手试完这篇给你盘清楚。 这到底是什么 Claude Fable 5 是 Anthropi…- 2.1k
- 0
-
Gemini 3.5 Flash 测评:当 Flash 系列开始干翻旗舰,谷歌的 Agent 时代来了
写个复杂 Agent 还要等几十秒才能动?Gemini 3.5 Flash 把输出速度干到了 280+ token/秒,直接是 GPT-5.5 和 Claude Opus 4.7 的 4 倍。在编码和智能体基准上,它甚至反过来碾压了自家上一代旗舰 Gemini 3.1 Pro。$1.5 的输入价格、90% 的缓存折扣、默认开启的 Thinking 模式,这个 Flash 系列新王,把"快…- 307
- 0
-
讯飞星火深度测评:国产大模型里唯一全国产算力跑出来的黑马,到底多能打?
写个论文还要自己逐字逐句改?AI 学习机还停留在给答案的水平?讯飞星火从 X1.5 到 X2,三个月推理性能飙了 50%。AIME 竞赛数学 95.7 分,MMLU Pro 87.3 国产夺冠,医疗场景甚至压过 GPT-5.2。它不是参数堆得最猛的那个,但可能是国产大模型里最务实的那一匹。 简单说说 讯飞星火是科大讯飞推出的认知智能大模型,最早于 2023 年 5 月首次亮相,走了一条不太一样的路…- 201
- 0
-
Qwen3.5 评测:从 0.8B 到 397B,开源大模型的代际突围
用 3B 的活跃参数跑出超越前代 235B 的性能,就这一条,Qwen3.5 已经让整个开源社区炸了锅。从 0.8B 的物联网小模型到 397B 的 MoE 旗舰,覆盖十条产品线,Apache 2.0 全开源商用无限制。但它真的像参数上看起来那么香吗?上手测了一圈,效率提升确实惊人,工具调用和 Agent 能力却还有进步空间。 先搞懂它是什么 2026 年除夕夜,阿里通义千问放了个大招,一口气甩出…- 162
- 0

















