-
Kimi K3 测评:2.8 万亿参数开源模型,前端编程全球第一,到底值不值?
写个前端页面还得手动改 CSS?丢给 AI 又怕它跑不起来?今天凌晨,月之暗面端出了 Kimi K3,参数规模拉到 2.8 万亿,全球最大开源模型,顺手还拿了前端编程竞技场的第一。48 小时自主设计芯片、一句话生成互动游戏,听着像科幻。但价格也不含糊,输出直逼国际一线水平。到底是不是真材实料,看完这篇你就有数了。 产品概述 7 月 17 日凌晨,月之暗面(Moonshot AI)正式推出 Kimi…- 1.2k
- 0
-
GPT-5.6 评测:三档模型同台,OpenAI 的效率牌打对了吗?
花三倍的钱用 Ultra 模式跑物理模拟,结果还不如 GPT-5.5?GPT-5.6 正式发布第一天,社区就把账单算得明明白白。Sol 是靠谱的日常通勤车,Terra 意外成了性价比黑马,而最贵的 Ultra 模式在特定任务上翻了车。这篇文章把三个版本的功能、价格、竞品对比和真实口碑全摊开,帮你判断该不该上手。 产品概述 2026 年 7 月 10 日,OpenAI 正式向全球开放 GPT-5.6…- 90
- 0
-
Claude Sonnet 5 评测:Agent 能力下放到中端,但真值这个价吗?
让 AI 自己规划任务、调用工具、跑终端,几个月前还只是 Opus 旗舰用户的特权。Anthropic 刚发布的 Claude Sonnet 5 把这种 Agent 能力压到了不到一半的价格,编码跑分直逼旗舰。但新分词器偷偷让 Token 消耗涨了三成,Max 模式跑同样的活反而更贵。第一批用户已经吵翻了天。 产品概述 Claude Sonnet 5(代号 Fennec)是 Anthropic 在…- 891
- 0
-
Claude Fable 5 评测:Anthropic 把神话级模型推向大众,但门票变贵了
代码库大到一个团队要干两个月,它一天跑完。这不是科幻,是 Claude Fable 5 在 Stripe 5000 万行 Ruby 代码上的真实战绩。Anthropic 把原本只给少数机构的 Mythos 级能力公开了,代价是价格翻倍、6 月 23 日后从订阅里踢出去单独收费。它到底强在哪,普通人用不用得起,上手试完这篇给你盘清楚。 这到底是什么 Claude Fable 5 是 Anthropi…- 2k
- 0
-
Gemini 3.5 Flash 测评:当 Flash 系列开始干翻旗舰,谷歌的 Agent 时代来了
写个复杂 Agent 还要等几十秒才能动?Gemini 3.5 Flash 把输出速度干到了 280+ token/秒,直接是 GPT-5.5 和 Claude Opus 4.7 的 4 倍。在编码和智能体基准上,它甚至反过来碾压了自家上一代旗舰 Gemini 3.1 Pro。$1.5 的输入价格、90% 的缓存折扣、默认开启的 Thinking 模式,这个 Flash 系列新王,把"快…- 274
- 0
-
讯飞星火深度测评:国产大模型里唯一全国产算力跑出来的黑马,到底多能打?
写个论文还要自己逐字逐句改?AI 学习机还停留在给答案的水平?讯飞星火从 X1.5 到 X2,三个月推理性能飙了 50%。AIME 竞赛数学 95.7 分,MMLU Pro 87.3 国产夺冠,医疗场景甚至压过 GPT-5.2。它不是参数堆得最猛的那个,但可能是国产大模型里最务实的那一匹。 简单说说 讯飞星火是科大讯飞推出的认知智能大模型,最早于 2023 年 5 月首次亮相,走了一条不太一样的路…- 139
- 0
-
Qwen3.5 评测:从 0.8B 到 397B,开源大模型的代际突围
用 3B 的活跃参数跑出超越前代 235B 的性能,就这一条,Qwen3.5 已经让整个开源社区炸了锅。从 0.8B 的物联网小模型到 397B 的 MoE 旗舰,覆盖十条产品线,Apache 2.0 全开源商用无限制。但它真的像参数上看起来那么香吗?上手测了一圈,效率提升确实惊人,工具调用和 Agent 能力却还有进步空间。 先搞懂它是什么 2026 年除夕夜,阿里通义千问放了个大招,一口气甩出…- 111
- 0












