Agnes-2.5-Flash 评测:全球第一梯队的免费 Coding 模型,Claude 的最佳替代品?

Claude 封号潮闹得人心惶惶,动不动就查证件。恰好这时候冒出一个 Coding 能力对标 Claude Opus 4.7 的模型,而且不限期免费。第一时间上手试了一遍,从定位隐藏 Bug 到从零搭建完整应用,体感确实对得起”全球第一梯队”这个标签。当然,跟 Claude Opus 4.8 的绝对巅峰还有差距,但考虑到价格是零,这可能是 2026 下半年最值得关注的 AI 编程模型。

产品概述

Agnes-2.5-Flash 是新加坡 AI 实验室 Agnes AI 在 2026 年 7 月 13 日发布的新一代高性能文本模型,Coding 能力位列全球第一梯队,核心定位是”开发者日常使用的主力模型”。模型围绕代码理解、工程修复、多步骤 Agent 任务执行和复杂推理做了专项优化,SWE-bench Verified 得分 75.6,较上一代 2.0-Flash 全面提升。

Agnes AI 的母公司是新加坡 Sapiens Technology PTE,创始人 Bruce Yang 是伯克利 CS+数学双学位、师从图灵奖得主 Richard Karp,目前在新加坡国立大学攻读 AI 博士。公司成立不到一年,已完成 2000 万美元融资,全球用户突破 600 万,估值超 1 亿美元。2026 年 6 月起,Agnes AI 将文本、图像、视频三大模型 API 全部免费开放,单周调用量飙升至 4.66 万亿 Token。

与传统编程模型最大的不同在于,Agnes-2.5-Flash 不是”给你写代码”的辅助工具,而是一个能真正介入工程流程的 Agent。它能理解项目结构、跨文件协同修改、自主规划多步骤任务。加上完全免费的定价策略,它直接挑战了”好模型必须付费”的行业惯性。

官网:https://agnes-ai.com

Agnes-2.5-Flash 评测:全球第一梯队的免费 Coding 模型,Claude 的最佳替代品?

核心功能实测

定位是骨架,这些功能才是真正的肌肉和血液。

代码生成与理解是基本功。根据自然语言描述生成可运行的代码片段、函数模块甚至完整应用,覆盖前端开发、自动化脚本和原型验证。更关键的是代码理解能力,把陌生项目丢给它,它能快速梳理出模块关系、调用链路和关键接口,这对接手别人代码库的开发者来说简直是救命稻草。

工程修复能力是这次升级的重头戏。在第三方实测中,测试者手动制造了一个全网没有现成答案的 Bug,只描述症状不说改了什么,Agnes-2.5-Flash 用了 3 分钟定位根因、12 秒完成修复,修复后游戏恢复正常运行。这种级别的 Bug 定位不是靠搜索 Stack Overflow 就能搞定的,它需要真正理解代码逻辑。

多步骤 Agent 任务执行让模型从代码补全器升级成了工程助手。它支持任务拆解、工具调用、文件读写、结果验证的完整闭环。官方给出的案例包括从一个网页链接自动读取内容、筛选信息、生成 PPT,或者从零构建一个包含评分系统和雷达图的”AI 前端竞技场”。这些任务不是单文件生成能解决的,需要跨模块协作。

Thinking 推理增强模式专门针对调试、重构、架构分析等深度场景设计。加上 512K 的超长上下文窗口和图像输入能力(支持截图分析、视觉问答),功能层面几乎没有明显短板。

核心能力 说明 典型场景
代码生成 自然语言到可运行代码 前端开发、脚本编写、原型验证
工程修复 Bug 定位与修复方案生成 调试、代码审查、遗留系统维护
Agent 执行 多步骤任务自主完成 从链接到 PPT、从零搭完整应用
Thinking 模式 深度推理增强 架构分析、重构方案、复杂调试

从零开始试

功能列表看完了,但东西好不好上手才是关键。

注册流程相当顺畅,访问 Agnes AI 网页端用邮箱或 Google 账号就能登录,不用填一堆表单。在模型列表里切换到 Agnes-2.5-Flash 就能用。桌面端 AgnesCode 需要下载安装,但它不只是个聊天窗口,整合了模型调用、Skill 管理、应用连接、本地项目浏览和产物管理,定位是”桌面 AI 工作台”而非单纯的编程工具。

首次体验的核心路径很直观。打开对话框,描述你要做的事,它就开始执行。我让它生成一个带计分系统的 Flappy Bird 风格小游戏,从输入到可运行的 HTML 文件,体感在两三分钟之内。界面虽然朴素但逻辑跑通了,鸟撞管子会死,分数正常累计。

意外的地方在于它对上下文的感知。第二轮加了需求,“做个双人模式”,它没有推到重来,而是在已有代码基础上增量修改。这意味着它不是每一轮都当全新对话处理,这对反复迭代的开发流程来说非常重要。当然也不是完美:有时候生成的 UI 比较原始,需要多轮微调,但这是当前所有 AI 编程模型的通病,不算硬伤。

Agnes-2.5-Flash 评测:全球第一梯队的免费 Coding 模型,Claude 的最佳替代品?

进阶玩法

基础操作不难,但真正用得溜的人都在用这几个技巧。

很多人不知道还有这些进阶用法:

  • 跨文件项目改造:把整个项目目录拖进 AgnesCode 工作区,直接描述接口调整需求(如把所有 API 调用统一迁移到新 base URL),模型会自动识别相关文件、逐个修改并保持引用一致。实测涉及 8 个文件的接口迁移任务,一次性完成且无语法错误。
  • Thinking 模式定位疑难 Bug:遇到逻辑层面的 Bug 而非语法错误时,不要直接让它修复。先开启 Thinking 模式分析项目架构和调用链路,定位根因后再改。这种两段式流程的成功率比一步到位高出约 40%。
  • 利用图像输入做代码审查:把设计稿截图、报错界面截图甚至手绘流程图直接贴进对话,让模型对照视觉需求检查代码实现。这对前端开发和 UI 验收场景尤其高效,省掉了反复文字描述的时间。
  • Agent 链式调用:把复杂需求拆成多个步骤,让模型逐步产出中间文件(先出技术方案文档、再出代码框架、最后填充实现)。分阶段构建的质量比一次性从头写到尾高出不少。

竞品对比

有些技巧是加分项,但真正决定选不选的还是和竞品的硬实力差距。

在 AI 编程模型赛道,Claude Opus 系列和 OpenAI Codex 是两个绕不开的参考坐标。下表对比了 Agnes-2.5-Flash 与主要竞品的核心维度(数据截至 2026 年 7 月):

对比维度 Agnes-2.5-Flash Claude Opus 4.8 OpenAI Codex DeepSeek V3.5
SWE-bench Verified 75.6 88.6 74.6
Terminal-Bench 2.1 62.3% 74.6%
上下文窗口 512K 1M 128K
定价(截至 2026.7) 免费 $5/$25 per 1M tokens 付费 免费/低价
Agent 工作流 原生支持 支持 支持 有限支持

Claude Opus 4.8 在各项基准测试上仍保持领先,SWE-bench Verified 88.6 的分数接近天花板。但 Agnes-2.5-Flash 在免费前提下拿出了 75.6 的成绩,这个分数在 CodeSoTa 榜单上超过 DeepSeek V3.5,介于 Gemini 3 Flash 和 Kimi K2.5 之间,实打实进入了全球 Coding 模型第一梯队。

核心差异在于定位:Claude 和 Codex 追求极致的绝对性能,而 Agnes 的策略是在”足够强”的线上把价格压到零。对于个人开发者和小团队来说,除非每天面对需要极深推理的架构级工作,否则 Agnes-2.5-Flash 的能力已经覆盖了 90% 的日常编程需求。

用户口碑如何

参数上赢没赢有数据,但真实用户用完后怎么想才是关键。

社交媒体上关于 Agnes-2.5-Flash 的讨论热度相当高。正面评价集中在两处:一是”免费但性能不免费”的惊喜,不少从 Claude 被封号转移过来的开发者表示,日常编程场景几乎感受不到明显差距;二是 Agent 任务执行能力的实用性,尤其是”给链接让它自己做 PPT”这类非代码场景的表现超出了很多人预期。

吐槽的声音也指向几个点。部分用户反馈生成的 UI 代码审美比较粗糙,需要多轮微调才能达到可用视觉效果。另外,Agnes-2.5-Flash 在极端复杂的架构推理场景下还是不如 Claude Opus 4.8,“遇到那种需要跨 20 个文件重构的问题,明显感觉到推理深度差了一截”。还有就是开源的缺位,截至 2026 年 7 月官方未公布任何开源计划,让偏好自部署的开发者有些失望。

但整体来看,在免费这个前提下,负面评价的声量远低于正面。毕竟大家心里清楚,一个免费模型能做到这个水平,已经没什么可抱怨的了。

六维评估

主观评价说了不少,来从几个硬维度打个分。

维度 评分 一句话解读
功能完整性 ⭐⭐⭐⭐☆ 代码+Agent+多模态,覆盖全面
易用性 ⭐⭐⭐⭐⭐ 对话即操作,零学习成本
性价比 ⭐⭐⭐⭐⭐ 不限期免费,同类无对手
创新性 ⭐⭐⭐⭐☆ Agent 工作台思路领先,非单纯代码补全
稳定性 ⭐⭐⭐☆☆ 复杂推理场景偶有波动,UI 审美不稳定
推荐度 ⭐⭐⭐⭐☆ 个人开发者闭眼入,架构级需求待 Pro

综合评分:8.2 / 10

性价比维度直接拉满毫无争议。易用性也做到了对话式交互的极致。扣分主要在稳定性,复杂场景下的推理深度和 UI 审美一致性还有提升空间。推荐度给出四星是因为,在当前价格点,它的价值已经远超同类产品。

正面清单 vs 吐槽清单

优势

  • 免费且不限期:网页端、桌面端、API 全线零成本,同类最强性价比
  • Coding 能力全球第一梯队:SWE-bench Verified 75.6,在免费模型中遥遥领先
  • 原生 Agent 工作流:多步骤任务自主执行,不是简单的代码补全器
  • 配套工具完善:AgnesCode 桌面端将模型能力落地到本地开发场景

不足

  • 与顶级旗舰仍有差距:SWE-bench 等基准落后 Claude Opus 4.8 约 13 个百分点
  • 复杂推理深度有天花板:跨大量文件的架构级重构不够稳定
  • 未开源:截至 2026 年 7 月无开源计划,无法自部署

适用人群

优缺点心里有数了,该回答最实际的问题:你到底需不需要它。

  • 独立开发者/个人程序员:日常编码、调试、重构的完美搭档。不需要任何预算就能拿到第一梯队的编程辅助,几乎没有不上手的理由。
  • AI Agent 开发者:原生 Function Calling 和 Tool Use 支持,加上多步骤任务执行框架,适合构建智能体应用和自动化工作流的开发者。
  • 受够了封号/区域限制的开发者:如果你的 Claude 或 Codex 账号最近出过问题,Agnes-2.5-Flash 是目前最接近的免费替代方案,迁移成本极低。
  • 预算有限的中小团队:团队需要一个主力编程模型但没预算买企业方案,免费 API 加桌面端的组合足够支撑日常协作开发。
  • 重度架构师/超大项目负责人:如果你日常要处理几十万行代码仓库的跨模块重构,Agnes-2.5-Flash 目前的推理深度可能不够用。建议等等 Agnes-2.5-Pro,或继续用 Claude Opus 4.8。

算笔账

人群对照清楚了,最现实的问题来了,它到底要花多少钱。

方案 价格(截至 2026.7) 核心权益 限制
免费版 ¥0 全部功能、API 调用、AgnesCode 桌面端 Token Plan 订阅用户有更高 RPM
Token Plan Starter 免费起步 每 5 小时 1500 次请求 / 每周 15000 次 仅文本模型
Token Plan Pro 付费 每 5 小时 30000 次 / 每周 300000 次 适合高频使用
Agnes-2.5-Pro(预告) 待公布 旗舰级编码能力,对标 Claude Opus 4.8 首款收费模型

免费版的定价策略在当前 AI 编程工具市场上几乎没有对手。Claude Opus 4.8 的 API 定价是输入 $5/百万 Token、输出 $25/百万 Token,一个月下来的费用对个人开发者不算小数目。Agnes-2.5-Flash 在 75.6 的 SWE-bench 分数上完全免费,这个性价比确实是降维打击。普通开发者用免费版完全够用,Token Plan 的付费方案更多是为高频调用场景准备的。

常见问题

分数摆在那,你可能还有些具体疑问要弄清楚。

Q1:Agnes-2.5-Flash 真的完全免费吗?

A1:不限期免费,没有隐藏收费。 网页端、AgnesCode 桌面端和 API 三种使用方式全部免费。API 有 RPM 限制(免费用户每分钟 20 次),但日常使用完全够用,高频场景可升级 Token Plan。


Q2:和 Claude Opus 4.8 比差距到底有多大?

A2:有差距但日常使用感知不强。 SWE-bench Verified 75.6 vs 88.6,差 13 个百分点。但 75.6 这个分数全球排名前 15,超过了很多年费几百刀的产品。除非你需要极复杂的架构级推理,否则用不出太大区别。


Q3:支持哪些编程语言?

A3:覆盖主流语言,未见明显偏科。 实测 Python、JavaScript、TypeScript、Go、Java、C++ 等主流语言表现一致,代码生成质量受语言因素影响较小。


Q4:需要下载软件吗?能用 API 吗?

A4:三种使用方式任选。 网页端无需安装,浏览器直接用;桌面端 AgnesCode 需下载,整合了本地项目管理和 Agent 能力;API 采用 OpenAI 兼容接口,现有项目改个 base URL 就能接入。


Q5:AgnesCode 桌面端和网页端有什么区别?

A5:桌面端多了本地项目集成和 Agent 工作台。 网页端是纯对话窗口,AgnesCode 能直接读取本地文件系统、管理项目目录、调用 Skill、执行终端命令,是更完整的开发工作台。


Q6:能商用吗?生成的代码有版权问题吗?

A6:免费使用,版权归你。 官方未对生成代码设置商用限制,API 生成的代码可以自由用于商业项目。


Q7:会不会像 Claude 一样封号?

A7:目前没有大规模封号事件。 Agnes AI 定位全球市场,主攻东南亚、拉美等新兴地区,暂无区域限制或封号历史。但政策可能调整,建议关注官方公告。


Q8:Agnes-2.5-Pro 什么时候上线?

A8:官方已预告,具体时间待公布。 Pro 将作为首款收费模型,目标对标 Claude Opus 4.8,侧重大型代码仓库理解和长链路 Agent 执行。Flash 免费策略不受影响。


Q9:适合新手程序员吗?

A9:非常合适。 对话式交互零门槛,Bug 定位和代码解释能力对学习阶段帮助很大。但要注意不要过度依赖 AI,理解逻辑再让它帮忙,别本末倒置。


Q10:国内用户能用吗?

A10:可以直接使用,无需特殊网络配置。 官网和 API 均可直接访问,中文支持良好,注册用邮箱即可。


最后总结

Agnes-2.5-Flash 做了一件很聪明的事,它没有试图在绝对性能上打败 Claude,而是在”足够好”的能力线上把价格压到了零。SWE-bench Verified 75.6 的成绩让它在免费模型里一骑绝尘,Agent 工作流和配套桌面端又让它不止是一个代码生成器。

对于独立开发者、小团队和被 Claude 封号搞烦了的用户,这是 2026 下半年最值得尝试的 AI 编程模型。如果你做的是架构级重构和超大规模仓库维护,建议等等 Agnes-2.5-Pro,或者继续用 Claude。免费版试错成本是零,没理由不试。

AI工具

腾讯 Miora 评测:不是另一个 AI 生图工具,而是你的私人创意工作室

2026-7-23 8:57:46

skills资源

YouTube Watcher:让 AI 替你"看"视频

2026-6-6 18:39:36

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧