Claude 封号潮闹得人心惶惶,动不动就查证件。恰好这时候冒出一个 Coding 能力对标 Claude Opus 4.7 的模型,而且不限期免费。第一时间上手试了一遍,从定位隐藏 Bug 到从零搭建完整应用,体感确实对得起”全球第一梯队”这个标签。当然,跟 Claude Opus 4.8 的绝对巅峰还有差距,但考虑到价格是零,这可能是 2026 下半年最值得关注的 AI 编程模型。
产品概述
Agnes-2.5-Flash 是新加坡 AI 实验室 Agnes AI 在 2026 年 7 月 13 日发布的新一代高性能文本模型,Coding 能力位列全球第一梯队,核心定位是”开发者日常使用的主力模型”。模型围绕代码理解、工程修复、多步骤 Agent 任务执行和复杂推理做了专项优化,SWE-bench Verified 得分 75.6,较上一代 2.0-Flash 全面提升。
Agnes AI 的母公司是新加坡 Sapiens Technology PTE,创始人 Bruce Yang 是伯克利 CS+数学双学位、师从图灵奖得主 Richard Karp,目前在新加坡国立大学攻读 AI 博士。公司成立不到一年,已完成 2000 万美元融资,全球用户突破 600 万,估值超 1 亿美元。2026 年 6 月起,Agnes AI 将文本、图像、视频三大模型 API 全部免费开放,单周调用量飙升至 4.66 万亿 Token。
与传统编程模型最大的不同在于,Agnes-2.5-Flash 不是”给你写代码”的辅助工具,而是一个能真正介入工程流程的 Agent。它能理解项目结构、跨文件协同修改、自主规划多步骤任务。加上完全免费的定价策略,它直接挑战了”好模型必须付费”的行业惯性。

核心功能实测
定位是骨架,这些功能才是真正的肌肉和血液。
代码生成与理解是基本功。根据自然语言描述生成可运行的代码片段、函数模块甚至完整应用,覆盖前端开发、自动化脚本和原型验证。更关键的是代码理解能力,把陌生项目丢给它,它能快速梳理出模块关系、调用链路和关键接口,这对接手别人代码库的开发者来说简直是救命稻草。
工程修复能力是这次升级的重头戏。在第三方实测中,测试者手动制造了一个全网没有现成答案的 Bug,只描述症状不说改了什么,Agnes-2.5-Flash 用了 3 分钟定位根因、12 秒完成修复,修复后游戏恢复正常运行。这种级别的 Bug 定位不是靠搜索 Stack Overflow 就能搞定的,它需要真正理解代码逻辑。
多步骤 Agent 任务执行让模型从代码补全器升级成了工程助手。它支持任务拆解、工具调用、文件读写、结果验证的完整闭环。官方给出的案例包括从一个网页链接自动读取内容、筛选信息、生成 PPT,或者从零构建一个包含评分系统和雷达图的”AI 前端竞技场”。这些任务不是单文件生成能解决的,需要跨模块协作。
Thinking 推理增强模式专门针对调试、重构、架构分析等深度场景设计。加上 512K 的超长上下文窗口和图像输入能力(支持截图分析、视觉问答),功能层面几乎没有明显短板。
| 核心能力 | 说明 | 典型场景 |
|---|---|---|
| 代码生成 | 自然语言到可运行代码 | 前端开发、脚本编写、原型验证 |
| 工程修复 | Bug 定位与修复方案生成 | 调试、代码审查、遗留系统维护 |
| Agent 执行 | 多步骤任务自主完成 | 从链接到 PPT、从零搭完整应用 |
| Thinking 模式 | 深度推理增强 | 架构分析、重构方案、复杂调试 |
从零开始试
功能列表看完了,但东西好不好上手才是关键。
注册流程相当顺畅,访问 Agnes AI 网页端用邮箱或 Google 账号就能登录,不用填一堆表单。在模型列表里切换到 Agnes-2.5-Flash 就能用。桌面端 AgnesCode 需要下载安装,但它不只是个聊天窗口,整合了模型调用、Skill 管理、应用连接、本地项目浏览和产物管理,定位是”桌面 AI 工作台”而非单纯的编程工具。
首次体验的核心路径很直观。打开对话框,描述你要做的事,它就开始执行。我让它生成一个带计分系统的 Flappy Bird 风格小游戏,从输入到可运行的 HTML 文件,体感在两三分钟之内。界面虽然朴素但逻辑跑通了,鸟撞管子会死,分数正常累计。
意外的地方在于它对上下文的感知。第二轮加了需求,“做个双人模式”,它没有推到重来,而是在已有代码基础上增量修改。这意味着它不是每一轮都当全新对话处理,这对反复迭代的开发流程来说非常重要。当然也不是完美:有时候生成的 UI 比较原始,需要多轮微调,但这是当前所有 AI 编程模型的通病,不算硬伤。

进阶玩法
基础操作不难,但真正用得溜的人都在用这几个技巧。
很多人不知道还有这些进阶用法:
-
跨文件项目改造:把整个项目目录拖进 AgnesCode 工作区,直接描述接口调整需求(如把所有 API 调用统一迁移到新 base URL),模型会自动识别相关文件、逐个修改并保持引用一致。实测涉及 8 个文件的接口迁移任务,一次性完成且无语法错误。 -
Thinking 模式定位疑难 Bug:遇到逻辑层面的 Bug 而非语法错误时,不要直接让它修复。先开启 Thinking 模式分析项目架构和调用链路,定位根因后再改。这种两段式流程的成功率比一步到位高出约 40%。 -
利用图像输入做代码审查:把设计稿截图、报错界面截图甚至手绘流程图直接贴进对话,让模型对照视觉需求检查代码实现。这对前端开发和 UI 验收场景尤其高效,省掉了反复文字描述的时间。 -
Agent 链式调用:把复杂需求拆成多个步骤,让模型逐步产出中间文件(先出技术方案文档、再出代码框架、最后填充实现)。分阶段构建的质量比一次性从头写到尾高出不少。
竞品对比
有些技巧是加分项,但真正决定选不选的还是和竞品的硬实力差距。
在 AI 编程模型赛道,Claude Opus 系列和 OpenAI Codex 是两个绕不开的参考坐标。下表对比了 Agnes-2.5-Flash 与主要竞品的核心维度(数据截至 2026 年 7 月):
| 对比维度 | Agnes-2.5-Flash | Claude Opus 4.8 | OpenAI Codex | DeepSeek V3.5 |
|---|---|---|---|---|
| SWE-bench Verified | 75.6 | 88.6 | — | 74.6 |
| Terminal-Bench 2.1 | 62.3% | 74.6% | — | — |
| 上下文窗口 | 512K | 1M | — | 128K |
| 定价(截至 2026.7) | 免费 | $5/$25 per 1M tokens | 付费 | 免费/低价 |
| Agent 工作流 | 原生支持 | 支持 | 支持 | 有限支持 |
Claude Opus 4.8 在各项基准测试上仍保持领先,SWE-bench Verified 88.6 的分数接近天花板。但 Agnes-2.5-Flash 在免费前提下拿出了 75.6 的成绩,这个分数在 CodeSoTa 榜单上超过 DeepSeek V3.5,介于 Gemini 3 Flash 和 Kimi K2.5 之间,实打实进入了全球 Coding 模型第一梯队。
核心差异在于定位:Claude 和 Codex 追求极致的绝对性能,而 Agnes 的策略是在”足够强”的线上把价格压到零。对于个人开发者和小团队来说,除非每天面对需要极深推理的架构级工作,否则 Agnes-2.5-Flash 的能力已经覆盖了 90% 的日常编程需求。
用户口碑如何
参数上赢没赢有数据,但真实用户用完后怎么想才是关键。
社交媒体上关于 Agnes-2.5-Flash 的讨论热度相当高。正面评价集中在两处:一是”免费但性能不免费”的惊喜,不少从 Claude 被封号转移过来的开发者表示,日常编程场景几乎感受不到明显差距;二是 Agent 任务执行能力的实用性,尤其是”给链接让它自己做 PPT”这类非代码场景的表现超出了很多人预期。
吐槽的声音也指向几个点。部分用户反馈生成的 UI 代码审美比较粗糙,需要多轮微调才能达到可用视觉效果。另外,Agnes-2.5-Flash 在极端复杂的架构推理场景下还是不如 Claude Opus 4.8,“遇到那种需要跨 20 个文件重构的问题,明显感觉到推理深度差了一截”。还有就是开源的缺位,截至 2026 年 7 月官方未公布任何开源计划,让偏好自部署的开发者有些失望。
但整体来看,在免费这个前提下,负面评价的声量远低于正面。毕竟大家心里清楚,一个免费模型能做到这个水平,已经没什么可抱怨的了。
六维评估
主观评价说了不少,来从几个硬维度打个分。
| 维度 | 评分 | 一句话解读 |
|---|---|---|
| 功能完整性 | ⭐⭐⭐⭐☆ | 代码+Agent+多模态,覆盖全面 |
| 易用性 | ⭐⭐⭐⭐⭐ | 对话即操作,零学习成本 |
| 性价比 | ⭐⭐⭐⭐⭐ | 不限期免费,同类无对手 |
| 创新性 | ⭐⭐⭐⭐☆ | Agent 工作台思路领先,非单纯代码补全 |
| 稳定性 | ⭐⭐⭐☆☆ | 复杂推理场景偶有波动,UI 审美不稳定 |
| 推荐度 | ⭐⭐⭐⭐☆ | 个人开发者闭眼入,架构级需求待 Pro |
综合评分:8.2 / 10
性价比维度直接拉满毫无争议。易用性也做到了对话式交互的极致。扣分主要在稳定性,复杂场景下的推理深度和 UI 审美一致性还有提升空间。推荐度给出四星是因为,在当前价格点,它的价值已经远超同类产品。
正面清单 vs 吐槽清单
优势
-
免费且不限期:网页端、桌面端、API 全线零成本,同类最强性价比 -
Coding 能力全球第一梯队:SWE-bench Verified 75.6,在免费模型中遥遥领先 -
原生 Agent 工作流:多步骤任务自主执行,不是简单的代码补全器 -
配套工具完善:AgnesCode 桌面端将模型能力落地到本地开发场景
不足
-
与顶级旗舰仍有差距:SWE-bench 等基准落后 Claude Opus 4.8 约 13 个百分点 -
复杂推理深度有天花板:跨大量文件的架构级重构不够稳定 -
未开源:截至 2026 年 7 月无开源计划,无法自部署
适用人群
优缺点心里有数了,该回答最实际的问题:你到底需不需要它。
-
独立开发者/个人程序员:日常编码、调试、重构的完美搭档。不需要任何预算就能拿到第一梯队的编程辅助,几乎没有不上手的理由。 -
AI Agent 开发者:原生 Function Calling 和 Tool Use 支持,加上多步骤任务执行框架,适合构建智能体应用和自动化工作流的开发者。 -
受够了封号/区域限制的开发者:如果你的 Claude 或 Codex 账号最近出过问题,Agnes-2.5-Flash 是目前最接近的免费替代方案,迁移成本极低。 -
预算有限的中小团队:团队需要一个主力编程模型但没预算买企业方案,免费 API 加桌面端的组合足够支撑日常协作开发。 -
重度架构师/超大项目负责人:如果你日常要处理几十万行代码仓库的跨模块重构,Agnes-2.5-Flash 目前的推理深度可能不够用。建议等等 Agnes-2.5-Pro,或继续用 Claude Opus 4.8。
算笔账
人群对照清楚了,最现实的问题来了,它到底要花多少钱。
| 方案 | 价格(截至 2026.7) | 核心权益 | 限制 |
|---|---|---|---|
| 免费版 | ¥0 | 全部功能、API 调用、AgnesCode 桌面端 | Token Plan 订阅用户有更高 RPM |
| Token Plan Starter | 免费起步 | 每 5 小时 1500 次请求 / 每周 15000 次 | 仅文本模型 |
| Token Plan Pro | 付费 | 每 5 小时 30000 次 / 每周 300000 次 | 适合高频使用 |
| Agnes-2.5-Pro(预告) | 待公布 | 旗舰级编码能力,对标 Claude Opus 4.8 | 首款收费模型 |
免费版的定价策略在当前 AI 编程工具市场上几乎没有对手。Claude Opus 4.8 的 API 定价是输入 $5/百万 Token、输出 $25/百万 Token,一个月下来的费用对个人开发者不算小数目。Agnes-2.5-Flash 在 75.6 的 SWE-bench 分数上完全免费,这个性价比确实是降维打击。普通开发者用免费版完全够用,Token Plan 的付费方案更多是为高频调用场景准备的。
常见问题
分数摆在那,你可能还有些具体疑问要弄清楚。
Q1:Agnes-2.5-Flash 真的完全免费吗?
A1:不限期免费,没有隐藏收费。 网页端、AgnesCode 桌面端和 API 三种使用方式全部免费。API 有 RPM 限制(免费用户每分钟 20 次),但日常使用完全够用,高频场景可升级 Token Plan。
Q2:和 Claude Opus 4.8 比差距到底有多大?
A2:有差距但日常使用感知不强。 SWE-bench Verified 75.6 vs 88.6,差 13 个百分点。但 75.6 这个分数全球排名前 15,超过了很多年费几百刀的产品。除非你需要极复杂的架构级推理,否则用不出太大区别。
Q3:支持哪些编程语言?
A3:覆盖主流语言,未见明显偏科。 实测 Python、JavaScript、TypeScript、Go、Java、C++ 等主流语言表现一致,代码生成质量受语言因素影响较小。
Q4:需要下载软件吗?能用 API 吗?
A4:三种使用方式任选。 网页端无需安装,浏览器直接用;桌面端 AgnesCode 需下载,整合了本地项目管理和 Agent 能力;API 采用 OpenAI 兼容接口,现有项目改个 base URL 就能接入。
Q5:AgnesCode 桌面端和网页端有什么区别?
A5:桌面端多了本地项目集成和 Agent 工作台。 网页端是纯对话窗口,AgnesCode 能直接读取本地文件系统、管理项目目录、调用 Skill、执行终端命令,是更完整的开发工作台。
Q6:能商用吗?生成的代码有版权问题吗?
A6:免费使用,版权归你。 官方未对生成代码设置商用限制,API 生成的代码可以自由用于商业项目。
Q7:会不会像 Claude 一样封号?
A7:目前没有大规模封号事件。 Agnes AI 定位全球市场,主攻东南亚、拉美等新兴地区,暂无区域限制或封号历史。但政策可能调整,建议关注官方公告。
Q8:Agnes-2.5-Pro 什么时候上线?
A8:官方已预告,具体时间待公布。 Pro 将作为首款收费模型,目标对标 Claude Opus 4.8,侧重大型代码仓库理解和长链路 Agent 执行。Flash 免费策略不受影响。
Q9:适合新手程序员吗?
A9:非常合适。 对话式交互零门槛,Bug 定位和代码解释能力对学习阶段帮助很大。但要注意不要过度依赖 AI,理解逻辑再让它帮忙,别本末倒置。
Q10:国内用户能用吗?
A10:可以直接使用,无需特殊网络配置。 官网和 API 均可直接访问,中文支持良好,注册用邮箱即可。
最后总结
Agnes-2.5-Flash 做了一件很聪明的事,它没有试图在绝对性能上打败 Claude,而是在”足够好”的能力线上把价格压到了零。SWE-bench Verified 75.6 的成绩让它在免费模型里一骑绝尘,Agent 工作流和配套桌面端又让它不止是一个代码生成器。
对于独立开发者、小团队和被 Claude 封号搞烦了的用户,这是 2026 下半年最值得尝试的 AI 编程模型。如果你做的是架构级重构和超大规模仓库维护,建议等等 Agnes-2.5-Pro,或者继续用 Claude。免费版试错成本是零,没理由不试。
