-
Better Harness:Agent 的交付过程,现在可以像录像一样回放
Better Harness 是我们开源的一套工具,用来检查 Coding Agent 的工作方式,并把有效经验沉淀成可复用的 SKILL。上线以来,我们一直在做一件事:从 Agent 的会话中识别重复出现的工作路径,判断哪些值得进一步沉淀。做起来以后发现,这件事远比“分析会话”复杂。 对于一次软件开发任务来说,Agent 的行为并不是孤立发生的。它从一个需求或者用户故事开始,经过对需求的理解、上…- 1.2k
- 0
-
Prime Agent:一个会改自己脚手架的编码 Agent
8 月 5 日,Prime Intellect 把一个叫 Prime Agent 的项目丢上了 GitHub。当天它就冲进了 Hacker News 首页,一周内攒下 8,500 多颗 Star。到现在(2026 年 8 月中旬),这个仓库已经站稳 1.4 万 Star 上下,MIT 协议,对开发者完全敞开。 引爆讨论的是一组数字:官方称,用 Claude Opus 5 驱动时,Prime Age…- 1.1k
- 0
-
Agnes-2.5-Flash 评测:全球第一梯队的免费 Coding 模型,Claude 的最佳替代品?
Claude 封号潮闹得人心惶惶,动不动就查证件。恰好这时候冒出一个 Coding 能力对标 Claude Opus 4.7 的模型,而且不限期免费。第一时间上手试了一遍,从定位隐藏 Bug 到从零搭建完整应用,体感确实对得起"全球第一梯队"这个标签。当然,跟 Claude Opus 4.8 的绝对巅峰还有差距,但考虑到价格是零,这可能是 2026 下半年最值得关注的 AI 编…- 985
- 0
-
git push no-mistakes:在代码推到 origin 之前,让 AI 先审一遍
你刚在 Claude Code 里折腾了两个小时。它写了 6 个文件、3 个测试、一个 migration。你扫了一眼 diff,看起来都合理。git push。CI 全绿。代码上线了。 两天后你发现那个 migration 脚本删了一个有三个下游服务依赖的字段。回滚花了一整个下午。 2026 年,这事不是假设。每个重度用过 Coding Agent 的人都经历过。问题不在于 AI 能不能写出好代…- 910
- 0
-
如果Claude Code 超过 200 步就开始失忆,MiMo Code 就是冲着这个问题来的
如果你用过 Claude Code 或者任何终端里的 AI 编程 Agent,你应该碰到过这样的时刻:Agent 已经在同一个任务上跑了几十轮,前面的决策开始被后面积压的上下文挤掉,它忘了你最开始说了什么,忘了中间改过的设计方向,甚至忘了测试还没跑完就宣布"搞定了"。 这不是模型不够聪明。是 Agent 的"记忆系统"跟不上任务的长度。 小米 MiMo 团队…- 907
- 0
-
Multica 评测:让编码智能体成为你的真队友
代码写完了,Agent 出结果了,但你根本不知道它中途卡在哪。Multica 就是来解决这个痛点的。开源、自托管、26.8k GitHub Stars,它把 Claude Code、Codex、Kimi 这些编码智能体变成看板上的正式队友。任务生命周期全程可视,技能复利沉淀团队能力。到底有没有传说中那么好使? 简单说说 现在市面上的编码 Agent 多到数不清:Claude Code、Codex、…- 1.1k
- 0










