Agent 评测的下半场:为什么需要一个「活的」Benchmark?

在 Claw-Eval 之前,主流 Agent 评测的做法是:给 Agent 一个任务,看最终结果,判对错 … Claw-Eval 还进一步把多模态和多轮对话也纳入统一评测框架,但它最关键的贡献,首先是把 Agent 评测从”只看答案”推进到”看行动”… 如果说过去的大模型竞争更像能力展示的上半场,那么面向真实 workflow 的评测、验证与部署,才是 Agent benchmark 的下半场真正开始的地方。

原文连接