-
专访大模型出卷人Meta陈文虎:当模型领先于Benchmark,AI该如何重新定义进步?
过去几年,大模型的发展一直伴随着一套不断升级的“标尺”:从MMLU、MMMU,到更复杂的Reasoning、Agentic Benchmark,模型需要在越来越难的测试中证明自己。但当模型开始领先于Benchmark,一个更根本的问题也随之出现:如果现有的标尺已经无法描述模型真正的能力,我们究竟应该用什么来衡量AI的下一步? 沿着这个问题继续往前走,Benchmark本身也正在发生变化。过去受限于…- 1.3k
- 0
-
我对 AI Coding 的一点思考:从 Spec 驱动转向环境与验证驱动
本文指出随着AI模型在代码生成基准测试中取得高分,Coding环节已趋近被解决,但研发整体效率并未同步提升,瓶颈已转移至编码之外的环境与验证环节。作者通过类比电气化革命中从“电力轴传动”到“单元驱动”的转变,批判了当前将AI简单嵌入原有固定工作流(Spec驱动)的做法,认为这限制了AI的自主性且收益线性递减。文章主张转向“环境与验证驱动”,即停止在提示词编排等易被模型迭代抵消的领域过度投入,转而致…- 3.2k
- 0




