-
专访大模型出卷人Meta陈文虎:当模型领先于Benchmark,AI该如何重新定义进步?
过去几年,大模型的发展一直伴随着一套不断升级的“标尺”:从MMLU、MMMU,到更复杂的Reasoning、Agentic Benchmark,模型需要在越来越难的测试中证明自己。但当模型开始领先于Benchmark,一个更根本的问题也随之出现:如果现有的标尺已经无法描述模型真正的能力,我们究竟应该用什么来衡量AI的下一步? 沿着这个问题继续往前走,Benchmark本身也正在发生变化。过去受限于…- 1.3k
- 0


