专访大模型出卷人Meta陈文虎:当模型领先于Benchmark,AI该如何重新定义进步? 过去几年,大模型的发展一直伴随着一套不断升级的“标尺”:从MMLU、MMMU,到更复杂的Reasoning、Agentic Benchmark,模型需要在越来越难的测试中证明自己。但当模型开始领先于Benchmark,一个更根本的问题也随之… 赞 参与讨论{{item.data.meta.comment}}条讨论
专访大模型出卷人Meta陈文虎:当模型领先于Benchmark,AI该如何重新定义进步? 过去几年,大模型的发展一直伴随着一套不断升级的“标尺”:从MMLU、MMMU,到更复杂的Reasoning、Agentic Benchmark,模型需要在越来越难的测试中证明自己。但当模型开始领先于Benchmark,一个更根本的问题也随之… 赞 参与讨论{{item.data.meta.comment}}条讨论
作者: 专访大模型出卷人Meta陈文虎:当模型领先于Benchmark,AI该如何重新定义进步? 过去几年,大模型的发展一直伴随着一套不断升级的“标尺”:从MMLU、MMMU,到更复杂的Reasoning、Agentic Benchmark,模型需要在越来越难的测试中证明自己。但当模型开始领先于Benchmark,一个更根本的问题也随之… 赞 参与讨论{{item.data.meta.comment}}条讨论
专访大模型出卷人Meta陈文虎:当模型领先于Benchmark,AI该如何重新定义进步? 过去几年,大模型的发展一直伴随着一套不断升级的“标尺”:从MMLU、MMMU,到更复杂的Reasoning、Agentic Benchmark,模型需要在越来越难的测试中证明自己。但当模型开始领先于Benchmark,一个更根本的问题也随之… 赞 参与讨论{{item.data.meta.comment}}条讨论