相关论文聚焦智能体、软件工程、科学智能、机器翻译、视频生成、移动 Agent 等方向,探索如何突破传统评测的局限,更准确地衡量 AI 系统在真实世界中的能力边界。卡内基梅隆大学、清华大学等多机构研究团队推出 Benchmark Radar,这是一个面向 AI 基准测试的动态数据库与搜索引擎,帮助研究者快速发现相关基准,并追踪其论文、代码、数据集及评测结果。Benchmark Radar 覆盖 LLM、Agent、编程、推理、安全等多个领域,并提供分数历史、基准采用趋势和饱和度分析,以及可下载证据、CLI 和 Web 仪表盘,帮助研究者更高效地检索现有基准、比较评测结果,并为新评测的设计提供参考。

