Meta 推出 AI 研究偏好模型 RPM:用小规模试点预测研究方案价值

AI 研究智能体(AIRA)能自主提出、实现并评估机器学习实验,但验证候选方案需耗费大量 GPU 时间。Meta 提出无需实际执行即可预测候选方案价值的”AI 研究偏好模型”(RPM)。该模型基于冻结的预训练语言模型构建,包含 inference-only 和 agentic 两种形式,后者先执行小规模试验再做后续决策。

原文连接