AI 研究智能体(AIRA)能自主提出、实现并评估机器学习实验,但验证候选方案需耗费大量 GPU 时间。Meta 提出无需实际执行即可预测候选方案价值的”AI 研究偏好模型”(RPM)。该模型基于冻结的预训练语言模型构建,包含 inference-only 和 agentic 两种形式,后者先执行小规模试验再做后续决策。
AI 研究智能体(AIRA)能自主提出、实现并评估机器学习实验,但验证候选方案需耗费大量 GPU 时间。Meta 提出无需实际执行即可预测候选方案价值的”AI 研究偏好模型”(RPM)。该模型基于冻结的预训练语言模型构建,包含 inference-only 和 agentic 两种形式,后者先执行小规模试验再做后续决策。