核心结论:V-Rubrics 将 50,248 个视觉样本拆成 352,938 条可逐项检查的准则,让图像中的事实、推理步骤和任务要求分别参与奖励计算。如果最后的答案恰好正确,按结果评分的训练方式就可能把这些”看似结果正确”但”实际推理错误”的情况也一并奖励。V-Rubrics 50K 从 17 个公开视觉数据源中选取样本,涵盖图表与文档问答、示意图、视觉数学、计数、教育问答和通用视觉推理,并按有效性、内容质量与重复性进行了初步筛选。
核心结论:V-Rubrics 将 50,248 个视觉样本拆成 352,938 条可逐项检查的准则,让图像中的事实、推理步骤和任务要求分别参与奖励计算。如果最后的答案恰好正确,按结果评分的训练方式就可能把这些”看似结果正确”但”实际推理错误”的情况也一并奖励。V-Rubrics 50K 从 17 个公开视觉数据源中选取样本,涵盖图表与文档问答、示意图、视觉数学、计数、教育问答和通用视觉推理,并按有效性、内容质量与重复性进行了初步筛选。