他从待直接拒稿的论文中非正式地抽取了 10 篇,通过审稿平台 OpenReview 给作者发去一条简短消息:一位主编希望在送审之前和您聊聊,以便更好地理解这篇论文,如果方便,请发邮件告知可约时间。题目分为四类:在多个版本中识别论文真实报告的数据(预置错误识别)、解释论文没有写明理由的设计选择、解释论文默认读者已知的背景概念,以及指出方法在什么具体条件下会失效。一位受试者的经历颇能说明问题:他在测试前把陌生论文丢给 AI,让它从头到尾讲解了一遍,但面对深入问题依然答不上来,陌生论文得分 1.3,自己论文得分 51。

