OpenAI 测谎 13 款大模型:Claude 3.7 封神,GPT-5.2 近乎失控!

在 CoT-Control 套件测试的 13 款前沿模型中,DeepSeek R1 控制自身思维链的成功率仅为 0.1%,Claude Sonnet 4.5 也只有 2.7% … **Claude 3.7 Sonnet**:虽然是全场最佳,思维链可控性达到 36.1%,但仍远低于其 59.5% 的输出控制力 … GPT-5.2 的可控性排名靠前,但 DeepSeek R1 这款在推理任务上表现优异的模型,反而是最难控制自己推理的。

原文连接

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧