J-Space 造假案背后:思维链作者暴论,小模型 + 工具干不掉顶级大模型

开源项目 J-Space Cognition Suite 声称无需修改模型权重,仅靠 DeepSeek V4 Flash 加外部 Harness 就能在 Agent 任务中追平 GLM-5.3。然而,思维链论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》指出,在小模型上使用思维链不仅不会提升性能,反而可能因引出错误中间推理步骤导致成绩下降。Omar Khattab 作为 Harness 优化推动者,其 DSPy 框架和 Meta-Harness 研究旨在提升工具链自动化水平,但他不认为 Harness 能替代模型本身能力,也不否认其工程价值。

原文连接