在原始结果页中,开源权重模型 Kimi K3 搭配 Prime Agent Harness 后跑出了 2930 步的成绩。参与测试的包括 Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM 5.2、Muse Spark 1.1、DeepSeek V4 Pro、Grok 4.6、Muse Spark 1.2、Qwen 3.8 等共计 18 个前沿模型。在 Kimi K3 的测试中,Prime Intellect 自家的 Prime Agent Harness 为模型提供了一个持久运行的 IPython 内核,让它们可以围绕研究任务,自己搭建和迭代一套工作流。

