7 名博士生仅用 3 个月从零训练 7B 大模型:代码 + 数据 + 训练日志全公开

随后,他们把各阶段训练数据和配方、模型权重、训练代码、中间 checkpoint 和日志也开放出来,让每一位感兴趣的研究者都可以追溯、复现整个流程。模型训完后,团队还对整个模型研发流程中 Agent 的实际表现做了一次评级,希望基于本次完整的大模型训练实践,为 RSI 现状提供真实的工程结论。最终权重能让人使用模型,各阶段权重、中间 checkpoint、训练代码、数据配方和日志,则让其他研究者有机会追踪能力如何形成,检查一个改动究竟带来了什么。

原文连接