烧钱的速度可能不是均匀的,从 pro 模型开始训练算起 36 小时,两款模型已经花了超过 108 万美元,平均每小时 3 万美元。见过开放权重、开放训练代码和开放训练数据的,开放训练过程的还真是没见过,围观群众纷纷大呼过瘾。当预训练的 Scaling 已经发展多年之后,能否把模型与环境交互、产生经验、评价经验再到学习经验的整个 RL 循环,也变成一台可以持续扩大规模的机器。
烧钱的速度可能不是均匀的,从 pro 模型开始训练算起 36 小时,两款模型已经花了超过 108 万美元,平均每小时 3 万美元。见过开放权重、开放训练代码和开放训练数据的,开放训练过程的还真是没见过,围观群众纷纷大呼过瘾。当预训练的 Scaling 已经发展多年之后,能否把模型与环境交互、产生经验、评价经验再到学习经验的整个 RL 循环,也变成一台可以持续扩大规模的机器。