Nanbeige4.2-3B:探索通用 Agent 小模型

Nanbeige4.2-3B 是在 3B 参数约束下,用一个模型同时掌握代码智能体、办公智能体、复杂工具调用以及通用推理的尝试。在 General Agent 与 Code Agent 的各项评测上,Nanbeige4.2-3B 的表现稳定超过参数量更大的 Qwen3.5-9B 和 Gemma4-12B,覆盖复杂工具调用、办公工作流、代码仓库修改和终端操作,而非集中在单一环境。团队还将研究 Linear / Sparse Attention,训练更大规模的 Nanbeige 模型,并探索如何用大模型蒸馏更强的小模型。

原文连接