它总参数 29B、激活参数只有 4B,原生支持 256K 上下文,还能扩展到 512K,是国内第一个从训练芯片到推理部署全程国产、又专门冲着复杂工程任务打磨的百亿参数大模型。官方把这趟路走成了闭环:昇腾芯片负责训练,国产框架做适配,架构自研,生态开源 —— 从底层算力到上层工具链,没有一处依赖海外供应链。经过 4-bit 量化后,显存占用压到 15GB,比 FP16 省了约 75%,意味着一块 24G 的 RTX3090 或 RTX4090 这类消费级显卡,就能在本地跑起长上下文任务 —— 不用堆服务器、不用租云卡,个人和中小团队也用得起来。

