一年从 3B 卷到 0.xB:MonkeyOCRv2 用 0.7B 拿下 17 语种文档解析开源第一

从 3B 的 MonkeyOCR,到 1.2B 的 MinerU、1.0B 的 HunyuanOCR、0.9B 的 PaddleOCR-VL 和 GLM-OCR,再到 0.7B、0.6B 的 MonkeyOCRv2,文档 OCR 正加速迈入小模型时代:模型越来越小,性能上限却一次次被重新定义。MDPBench 的开源模型列表几乎记录了文档 OCR 快速变小的过程:3B 的 dots.mocr、1.2B 的 MinerU2.5-Pro、1.0B 的 HunyuanOCR-1.5、0.9B 的 PaddleOCR-VL 系列,再到 0.6B 和 0.7B 的 MonkeyOCRv2。MonkeyOCRv2 开放了独立视觉编码器、0.6B 与 0.7B 解析模型、文档理解模型、训练 / 推理代码、部署示例和在线 Demo、以及 MonkeyDoc v2 数据。

原文连接