通用模型竟然比医疗专用模型更懂医疗?一篇 ACL 论文的两个反直觉发现

研究团队构建了首个面向医疗错误检测、错误定位和错误纠正的多语言评测基准 MedErrBench,覆盖英语、中文和阿拉伯语三种语言,考验了 GPT-4o、Gemini、Llama、Qwen、DeepSeek 等一系列主流模型在多达十类典型医疗错误上的表现。研究选取通用大语言模型、语言专用大语言模型和医疗专用大语言模型三类模型进行测试,涵盖 GPT-4o、Gemini、Llama、Qwen、DeepSeek、ALLAM、MedGemma 和 HuatuoGPT 等。结果显示,医疗专用模型 MedGemma 和 HuatuoGPT 的表现不仅没有超越通用模型,甚至落后于部分通用模型。

原文连接