蚂蚁发布大模型内生式安全护栏 SingProbe,让 AI 边生成边识别风险

国家网络安全宣传周期间,蚂蚁 AI 安全实验室正式发布大模型内生式安全护栏 SingProbe,将安全检测融入模型生成过程。面对风险,SingProbe 能够在回答生成过程中持续提供风险信号,帮助应用系统及时采取中止回答、重新生成等措施。在医疗生成场景中,研发团队进一步探索了从风险识别到按需纠偏的技术应用,提出 SingProbe-Med:持续监测生成过程中的医疗风险,仅在达到触发条件后,对局部高风险内容进行解码干预。

原文连接