** 也就是说,AI 在长期代码维护过程中,可能将代码「越改越糟」… ** 这是全球首个专门评估 AI 智能体在长期代码维护表现的评测系统 **,它不再满足于考察 AI 编程的「一次性正确」, ** 而是评估 AI 是否像真正的软件工程师一样,在数月甚至数年的开发过程中持续保持代码质量 … 包括 GPT-5.2、Qwen3.5-plus、MiniMax-M2.5 和 DeepSeek-V3.2 在内的其余 14 个 AI 大模型的零退化率都在 25% 以下, ** 这意味着在长期代码维护过程中,大模型在超过 75% 的任务中会破坏原本正常的代码功能,引发性能退化问题。
暂无讨论,说说你的看法吧

