OpenAI 突发 GPT-5.4!首次原生操控电脑,AI 真的开始替你干活了

在 τ²-bench 电信测试里,模型要用工具完成客户服务任务,不开推理的情况下,GPT-5.4 准确率 64.3%,GPT-5.2 是 57.2%,GPT-5.1 是 45.2%,GPT-4.1 是 43.6% … 在 BrowseComp 测试里,衡量 AI 智能体能多持久地浏览网络,找到那些难找的信息时,GPT-5.4 比 GPT-5.2 提升了 17 个百分点,GPT-5.4 Pro 以 89.3% 的成绩创下该基准测试的新高 … 在安全方面,OpenAI 把 GPT-5.4 定位为高网络能力模型,沿用了 GPT-5.3 Codex 的类似保护措施,包括监控系统、受信任访问控制,对零数据保留 (ZDR) 表面的高风险请求做异步阻断。

原文连接

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧