-
Claude Opus 5 四句话跑了 8 小时:长任务 Agent 开始接近真实交付
Claude Opus 5 长任务演示 写在前面 Claude Opus 5 这次最醒目的数字,不是某个榜单多拿了几分,而是一个更像真实工作的案例:4 句话提示,模型自己跑了 8 小时,产出约 7 万行代码,完成一个网页版 3D 游戏浏览器,让 420 万格地图在 6 秒内加载,并保持 60fps。 这组数字听起来很适合做发布会烟花,但开发者真正该盯住的是另一个变化:模型开始承担“持续推进任务”的…- 741
- 0
-
Opus 5上线后跑分爆了,Claude Code该减负了
写在前面 Claude Opus 5 上线之后,最容易被讨论的是跑分:ARC-AGI-3 到了 30.2%,GPT-5.6 Sol 是 7.8%,Opus 4.8 只有 1.5%;AA 跑分甚至压过 Fable 5;输入每百万 Token 5 美元,输出每百万 Token 25 美元,和 Opus 4.8 一样;Fast Mode 速度大约提升 2.5 倍,价格翻倍。 但开发者真正该盯住的,不是“…- 900
- 0
-
Opus 5和GPT-5.6 Sol胜负已分,别再问谁更强
写在前面 Opus 5 出来以后,很多人的第一反应是把它和 GPT-5.6 Sol 放到同一张擂台上:谁更强,谁更值得默认使用,谁会成为下一代 AI 编程主力。 但连续高强度使用之后,一个更务实的答案会浮出来:这两个模型不是同一种“工程师”。Opus 5 更像能和你一起讨论产品、拆 MVP、做技术取舍的资深同事;GPT-5.6 Sol 更像执行力强、适合压测、审查和长时间无人值守任务的工程机器。 …- 910
- 0
-
AI互联网日报:DeepSeek宕机考验服务稳定、携程停止独家合作、华为AI眼镜接入支付、特斯拉收购AI硬件企业
看似只是几项功能更新,其实平台和设备都在重新争夺用户愿意交出的那一步操作。华为AI眼镜把支付放到视线里,穿戴设备开始接管原本属于手机的服务入口。微信还在补齐鸿蒙体验。携程则被要求把定价与流量选择还给商家,我想提醒老朋友们,方便不是让人更难离开,而是每次点击、授权和消费都清楚、可退,也经得起一次故障。 一起来看看这两天发生的AI和互联网赛道的大事件吧! 📌 今日AI互联网大事件速览 1,Anthro…- 1.2k
- 0






