GPT-6 Astra 深度评测:当 AI 开始自己干活

还在把 AI 的回答复制进 Excel 自己排版?新旗舰 Astra 想替你把这一步也省了。它能直接打开浏览器、填表格、跑代码、做 PPT,自己把活干完再交付。抽象推理基准 ARC-AGI 几乎满分,官方称这是 AGI 时代的开端。它到底有多能打,又贵不贵,上手试一遍才知道。

产品概述

OpenAI 在 2026 年 9 月 4 日(北京时间)发布了新一代旗舰模型 GPT-6 Astra,代号在拉丁语里意为星辰。官方把它定义为全球最智能、对齐最好的模型,明确把重心从聊天问答转向自主完成任务。训练动用了得州 Stargate 超算超过 10 万块 GPU,是 OpenAI 首次大规模用前代模型参与监督训练的旗舰产品。

它不是又一个只会聊天的 bot,定位是 computer-use agent,能操控浏览器、办公软件、开发工具去完成多步骤工作流,再把成品交给你。这种从“给答案”到“交成果”的跳跃,是这一代最该被记住的变化,意味着 AI 竞争的标尺从“谁更会聊”变成了“谁真能把事办成”。

入口都在 OpenAI 自家体系内,认准官网与 API 文档这两个地址,别去第三方镜像折腾。

想第一时间试,直接装 ChatGPT 桌面端最省事,灰度从那里推,比苦等 API 配额更早摸到真实能力,企业用户走 API 还能拿到完整参数和更高额度。

官网:https://openai.com | API 文档:https://platform.openai.com/docs。

GPT-6 Astra 深度评测:当 AI 开始自己干活

核心功能

前面说了它要自己干活,下面看看底子到底有多厚。Astra 最大的变化是操作计算机:你给它一个目标,比如把财报做成演示文稿,它自己拆任务、调工具、边做边查,再交付成品。它能填在线表单、更新 CRM、整理日历、做网页研究摘要,也能分析科学数据、画图表、建网站并跑前端 QA。

OpenAI 展示的案例里,它能把电子原理图转成可制造 PCB,用 Unity 做游戏原型,在 Blender 建好房再导入虚幻 5 让人走进去体验。找儿科医生人工要 5 小时,它不到 3 分钟。法律平台一次性核查 41 份财报,预埋的 4 处错误一个没漏,这种长链路准确率正是 agentic 模式最值钱的地方。

理解 Astra 得看它的工作方式,它不是单模型硬扛,而是分层协作:上层接住你的目标和授权边界,中间规划并记住跨上下文的信息,下层调度一连串工具去执行,再经安全门控后交付。这套结构决定了它为什么能跑长任务而不中途失忆,也解释了为什么它比单纯大模型更难被对手抄作业。

GPT-6 Astra 深度评测:当 AI 开始自己干活

关键在跨上下文记忆。过去 Codex 靠压缩旧对话,会丢掉为什么某次修复失败。Astra 保留笔记并回查早期消息和工具输出,长任务不丢上下文。reasoning 还新增 xhigh 和 max 两档,复杂工程任务可以拉满算力,代价是更慢更贵,按难度切换即可,不必全程开满浪费预算。

数字最能说明问题,下面这组 OpenAI 自测成绩,是 Astra 相对上代 GPT-5.6 Sol 的代际跃升,部分维度已经接近饱和。需要提醒的是,这些数字多来自 OpenAI 自家评测,第三方尚在复核,读的时候留一分余量,别被接近满分的成绩单冲昏头。

GPT-6 Astra 深度评测:当 AI 开始自己干活

ARC-AGI-3 从 7.8% 跳到 99.9%,几乎打满;FrontierMath Tier 4 到 97.6%;OSWorld 2.0 任务完成率 72.6%,平均耗时从 75 分钟压到 40 分钟,约降 47%。数学、抽象推理、计算机操作三块同时起飞,这才是“代际”二字的底气,不是挤牙膏式的小修小补,而是整段能力的重新排列。

上手体验

聊完能力,最实在的问题是现在怎么用上它。普通用户最快的路径是 ChatGPT 桌面端:发布当天优先开放给 Daybreak 网络安全项目的企业,随后数日内向 Plus、Pro、Business、Enterprise 推送,想写代码或做自动化则走 API 更直接,文档和配额都更完整。

拿到 key 后,一次最基础的调用长这样:model 填 gpt-6-astra,把目标当 input 丢进去就行,不用自己拆步骤。下面这段就是真实请求,注意它只描述“要什么”,不写“怎么做”,剩下的交给模型自己规划与调度工具,你只管验收最终结果,省掉手写多步提示词的麻烦。

GPT-6 Astra 深度评测:当 AI 开始自己干活

第一次体感是给目标比给提示词省事。我说把这份财报做成带图表的 PPT,它真去检索、生成、自检,十几分钟交出版式能看的成品。代价是思考过程比上代更不透明,你很难看清它为什么这么决定,普通用户还要等几天灰度,别急着冲,先在小任务上摸清它的脾气。

使用技巧

很多人不知道,Astra 的性价比不在单价,而在一次把任务做对、省下反复调的工夫。下面几条是这段时间实测下来最管用、也最容易被忽略的用法,照着做能省不少冤枉钱,也能少踩几个权限和成本的坑,新手尤其该先看一遍。

  • 把目标说清,而不是下指令。Astra 擅长自己拆任务,你定义什么叫“好”,比教它每一步更划算。
  • 长任务开 xhigh 或 max 推理档,复杂工程类任务准确率明显更高,但更慢更贵,按难度切换。
  • 涉及敏感权限时主动设授权边界,它能做到越界率 0%,但你得先把边界讲明白。
  • 超长上下文(超 27.2 万 token)会触发阶梯计价,长文档先裁再喂,成本能砍一半。

竞品对比

光看自家数据不够,放进牌桌才清楚位置。下面这张表把 Astra 和上代 Sol、Anthropic 的 Fable 5.1 摆在一起,维度选的是普通人最在意的几项,而不是堆冷门指标,这样你一眼就能看出谁适合干什么活,不用自己拼凑。

维度 GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1
产品定位 计算机操作 agent 通用旗舰(聊天/编码) 通用旗舰(强编码/长上下文)
上下文窗口 105 万 token 未披露 未披露
计算机操作 强(OSWorld 72.6%) 中(65.7%) 强(Anthropic 报 77.9%,版本不同)
网安能力门控 Critical 级(受限开放) 未达 Critical 未达 Critical
API 定价 $10 / $50 每百万 约 $4 / $20(促销) 约 $10 / $50
可用状态 灰度开放中 全量 全量

横向看,Astra 在 computer-use 和网安能力上最激进,代价是定价也最高。Claude Fable 5.1 在 OSWorld 上报过 77.9%,但那是不同版本,不宜直接横比;Astra 的 agentic 整合更深入,不是单点分数高。Sol 是性价比基线,适合不想为 agentic 买单的常规任务,短期仍是多数人的务实选择。

用户反馈

发布会刷屏,真实声音目前两极,主要来自早期企业和评测圈,毕竟大众还要等灰度。把正反两面的信号分开看,比被标题带着走更有用,也更能判断自己要不要现在上车,而不是跟风喊一句 AGI 就掏钱。

正面:早期企业用户最买账的是省人力。Legora 用它核 41 份财报零漏错,Playco 进 Unity 做原型把人工修补砍半。开发者圈子里,长任务一次做对比反复调省心是共识,尤其适合本来就要雇人盯流程的团队,替代的是重复性脑力劳动。

负面:价格先被吐槽,2.5 倍于 Sol,小团队算账会肉疼。可监控性也被点名,首席科学家自己把模型可解释性列为后续挑战。还有人质疑部分基准用了配套 harness,分数含系统红利而非纯模型能力,这点等独立复测才有定论,现在下结论确实太早。

多维评分

该打多少分,按八个维度摊开看。评分基于已披露的官方数据与早期实测信号,能力维度几乎拉满,扣分项集中在价格和早期支持,企业和个人体感会差很多,所以下面这个分数要分人看,别直接套到自己的场景上。

维度 权重 星级 一句话解读
功能完整性 20% ★★★★★ computer-use + 多工具 + 长任务,能力覆盖面空前
易用性 15% ★★★★ 自然语言给目标即可,但安全门控和 API 配置有门槛
性能表现 15% ★★★★★ 多项基准代际跃升,任务耗时降约 47%
AI 能力 15% ★★★★★ 推理/对齐/agentic 全面领先,ARC-AGI-3 达 99.9%
价格合理性 10% ★★★ $10/$50 每百万,是 Sol 的 2.5 倍,偏贵
生态集成 10% ★★★★ ChatGPT + API + AWS + Codex/MCP,但权重不开放
文档与支持 10% ★★★ 刚发布,文档和企业支持仍在铺开,普通用户延迟数日
更新频率 5% ★★★★ 距 5.6 仅两月即 6 代,迭代快

加权归一化后综合约 8.6 / 10。对预算充足、要自动化干活的企业,这个分数很能打;对个人尝鲜者,定价和灰度节奏会压低实际体验分,建议等一两个月口碑稳定再下注,那时降价或任务计费可能也已落地。

优缺点

优点:

  • 真正能操作电脑完成多步骤任务,不止给建议
  • 跨上下文记忆让长任务不丢线索,一次做对比反复调省心
  • 推理与对齐双高,越权率实测 0%,是迄今最守规矩的模型
  • 基准代际跃升明显,数学、抽象推理、计算机操作全面领先

缺点:

  • 定价是上代 2.5 倍,中小团队短期账本不好看
  • 思考过程更不透明,可监控性被官方列为后续挑战
  • 强网安能力受限开放,普通 API 用户拿不到完整能力
  • 刚发布灰度中,普通用户要等几天,稳定性待观察

适用人群

不是每个人都该现在上车,按 ROI 高低排个序更清楚。下面四类人,前两类最该立刻试,后两类建议再等等,免得为用而用、白交订阅,先把任务定义清楚比抢先体验更重要。

  • 企业自动化团队:要批量跑报表、CRM、研究摘要的,ROI 最明显,人力替代直接可见。
  • 开发者与独立游戏人:做原型、搭站点、跑 QA,省下一堆重复劳动,原型周期明显缩短。
  • 科研与金融建模:长链路分析任务,Astra 的跨上下文记忆是刚需,一次跑完不丢中间结论。
  • 普通个人用户:等灰度稳定再说,现在冲容易卡在权限和价格上,体验未必比 Sol 好太多。

定价方案

钱的事单独算笔账,毕竟这是最多人皱眉的地方。Astra 的计价逻辑和 Sol 一样按 token,但单价和附加项都更狠,得拆开看才不会被标价吓退,也不会误判自己到底要花多少,建议先拿小任务试水。

档位 价格 说明
API 标准 $10 输入 / $50 输出(每百万) 缓存输入 $1,常规调用主力档
快速模式 标准价 ×2 速度最高 2.5 倍,赶进度时划算
长上下文附加 超 27.2 万 token 触发 输入 ×2、输出 ×1.5 的阶梯计价
ChatGPT 订阅 随 Plus/Pro/Business/Enterprise 后续内置,按订阅费计,不单列 token
Astra Pro 仅 Pro/企业 能力更强,面向重度工作负载

对比 Sol 促销价(约 $4/$20),Astra 贵 2.5 倍。OpenAI 的意思是别按 token 算,按任务算:一次做对省反复。但中小团队短期账本不好看,得等任务计费真正落地,才能说贵得有理,现在先用小任务摸成本曲线最稳。

FAQ

把大家最关心的问题集中回答一遍,下面十二条覆盖从能力、价格到部署的大部分疑惑。这些答案基于发布当天的官方信息与早期实测信号,能省你不少翻文档和试错的时间,看完基本能判断自己要不要现在上车。

Q1:GPT-6 Astra 和普通 GPT-5 有什么区别?

A1:核心区别是从问答转向执行。 它能直接操作电脑完成多步骤任务,而不是只给建议。基准上 ARC-AGI-3 从 7.8% 跳到 99.9%,代际差距明显,不是同一代产品的修补。

Q2:普通人现在能用吗?

A2:还不能完全随便用。 发布当天先给 Daybreak 企业用户,随后数日向 Plus、Pro、Business、Enterprise 灰度,等几天才轮到大多数普通用户,企业渠道更早。

Q3:API 怎么调用?

A3:走 OpenAI Responses API,model 填 gpt-6-astra。 把目标当 input 传入即可,模型自行拆解任务,无需手写多步提示词,你只管描述和验收最终结果。

Q4:定价贵不贵?

A4:偏贵,是上代 Sol 的 2.5 倍。 标准价每百万输入 10 美元、输出 50 美元,快速模式再翻倍,长上下文另有阶梯计价,中小团队需先算清任务总成本。

Q5:它真达到 AGI 了吗?

A5:OpenAI 没正式宣布 AGI,只说有理由认为已身处 AGI 时代。 Brockman 把判断权留给读者,强调这是旅程开端而非终点,是否算 AGI 由你自行定义。

Q6:安全吗,会乱来吗?

A6:越权率实测 0%,是迄今最对齐的模型。 无防护措施时 Sol 有 48% 会越界,Astra 把这项压到零,强网安能力反而受限开放,普通用户拿不到完整权限。

Q7:上下文有多长?

A7:105 万 token 输入,最大输出 12.8 万 token。 知识截止 2026 年 4 月 30 日,支持文本与图像输入、纯文本输出,长文档可一次性喂入不截断。

Q8:和 Claude Fable 5.1 比谁强?

A8:Astra 的 agentic 整合更深,Fable 编码与长上下文更强。 两者 API 定价持平,OSWorld 成绩因版本不同不宜直接横比,选谁看你的任务落在哪块。

Q9:为什么思考过程看不懂?

A9:推理更往模型内部藏,外部难追踪决策链。 OpenAI 首席科学家已把可监控性列为后续 Scaling 的重要挑战,透明度问题短期难根本解决。

Q10:有开源或自部署吗?

A10:没有,纯托管闭源,权重不开放。 只能走 ChatGPT、OpenAI API 或 AWS,无法私有化部署到自家硬件,数据出境合规需自行评估。

Q11:快速模式值得开吗?

A11:看任务时效要求。 速度最高 2.5 倍但价格翻倍,紧急交付或长任务赶进度时划算,常规任务用标准档更省,别为一点快感多花钱。

Q12:未来会按任务收费吗?

A12:OpenAI 暗示行业可能转向按任务计费。 当前仍是 token 计价,但官方口径是看单次任务总成本,而非单价高低,任务计费落地后性价比逻辑会变。

结尾

GPT-6 Astra 不是一次普通升级,它把 AI 的标尺从会写会答,推到了会干事。computer-use、跨上下文记忆、越权率归零,这三件事叠在一起,确实配得上官方那句欢迎来到 AGI 时代,也值得认真看待而非当营销。

但它不是所有人的立刻选项。2.5 倍定价、灰度开放、思考不透明,都意味着普通人先观望、企业先试点更稳。把任务定义清楚、把边界讲明白,比追逐参数更重要,工具越强越考使用者的功力,别被宣传带节奏。

这一代真正改变的,是我们和工具的关系:从你教它怎么做,变成你告诉它要什么。剩下的问题,交给接下来几个月的真实落地,让独立复测和大众口碑替我们作答,那时候再下最终判断也不迟。

AI工具

Cheso:腾讯推出的 AI 演示文稿 Agent

2026-9-4 8:35:45

行业动态

国家发改委:依法依规对外资收购Manus项目作出禁止投资决定

2026-4-27 16:08:35

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧