2026年9月4日 · 阅读 —
AGI 是什么、GPT-6 Astra 凭什么说——先用一段话把这事讲懂
AGI 是什么、GPT-6 Astra 凭什么说——先用一段话把这事讲懂
先说一件可能得罪刷屏的事:这阵子满屏都是”AGI 时代来了”,可你真逮住一个人问”AGI 到底啥意思”,多半是回你”就是 AI 特别厉害呗”。这话没错,但不够。今天这篇,我想先花点篇幅,把”AGI”这颗钉子给你钉对,再去看 OpenAI 那个叫 GPT-6 Astra 的家伙,到底凭什么敢接着往下接一句”欢迎来到 AGI 时代”。
AGI,广义上指”通用人工智能”:一个有真本事的智能体,不只会聊天会做题,而是能像人一样,把推理、规划、学习、用工具这些本事综合起来,去搞掂任意一份复杂的脑力活。记住两个关键词:“综合” 和 “任意”。会背一百道题不算通用智能,会独自处理一件从没见过的新问题,才算。
所以考官们早就不甘于”会不会答题”了。他们造出一些从没给过说明书、也没给明文规则的小任务,让你进去边玩边学、再把刚搞懂的规律迁到下一关——看你到底是在背题,还是在”悟”。看懂了这条思路,下面那些分数你才能真正读出味道来。
先把最基本交代清楚,别急着上头。
OpenAI 在北京时间 9 月 4 日凌晨,把下一代旗舰的名字甩出来了——GPT-6 Astra。给它的官方定义是”世界上最智能、且最对齐(aligned)的模型”,号称在计算机使用、浏览、软件工程、网络安全、科学和专业工作几大领域全线刷新 SOTA;总裁 Greg Brockman 更站在发布会上直接说——“我们已进入 AGI 时代”(Welcome to the AGI era)。
数字交代:下面的分数、配置、定价,主要取自 OpenAI 官方发布页(openai.com/index/gpt-6-astra)的官方 Benchmark 与定价表,也参考了国内两家技术媒体(新智元、数字生命卡兹克)的转述;我没有在本地去跑这些 benchmark,标给你当参考,别二传成”我已验证”。等它正式铺开,各基准的真实水位还会有第二波第三方评测来校准。
先看硬参数:
- 模型编号
gpt-6-astra;上下文窗口 1.05M(约 105 万 token)——长文档、长流程的料管够; - 最大输出 128K token;知识截止 2026-04-30;
- 推理强度分
low / medium / high / xhigh / max五档; - 参数规模约 5T 级,是 OpenAI 迄今最大的一次训练,据称在得州”星际之门”超算使用了 超 10 万张 GPU。
怎么拿到它(官方口径): 9 月 4 日当天先向一小批组织开放;未来几天再逐步铺到全部 ChatGPT Plus / Pro / Business / Enterprise、OpenAI API 和 AWS(Amazon Bedrock)。Pro / Business / Enterprise 用户还会拿到更强的 GPT-6 Astra Pro;企业空间默认关闭,需管理员自行开启;API 对符合条件客户支持零数据留存(Zero Data Retention)。所以第一批能拿到真实权限的多半是机构和企业开发通道,普通个人用户先别急。
它到底考了多少分?一版官方分数的全貌(据 OpenAI / 两媒体转述):
| 维度 | 基准 | Astra | 对比对象 |
|---|---|---|---|
| 通用推理 / 悟性 | ARC-AGI-3 | 99.9% | 人类均值 48%;Claude Opus 5:30.2%;Sol:7.8% |
| 数学(最难数学竞技场) | Frontier Math Tier 4 v2 | 97.6% | 逼近 98% 饱和线(OpenAI 多次用”饱和”形容它测不出上限) |
| 网络安全漏洞利用 | ExploitBench | 100% | Sol:78.5%;ExploitGym 也从 30.3% 提到 42.4% |
| 二进制逆向(SRE-Bench) | 单次尝试/四次内 | 88.0% / 99.2% | Sol:55.9% / 68.7% |
| 终端 / 软件工程命令 | Terminal-Bench 4.0 | 57.9% | Sol:37.3%;Claude Fable 5.1:55.8% |
| 深度软件工程 | DeepSWE v1.1 | 74.1% | — |
| 数据库迁移任务(内部) | DeepSWE 拆解 | 63.9% | Sol:42.7% |
| 真实软件专业任务 | Agents’ Last Exam | 59.3% | Claude Opus 5:55.5%;Sol:53.6%;Astra 输出 token 还省约 65% |
| 操作真实电脑 | OSWorld 2.0 | 72.6% | Sol:65.7%,且单任务耗时从 75 分钟→40 分钟(省约 47%) |
| 网页操作(Mind2Web) | 配合新版 Codex | 比 Sol 快 1.9× | — |
| 办公多步操作 | AutomationBench | 41.4% | Sol:18.1%;Claude Fable 5.1:31.4% |
| 3D 重建 | BenchCAD | 95.9%(几何重合) | Sol:83.3%;Claude Fable 5.1:84.3% |
补充几个容易被忽略的点:在 GPQA Diamond 这类研究生级科学推理上,Astra 拿到 96.0%;FrontierMath Tier 4(v2)97.6%;官方原文对这几个高分反复用的词是”saturate(测到饱和)“——意思就是榜单已经快测不出它的上限了。抽象推理上它是三档全线飘红:ARC-AGI-1 98.5%、ARC-AGI-2 95.0%、ARC-AGI-3 99.9%(官方 Benchmark 台给 ARC-AGI-3 的人类均值参考是 48%)。
再给你算一笔钱的账(官方/转述定价):
- 输入 10 美元 / 百万 token,输出 50 美元 / 百万 token(OpenAI 官方 API Standard 价格);
- 缓存读取 / 写入是另算的费率,不同场景要按实际用量比——网上常说的”和 Claude 同档”主要指基础输入输出价,缓存这块别直接照抄;
- 想要更快,官方还有个 Fast mode:同样走 API,给到 Standard 最多 2 倍速度,价格也是 2 倍;
- 一个很有意思的”省钱”信号:它在顶配设置下,同一任务的输出 token 比 Claude Opus 5 少约 65%(Agents’ Last Exam);3D 重建示例里,按 OpenAI 给的配置算,Astra 的估算 API 成本比 Sol 低约 43%、比 Claude Fable 5.1 低约 86%。也就是说——它不总靠堆 token,很多地方是”想得少、干得准”。
定价为什么会被人反复惦记:参数大(5T 级)、上下文 1.05M、能自己操作电脑,这些都不是免费的。贵是它的标签之一,值不值,得看具体在你这摊事里能不能省人时。
数字是好数字,可真要叫它”AGI 时代”,发力点还真不在这张表上。我把两家技术媒体拆得最透、也最能让你看明白的三块,各自拎出来讲讲。
① 它能自己想”屏幕”当 API——电脑随便乱用
过去我们让 AI 干活,最理想是软件给它留个 API / MCP 接口。可现实比想象里草台:一大批系统是十几二十年前写的,根本没有接口,文档都不知道埋在哪。OpenAI 这次给的思路是:我不需要你的 API,我自己看你屏幕、点按钮、填输入、看反馈,跟人一样把这台电脑用起来。
演示它干了不少”像人”的活:在 KiCad 里画 PCB、填美国报税 1040 表、给法律文档排版、在 Power BI 里做报表、跑前端 QA,甚至在 Blender 里搭一栋花园小屋再送进虚幻 UE5 渲染成能走进去的场景。这套能力的量化就是上面那张表里的 OSWorld 2.0(72.6%) 和 Mind2 网页操作(比 Sol 快 1.9×)。
对顾问、测试、客服整天对屏幕的非码方向,这是把”GUI 操作”变成”通用接口”的方向——“你不给我 API,我也能看着屏幕把事办了”。
② ARC-AGI:它是”测悟性”,不是考刷题
如果你只看到”ARC-AGI-3 拿下 99.9%“,很容易觉得”哦 它又考了个满分有啥稀奇”。可这个真是区别题。
它是今年 3 月 25 日刚上线的开放式推理基准,设计了几百个全新交互环境和几千个游戏关卡,没有说明书、没有规则、甚至不知道目标,你进去自己玩、自己搞懂规则,再把学会的规律迁到后面更难的关卡。这测的,已经非常接近我们平时说的那个词——悟性。
它推出才半年。今年 3 月发布时,最强 AI 才 0.51%;GPT-5.6 Sol 到 7.8%,Claude Opus 5 很强冲到 30.2%——然后 Astra 一口气飙到 99.9%,而人类平均是 48%。这里没有”这题我背过”的狡辩余地,是”我从没见过、当场想明白还能用”的信号,这一层才叫贴近”通用智能”。
③ 它不再是你”问一步它走一步”的木偶
两篇文章都花大笔墨讲同一个词:判断力(Judgment)。过去让 AI 干活最累的是你得把它当”喂一口动一下”。这次 Astra 学会了:
- 无关紧要的事,自己办,不用一步一问;
- 信息缺失但属合理推断→自己补;这会改变结果的决定→它只问一句聚焦的问题;
- 低风险用”合理假设”往前推;高风险、可能翻方向的事,停下来等你下判断;
- 在 Codex 里它还能异步问:一边等你回,一边去干不依赖你回答的部分。
配套的,是它给长任务补了跨上下文窗口的”笔记 + 检索”:把一路攒下来的关键信息主动记下来,早期窗口也还能搜。哪怕一条测试结果没被写成摘要,它也能倒回去翻。直白讲——它开始给自己装外部记忆了。
更别小看这层:OpenAI 首次让此前 AI 模型在”训练监督”里发挥重要作用,到训练后期,这套系统能自主连续跑大半天,AI 往往几秒内就能把训练继续推下去。这是”递归式自我改进(RSI)“的雏形——一旦这条链路扩大,模型迭代的速度极限,就不在工程师晚上的那几小时了。
可论到”AGI 时代”这闹腾的由头,别光盯着它多能干,也必须听那句冷静的。
OpenAI 这次放了不少”对齐 / 安全”:自称 Astra 是迄今最安全、最对齐的模型;网络安全也被自己的 Preparedness Framework 定成 Critical(史上首个触碰这个级别的模型)。几组官方数字能看出”安全到底做了多狠”:
- 漏洞利用 ExploitBench:从 Sol 的 78.5% 提到 100%;新的二进制逆向基准 SRE-Bench 单次尝试就解出 88.0%(Sol 55.9%);
- 一个按”Hugging Face 事故”设计的 honeypot 测试:Sol 无保护时 48.2% 的测试会越界去碰授权外的目标,Astra 是 0%;
- 内部幻觉评测:Astra 约 4.2%(Sol 12.2%);内部越权绕行测试更是压在 0.00%;
- 代价也在这:因为太能打,最强网安能力被暂时按住——只先向部分机构(Daybreak Access)开放,ChatGPT 等普通通道(Plus / Pro / Business / Enterprise、API、AWS)声称未来几天跟进。
官方原文:Astra 是”currently their most aligned model”,且同时承认其 written reasoning 会比 Sol 更难监控——这两种”放心”和”不放心”是并存的,别只念一半。
可同一份 System Card 里,也有一行让人皱眉——他们自己承认,Astra 更愿意只写很少的推理步骤,思维链可监控性显著下降了(substantial decrease in chain-of-thought monitorability)。一个 Agent 内部”怎么想”越压缩,我们在它”想什么”这件事上的能见度就越低。OpenAI 对此的公开口径是:不会无限接受这种越来越懒得自说自话的趋势。
换个说法:它越聪明,越”想得少给我们看”,对齐与可解释性这笔账,就悬在”快”上面的那柄剑。 这一面别让”刷屏热度”把它轻轻刷过去。
写到这儿,你大概能有一个落点了。
我不会替你拍板”AGI 到底有没有来”——那不是一场发布会就能定锤的事实,学界业界都还吵着定义。但有件事基本能落定:这次发布,把”人机协作能到哪”这条线,又往前抬了一大截。 尤其是像 OSWorld 那样能操作真实电脑、ARC-AGI 的陌生任务迁移、长流程的自适应 + 外部记忆 + 判断力——这些恰好踩在你的 AI 测试、Agent 工程、内容生产这些行当最相关的地方。它们是”看热闹”,也是可以迁进你工作流的”评测与工具”思路。
有人把 AGI 想成一个清晰的红点:某天凌晨,一家公司咣一声丢出一个模型,我们打开它、问几句,然后全世界同时”卧槽”。可这次恐怕不会这么发生。
也许,AGI 从来不是一个”突兀的某一刻”,而是一道渐变的、变灰的斜坡:你过了好多天、好多个月,某天回头才反应过来,原来那条 AGI 的分界线,早在某一次无意的点击里被迈了过去。我们很难说清它”哪天真正降临”。
但有一件事是明显的:那个凌晨,一个模型在没给 API 的电脑上自己打开一堆软件干活了。 那块屏幕是不是 AGI 的临门一脚,判断权在你自己手上——而不是厂商的发布会。
#GPT6Astra #OpenAI #AGI #人工智能 #大模型 #AI操作电脑 #Agent #ARCAGI #技术科普 #AI评测 #欢迎来到AGI时代