2026年4月13日 · 阅读 —
Opus 4.6 vs Codex 5.3:别吵了,按场景选
Opus 4.6 vs Codex 5.3:别吵了,按场景选
今天这波发布,像两家大厂在同一条走廊里迎面走来:谁也不让,谁也不铺垫,直接把“王炸”拍桌上。
20 分钟内,Claude Opus 4.6 和 GPT-5.3 Codex 先后亮相。社区当场分裂:一边喊“AI 春晚”,一边开始掏计算器算订阅费。
别急着站队。看完下面这套“对照表 + 适用场景”,纠结会少一大半。
先把“缺点”说清楚:为什么会纠结
纠结的根源不是两家都强(强是前提),而是强在不同地方:
- 有的模型像“高智商但情绪不稳定的总监”:灵感上天,偶尔也能把你带沟里。
- 有的模型像“执行力拉满的工程队长”:交付稳、速度快,但遇到模糊需求会问得多。
这篇只干一件事:把差异从“听感”变成“可选项”。
1)Claude Opus 4.6:深思熟虑的全能型(偏复杂任务)
1.1 上下文 100 万 Token:长文档党狂喜
Opus 4.6 把上下文窗口从 200K 直接拉到 100 万 Token。
这意味着:
- 一整本书
- 几百页财报
- 一堆合同/法律文件
可以“一口气灌进去”,不用边喂边祈祷它别失忆。
长上下文常见的坑叫“上下文腐烂”:喂得越多,注意力越散,前后矛盾越多。
Opus 4.6 在 MRCR v2(大海捞针类长上下文测试)上给了一个很离谱的提升:
- 76%(Opus 4.6)
- 18.5%(前代)
这不是优化,是换引擎。
1.2 Agent Teams + Adaptive Thinking:多代理协作更像“真团队”
Opus 4.6 的 Agent Teams 可以理解成:
- 多个代理分工
- 各自独立上下文
- 还能互相通信
配合 Adaptive Thinking(自适应思考深度):
- 难题就深想
- 简单事就快走
效果像把“拍脑袋的长文推理”变成“有人负责规划、有人负责核对、有人负责写交付”。
1.3 推理与知识工作:数据很硬
几个关键指标:
- ARC-AGI 2:68.8%(流体智力类)
- GDPval-AA:1606 Elo(金融/法律等知识工作评估)
- BigLaw Bench:90.2%(法律推理专项)
一句话:复杂、开放、需要“想清楚再下笔”的活,Opus 更像“能带路的脑子”。
2)GPT-5.3 Codex:快、稳、准的编程执行机(偏落地执行)
2.1 Terminal-Bench 2.0:终端编程优势很直观
Terminal-Bench 2.0(终端环境编程能力)上:
- 77.3%(GPT-5.3 Codex)
- 65.4%(Opus 4.6)
优势接近 12 个百分点。
再加两条工程党会更在意的:
- 速度比前代快 25%
- 同任务 Token 消耗不到之前一半
又快又省,还不太掉链子。
2.2 “参与造自己”:递归改进的信号
OpenAI 这次披露了一件更刺激的事:
GPT-5.3-Codex 的早期版本参与了自身开发流程:调试训练、管理部署、诊断测试。
严格说这还停留在“工程层面的递归改进”,但它确实是一个信号:
- 代理不再只是写代码
- 代理开始“参与造工具链”
这类变化属于:不一定立刻改变日常,但会改变行业预期。
2.3 OSWorld:从写代码走向“会用电脑”
OSWorld(模拟真实桌面操作)上:
- 64.7%(Codex 5.3)
- 38.2%(前代)
分数接近翻倍。
一句话:Codex 的野心不止写代码,它想当“能在电脑上干活的代理”。
3)硬碰硬:关键数据一览(看表最省命)
| 基准测试 | Claude Opus 4.6 | GPT-5.3 Codex | 领先者 |
|---|---|---|---|
| Terminal-Bench 2.0(终端编程) | 65.4% | 77.3% | GPT-5.3 Codex |
| SWE-Bench Pro(真实软件工程) | 80.8% | 56.8% | Claude Opus 4.6 |
| OSWorld(计算机操作) | 72.7% | 64.7% | Claude Opus 4.6 |
| GDPval-AA(知识工作) | 1606 Elo | 70.9%(胜率) | Claude Opus 4.6 |
| ARC-AGI 2(流体智力) | 68.8% | 未公布 | Claude Opus 4.6 |
表面结论很清楚:
- Codex 在“终端编程”更强
- Opus 在“复杂软件工程/计算机操作/知识工作/推理”更强
但别只看跑分。
4)跑分之外:复杂任务的差距更真实
Every.to 做了一个内部基准 LFG(从着陆页到完整电商网站的渐进式复杂任务):
- Opus 4.6:9.25/10
- Codex 5.3:7.5/10
关键发现:
- 简单任务两者都好
- 任务越复杂,差距越明显
例如做一个包含 11 个功能的完整电商网站:
- Opus 交付了全功能 + 完整结账流程
- Codex 做出了漂亮设计,但漏掉了整个结账模块
一句话:复杂任务里,“交付完整性”比“局部漂亮”更重要。
5)大量用户反馈的共同结论:形成了默认分工
从社区讨论里能看到一种“默认工作流”正在成型:
- Opus 更适合做架构设计与规划:把模糊目标收敛成可执行方案
- Codex 更适合做具体实现与执行:按明确指令快速交付
这不是站队,这是分工。
6)到底怎么选:按场景,不按情绪
Every.to 的总结很贴切:
- Opus:高上限、高方差
- Codex:低上限、低方差
翻译成可操作的选择规则:
选 Claude Opus 4.6,如果主要是这些事
- 超长文档分析(合同/财报/论文/法条)
- 复杂逻辑推理(规则多、约束多、边界多)
- 金融/法律等专业知识工作
- 多代理协同(规划/审查/写作/核对拆分)
- 需求模糊但必须产出方案(需要“自己去探索并收敛”)
选 GPT-5.3 Codex,如果主要是这些事
- 高强度编程执行(终端任务、脚手架、改造、批量重构)
- 指令明确、追求速度与稳定
- 网络安全分析/脚本化任务
- 需要“少犯低级错”的代码工作马
7)更大的趋势:两家都在奔着同一个终点
Every.to 把它叫“伟大的趋同”(The Great Convergence)。
说白了:
- 一个优秀编码代理需要规划、工具使用、并行执行、知道何时深想何时交付
- 一个优秀知识工作代理也需要同一套能力
所以两家在不同入口发力,但目标是同一个:通用 AI 代理。
最短决策路径
- 任务模糊、复杂、长文档、多约束 → 先 Opus
- 任务明确、要快、要稳、要落地 → 先 Codex
- 日常工作最省心的组合:Opus 做规划,Codex 做执行
今天能用的 AI,比昨天又强了一大截。 纠结可以有,但别纠结太久:该干活还是得干活。
#Claude #OpenAI #Codex #大模型对比 #AI编程 #Agent #开发者工具