2026年4月13日 · 阅读 —

Opus 4.6 vs Codex 5.3:别吵了,按场景选

Agent 与 Skills

Opus 4.6 vs Codex 5.3:别吵了,按场景选

今天这波发布,像两家大厂在同一条走廊里迎面走来:谁也不让,谁也不铺垫,直接把“王炸”拍桌上。

20 分钟内,Claude Opus 4.6 和 GPT-5.3 Codex 先后亮相。社区当场分裂:一边喊“AI 春晚”,一边开始掏计算器算订阅费。

别急着站队。看完下面这套“对照表 + 适用场景”,纠结会少一大半。


先把“缺点”说清楚:为什么会纠结

纠结的根源不是两家都强(强是前提),而是强在不同地方:

  • 有的模型像“高智商但情绪不稳定的总监”:灵感上天,偶尔也能把你带沟里。
  • 有的模型像“执行力拉满的工程队长”:交付稳、速度快,但遇到模糊需求会问得多。

这篇只干一件事:把差异从“听感”变成“可选项”。


1)Claude Opus 4.6:深思熟虑的全能型(偏复杂任务)

1.1 上下文 100 万 Token:长文档党狂喜

Opus 4.6 把上下文窗口从 200K 直接拉到 100 万 Token。

这意味着:

  • 一整本书
  • 几百页财报
  • 一堆合同/法律文件

可以“一口气灌进去”,不用边喂边祈祷它别失忆。

长上下文常见的坑叫“上下文腐烂”:喂得越多,注意力越散,前后矛盾越多。

Opus 4.6 在 MRCR v2(大海捞针类长上下文测试)上给了一个很离谱的提升:

  • 76%(Opus 4.6)
  • 18.5%(前代)

这不是优化,是换引擎。

1.2 Agent Teams + Adaptive Thinking:多代理协作更像“真团队”

Opus 4.6 的 Agent Teams 可以理解成:

  • 多个代理分工
  • 各自独立上下文
  • 还能互相通信

配合 Adaptive Thinking(自适应思考深度):

  • 难题就深想
  • 简单事就快走

效果像把“拍脑袋的长文推理”变成“有人负责规划、有人负责核对、有人负责写交付”。

1.3 推理与知识工作:数据很硬

几个关键指标:

  • ARC-AGI 2:68.8%(流体智力类)
  • GDPval-AA:1606 Elo(金融/法律等知识工作评估)
  • BigLaw Bench:90.2%(法律推理专项)

一句话:复杂、开放、需要“想清楚再下笔”的活,Opus 更像“能带路的脑子”。


2)GPT-5.3 Codex:快、稳、准的编程执行机(偏落地执行)

2.1 Terminal-Bench 2.0:终端编程优势很直观

Terminal-Bench 2.0(终端环境编程能力)上:

  • 77.3%(GPT-5.3 Codex)
  • 65.4%(Opus 4.6)

优势接近 12 个百分点。

再加两条工程党会更在意的:

  • 速度比前代快 25%
  • 同任务 Token 消耗不到之前一半

又快又省,还不太掉链子。

2.2 “参与造自己”:递归改进的信号

OpenAI 这次披露了一件更刺激的事:

GPT-5.3-Codex 的早期版本参与了自身开发流程:调试训练、管理部署、诊断测试。

严格说这还停留在“工程层面的递归改进”,但它确实是一个信号:

  • 代理不再只是写代码
  • 代理开始“参与造工具链”

这类变化属于:不一定立刻改变日常,但会改变行业预期。

2.3 OSWorld:从写代码走向“会用电脑”

OSWorld(模拟真实桌面操作)上:

  • 64.7%(Codex 5.3)
  • 38.2%(前代)

分数接近翻倍。

一句话:Codex 的野心不止写代码,它想当“能在电脑上干活的代理”。


3)硬碰硬:关键数据一览(看表最省命)

基准测试Claude Opus 4.6GPT-5.3 Codex领先者
Terminal-Bench 2.0(终端编程)65.4%77.3%GPT-5.3 Codex
SWE-Bench Pro(真实软件工程)80.8%56.8%Claude Opus 4.6
OSWorld(计算机操作)72.7%64.7%Claude Opus 4.6
GDPval-AA(知识工作)1606 Elo70.9%(胜率)Claude Opus 4.6
ARC-AGI 2(流体智力)68.8%未公布Claude Opus 4.6

表面结论很清楚:

  • Codex 在“终端编程”更强
  • Opus 在“复杂软件工程/计算机操作/知识工作/推理”更强

但别只看跑分。


4)跑分之外:复杂任务的差距更真实

Every.to 做了一个内部基准 LFG(从着陆页到完整电商网站的渐进式复杂任务):

  • Opus 4.6:9.25/10
  • Codex 5.3:7.5/10

关键发现:

  • 简单任务两者都好
  • 任务越复杂,差距越明显

例如做一个包含 11 个功能的完整电商网站:

  • Opus 交付了全功能 + 完整结账流程
  • Codex 做出了漂亮设计,但漏掉了整个结账模块

一句话:复杂任务里,“交付完整性”比“局部漂亮”更重要。


5)大量用户反馈的共同结论:形成了默认分工

从社区讨论里能看到一种“默认工作流”正在成型:

  • Opus 更适合做架构设计与规划:把模糊目标收敛成可执行方案
  • Codex 更适合做具体实现与执行:按明确指令快速交付

这不是站队,这是分工。


6)到底怎么选:按场景,不按情绪

Every.to 的总结很贴切:

  • Opus:高上限、高方差
  • Codex:低上限、低方差

翻译成可操作的选择规则:

选 Claude Opus 4.6,如果主要是这些事

  • 超长文档分析(合同/财报/论文/法条)
  • 复杂逻辑推理(规则多、约束多、边界多)
  • 金融/法律等专业知识工作
  • 多代理协同(规划/审查/写作/核对拆分)
  • 需求模糊但必须产出方案(需要“自己去探索并收敛”)

选 GPT-5.3 Codex,如果主要是这些事

  • 高强度编程执行(终端任务、脚手架、改造、批量重构)
  • 指令明确、追求速度与稳定
  • 网络安全分析/脚本化任务
  • 需要“少犯低级错”的代码工作马

7)更大的趋势:两家都在奔着同一个终点

Every.to 把它叫“伟大的趋同”(The Great Convergence)。

说白了:

  • 一个优秀编码代理需要规划、工具使用、并行执行、知道何时深想何时交付
  • 一个优秀知识工作代理也需要同一套能力

所以两家在不同入口发力,但目标是同一个:通用 AI 代理。


最短决策路径

  • 任务模糊、复杂、长文档、多约束 → 先 Opus
  • 任务明确、要快、要稳、要落地 → 先 Codex
  • 日常工作最省心的组合:Opus 做规划,Codex 做执行

今天能用的 AI,比昨天又强了一大截。 纠结可以有,但别纠结太久:该干活还是得干活。

#Claude #OpenAI #Codex #大模型对比 #AI编程 #Agent #开发者工具