Claude Opus 5.5 对比 GPT-6 Astra
Opus 5.5 标准 token 价格更低;Astra 上下文略大。请比较 API 工具、长上下文价格与自己的任务结果。
核实于 2026-09-25 · 官方 API 规格与注明来源的评测
| 规格 | Claude Opus 5.5 | GPT-6 Astra |
|---|---|---|
| 上下文窗口 | 1M | 1.05M |
| 最大输出 | 128K | 128K |
| 输入 / 百万 token | $4 | $10 |
| 输出 / 百万 token | $20 | $50 |
| 缓存读取 / 百万 token | $0.2 | $1 |
| 推理 | 自适应、始终开启 · 默认 medium | 推理强度:low、medium、high、xhigh、max |
适合评估的场景 Claude Opus 5.5
评估编程与 Agent 工作负载的起点,token 单价低于 Opus 5 和 Fable 5.1。
评测设置不同于默认 medium 强度,请用自己的工作负载测量任务完成率与总 token 消耗。
标准 API 价格。批量输入输出降低 50%;fast 模式为 $8 / $40。缓存写入每百万 token 为 $5(5 分钟)或 $8(1 小时)。
官方规格适合评估的场景 GPT-6 Astra
适合评估围绕 Responses API、托管工具和电脑操作构建的流程。
下方跨厂商评测由 Anthropic 报告,不是相同设置下的独立评估。
输入不超过 272K token 的标准价格。超过后整次请求输入与缓存为 2 倍,输出为 1.5 倍;工具可能另收费。
官方规格已报告的基准成绩
| 基准评测 | Claude Opus 5.5 | GPT-6 Astra |
|---|---|---|
| Terminal-Bench 4.0Opus 5.5:xhigh 强度 | 66.4% | 57.9% |
| FrontierCode v1.1Opus 5.5:max 强度 | 54.4% | 53.3% |
| CursorBench 4.0Opus 5.5:max 强度 | 57.8% | 未报告 |
| GDPval-AA v2.1Opus 5.5:max 强度 | 1846 Elo | 1542 Elo |
| AutomationBenchOpus 5.5:max 强度 | 40% | 41.4% |
| Humanity's Last Exam使用工具 · Opus 5.5:max 强度 | 67.7% | 57.2% |
厂商于 2026 年 9 月 22 日报告的发布评测。Opus 5.5 除 Terminal-Bench 使用 xhigh 外均使用 max。其他模型的推理强度、框架与工具设置可能不同,请查看原始方法。这不是 AI IDE List 实测,也不同于 Anthropic 的 medium 强度成本图。
评测来源与方法用与你相关的工作测试
使用相同任务、输入、工具和成功标准,记录模型版本、推理强度、总成本、延迟与人工修正。选择前重复测试,单个演示不能证明普遍领先。