Claude Opus 5.5 対 GPT-6 Astra
Opus 5.5 は標準単価が低く、Astra はコンテキストがやや大きいモデルです。API ツール、長文料金、自分のタスク結果で比較してください。
確認日 2026-09-25 ・公式 API 仕様と出典付き評価
| 仕様 | Claude Opus 5.5 | GPT-6 Astra |
|---|---|---|
| コンテキストウィンドウ | 1M | 1.05M |
| 最大出力 | 128K | 128K |
| 入力 / 100万トークン | $4 | $10 |
| 出力 / 100万トークン | $20 | $50 |
| キャッシュ読込 / 100万トークン | $0.2 | $1 |
| 推論 | 適応型・常時オン・標準は medium | 推論強度:low、medium、high、xhigh、max |
評価したい用途 Claude Opus 5.5
開発やエージェント評価の起点。トークン単価は Opus 5 / Fable 5.1 より低くなります。
評価設定は標準の medium と異なります。自分のタスクで完了率と総トークンを測定してください。
標準 API 料金。バッチの入出力は50%割引、fast は $8 / $40。100万トークンのキャッシュ書込は5分 $5、1時間 $8。
公式仕様評価したい用途 GPT-6 Astra
Responses API、ホスト型ツール、コンピューター操作を使うフローで評価。
下の他社比較は Anthropic による報告で、同一設定による独立評価ではありません。
入力272K以下の標準料金。超過するとリクエスト全体の入力・キャッシュは2倍、出力は1.5倍。ツールは別料金の場合があります。
公式仕様報告されたベンチマーク結果
| ベンチマーク | Claude Opus 5.5 | GPT-6 Astra |
|---|---|---|
| Terminal-Bench 4.0Opus 5.5:xhigh 強度 | 66.4% | 57.9% |
| FrontierCode v1.1Opus 5.5:max 強度 | 54.4% | 53.3% |
| CursorBench 4.0Opus 5.5:max 強度 | 57.8% | 未報告 |
| GDPval-AA v2.1Opus 5.5:max 強度 | 1846 Elo | 1542 Elo |
| AutomationBenchOpus 5.5:max 強度 | 40% | 41.4% |
| Humanity's Last Examツール使用・Opus 5.5:max 強度 | 67.7% | 57.2% |
2026年9月22日にベンダーが報告した結果。Opus 5.5 は Terminal-Bench の xhigh を除き max を使用。他モデルの強度、ハーネス、ツール設定は異なる場合があります。元の手法を確認してください。当サイトのテストではなく、Anthropic の medium 費用グラフとも別です。
評価の出典と手法自分に重要なタスクを試す
同じタスク、入力、ツール、成功基準を使い、バージョン、強度、総費用、遅延、人の修正を記録しましょう。選定前に繰り返し検証してください。単一のデモでは一般的な優劣は判断できません。