モデル / 比較

Claude Opus 5.5 対 Claude Opus 5

Opus 5.5 は標準入出力料金を20%削減。Opus 5 を基準に既存タスクの回帰を確認してください。

確認日 2026-09-25 ・公式 API 仕様と出典付き評価

モデル仕様と標準 API 料金
仕様 Claude Opus 5.5Claude Opus 5
コンテキストウィンドウ1M1M
最大出力128K128K
入力 / 100万トークン$4$5
出力 / 100万トークン$20$25
キャッシュ読込 / 100万トークン$0.2$0.5
推論適応型・常時オン・標準は medium適応型・標準は high

評価したい用途 Claude Opus 5.5

開発やエージェント評価の起点。トークン単価は Opus 5 / Fable 5.1 より低くなります。

評価設定は標準の medium と異なります。自分のタスクで完了率と総トークンを測定してください。

標準 API 料金。バッチの入出力は50%割引、fast は $8 / $40。100万トークンのキャッシュ書込は5分 $5、1時間 $8。

公式仕様

評価したい用途 Claude Opus 5

Opus 5 向けに調整済みのアプリの回帰テスト基準に適します。

Anthropic は旧モデルと位置付け、Opus 5.5 の検討を推奨。移行前にプロンプト、ツール、費用を再検証してください。

標準 API 料金。バッチの入出力は50%割引。100万トークンのキャッシュ書込は5分 $6.25、1時間 $10。

公式仕様

報告されたベンチマーク結果

Anthropic の公開時ベンチマーク(2026年9月22日)
ベンチマーク Claude Opus 5.5Claude Opus 5
Terminal-Bench 4.0Opus 5.5:xhigh 強度66.4%52.3%
FrontierCode v1.1Opus 5.5:max 強度54.4%48%
CursorBench 4.0Opus 5.5:max 強度57.8%46.6%
GDPval-AA v2.1Opus 5.5:max 強度1846 Elo1708 Elo
AutomationBenchOpus 5.5:max 強度40%26.9%
Humanity's Last Examツール使用・Opus 5.5:max 強度67.7%63.6%

2026年9月22日にベンダーが報告した結果。Opus 5.5 は Terminal-Bench の xhigh を除き max を使用。他モデルの強度、ハーネス、ツール設定は異なる場合があります。元の手法を確認してください。当サイトのテストではなく、Anthropic の medium 費用グラフとも別です。

評価の出典と手法

自分に重要なタスクを試す

同じタスク、入力、ツール、成功基準を使い、バージョン、強度、総費用、遅延、人の修正を記録しましょう。選定前に繰り返し検証してください。単一のデモでは一般的な優劣は判断できません。