AnthropicがClaude Opus 5.5を9月22日公開。推論速度30%超向上とコスト40%削減を実現
20秒でわかる内容解説
Anthropicは2026年9月22日、新Claude 5.5ファミリーの先駆けとして推論モデルClaude Opus 5.5を公開した。従来比でコストを40%削減し、出力速度を30%超高速化したことで、エージェント開発や長文処理のワークフローコストを圧縮できる。ベンチマークでは同価格帯モデルを大きく上回るスコアを記録しており、実務での使い勝手向上が期待される。
仕様とベンチマーク
Claude Opus 5.5は100万トークンのコンテキストウィンドウとテキスト画像入力に対応するプロプライエタリモデルだ。Artificial Analysisが計測したインテリジェンス指数では58点を記録し、同価格帯の推論モデル中央値の25点を大きく上回る。
パフォーマンス面では複雑なコードベースの移行作業で従来比の大幅な短縮を実現した。内部テストではHAProxyのC言語コードをRustへ翻訳する作業を9.5時間で完了させ、12時間で完了したFable 5.1より2.5時間早く処理が終了した。
コスト構造の刷新が目立つ。入力トークンが100万あたり4ドル、出力が20ドルでそれぞれ20%値下げされた。特にエージェント作業で費用の大半を占めるキャッシュ読み取りが0.20ドルに引き下げられ、60%のコスト削減につながった。
推論機能は拡張思考を採用し、複雑な問題解決前に内部で思考を深める。Fast modeでは最大2.5倍の速度を実現するが、トークン単価は通常設定の2倍になる。
| 項目 | Opus 5.5 | Opus 5 |
|---|---|---|
| キャッシュ読み取り | $0.20 | $0.50 |
| 入力トークン | $4.00 | $5 |
| 出力トークン | $20.00 | $25 |
安全性と対話スタイル
新モデルは自動行動監査において過去最良のスコアをマークした。シミュレーションされた数千のシナリオで、ハードなアクションや境界外行動を起こしにくく、プロンプトインジェクションにも強い。
On our automated behavioral audit, the most comprehensive alignment test we run, Opus 5.5 is the strongest-performing model we’ve tested to date.
実施している最も包括的なアライメントテストである自動行動監査において、Opus 5.5は過去にテストしたモデルの中で最高のパフォーマンスを記録した。
生物学やサイバーセキュリティの分野ではMythos 5.1と同等の性能を持つため、Fable 5.1と同様の安全対策を適用して展開する。認証済み組織はLife Sciences Verification Programへの申請で生物研究に使用できる。
対話スタイルの改善も実施された。以前のOpus 5で指摘されがちだった冗長な出力が解消され、重要な情報を先頭に配置するようになった。長期セッションでの作業パートナーとしての使い勝手が向上している。
68万行のコードマイグレーションを1日で完了させるなど実務での効率化が進む。OSWorld 2.0で81.8%、AutomationBenchで40.0%のスコアを記録し、ツール連携型の作業に強い。下の画像では各指標での評価結果が一目で比較できる。
コミュニティと競合動向
ハッカーニュースでは価格引き下げと速度向上に肯定的な反応が多く寄せられた。Opus 5の冗長な出力スタイルが改善されることを期待する声や、サブスクリプションユーザーが利用制限をリセットできる新仕組みへの注目も目立つ。
一方でバージョン番号の飛躍やペースダウン宣言との整合性を疑問視する意見もある。ベンチマークスコアと実際のトークン効率に乖離がある可能性を指摘するユーザーもおり、実使用での安定性が注目される。
競合モデルとの比較ではGPT-6 AstraやGPT-5.6 Solを多くの指標で上回る。特にエージェントコード生成では高負荷時のスコアで先行し、タスクあたりのコストはAstraの約20%水準で収まる。
中国勢のMiMo-v2.6-Proも100万トークンコンテキストとマルチモーダル入力を搭載し、インテリジェンス指数で46点を記録した。オープンウェイトのMITライセンスで商用利用が可能だ。1.0Tパラメータの総数に対し推論時は42Bパラメータのみが活性化する。
出力速度は76.2トークン毎秒で平均値68.0を上回り、リアルタイム応答に向く。価格は入力0.43ドル、出力0.87ドルと価格競争力が高い。評価では140Mトークンを生成し、同規模のオープンウェイトモデル中央値の140Mトークンと同等の冗長さを示した。
今後のリリースと未確定点
Claude Sonnet 5.5とClaude Haiku 5.5は数週間以内にリリースされる。推論速度の向上と効率化、安全性の強化が同様の改善点として適用される見込みだ。
実務でのトークン消費量については、Artificial Analysisの評価で260Mトークンを生成したとあり、同価格帯モデルの中央値の92Mトークンを大幅に上回った。実際のワークフローでどれほど効率的に動作するかは未確定だ。
ベンチマークと実パフォーマンスの乖離も検討材料になる。テスト環境で最適化されたスコアが、多様なデプロイ環境で維持されるかは開発側の今後のデータ公開に依存する。Humanity's Last Examで67.7%のスコアをマークした。ツール使用時の推論精度が先行モデルを凌駕している。
新モデルの性能推移とコスト改善の持続性を確認するため、今月の後半にかけて実務での評価が本格化する。サブスクリプションユーザーは10月22日まで利用制限のリセットを保存できる。5時間の利用制限も拡大され、rate limit reset機能で好きなタイミングでリセットを活用できる。
用語の注釈
- トークン
- 長いデータを最小の構成単位に分割したもので、LLMがテキストや画像を処理する際の基準となる。価格計算にも利用される。(参考:トークンとは - IT用語辞典 e-Words)
- エージェント
- 目標達成に向けて自律的に判断・行動するAIシステム。外部ツールやAPIを活用してタスクを自動遂行する。(参考:AIエージェントとは?仕組みや生成AIとの違い、企業での活用例 ...)
出典
- Claude Opus 5.5(Hacker News) · 議論
- Claude Opus 5.5 Intelligence, Performance and Price Analysis (Max)(Hacker News) · 議論
- MiMo-v2.6-Pro: Intelligence, Performance and Price Analysis(Hacker News) · 議論