Opus 5 の立ち位置
Anthropic が 2026年7月24日に Claude Opus 5 を発表し、同日から全プラットフォームで提供を開始した。上位の Fable 5 に迫る知能を、その半分の価格で出すというのがこのモデルの主張だ。Claude Max の新しいデフォルトモデルであり、Claude Pro で選べる最上位モデルでもある。
ポジショニングとしては「毎日使うためのモデル」。フロンティアの記録を塗り替えるためではなく、日常的なワークロードを効率よく回すために設計されている、という説明がされている。コーディングとナレッジワークの評価では新しい state-of-the-art だが、サイバーセキュリティ系のタスクでは依然として Mythos 5 の後方にある。
effort という調整軸
今回の発表で全体を貫いているのが effort 設定 という考え方だ。知能を優先するか、トークンを節約して速く安く済ませるかを、利用者側が明示的に選べる。公開されているベンチマークのグラフがすべて「effort 別のコスト対性能」で描かれているのは、この軸をモデルの使い方の中心に据えたいという意思表示だろう。
結果として、単一のスコアではなく「同じコストならどちらが強いか」という比較のしかたになる。以下は主要な評価から読み取れるポイント。
| 評価 | 結果 |
|---|---|
| Frontier-Bench v0.1 | 全モデルを上回り、Opus 4.8 の 2 倍超のスコアをより低いタスク単価で達成 |
| CursorBench 3.2 | max effort で Fable 5 のピークと 0.5% 差、コストは半分 |
| ARC-AGI 3 | 次点モデルの 3 倍のスコア |
| Zapier AutomationBench | 同コストで次点の約 1.5 倍の pass rate。最低 effort でも他モデルを上回る |
| OSWorld 2.0(computer use) | Fable 5 のベスト記録を、その 1/3 強のコストで超える |
ライフサイエンス系の社内評価では全項目で Opus 4.8 を上回っており、特に有機化学(分光データからの分子構造推定)で 10.2 ポイント、タンパク質配列の変異が機能に与える影響の予測で 7.7 ポイントの改善が報告されている。
Fast mode: デフォルトの約 2.5 倍速で動作するモードも提供される。価格は基本料金の 2 倍で、Claude Code では usage credit を通じて利用する。
エージェントとしての振る舞い
スコアよりも興味深いのは、行き詰まったときに何をするかという挙動の質だ。発表では「自分の作業を検証し、成功するまで慎重に反復する能力」が強調されており、具体例がいくつか挙げられている。
手段がないなら手段を作る
Frontier-Bench のあるタスクでは、機械部品の図面を FreeCAD の 3D モデルとして再構築するコードを書くよう求められる。ただし、このタスクではモデルに図面を直接「見る」手段が意図的に与えられていない。Opus 5 は自前のコンピュータビジョンパイプラインを書いて生のピクセルから幾何情報を取り出し、部品全体を再構成した。同じ条件で他のモデルは 5 回試行しても解けなかった。
症状ではなく原因を直す
広く使われている OSS パッケージマネージャの実際のバグに対して、根本原因を突き止め、コミュニティのパッチが見逃していたエッジケースまで修正した。比較対象のモデルは表層的な症状だけを直して「解決した」と報告している。
検証環境を自分で用意する
ある取引会社のエンジニアは、新しい取引所向けのマーケットデータフィードを 1 セッションで構築させた。従来モデルは詳細な計画を与えても完遂できなかったタスクだ。Opus 5 は検証用のライブフィードが存在しないと分かると、取引所のデータを正しくパースできているか確認するためのテストハーネスを自分で作った。
もうひとつ、早期アクセス顧客からの報告で目を引くのが設計レビューでの振る舞いだ。人間が提案した設計に対して押し返し、こちらが食い下がっても折れずに、提案の価値ある部分を明示したうえで反対点を一つの設計論点に絞り込み、良い部分を残して欠陥だけを直す妥協案を出した、という報告がある。監督を減らして任せられるかどうかは、こういう判断力に懸かっている。
アラインメントと安全性
Anthropic はデプロイ前テストの自動 behavioral audit で、Opus 5 をこれまでで最もアラインしたモデルだと評価している。Opus 4.8、Sonnet 5、Fable 5 のいずれよりも Claude's Constitution への遵守度が高く、欺瞞的な挙動の発生率が最も低く、誤用へ誘導される耐性も最も強い。不可逆な副作用を招きうる無謀な行動を避けるという点でも過去最高だという。総合的な misaligned behavior のスコアは 2.3 で、直近のモデル群の中で最も低い。
脆弱性の発見
サイバータスクは意図的に学習させていないが、汎用能力の向上に伴って大きく改善。脆弱性を見つける能力では Mythos 5 に肉薄している。
エクスプロイトの開発
見つけた脆弱性を実際の脅威に変える段階では Mythos 5 に大きく劣る。OSS-Fuzz 評価はこの非対称性を示すために設計されている。
デュアルユース能力の面では、Opus 5 はフロンティアを前進させていない。生物学研究と攻撃的サイバーの両方で Mythos 5 の後方にとどまることが、民間および政府のパートナーと共同で行った評価で確認されている。
セーフガードの設計
Opus 5 のセーフガードは Opus 4.8 とおおむね同等で、違いは限られた範囲のサイバータスクに強めのガードレールが入っている点だ。サイバー分類器は Fable 5 のものより比例的に緩く、ソースコードの脆弱性発見は許可される一方、バイナリベースの脆弱性スキャン、ペネトレーションテスト、エクスプロイト生成はブロックされる。
Anthropic の見込みでは、分類器の介入頻度は Fable 5 の約 85% 減。Claude.ai / Claude Code / Claude Cowork ではフラグされたリクエストがデフォルトで Opus 4.8 にフォールバックし、API でもこのフォールバックを有効化できる。セーフガードによって正当なセキュリティ業務が妨げられる場合は、Cyber Verification Program の参加者が制限を緩めたバージョンに即時アクセスできる。
生物学分野については Opus 4.8 相当のセーフガードのままなので、結果的に Opus 5 は一般提供モデルとして最も科学研究に使えるモデルになった。Fable 5 でブロックされる生物学関連のリクエストは、今後 Opus 4.8 ではなく Opus 5 にルーティングされる。
ハーネスを組む側が意識しておく点
- 分類器の発動頻度が下がっても、ゼロにはならない。フラグされるとモデルが Opus 4.8 に入れ替わるため、ループの途中でモデルが変わりうる前提で設計する
- 長時間・自律的な研究タスクには依然として重要な制約が残る。この領域は Mythos 5 が上位
- Frontier-Bench の effort プロットは社内実行(mini-SWE-agent ハーネス、GKE バックエンド、5 試行の平均 reward)で、Opus 5 と Fable 5 は分類器の拒否時に Opus 4.8 をフォールバックとして使っている
同時リリースのβ機能
モデル本体と合わせて、開発者向けに 2 つの機能がベータで公開された。どちらもエージェントを長時間動かす側にとっては地味に効く変更だ。
Mid-conversation tool changes Beta
会話の途中で Claude が使えるツールを差し替えても、prompt cache が無効化されなくなった。フェーズごとに必要なツールだけを露出させる設計が、キャッシュのペナルティなしに取れるようになる。
Automatic fallbacks Beta
Opus 5(および Fable 5)でセーフティ分類器にフラグされたリクエストを、別のモデルへ自動的にルーティングできる。有効にしておくと、リクエストがブロックされる代わりに常に利用可能な最良のモデルへ流れる。
なお、従来の Opus モデルと同様、Opus 5 は一般アクセスにおけるデータ保持要件を持たない。
ハーネス設計の観点から
effort 設定と Fast mode が入ったことで、ハーネスの設計は「どのモデルを使うか」から「どのフェーズにどれだけ計算を割り当てるか」へと粒度が一段細かくなる。軽量な検証ゲートは低 effort か Fast mode、実装フェーズは高 effort、といった配分をフェーズ単位で決められるようになったからだ。ここは計測しないと最適解が出ない領域で、ループのログに effort を軸として残しておく価値がある。
Mid-conversation tool changes も同じ方向の話だ。ツール定義がコンテキストを圧迫する問題に対して、フェーズごとにツールセットを絞る手は以前から取れたが、キャッシュが飛ぶコストを払っていた。それが不要になるなら、ツール露出の設計はもっと積極的に動かしていい。
要点: Opus 5 は Fable 5 に迫る知能を半分の価格で提供し、Opus 4.8 と同じ $5 / $25 の価格を維持したまま性能を大きく引き上げた。Claude Max の新デフォルト。
スコア以上に注目すべきは、検証手段がないときに自分で検証手段を作る、症状ではなく根本原因を追う、押し返すべきところで押し返すといった判断の質。監督コストを下げる方向の改善が中心にある。
一方でサイバーのエクスプロイト開発と長時間の自律研究には明確な制限が残り、その領域は Mythos 5 の担当範囲。分類器によるフォールバックが起きうる前提でワークフローを組んでおくのが現実的。