Google が 2026年9月2日、Gemini 3.8 Flash と Gemini 3.8 Flash Cyber を発表した。3.7 Flash からわずか3週間、3.6 → 3.7 → 3.8 と6週間で3回目の Flash リリースになる。
今回の見出しは「同じ速度・同じ低価格のまま、推論とコーディングが過去最良」。ただし公式ドキュメントまで読むと、単価は据え置きでも実コストは上がりうるという設計上の但し書きが明記されている。そこが今回いちばん実務に効くポイントなので、そこを中心にまとめる。
2つのバリアント
Gemini 3.8 Flash GA
ソフトウェアエンジニアリング、エージェントタスク、専門領域の多段推論で 3.7 Flash から大幅改善した「最も賢いワークホース」。一般提供。
3.8 Flash Cyber 限定提供
脆弱性検出と自動パッチでフロンティア級。Fairwind Program の審査を通った「信頼された防御者」にのみ提供される。
両者は同じ基盤インテリジェンスを共有している。そして Google は、コーディングと推論の伸びを牽引した要因のひとつとして「サイバーセキュリティという極めて要求の厳しい領域での訓練」を挙げている。加えて、モデル自身を再帰的に評価・改善する長時間稼働のエージェントループで開発を加速したという。
価格は据え置き、ただしトークンは増える
単価は前世代と同じだ。だが公式ドキュメントは、3.8 Flash が長時間かかる複雑なタスクでは意図的により多くのトークンを使うと明記している。難しい多段の課題で品質を出すために、より小さい推論ステップを踏み、ツールを反復的に呼び出し、途中で自分の作業を検証するという設計だからだ。Google 自身の言葉を借りれば、このモデルは「より熱心に働く」。
裏返すと: すべてのワークフローがそのレベルの検証を必要とするわけではない。公式は日常的なタスクには推論エフォートを下げるか、効率重視のワークロードには 3.7 Flash を使い続けることを推奨している。3.7 はフルサポートが継続される。
thinking_level という新しいツマミ
その調整のために用意されているのが thinking_level の3段階だ。「賢さ」ではなく「どれだけ働かせるか」がAPIパラメータとして明示的に露出した、と読むのが実務的だと思う。
| レベル | 用途 |
|---|---|
low | インシデント対応パイプライン、リアルタイムチャット、下書き、高速なデータ分析などレイテンシ重視 |
medium(既定) | 大半のタスクで最良の品質。複雑なコードとエージェント用途の推奨値 |
high | 深い推論、数学、難しい多段タスク。推論とツール調整能力を最大化 |
エージェントハーネスを自作している立場から見ると、これは「ゲート通過率を上げる代わりにトークンを払う」ツマミが公式APIに出てきたということになる。探索フェーズは low、パッチ生成は high、といったゲートごとの出し分けが素直に書ける。
基本スペック
| 項目 | 値 |
|---|---|
| モデルID | gemini-3.8-flash |
| ステータス | GA(本番利用可) |
| コンテキスト | 1M トークン |
| 最大出力 | 64k トークン |
| 既定の thinking level | medium |
3.7 からの移行は破壊的
モデル文字列を差し替えるだけでは動かない。公式の移行チェックリストは以下の通り。
モデルIDの更新
ターゲットのモデル文字列を gemini-3.8-flash に変更する。
サンプリングパラメータの削除
生成設定から temperature / top_p / top_k を除去。candidate_count も Gemini 3 以降は非サポート。
thinking_budget の置換
数値の thinking_budget を文字列 enum の thinking_level に置き換える。
ターン検証ルールの適用
マルチターンはサーバー側の previous_interaction_id に統一し、事前充填されたモデルターンを削除する。
Function calling の監査
マルチモーダル資産はレスポンスペイロード内に置き、インライン指示は改行2つで整形する。
移行時にハマりやすい点
minimalの thinking level は 3.8 Flash では非対応。指定するとエラーになる- 導入価格は 2026年12月31日まで。2027年1月1日から2倍になるため、コスト試算は通常価格ベースで行っておく
- ツール呼び出し前のテキストに起因する
Malformed_Function_Callについて、公式に回避策の案内がある - 6週間で3リリースというペースなので、モデル名をコードに直書きした運用は陳腐化が速い
3.8 Flash Cyber: 防御側にだけ配る
もう一方の Cyber は、Fairwind Program 経由で信頼された防御者にのみ提供される。政府機関、重要インフラ事業者、ソフトウェアメンテナが優先アクセスの対象で、申請制だ。
能力面では、業界標準の脆弱性発見ベンチマーク CyberGym で前世代の 3.5 Flash Cyber と、はるかに大きいフロンティアモデルの双方を上回ったとされる。CyberGym が C/C++ 中心であることを補うため、20のプログラミング言語にまたがる複雑なコードベースを対象にした社内ベンチマークでも評価しており、そちらでは成功率70%超に達したという。
自動パッチについては、Collinear が運営する外部ベンチマーク CWE-Bench で pass@1 が 47.2%。首位のフロンティアモデルの 47.8% にわずかに届かないものの、コストが大幅に低いためパレートフロンティア上にあるという位置づけになっている。
Google は、攻撃能力(エクスプロイト)よりも脆弱性の修正を当初から優先して投資してきたと明言している。社内での適用事例も公表された。
Chrome Security チーム
Chrome の脆弱性に対して、はるかに大規模な最良の商用モデルと比べて2.6倍の正しいパッチを生成した。
Wiz
社内のペネトレーションテスト用ベンチマークで、他の主要フロンティアモデル比でリコールが7.5〜9.7ポイント高く、コストは2.3〜5.2倍低かった。
Google Cloud 脆弱性研究チーム
通常なら調査と発見に数ヶ月を要する重大な基盤脆弱性を、2時間未満で発見した。
安全性の扱いも対照的だ。通常版の 3.8 Flash は Frontier Safety Framework に沿って CBRN とサイバー攻撃領域のセーフガードを備えて出荷される。一方 Cyber はより緩和された緩和策で出荷され、そのぶん配布先が信頼された防御者に限定される。加えて 3.8 世代は Gray Swan の評価でプロンプトインジェクション耐性が大きく向上したとされている。
開発者にとっての意味
提供チャネルは、開発者向けが Google Antigravity / Gemini API(AI Studio)/ Android Studio / Stitch、企業向けが Gemini Enterprise、個人向けが Gemini アプリ・Google 検索の AI Mode・Google Sheets(Google AI Pro / Ultra 契約者)。さらに Managed Agents の Antigravity agent は既定モデルが 3.8 Flash に切り替わった。Antigravity SDK も既定で 3.8 Flash を使う。
単価の据え置きだけで判断しない。「同じ値段」と「同じコスト」は違う。乗り換えを評価するなら、成功率だけでなく総トークン数と実コストを同時に計測しないと結論が出せない。
モデル指定はコードから剥がす。6週間で3リリース、しかも毎回パラメータが破壊的に変わる。モデルIDと生成パラメータをセットで持つ設定オブジェクトにしておかないと、差し替えが効かなくなる。
配布モデルの収束に注目する。強い能力を全員に配らず、防御側にだけ緩和策を配る。フロンティア各社が似た設計に収束してきている。競争軸が「モデルの能力」から「誰に配るか」へ広がりつつある。
数値の出どころについて: DeepSWE v1.1、Vals Finance Agent V2、Harvey's Legal Agent Benchmark、CyberGym の具体的なスコアは発表記事内でチャート画像として埋め込まれており、本文テキストからは確認できなかった。本記事で数値を挙げているのは、テキストで確認できた HLE-Verified 54.9% と CWE-Bench の 47.2% / 47.8% のみ。それ以外は公式の定性表現に留めている。またベンチマークの多くは Google 自身による提示であり、第三者検証は別途待ちとなる。