2026年9月2日、Googleが「Gemini 3.8 Flash」と「Gemini 3.8 Flash Cyber」の2つのモデルを発表しました(Introducing Gemini 3.8 Flash and 3.8 Flash Cyber、日本語版は9月3日掲載)。
ひとつ前のGemini 3.7 Flashが8月13日でしたから、また3週間です。7月21日の3.6 Flash、8月13日の3.7 Flash、そして今回と、6週間でFlash系列が3本並びました。3.7 Flashのときに3週間で来た更新という記事を書きましたが、あれは例外ではなくペースそのものだったようです。
ただ、今回の主役は速さの話ではないと私は思っています。もう1本の3.8 Flash Cyberの方です。脆弱性の発見とパッチ生成に特化したモデルで、一般には提供されません。Fairwind Programという審査制の枠組みを通じて、政府機関、重要インフラ事業者、防御研究を行う学術研究室といった、審査を通った相手にだけ渡されます。8月にOpenAIがGPT-5.6-Cyberで採った方式(OpenAI DaybreakとGPT-5.6-Cyberの記事)とほとんど同じ構図で、ひと月のあいだに主要なAI企業が2社続けて、強いサイバー能力は審査した相手にだけ渡す方式へ舵を切ったことになります。
本体の仕様と価格を短く押さえたうえで、3.8 Flash Cyberのベンチマークと、Fairwind Programの中身を見ていきます。先に、調べていていちばん引っかかった点を挙げておきます。このモデルの脆弱性関連のベンチマーク3つのうち、第三者が測ったものはCWE-Benchの1つしかありません。そしてそのCWE-Benchでは、審査なしで誰でも使える汎用モデルが0.6ポイント差の首位にいます。
Table of contents
Open Table of contents
6週間で3本というペース
まず時系列を並べておきます。
| モデル | 発表・リリース日 | 前モデルからの間隔 |
|---|---|---|
| Gemini 3.6 Flash | 2026年7月21日 | なし |
| Gemini 3.7 Flash | 2026年8月13日 | 約3週間 |
| Gemini 3.8 Flash | 2026年9月2日 | 約3週間 |
モデルカードによると、3.8 Flashは3.7 Flashを基礎にした改良版で、訓練データの詳細は3.7 Flashのカードを参照するよう案内されています。3.7 Flashが3.6 Flashの改良版だったのと同じ作り方です。ゼロから訓練し直すのではなく、同じ基盤へ改良を重ねて3週間ごとに出す。このリズムはしばらく続くと見てよさそうです。時系列と作り方を1枚にまとめるとこうなります。
追いかける側としては、正直、記事を書く手が追いつきません。
Gemini 3.8 Flashの仕様と価格
仕様の骨格は3.7 Flashからほぼ変わっていません。モデルカードと開発者向けドキュメントの記載をまとめます。
| 項目 | 内容 |
|---|---|
| モデルID | gemini-3.8-flash |
| リリース時期 | 2026年9月 |
| コンテキストウィンドウ | 1,000,000トークン |
| 最大出力 | 64,000トークン |
| 入力モダリティ | テキスト、画像、音声、動画ファイル |
| 出力モダリティ | テキスト |
| 知識のカットオフ | 2026年3月(一部の領域は2025年1月まで) |
| 思考レベル | low / medium / high(既定はmedium) |
| 導入価格 | 入力0.75ドル / 出力3.75ドル(100万トークンあたり、2026年12月31日まで) |
| 標準価格 | 入力1.50ドル / 出力7.50ドル(2027年1月1日から) |
トークンやコンテキストウィンドウといった用語の説明は3.7 Flashの記事に書いたので、初めての方はそちらをどうぞ。
価格は3.7 Flashの導入価格と同じ数字です。今回は前回のような半額という宣伝文句が出てきません。値下げしていないので当然ではあります。導入価格の期限は2026年12月31日で据え置き、2027年1月1日からは倍の標準価格に切り替わる予定も変わっていません。つまり、この価格で使えるのは残り4か月弱です。採算の計算は標準価格でやっておくべきだ、という前回の話がそのまま当てはまります。期限を図にしておきます。
性能については、複雑なエンジニアリング課題を自律的に解くDeepSWE v1.1で73.7%を出し、より大規模なフロンティアモデルの多くを上回ったとされています。多段階の推論を測るHLE-Verifiedでは54.9%。発表内のグラフにはこのほか、金融エージェントのVals Finance Agent V2で61.4%、リーガルテック企業Harveyの法務エージェントベンチマークで10.0%、ターミナル操作のTerminal-benchで89.4%といった数値が、3.7 Flashや競合モデルとの比較付きで載っています。Harveyの10.0%のように絶対値の小さいベンチマークも混ざっているので、数字の高い低いは、それぞれのベンチマークの相場と併せて読んでください。
提供の窓口は発表と同時に開いています。開発者はGoogle AI StudioとGemini API、Googleのエージェント開発環境であるGoogle Antigravity、Android Studioから使えます。Antigravityは既定のモデルが3.8 Flashに切り替わりました。法人向けはGemini Enterprise、個人はGoogle AI ProまたはUltraの加入者がGeminiアプリ、Google検索のAIモード、スプレッドシートで利用できます。UI生成ツールのStitchも対応しています。
3.8 Flash Cyberのベンチマーク
何をするモデルか
3.8 Flash Cyberは、脆弱性を見つけて修正パッチを作ることに特化したモデルです。脆弱性は、ソフトウェアの欠陥のうち、悪用されるとセキュリティ上の被害につながるものを指します。見つける知識と塞ぐ知識がほぼ同じというデュアルユースの性質があり、だからこそ配り方が問題になるのですが、この前提はDaybreakの記事の用語整理で詳しく書いたので、ここでは繰り返しません。
発表文には3種類の数字が出てきます。
CyberGymと内部ベンチマーク
CyberGymは、UC Berkeleyの研究チームが公開しているベンチマークです。実在のオープンソースプロジェクト188件から採った1,507件の課題について、脆弱性の説明とコードベース、それに実行環境を与えられたAIエージェントが、実行結果のフィードバックを見ながら、その脆弱性を再現する入力(PoC)を作れるかを測ります(CyberGym論文)。測っているのは既知の脆弱性の再現で、未知の脆弱性を一から見つける設定は別にあります。Googleは発表文で、3.8 Flash Cyberはここでフロンティアモデル級の性能を持ち、前世代の3.5 Flash Cyberも、大幅に規模の大きいモデルも上回った、と言っています。
数字は86.2%です。発表のグラフとFairwind Programの案内ページの両方に、CyberGymで86.2%の成功率と示されています。測り方も評価方法の資料として公開されていて、pass@1の単一試行、多数決や並列のtest-time computeなし、APIの既定サンプリング、サイバー特化ではない社内版Antigravityハーネス、公開リーダーボードと同じFinal-submission設定、とあります。論文の公開時点では、最も良いモデルとエージェントの組み合わせでも成功率はおよそ20%と報告されていたので、そこから見れば大きな伸びです。ただし、この86.2%を測ったのはGoogle自身です。モデルに触るにはFairwindの審査を通る必要があるので、一般の第三者が自由に追試できる状態ではなく、独立した追試の結果も今のところ公表されていません。
もうひとつの、20種類のプログラミング言語にまたがる脆弱性検出で成功率70%超という数字は、Google自身が作った内部ベンチマークの結果です。評価方法の資料には、対象が著名なオープンソースプロジェクトの最近の確認済み脆弱性1,200件超で、サイバー特化ではない社内版Antigravityハーネスで実行した、という程度の開示はあります。ただ課題そのものは非公開なので、外部からは検証のしようがありません。参考程度に読んでおきます。
CWE-Benchの47.2%
外部のリーダーボードで検証できる数字がひとつだけあります。CWE-Benchです。
CWE-BenchはCollinear AIが公開している防御側向けのベンチマークで、実在のオープンソースリポジトリにある脆弱性をモデルが修正できるかを測ります。54種類のCWE(脆弱性の分類体系)にまたがる100件の課題があり、エクスプロイトが遮断され、かつ既存のテストがすべて通ったときだけ、解けたと数えます。pass@1は1回目の試行で解けた割合です。3.8 Flash Cyberのスコアは、運営元のCollinear AI自身が測定したと評価方法の資料にあります。
リーダーボードの上位はこうなっています(2026年9月5日参照)。
| モデル | pass@1 | 1課題あたりの平均コスト |
|---|---|---|
| Claude Fable 5 | 47.8% | 10.27ドル |
| Gemini 3.8 Flash Cyber | 47.2% | 3.64ドル |
| GPT-5.6 Sol | 44.2% | 2.29ドル |
Googleは、主要なフロンティアモデルのpass@1が47.8%のところ47.2%だった、という書き方をしています。つまり首位ではなく、0.6ポイント差の2位です。上回ったとは書かず、発表内のグラフには比較相手がClaude Fable 5だと明記されています。文章の側では名前を省いていますが、隠しているわけではありません。ここの見せ方はフェアだと思います。
見るべきはコストの列です。精度がほぼ並んでいる首位モデルの3分の1近い単価で、フロンティア級の性能を低コストでという主張の実体はここにあります。
この表からはもうひとつ読み取れることがあります。パッチを書く仕事に関しては、審査なしで誰でも使える汎用モデルが、防御側限定のCyberとほぼ同じ精度を出しているという点です。ここからは私の推測ですが、選別配布で囲い込まれている能力の中心は、パッチを書く力ではなく、脆弱性を突く側の力だと考えています。CyberGymが測るのは既知の脆弱性を再現するPoC作成、内部ベンチマークが測るのは検出です。そしてこちら側の数字は、条件の開示こそあれ、どちらもGoogleが自分で測った値です。審査を通ったパートナーなら確かめられるはずですが、独立した追試の結果はまだ公表されていません。3つの数字を検証のしやすさで並べ直すと、この形です。
実運用の報告
発表には実際に使った側の報告も載っています。
- Chromeのセキュリティチームは、大幅に規模の大きい商用モデルと比べて2.6倍の数の正しいパッチを生成できたと報告しています。
- クラウドセキュリティ企業のWizは、社内のペネトレーションテストで再現率が7.5〜9.7%高く、コストは2.3〜5.2倍低かったとしています。再現率は、見つけるべき脆弱性のうち実際に見つけられた割合です。
- Google Cloudの脆弱性調査チームは、通常なら数か月かかる基盤部分の重大な脆弱性を、2時間足らずで発見したそうです。
数字としては悪くありません。ただし出どころを見ると、ChromeとGoogle CloudはGoogle自身のチームで、Wizも2026年3月に買収が完了してGoogle傘下に入った会社です。3件ともGoogleグループの中からの報告なので、第三者による追試とは呼べません。条件の詳細も公開されていません。
Fairwind Programの仕組み
3.8 Flash Cyberは、APIの料金表にも開発者向けドキュメントにも出てこず、3.8 Flash本体のような専用モデルカードもありません。公開資料は、ブログの発表文、Fairwind Programの案内ページ、専用のモデルページ、それに評価方法の資料です。一般公開はしないとGoogleは明言しています。
案内ページによると、対象になるのは次の顔ぶれです。
- 政府機関と各国のサイバーセキュリティ当局
- 医療、通信、エネルギー、金融網といった重要インフラの事業者
- 主要な技術プラットフォームの企業とソフトウェアの保守者
- 防御目的のベンチマーク研究を行う学術研究室
参加には審査があります。倫理的な運用実績の確認に加えて、利用者単位の認証とフィッシング耐性のある多要素認証、アクセスの追跡と従業員の利用ログ管理が求められます。承認されたパートナーがモデルを使えるのは防御目的の作業に限られ、許可を得た脅威シミュレーションはその範囲に含まれます。
もう1つ関係するのが、DeepMindが以前から研究発表していたコード修復エージェントのCodeMenderです。こちらはエージェント自体が公開されていて、Fairwindに参加していなくても公開モデルと組み合わせて使えます。Fairwind限定なのはあくまで3.8 Flash Cyberへのアクセスで、パートナーはそのモデルを単体でも、CodeMenderの中のモデルとしても使える、という関係です。
Daybreakとの符合
この仕組み、OpenAIが8月10日に発表したDaybreakの拡張とGPT-5.6-Cyberに驚くほど似ています。一般向けには出さない専用モデルを用意し、審査で相手を選び、防御目的に限定し、利用の記録を条件にする。4点とも同じです。
中身の力点は違います。OpenAIのGPT-5.6-Cyberは、通常のモデルなら断る依頼に95.0%応じるという、拒否の削減が中心でした。Googleの3.8 Flash Cyberは、発見と修正の能力そのものを高める方向です。入口は違いますが、着地点は同じで、強いサイバー能力は審査済みの防御側にだけ渡すという配り方に落ちています。
方向そのものには私は賛成です。防御側が使えない間も、攻撃側は別のモデルや既存のツールを使い続けるというDaybreakのときの理屈は、今回もそのまま成り立ちます。引っかかるのは、1か月のうちに2社が同じ方式へ並んだのに、審査の基準はどちらも外から見えないままだという点です。信頼できるパートナーの線引きを各社が独自の非公開基準でやる状態が業界標準になると、審査から漏れる側、たとえば中小企業や独立系の研究者は、どの会社からも似た理由で断られることになります。共通の枠組みや第三者による監査の話は、今のところどちらの発表にも出てきません。
安全性評価の中身
発表文の安全対策は3点です。Frontier Safety Frameworkに基づいて評価したこと。化学・生物・放射線・核(CBRN)兵器とサイバー攻撃への悪用を防ぐセーフガードを組み込んだこと。そして、Gray Swanの測定でプロンプトインジェクション耐性が大きく向上したことです。
プロンプトインジェクションは、モデルに読ませる文書やWebページの中に指示文を紛れ込ませて、本来の指示を乗っ取る攻撃です。エージェントとしてツールを操作させる用途が増えるほど効いてきます。この評価は、Googleがモデルのチェックポイントを渡し、Gray Swan(AIの安全性測定を専門にする会社です)が独立に実験を組んで測定したと評価方法の資料にあります。発表のグラフには数値も出ていて、3.7 Flashの9.2%に対し、3.8 Flashは5.5%、Flash Cyberは6.0%です(攻撃が成功した割合で、低いほど良い値です)。脆弱性系の数字と違って、こちらは第三者の測定で、筋がよいと思います。
もうひとつ、発表文には出てこない数字がモデルカードにあります。自動評価の結果は全体として3.7 Flashと同水準なのですが、内訳を見ると、多言語の安全性が5.4ポイント悪化しています(この指標は低いほど良い値です)。Google自身が、カードの中で、英語以外の言語では安全性がわずかに後退したと認めています。悪化分を人手でレビューしたところ大半は誤検知か深刻でないものだった、という説明は付いていますが、日本語で使う側からすれば、英語圏より条件が悪い方向の変化です。発表文だけ読んでいると気付けない類いの情報なので、ここに書いておきます。この記載差も1枚にまとめておきました。
要点
- Gemini 3.8 Flashは3.7 Flashの3週間後に出た改良版で、仕様も導入価格も据え置き。導入価格の期限は2026年12月31日のままなので、採算は2027年1月からの標準価格(入力1.50ドル / 出力7.50ドル)で考える。
- 3.8 Flash Cyberの脆弱性関連ベンチマーク3つのうち、第三者が測ったのはCWE-Benchのpass@1 47.2%だけ。首位のClaude Fable 5に0.6ポイント差の2位で、単価は約3分の1。パッチ生成では汎用モデルとの差は小さい。
- CyberGymの86.2%は評価方法の開示付きだが測定はGoogle自身、20言語で70%超は内部ベンチマーク。脆弱性系のベンチマークで第三者の測定があるのはCWE-Benchだけ。
- Fairwind Programは、3.8 Flash Cyberへのアクセスを審査制で防御側にだけ渡す仕組み。OpenAIのDaybreakと1か月違いで同じ方式に並んだが、審査基準はどちらも非公開のまま。
- モデルカードには多言語の安全性が5.4ポイント後退したという記載があり、発表文には出てこない。日本語で使うなら頭に入れておきたい。
参考資料
- Introducing Gemini 3.8 Flash and 3.8 Flash Cyber(Google、2026年9月2日。日本語版は9月3日掲載)
- Gemini 3.8 Flash モデルカード(Google DeepMind、2026年9月)
- Gemini API 開発者向けドキュメント What’s new(Google、2026年9月5日参照)
- Fairwind Program(Google DeepMind、2026年9月5日参照)
- CWE-Bench リーダーボード(Collinear AI、2026年9月5日参照)