2026年8月、Googleが新しいモデル「Gemini 3.7 Flash」を公開しました(Gemini 3.7 Flash: our most intelligent workhorse model、日本語版)。モデルカードのリリース日は2026年8月13日です。
まず、間隔が短い。ひとつ前のGemini 3.6 Flashが2026年7月21日の発表でしたから、わずか3週間で次が来たことになります。
もうひとつが価格です。100万トークンあたり入力0.75ドル、出力3.75ドル。ただしこの数字には条件が2つ付いています。ひとつは年内までの導入価格であること。もうひとつは、Googleが「半額」と比べている相手がGemini 3.6 Flashの当初価格で、その3.6 Flashにも同じ価格を適用したため、いま両者の単価は同じだということです。この「半額」を将来のコスト計算や乗り換えの理由にそのまま使うと、足をすくわれます。
Table of contents
Open Table of contents
2026年8月に発表されたこと
モデルの位置づけ
GoogleはGemini 3.7 Flashを「コーディングおよびエージェント向けの最も高性能な主力モデル」と呼んでいます。英語版の見出しに使われているのは workhorse(働き者、主力の意)という語です。
Geminiのモデル名には Pro、Flash、Flash-Lite といった系列があります。おおまかには、Proが最上位、Flashが日常的に大量に使う中位、Flash-Liteが速度と単価を最優先する下位という並びで、Flashはそこそこ賢くてたくさん回しても財布が痛まない層です。
Googleが今回言っているのは、その中位枠が、これまで上位モデルの仕事だと思われていた領域まで届くようになった、という点です。
仕様のまとめ
モデルカードと開発者向けドキュメントに記載されている値をまとめます(モデルカード、What’s new in Gemini 3.7 Flash)。
| 項目 | 内容 |
|---|---|
| モデルID | gemini-3.7-flash |
| リリース日 | 2026年8月13日 |
| コンテキストウィンドウ | 1,000,000トークン |
| 最大出力 | 64,000トークン |
| 入力モダリティ | テキスト、画像、音声、動画ファイル |
| 出力モダリティ | テキスト |
| 知識のカットオフ | 2026年3月(一部の領域は2025年1月まで) |
| 思考レベルの既定値 | medium |
| 導入価格 | 入力0.75ドル / 出力3.75ドル(100万トークンあたり) |
| 標準価格 | 入力1.50ドル / 出力7.50ドル(2027年1月1日から) |
トークンは、モデルが文章を扱うときの最小単位です。英語ではおおむね単語の一部、日本語では1文字前後が1トークンにあたります。文庫本1冊がおよそ10万文字だとすると、100万トークンは文庫本10冊分くらいの分量です。
コンテキストウィンドウは、1回のやり取りでモデルが同時に見ていられる分量の上限です。100万トークンあれば、中規模のソースコード一式や、分厚い仕様書をまとめて渡せます。
知識のカットオフは、訓練データに含まれる情報の締め切りです。Gemini 3.7 Flashは2026年3月以降の出来事を、そのままでは知りません。しかもGoogleはモデルカードに「一部の領域は2025年1月まで」と但し書きを付けています。全部が一律に2026年3月まで揃っているわけではない、ということです。最新の情報が要る用途なら、Web検索などのツールを併用する前提で組んでおきます。
なお、モデルカードの説明によると、Gemini 3.7 Flashは「Gemini 3.6 Flashを基礎とし、中核の推論基盤へアルゴリズム的な改良を加えたもの」だそうです。訓練データの詳細は3.6 Flashのモデルカードを見ろ、と案内されています。要するに既存モデルの改良版で、3週間で出せた理由もそこでしょう。
提供チャネル
発表と同時に、開発者向けと法人向け、それに個人向けの提供が始まりました。
開発者は Google AI Studio やGemini API、Googleのエージェント開発環境である Google Antigravity、それにAndroid Studioから使えます。法人向けにはGemini Enterprise Agent PlatformとGemini Enterpriseアプリ。個人はGoogle AI ProまたはUltraの加入者が、160か国以上でGemini Sparkから利用できます。
ベンチマークの読み方
公式が並べた5つの数字
発表で示されたベンチマーク結果です。いずれも3.6 Flashとの比較として提示されています。
| ベンチマーク | Gemini 3.7 Flash | Gemini 3.6 Flash | 測っているもの |
|---|---|---|---|
| FrontierCode 1.1 Main | 43.6% | 34.4% | 実務で通用するコード変更の品質 |
| DeepSWE v1.1 | 65.3% | 49.0% | 長丁場のソフトウェア開発作業 |
| WebDev Arena | 1588 | 1538 | Webアプリ生成の人間評価(Elo) |
| GDP.pdf | 34.0% | 22.0% | 複雑な文書の読み取り |
| AutomationBench | 30.4% | 17.0% | 業務自動化の遂行 |
モデルカードには、このほかにGDM-MRCR v2(128kトークン)で97.0%、法務ワークフローを扱うHarvey LAB-AAで90.7%という数字も載っています。
上げ幅だけを見ると派手です。AutomationBenchは17.0%から30.4%へ、ほぼ倍増しています。ただ、何を測っているのかを知らないまま倍になったとだけ受け取ると、使ったときの実感と噛み合いません。
各ベンチマークの中身
FrontierCodeは、Cognitionが公開しているベンチマークです(FrontierCode)。Cognitionが基準に据えたのは、開発者が実際にこのプルリクエストをマージするかどうかです。正確性に加えて、テストの質、変更範囲の妥当性、コードスタイル、リポジトリの規約への適合まで含めて採点します。
20人以上のオープンソース開発者が、1タスクあたり40時間以上かけて課題を作ったそうです。バージョン1.1からは、答えを含むソースを参照して解いた場合はスコアをゼロにする判定が入りました。検索で答えを拾ってきた実行は弾かれる、ということです。
コードが動くかどうかだけを見るベンチマークが多いなかで、Cognitionはレビューを通るかどうかを測ろうとしています。
ここで気をつけたいのは、43.6%が成功したタスクの割合ではないという点です。Cognitionは2つの指標を別々に定義しています(FrontierCodeの採点方法)。
| 指標 | 定義 |
|---|---|
| pass rate | 保守者が絶対に譲れない要件である「ブロッカー基準」をすべて満たした割合 |
| score | ブロッカーに不合格なら0点としたうえで、ルーブリック項目を加重集計した値 |
ルーブリックは2層です。動作の正しさや性能、変更範囲といったマージ可否を決める項目がブロッカーで、コードスタイルや型安全性、可読性は非ブロッカーに入ります。Cognitionは、ブロッカーを通った解答にだけ、両方を合わせた加重スコアを付けます。
発表に出ている43.6%は後者のscoreです。ブロッカーを通っても、スタイルや可読性で減点されれば満点にはなりません。43.6%のタスクに成功した、とも、56.4%のタスクが失敗した、とも読めない数字です。
DeepSWEは、5言語91リポジトリから作った113タスクで、長丁場のソフトウェア開発を測ります(DeepSWE)。既存のコミットやプルリクエストを流用しない新規タスクで、指示文はSWE-bench Proの約半分の長さなのに、解答には5.5倍のコード量が要るそうです。短い指示から長い実装を導く力を見るわけです。
リーダーボードには他社モデルのスコアも載っています。2026年8月15日時点の上位はClaude Opus 5が74%、GPT 5.6-solが73%、Claude Fable 5が70%。Gemini 3.7 Flashの65.3%は首位ではありませんが、各社のフラッグシップから10ポイント以内です。中位モデルがここまで食い込んだことが、今回いちばん効く変化だと思います。
WebDev Arenaは、Webアプリのコード生成を人間の比較投票で順位づけする仕組みです(WebDev Arena)。スコアの単位であるEloは、チェスの棋力評価と同じ考え方で、勝ち負けの積み重ねから相対的な強さを推定した数値です。絶対的な正答率ではないので、1588点取れたという意味ではありません。1538の相手に勝ち越す位置にいる、と読みます。50点差は体感でわずかに勝つ程度です。
GDP.pdfは複雑な文書の処理能力、AutomationBenchは業務自動化の遂行能力を測る評価です。どちらも採点方法は公開されていて、どちらも指標を2種類併記します。
- GDP.pdfは、100項目それぞれに原子的な基準のルーブリックを持ち、段階評価のルーブリックスコアと、完全な正答だけを数える厳密なタスク単位の合格率を、両方報告します(GDP.pdf論文、2026年7月)。
- AutomationBenchは、エージェントがどう手を動かしたかではなく、最終状態をプログラムで検証します。満たしたアサーションの割合を示す
partial_creditと、全アサーションが通ったときだけ1になるtask_completed_correctlyの2つがあり、公式の合格率は後者です(AutomationBench)。
困るのは、Googleの表に載っている34.0%と30.4%が、そのどちらなのか表からは分からないことです。段階評価のスコアなのか、厳密な合格率なのかで、同じ30%台でも意味がまるで違います。分からないうちは、7割のタスクに失敗していると読み替えるのは危ないです。
AutomationBenchにはもうひとつ落とし穴があります。公開されている600タスクとは別に、公式ランキングは非公開の保留タスクセットで採点されます。公開セットを手元で回しても、公式の数字とは一致しません。
数字に付いている条件
発表本文とモデルカードでは、見える景色が違います。発表記事に載っているグラフはGemini 3.6 Flashとの並置が中心ですが、モデルカードにはClaude Sonnet 5、GPT-5.6 Terra、Muse Spark 1.2との横並び比較が、価格つきで載っています。
| モデル | 入力(100万トークン) | 出力(100万トークン) |
|---|---|---|
| Gemini 3.7 Flash | 0.75ドル | 3.75ドル |
| Muse Spark 1.2 | 1.25ドル | 4.25ドル |
| Claude Sonnet 5 | 2.00ドル | 10.00ドル |
| GPT-5.6 Terra | 2.00ドル | 12.00ドル |
比較の中身は項目ごとに違います。FrontierCode 1.1では3.7 Flashの43.6%が競合を上回る一方、DeepSWE v1.1ではGPT-5.6 Terraの69.6%が3.7 Flashの65.3%を上回ります。発表記事だけで判断すると、他社比較は出ていないと思い込むか、全面的に最良だと受け取るか、どちらかに転びます。モデルカードの表まで開いて、項目ごとに見てください。
数字の意味も指標ごとに違います。FrontierCodeの43.6%は加重スコアで成功率ではありませんし、WebDev Arenaの1588はEloで、正答率とは単位そのものが違います。表に並ぶと同じ点数に見えますが、43.6%と30.4%と1588を同じものさしには乗せられません。伸び率の大きさも、元の水準と採点方法しだいです。
そして実行条件でも動きます。このモデルは思考量を3段階で調整できるので、ベンチマークをどの設定で走らせたかでスコアもコストも変わります。公表値と同じ体験を期待するなら、条件を揃えてください。
thinking_level という調整つまみ
3段階の使い分け
Gemini 3.7 Flashは、答える前にどれだけ考えるかを thinking_level というパラメータで指定できます。low、medium、high の3段階で、既定値は medium です。
公式ドキュメントの説明は次のとおりです。
lowは、応答までの時間を短くします。インシデント対応のパイプライン、リアルタイムの対話、文章の下書き、素早いデータ分析といった、待たせたくない用途向けです。mediumは既定値で、「ほとんどのタスクで最良の品質」とされています。複雑なコードやエージェント用途に推奨され、一発目の正答率が高くなります。highは、モデルが考えツールを使う能力を最大化します。難しい推論、難易度の高い数学、最も困難なコーディングやエージェント作業向けです。
なお、3.6 Flashにはこれより低い minimal がありましたが、Googleは3.7 Flashで落としました。指定するとエラーになります。Flash系列なのに、ほとんど考えずに即答するモードが無くなったわけです。前の世代からの後退はここだけです。
このつまみが効くのは、思考にもトークンを消費するからです。考えた分だけ出力トークンが増え、出力は入力の5倍の単価。high に上げれば賢くなりますが、そのぶん請求も伸びます。品質と速さと料金を同時に最良にはできません。用途ごとにどれを削るかは、自分で決めることになります。
エージェント用途で効いてくるところ
Googleが発表でくり返し押しているのがエージェント(agent)です。人間が一つひとつ指示を出さなくても、目標を受け取って自分で手順を分解し、ツールを呼びながら作業を進めるAIのことです。
たとえば「このリポジトリのテストが落ちているので直して」と頼まれたエージェントは、テストを実行し、該当コードを読み、原因を推測して直し、また実行して、まだ落ちていれば別の仮説を立てる、という往復を自分で回します。
この往復では、1回ごとの精度がそのまま全体の成否に効いてきます。10回のツール呼び出しをすべて成功させる必要があるとき、1回あたりの成功率が90%なら全体は約35%、95%なら約60%です。5ポイントの差が、最終的な成功率では25ポイントの差になります。
Googleが medium について一発目の正答率を持ち出しているのも、たぶんこの掛け算のことでしょう。やり直しが減れば、消費トークンも待ち時間も減ります。
「半額」の中身
導入価格と標準価格
価格は2段構えになっています。
| 期間 | 入力(100万トークン) | 出力(100万トークン) |
|---|---|---|
| 導入価格(2026年12月31日まで) | 0.75ドル | 3.75ドル |
| 標準価格(2027年1月1日から) | 1.50ドル | 7.50ドル |
「半額」という言い方の比較対象は、Gemini 3.6 Flashが発表されたときの価格です。3.6 Flashは2026年7月21日の発表時、入力1.50ドル・出力7.50ドルでした(Gemini 3.6 Flash の発表)。その半分が、今回の0.75ドル・3.75ドルにあたります。
ただし、ここに見落としやすい点があります。Googleは同じ導入価格を3.6 Flashにも適用しました。開発者向けドキュメントは「この新しい料金を3.6 Flashにも適用する」と明記しています(What’s new in Gemini 3.7 Flash)。
つまり2026年8月現在、3.6 Flashと3.7 Flashの単価は同じです。半分になったのはFlash系列の価格で、3.6 Flashを使い続ける人にも同じ値段が届いています。3.7 Flashへ乗り換えれば単価が半分になる、という話ではありません。
2027年1月1日には、入力1.50ドル・出力7.50ドルへ戻ります。年末までの4か月半のキャンペーンです。
とはいえ、同じ値段で性能が上がるなら、乗り換える理由としてはそれで足ります。今だけ半額なのと、同じ値段で性能が上がったのは、別の話として扱ってください。
実際にいくらかかるのか
具体的な数字にしてみます。仮に、1回のリクエストで入力2万トークン・出力4千トークンを使うワークロードを考えます。コードベースの一部を読ませて修正案を返させる、くらいの規模です。
| 項目 | 導入価格 | 標準価格 |
|---|---|---|
| 入力2万トークン | 0.015ドル | 0.030ドル |
| 出力4千トークン | 0.015ドル | 0.030ドル |
| 1リクエストあたり | 0.030ドル | 0.060ドル |
| 1日1万リクエスト | 300ドル | 600ドル |
| 30日換算 | 9,000ドル | 18,000ドル |
導入価格のあいだ月9,000ドルで回していた仕組みは、2027年1月から月18,000ドルになります。年内に規模を決めて、そのまま来年の予算を組むと、差額がまるごとのしかかります。
この表からはもうひとつ読めます。入力2万トークンに対して出力4千トークン、つまり入力のほうが5倍多い構成なのに、料金は入力と出力で同額です。出力の単価が入力の5倍だからです。思考レベルを上げて出力トークンが増えると、その分がそのまま請求に乗ります。high を既定にするのはやめておいたほうがいいです。
期間限定の狙い
3週間でモデルを出し、Flash系列の単価を年内だけ半分にする。性能競争というより、開発者を自分の環境へ引き込みにきた打ち方に見えます。新旧どちらを使っていても安くなるので、これが効くのは、そもそもGoogleを使うかどうかの判断のほうです。
エージェントを本格的に組み込むと、プロンプト、ツール定義、評価データセット、失敗時の再試行ロジックを、そのモデルに合わせて作り込むことになります。そこまで作り込んでから他社へ移ると、書き直しの手間が単価差を軽く超えます。安いうちに移ってもらい、手が抜けなくなったころに標準価格へ戻す。順序としてはそういうことでしょう。
導入価格で採算を組むと、2027年1月に困ります。標準価格で成立するかどうかで決めてください。
3.6 Flashからの移行で必要な変更
先に結論を書くと、3.6 Flashからの移行は、多くの場合ほぼモデルIDの差し替えだけで済みます。
ここは誤解しやすいところです。開発者向けドキュメントには、非推奨のサンプリング系パラメータ(temperature、top_p、top_k)を生成設定から取り除くこと、thinking_budget を thinking_level に置き換えることが、手順として並んでいます。ただしこれは、Gemini 3.5 Flash、Gemini 3 Flash (Preview)、Gemini 3.1 Pro からアップグレードする場合の話です。Google自身が同じページに「Gemini 3.6 Flashはすでにこれらのパラメータをサポートしていない」と書いています。3.6 Flashが正常に動いているコードなら、もう済んでいる作業です。
3.7 Flashで新しく効いてくる差分は、別のところにあります。
**thinking_level の minimal が使えなくなりました。**3.6 Flashは minimal を含む4段階を受け付けますが、3.7 Flashが受け付けるのは low / medium / high の3段階だけです。minimal を指定するとAPIがエラーを返します。
したがって、移行時に確認するのは1点だけです。**3.6 Flashで minimal を指定している箇所はないか。**あるなら low へ置き換えます。
minimal から low は思考量が増える方向なので、応答までの時間と出力トークン数が上がります。名前の付け替えでは済みません。待ち時間を切り詰めるために minimal を選んでいたなら、切り替えたあとに応答時間と料金を実測して、許容範囲に収まっているか確かめてください。
なお、組み込みツールについては「3.6 Flashと同じ一式」に対応するとされており、ツール周りの再実装は不要です。
安全性と公式が認めた限界
Googleは、CBRN(化学・生物・放射性物質・核)とサイバー攻撃の領域における悪用対策を更新したと述べています(Frontier Safety、バイオレジリエンスへの取り組み)。自動化された安全性評価では3.6 Flashと同等以上、人手によるレッドチーミング(攻撃者の視点で弱点を探す検証)でも深刻な懸念は検出されなかった、とモデルカードは報告しています。
一方で、モデルカードは既知の限界も明記しています。
- 幻覚(hallucination、事実でないことをもっともらしく答えてしまう現象)が起こりうる
- ジェイルブレイク(安全機構を回避させる働きかけ)への耐性は改善を継続中
- 動作が遅くなったりタイムアウトしたりすることがある
- 知識が一部の領域で限定的である
最後の項目は、さきほどの知識カットオフの但し書きと同じ話です。2026年3月までと一律に思い込まず、領域によっては1年以上古いものとして扱ってください。
コーディング向けを謳っていても、生成物をレビューなしで本番へ流せるようにはなっていません。ここは3.6 Flashのときと変わりません。
実務での選び方
まず試す。3.6 Flashで動いている処理なら、確認するのは minimal を指定していないかの1点だけで、あとはモデルIDの差し替えで動きます。単価も同じですから、切り替えのコストはほぼゼロです。そのうえで自前の評価データを流して、公表値と自分の用途がどれだけ噛み合うかを見ます。
思考レベルは用途ごとに振る。全部を high にすると出力トークンが膨らみます。対話や下書きは low、エージェントの主要な判断は medium、どうしても外せない難所だけ high。この振り分けが、そのまま請求額を決めます。
採算は標準価格で組む。導入価格は2026年12月31日まで。年内の実験は0.75ドルで構いませんが、本番の見積もりは入力1.50ドル・出力7.50ドルで成立するかどうかで判断します。
難所は上位モデルへ回す。DeepSWEのリーダーボードを見ると、最難関の領域ではまだフラッグシップとの差があります。難所だけ上位モデルへ渡して、量をこなす部分をFlashに任せるほうが、全体では安く早く済みます。
要点
- Gemini 3.7 Flashは2026年8月13日リリースの中位モデル。3.6 Flashから3週間で、中身は3.6 Flashの推論基盤にアルゴリズム改良を入れたものだとGoogleは説明している。
- ベンチマークはFrontierCode 1.1で43.6%、DeepSWE v1.1で65.3%と、いずれも3.6 Flashを大きく上回る。ただしFrontierCodeの43.6%は加重スコアで、成功率ではない。指標ごとに意味が違うので、同じものさしには乗せられない。
- モデルカードにはClaude Sonnet 5、GPT-5.6 Terra、Muse Spark 1.2との横並び比較も価格つきで載っている。DeepSWE v1.1ではGPT-5.6 Terraの69.6%が3.7 Flashを上回るなど、全面的に最良というわけではない。
- 100万トークンあたり入力0.75ドル・出力3.75ドルは2026年12月31日までの導入価格。同じ価格が3.6 Flashにも適用されているため現時点で両者の単価は同じで、2027年1月1日から入力1.50ドル・出力7.50ドルへ戻る。
thinking_levelをlow/medium/highで切り替えて、品質と速さと料金の釣り合いを用途ごとに決める。既定値はmedium。- 3.6 Flashからの移行はほぼモデルIDの差し替えで済む。サンプリング系パラメータの廃止は3.6の時点で済んでおり、3.7固有の差分は
minimalが使えなくなったこと。
参考資料
- Gemini 3.7 Flash: our most intelligent workhorse model:Google公式発表(2026年8月15日参照)
- Gemini 3.7 Flash(日本語版発表記事):Google公式発表の日本語版(2026年8月15日参照)
- Gemini 3.7 Flash モデルカード:仕様、ベンチマーク、安全性評価、既知の限界(リリース日2026年8月13日、2026年8月15日参照)
- What’s new in Gemini 3.7 Flash | Gemini API:開発者向けドキュメント。thinking_level と移行手順(2026年8月15日参照)
- Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber:前世代の発表と価格(2026年7月21日)
- FrontierCode:Cognitionによるコード品質ベンチマーク(v1.1、2026年7月7日)
- FrontierCodeの採点方法:pass rateとscoreの定義、ブロッカー基準の扱い(2026年8月15日参照)
- DeepSWE:長丁場のソフトウェア開発ベンチマークとリーダーボード(2026年8月15日参照)
- WebDev Arena:Webアプリ生成の人間評価リーダーボード(2026年8月15日参照)
- GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents:ルーブリックスコアと厳密な合格率の定義(arXiv:2607.11192、2026年7月)
- AutomationBench:最終状態のプログラム的検証とスコア定義(2026年8月15日参照)
- Google Antigravity:Googleのエージェント開発環境
- Frontier Safety:Google DeepMindの安全性フレームワーク
- Our approach to bioresilience:生物学領域の安全性への取り組み