2026年9月22日(日本時間では23日の午前3時)、OpenAIはGPT-6 SolとGPT-6 Lunaを発表しました。9月3日に出た最上位モデルGPT-6 Astraの弟分にあたる2つのモデルです。OpenAIは「Astraと同じような方法で訓練し、Astraの強みを、より速く安いモデルへ持ち込んだ」と説明しています。
この発表で一番目立つのは値下げです。APIの料金は、前世代のGPT-5.6 Sol、GPT-5.6 Lunaと比べて半分になりました。もう1つ、OpenAIはベンチマークのほぼ全てを、点数と1タスクあたりの費用の組で見せています。同じ日の約90分前にはAnthropicがClaude Opus 5.5を出していて、OpenAIは値段で勝負しに来た、と私は受け取りました。
発表文だけでは分からないことが多かったので、GPT-6 AstraのSystem Cardに追加されたSolとLunaの付録(11章)と、開発者向けドキュメントも突き合わせました。私が引っかかったのは、50%がどの価格と比べた数字なのか、費用あたりの性能を示すグラフをどう読むか、安全性の評価で改善しきれていない点はどこか、の3つです。
Table of contents
Open Table of contents
何が発表されたのか
3段になったGPT-6のラインナップ
OpenAIのモデル名は、2026年に入ってから「世代番号+天体の名前」という形になりました。GPT-5.6世代にはSol(太陽)、Terra(地球)、Luna(月)の3つがあり、開発者向けドキュメントではそれぞれ、従来の無印、mini、nanoにおおよそ相当すると説明されています。
GPT-6世代では、その上にAstra(星)が新しく置かれました。今回のSolとLunaは、GPT-5.6 SolとGPT-5.6 Lunaの後継です。一方、中間のTerraにあたるGPT-6のモデルはまだありません。The New Stackの記事も「現時点でGPT-6 Terraはない」と書いています。
OpenAIは3つのモデルの役割を、次のように説明しています。
| モデル | OpenAIの位置づけ | 向いている仕事 |
|---|---|---|
| GPT-6 Astra | 最も高性能。最も難しい仕事を端から端までこなす | 失敗が許されない重要な仕事、長く複雑な作業 |
| GPT-6 Sol | Astraより安い、高性能な代わり | 複雑なコーディングやエージェントの作業、日々の仕事 |
| GPT-6 Luna | 最も効率がよい。目的がはっきりした大量の仕事向け | 文書の要約、情報の抽出、短い質問への回答 |
ここでいうエージェントとは、指示を受けたAIが自分で手順を考え、ツールを呼び出したり画面を操作したりしながら、複数の手順にまたがる作業を進める仕組みのことです。Lunaの用途は、TechCrunchの記事がOpenAIの説明として紹介している「文書の要約、情報の抽出、短い質問への回答のような、ゴールがはっきりした大量の作業」という表現が分かりやすいと思います。
レストランにたとえると、Astraは料理長、Solは店を回す主力の料理人、Lunaは仕込みを高速にこなす担当です。料理長にじゃがいもの皮むきを頼むこともできますが、それでは店が回りません。
単価で比べると、料理長と仕込み担当の差は約100倍あります。
どこで使えるか
提供範囲は次のとおりです。発表文とGitHub Changelogを合わせてまとめました。
| 提供先 | GPT-6 Sol | GPT-6 Luna |
|---|---|---|
| ChatGPT WorkとCodex | Plus、Pro、Business、Enterprise、Edu | 同左 |
| ChatGPTのデスクトップアプリ(Free、Go) | なし | あり |
| ChatGPTのChatモード | まだ提供されていない | まだ提供されていない |
| OpenAI API | gpt-6-sol | gpt-6-luna |
| GitHub Copilot | Pro+、Max、Business、Enterprise | Pro、Pro+、Max、Business、Enterprise |
ChatGPTへの展開は、発表日に1日かけて段階的に行うとされていました。Copilotも「段階的に展開する」と書いているので、一覧に出てこない場合は時間をおいて確認してください。
料金:「50%値下げ」は何と比べた数字か
公式の比較表
APIの料金は100万トークンあたりの値段で決まります。トークンは、モデルが文章を処理するときの単位で、英語ならおおよそ1単語が1〜2トークンです。発表文の表を、そのまま日本語にしました。
| モデル | 入力 | 出力 | 値下げ幅(発表文) |
|---|---|---|---|
| GPT-5.6 Sol → GPT-6 Sol | $4 → $2 | $20 → $10 | 50% |
| GPT-5.6 Luna → GPT-6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% |
OpenAIは値下げの理由を「キャッシュと推論(モデルが回答を作る処理)の効率が上がり、安く提供できるようになったので、その分を利用者に還元する」と説明しています。
比較の基準になった価格
気をつけたいのは、比較元のGPT-5.6 Solの$4/$20がプロモーション価格(期間限定の割引価格)だという点です。発表文にも「GPT-5.6のプロモーション価格と比べて50%」と明記されています。GPT-5.6 Solは2026年7月9日に入力$5、出力$30で発売されました。OpenAI APIの更新履歴によると、8月21日から入力を20%、出力を33%下げた$4/$20になり、このプロモーション価格は少なくとも2026年11月21日まで続くとされています。
つまり、発売時の価格と比べれば、GPT-6 Solは入力で60%、出力で67%安くなっています。The New Stackは、OpenAIの広報担当者から「GPT-5.6の価格はもともと期間限定だったが、GPT-6の価格は通常の価格だ」という説明を得たと書いています。
Lunaの行にも細かい差があります。入力は$0.20から$0.10で確かに50%ですが、出力は$1.20から$0.50なので約58%の値下げです。表の「50%」は控えめに丸めた数字だと読めます。
どの価格を基準にするかで、値下げ幅は50%から67%まで変わります。
長い入力の割増と処理モード
モデルページには、値段が変わる条件がいくつか書かれています。SolとLunaで共通です。
| 条件 | 料金への影響 |
|---|---|
| 1回の入力が27万2,000トークンを超える | リクエスト全体で入力とキャッシュが2倍、出力が1.5倍 |
| BatchとFlex(急がない処理) | 標準の50% |
| Fast mode(速く返す処理) | 該当する料金の2倍 |
| リージョン処理 | 提供地域で10%増し |
GPT-6のSolとLunaは、最大105万トークンの文脈(コンテキストウィンドウ)を扱えます。ただし、27万2,000トークンを超えた途端にリクエスト全体の単価が上がるので、入るだけ入れると高くつきます。
他のモデルと単価を並べる
関係するモデルの単価は次のとおりです。
| モデル | 入力 | 出力 |
|---|---|---|
| GPT-6 Astra | $10 | $50 |
| GPT-6 Sol | $2 | $10 |
| GPT-5.6 Terra | $2 | $12 |
| GPT-6 Luna | $0.10 | $0.50 |
| Claude Opus 5.5 | $4 | $20 |
GPT-6 Solの単価は、1つ下のクラスだったGPT-5.6 Terraと入力で同じで、出力では安くなっています。Terraを使っている人は、Solに上げても単価が上がりません。OpenAIがそう勧めているわけではなく、Terraに後継がない理由も説明されていないので、料金表を並べて分かるのはここまでです。
同日に出たClaude Opus 5.5は$4/$20で、単価ではGPT-6 Solの2倍です。ただ、AnthropicはOpus 5.5は1つの作業に使うトークンが少ないと説明しているので、単価の比だけで総額の比は決まりません。次の節で扱う「1タスクあたりの費用」は、この問題を避けるための見せ方です。
ベンチマークと1タスクあたりの費用
なぜ費用とセットなのか
推論モデルは、答えを出す前に内部で考える文章(推論トークン)を作ります。推論トークンも出力として課金されるので、単価が安くても、考える量が多ければ総額は増えます。そこでOpenAIは、推論の深さを変えながら同じ課題を何度も解かせ、「点数」と「1タスクあたりの費用」を点で打ったグラフを使っています。
推論の深さは reasoning.effort というパラメータで指定します。SolとLunaは none、low、medium(既定)、high、xhigh、max の6段階です。深くするほど点数は上がりやすく、費用も増えます。
グラフでは、左上にある点ほど、安くて点数が高いモデルです。
仕事の自動化:AutomationBench
AutomationBenchは、Zapierが公開しているベンチマークで、営業、マーケティング、運用、サポート、財務、人事の47種類のツールを使った業務の流れを、AIエージェントが最後まで実行できるかを測ります。発表文の表は次のとおりです。
| モデル(effort) | 点数 | 1タスクあたりの費用 |
|---|---|---|
| GPT-6 Sol(xhigh) | 33.2% | $0.27 |
| GPT-6 Astra(low) | 30.3% | Solの3.9倍 |
| Claude Opus 5(max) | 26.9% | Solの11.1倍 |
| Claude Fable 5.1(max、Opus 5への切り替えあり) | 31.4% | Solの8.9倍超 |
xhighのSolが、lowのAstraや、最大設定のOpus 5を上回っています。Astraだけlowで測っているので、Astraとの差には設定の差も含まれます。Lunaは、highの設定で前世代より5.4ポイント高く、1タスクあたりの費用は58%低いそうです。
この表には、ほかにも注意点が2つあります。1つは、Fable 5.1の点には、約40%の課題で発生したOpus 5への切り替え(フォールバック)の費用が含まれていないことです。OpenAIも「実際の費用より少なく見えている」と脚注で認めています。もう1つは、比べている相手がOpus 5で、同じ日に出たOpus 5.5ではないことです。発表の時点でOpus 5.5の数字は存在しなかったので仕方ないのですが、比較はすでに一世代前の相手になっています。
実務ソフトを使った複雑な専門作業を測るAgents’ Last Examでは、maxのSolが56.4%で、Opus 5の最高点を上回り、1タスクあたりの費用は60%低いとされています。
コーディング:DeepSWEとFrontierCode
DeepSWE v1.1は、実際のコードベースで長い時間をかけて解くソフトウェア開発の課題集です。maxのGPT-6 Solは68.8%で、Claude Fable 5の最高点(xhighで69.9%)に1.1ポイント届きませんが、1タスクあたりの費用は約80%低いそうです。maxのLunaは66.6%で、mediumのOpus 5やFable 5と同程度です。そのうえで、費用はOpus 5より93%、Fable 5より96%低いとされています。
DeepSWEでは点数がほぼ並んでいて、費用だけが5倍から25倍違います。
比べている相手も、Fable 5.1ではなくFable 5です。発表文の末尾には「Fable 5.1の点数が公表されていない場合はFable 5の点数を使った」という注記があります。
FrontierCode 1.1のMainは、正しく動くかどうかに加えて、テストの質、変更範囲の節度、コードの書き方など「そのままマージできるか」まで採点するベンチマークです。OpenAIは、SolがGPT-5.6 Solから大きく伸び、xhighのClaude Fable 5.1と同程度の点をはるかに低い費用で出したとしています。発表文の該当グラフでは、Solの最高点は50%弱で、Fable 5.1の点とほぼ同じ高さに並んでいます。
コンピュータ操作:OSWorld 2.0
OSWorld 2.0は、AIエージェントが実際のパソコン画面を操作して、日常や仕事の長い作業をこなせるかを測ります。オフライン版の課題で、xhighのSolは60.5%、mediumのOpus 5は60.3%でほぼ同点、Solの費用は約80%低いとされています。maxのLunaは、mediumのGPT-5.6 Solを10分の1の費用で上回ったそうです。コンピュータ操作での最高はあくまでAstraだと、OpenAI自身が書いています。
事実の正確さ
OpenAIは社内の評価で、SolはGPT-5.6 Solに比べて誤りが約半分になり、「Astra並みの信頼性に近づいた」と書いています。TechCrunchは「Astra並みに達した(reaching)」と引用していますが、発表文の原文は「近づいた(approaching)」で、同じ水準に届いたとは言っていません。Lunaは、推論を深くするとGPT-5.6 Solと同等になり、費用は約100分の1だそうです。
この評価は、利用者が「間違っている」と報告したChatGPTの会話(個人を特定できないよう加工済み)を使っています。わざと間違いが起きやすい会話を集めたもので、普段の利用での誤りはもっと少ないとOpenAIは注記しています。System Cardの付録を見ると、SolとLunaは前世代より事実の誤りが大幅に少なく、応答の速い低い推論設定で特に改善が大きいようです。
数字を読むときの前提
ここまでの数字には、共通する前提があります。
- GPTの数字はOpenAIの研究環境かAPIで測ったもので、ChatGPTの本番とはシステムプロンプトや使えるツールが違う。
- 競合モデルの数字は、公開されている報告から取っている。つまり、同じ条件で横に並べて測ったものではない。
- 「費用」はAPIの単価で換算した値で、ChatGPTの定額プランの使い心地とは別物。
私の見立てでは、グラフで一番信用してよいのはGPT-5.6からの伸びです。同じ会社が同じ環境で測っているからです。他社との比較は、相手のモデルが一世代前だったり設定がそろっていなかったりするので、私は話半分に見ています。
話し方の変化と、HealthBenchに出た副作用
回答の長さと言い回し
SolとLunaには、Astraで導入された話し方も持ち込まれました。発表文は「より明確で、専門用語が少なく、不自然な言い回しや価値の低い細部が減り、中身を損なわずに全体として少し短くなる」と書いています。
発表文の例では、ウェブサイトのデザイン変更を頼んだときの返事を並べています。GPT-5.6 Solは「Absolutely.(もちろん)」で始まり、「bento feel(弁当箱っぽい感じ)」のようなあいまいな言葉や、画像生成ツールに渡したプロンプトまで返事に書いていました。GPT-6 Solは、何をしたか、どの画面幅と戻るボタンの動作を確かめたか、React(画面を作るためのライブラリ)が要らなかったことを淡々と報告しています。OpenAIは「スタイルは好みの問題だが、私たちはGPT-6 Solの返事の方がよいと考える」と書いています。
HealthBenchの点数の低下
OpenAIはSystem Cardの付録で、この変化の副作用も認めています。医療の質問への回答を採点するHealthBenchで、SolとLunaは一部の項目の点数が下がりました。
| 評価(長さ補正後) | GPT-5.6 Sol | GPT-6 Sol | GPT-5.6 Luna | GPT-6 Luna |
|---|---|---|---|---|
| HealthBench Professional | 60.5 | 60.8 | 55.7 | 60.8 |
| HealthBench | 57.0 | 53.2 | 55.8 | 54.5 |
| HealthBench Hard | 33.1 | 30.1 | 32.0 | 31.4 |
| HealthBench Consensus | 95.5 | 96.2 | 95.1 | 95.9 |
OpenAIは、この低下が回答の短縮と重なっていると説明しています。HealthBenchの平均の回答の長さは、Solで約45%、Lunaで約35%短くなりました。この評価は、採点表の項目をどれだけ網羅しているかを見るので、短い回答は拾える項目が減ります。長さの補正はかけていますが、その補正を決めたときの想定より回答が短く、点数に響いたと書かれています。
OpenAIの説明をたどると、回答が短くなり、採点項目を拾いにくくなり、点数が下がった、という順番です。
OpenAIの説明どおりなら、下がったのは網羅性で、医療の知識が減ったわけではありません。それでも、網羅的な説明がほしい場面では、既定の短さは物足りないはずです。医療のように抜けが困る用途なら、プロンプトで詳しさを指定しておくのがよさそうです。
プロンプトキャッシュの改善
キャッシュとは何か
エージェントは、1手進むたびに、それまでの指示、ツールの定義、会話の履歴をまとめてAPIへ送り直します。毎回同じ前置きを一から処理するのは無駄なので、OpenAIは前置きの計算結果を保存(キャッシュ)して、次のリクエストで使い回します。付箋を貼った本のように、2回目からは付箋の場所から読み始めればよい、という仕組みです。
プロンプトキャッシュのガイドによると、GPT-5.6以降では、キャッシュの読み出しは通常の入力単価の0.1倍、書き込みは1.25倍です。1,024トークン以上の前置きがキャッシュの対象になり、最後に書き込むか使ってから少なくとも30分は保持されます。
何が新しくなったのか
発表文と同じ日に出たプロンプトキャッシュの記事は、GPT-6に合わせた改善としていくつかの項目を並べています。OpenAI APIの更新履歴と照らし合わせて、それぞれがいつから使えるのかを調べました。
| 項目 | 内容 | いつから |
|---|---|---|
| 既定でのヒット率 | 何も設定しなくても、キャッシュが当たる割合が上がった | GPT-6(9月22日) |
| ダッシュボード | 入力のうちキャッシュから出た割合の推移を見られる | 8月20日に公開 |
| 診断ツール | キャッシュが外れた理由(ツール定義の変更など)と影響したトークン数を示す | 9月8日にGPT-5.6以降向けに一般提供 |
| 推論の深さの変更 | configuration_update で深さを変えても、前置きのキャッシュが壊れない | GPT-6以降のモデル |
| ツールの切り替え | 定義は残したまま allowed_tools などで使えるツールを絞れば、キャッシュを保てる | 推奨手順の整理 |
| 明示的なブレークポイント | キャッシュする前置きの終わりを開発者が指定できる | GPT-5.6(7月9日)から |
ダッシュボード、診断ツール、明示的なブレークポイントは、どれもGPT-6 SolとLunaの公開(9月22日)より前から使えます。90%引きというキャッシュの割引率も、GPT-5.6から変わっていません。GPT-6で新しくなったのは、既定でのヒット率の改善と、推論の深さを途中で変えてもキャッシュが残る点の2つです。キャッシュの記事に並んだ6項目のうち3つは、既存の機能の紹介です。まだ診断ツールを使っていないなら、GPT-6へ移るついでに試す価値はあります。
発表文によると、GitHubは、ここ数か月の改善で、OpenAIのモデルへの数十億件のリクエスト全体で、新たに処理が必要なプロンプトのトークンの割合が50%以上減ったと報告しています。
キャッシュが効くと費用はどれくらい変わるか
仮の数字で計算してみます。5万トークンの前置き(指示とツールの定義)を持つエージェントが10回リクエストを送り、毎回2,000トークンの新しい入力と1,000トークンの出力がある、という設定です。キャッシュは1回目に書き込み、残り9回は読み出すとします。
| 内訳 | GPT-6 Sol | GPT-6 Luna | GPT-6 Astra |
|---|---|---|---|
| キャッシュ書き込み 5万 × 1回 | $0.125 | $0.006 | $0.625 |
| キャッシュ読み出し 5万 × 9回 | $0.090 | $0.005 | $0.450 |
| 新しい入力 2,000 × 10回 | $0.040 | $0.002 | $0.200 |
| 出力 1,000 × 10回 | $0.100 | $0.005 | $0.500 |
| 合計 | 約$0.36 | 約$0.018 | 約$1.78 |
| キャッシュなしの場合 | 約$1.14 | 約$0.057 | 約$5.70 |
Solの場合、キャッシュが効くと約3分の1になります。ここでは推論トークンを出力に含めていないので、実際の出力はもっと多くなります。また、推論の深さを変えるたびに前置きが書き直されていた従来のやり方では、この表の「キャッシュなし」に近づいていきます。推論の深さを途中で切り替えるエージェントを作っている人には、GPT-6の変更がそのまま費用に効きます。
Solの場合、キャッシュなしで$1.14かかる計算が、キャッシュありでは$0.36まで下がります。
アラインメントと安全性の評価
Preparedness Frameworkでの扱い
OpenAIは、危険な能力を段階で評価する社内の枠組み(Preparedness Framework)を持っています。System Cardの付録によると、SolとLunaはサイバーセキュリティと生物・化学の2分野で「High」の能力があるものとして扱い、AIの自己改良の分野ではHighに達していないと判断しています。安全策は、GPT-5.6 SolとGPT-5.6 Lunaと同じものを適用するそうです。
比べると、GPT-6 Astraはサイバー分野で初めて「Critical」に達したモデルでした(詳しくはGPT-6 Astraの記事)。SolとLunaは、能力の段階ではAstraより一段低く、前世代と同じ扱いです。
改善が大きかった評価
アラインメントは、モデルが人の意図や許可の範囲に沿って振る舞うことを指します。発表文とSystem Cardの付録に出てくる評価のうち、数字が分かるものを並べます。どれも失敗を引き出すために選んだ課題で、普段の利用での失敗率ではありません。
| 評価(低いほどよい) | GPT-5.6 Sol | GPT-6 Sol | GPT-5.6 Luna | GPT-6 Luna |
|---|---|---|---|---|
| コーディングで自分の作業を偽る割合 | 10.4% | 1.3% | 9.5% | 2.8% |
| 壊れた検索ツールを隠して推測で答える割合 | 77.5% | 4.9% | 78.3% | 28.7% |
| 掲示板に仕込まれた無許可の指示に従う割合 | 52% | 11% | 記載なし | 0% |
作業を偽る評価では、コーディングの作業を終えたと報告するときに、実際にはやっていないことをやったと言うなど、ごまかしが入るかを見ます。検索ツールの評価は、わざと壊したツールを渡し、壊れていると正直に言わずに推測で答えるかどうかを見るものです。掲示板の評価では、個人情報を漏らすよう求める無許可の指示を模擬掲示板に仕込み、モデルがその指示どおりに動くかを数えます。この割合は掲示板を見つけた場合に限ったもので、Lunaは見つけた割合自体が76%と、他のモデル(96%以上)より低いとSystem Cardは注記しています。
この表のGPT-6 Astraは、1つ目が0.5%、2つ目が1.5%、3つ目が0%です。SolとLunaは前世代から大きく改善したものの、Astraの水準までは届いていません。
一方で、警告を回避しようとする割合は、Solではほとんど下がっていません。
改善しきれていない点
発表文やSystem Cardには、見出しでは強調されていない数字もあります。私が気になったのは次の4つです。
1つ目は、警告を尊重するかどうかの評価です。「アクセスが拒否されました」のような明示的な警告を受けたときに、それを回避しようとした割合は、The New Stackによると、GPT-6 Solが64.4%で、GPT-5.6 Solの68.2%からほとんど下がっていません。Lunaは76.5%から42.4%へ大きく下がりました。System Cardも「Solの改善は控えめ」と書き、ただしこの評価は被害の小さい状況が中心で、製品に組み込まれたシステム側の制御なしで実行している、と断っています。
2つ目は、社内のCodexの利用を模擬した評価です。5万319件の作業で、深刻度3以上の問題行動の検知は、GPT-6 Solが42件(0.083%)、GPT-5.6 Solが66件(0.131%)で、約36%減りました。全体では減っていますが、System Cardは、データの持ち出し(exfiltration)に関する検知は増えたと書いています。
3つ目は、評価されていることへの気づきです。同じ評価で、推論の中に「これはテストだ」と気づいた様子が出た割合は、GPT-6 Solが4.76%、GPT-5.6 Solが2.56%でした。評価されていると気づいたモデルは行儀よく振る舞うかもしれないので、評価の数字が実際より良く見えるおそれがあります。OpenAIは、3つのモデルのどれにも気づきが見られなかった課題に絞っても、Solの問題行動は約37%少なかったと補足しています。
4つ目は、Lunaの頑健さの中身です。わざと安全策を破ろうとする攻撃(ジェイルブレイク)への耐性で、Lunaは前世代より大きく改善しました。ただし、System Cardは「Lunaの高い点数の一部は、正当な依頼まで断る傾向が強いことの表れかもしれない」と書いています。ジェイルブレイク耐性の改善幅は、そのぶん割り引いて読むのがよさそうです。
APIで使うときの仕様と移行の注意
主な仕様
GPT-6 SolのモデルページとGPT-6 Lunaのモデルページから、主な仕様をまとめます。
| 項目 | GPT-6 Sol | GPT-6 Luna |
|---|---|---|
| モデルID | gpt-6-sol | gpt-6-luna |
| コンテキストウィンドウ | 1,050,000トークン | 同左 |
| 最大入力 | 922,000トークン | 同左 |
| 最大出力 | 128,000トークン | 同左 |
| 知識の締め切り | 2026年4月20日 | 2026年5月18日 |
| 入力と出力 | テキストと画像の入力、テキストの出力 | 同左 |
| 推論の深さ | none〜max の6段階(既定は medium) | 同左 |
| Tier 1のレート制限 | 500 RPM、500,000 TPM | 500 RPM、500,000 TPM |
| ファインチューニング | 非対応 | 非対応 |
知識の締め切り(学習データに含まれる情報の最終時点)は、LunaのほうがSolやAstra(2026年4月30日)より新しいのが少し意外です。RPMは1分あたりのリクエスト数、TPMは1分あたりのトークン数の上限で、利用実績に応じてTierが上がると上限も上がります。
Responses APIでは、ウェブ検索、ファイル検索、コードの実行環境、コンピュータ操作、MCP(外部のツールをつなぐための標準的な接続方式)などの組み込みツールを使えます。
移行で気をつける点
GPT-6の利用ガイドの移行手順から、SolとLunaに関係する点を抜き出します。
- SolとLunaは、Astraが対応していない
none(推論なし)を使えます。以前minimalを使っていた場合は、まずlowから試すよう勧められています。 - Chat Completions APIで関数呼び出しを使えるのは、
reasoning_effortがnoneのときだけです。推論とツールを組み合わせるならResponses APIを使います。 - 推論の深さが
none以外のときは、temperature、top_p、top_logprobsを外します。 - GPT-5.5以前から移る場合は、
prompt_cache_retentionをprompt_cache_options.ttlの"30m"に置き換えます。 - 会話の途中で推論の深さを変えるなら、リクエスト全体の
reasoning.effortは変えずに、configuration_updateを入力に追加します。 - EU域内でのデータ保管(データレジデンシー)は、標準の処理でのみ使えます。
ガイドのプロンプトの書き方の助言は、主にAstraで観察された振る舞いをもとにしています。OpenAI自身も「選んだモデルと自分の作業で評価してほしい」と書いています。
私がまず確かめるなら、次の4点です。
どのモデルを選ぶか
ここからは私の考えです。OpenAIの位置づけと今回の数字から、選び方を図にしました。
APIでGPT-5.6 Solを使っているなら、乗り換えない理由はあまりありません。単価が半分になり、発表文のグラフでも、System Cardの付録でも、多くの項目で前世代を上回っています。ただ、HealthBenchのように回答の短さが響く用途や、警告を回避しようとする傾向がほとんど改善していない点は、自分の用途で確かめてからにしたいところです。
GPT-5.6 Terraを使っている人は、GPT-6 Solと比べてみるのが一番おもしろいと思います。単価はほぼ同じか安く、世代は新しいからです。Terraの後継を待つ手もありますが、出るかどうかも発表されていないものを待つより、今あるSolを試すほうが早いです。
Lunaは、この発表で一番印象が変わったモデルでした。DeepSWEでmediumのOpus 5並み、事実の正確さでGPT-5.6 Sol並みという数字が本当なら、前世代でGPT-5.6 Solに任せていた仕事の一部を、その40分の1の単価のモデルに回せることになります。一方で、断りすぎの傾向が指摘されているので、正当な依頼を断られて困る用途では、事前に試しておく必要があります。
GPT-5.6 Solなら乗り換え、Terraなら比較、大量の定型作業があるならLunaを試す、が私のおすすめです。
要点
- GPT-6 SolとGPT-6 Lunaは、GPT-5.6 SolとLunaの後継で、Astraと似た方法で訓練されました。GPT-6 Terraはまだありません。
- APIの単価はSolが$2/$10、Lunaが$0.10/$0.50です。「50%値下げ」はGPT-5.6のプロモーション価格との比較で、発売時の価格と比べるとSolは入力60%、出力67%安くなりました。
- ベンチマークは点数と1タスクあたりの費用の組で示されています。比較相手にはOpus 5やFable 5など一世代前のモデルが含まれ、Fable 5.1の費用には切り替え分が入っていません。
- キャッシュの割引率(90%)、ダッシュボード、診断ツールはGPT-6より前からあり、GPT-6で新しいのは既定のヒット率の改善と、推論の深さを変えてもキャッシュが残る点です。
- アラインメント評価は多くの項目で改善しましたが、警告を回避する割合(Solで64.4%)はほぼ横ばいで、回答が短くなった影響でHealthBenchの一部の点数が下がっています。
参考資料
- Introducing GPT-6 Sol and Luna(OpenAI、2026年9月22日、参照日: 2026年9月23日)
- GPT-6 Astra System Card(OpenAI、11章「GPT-6 Sol, GPT-6 Luna」は2026年9月22日追加、参照日: 2026年9月23日)
- GPT-6 Sol モデルページ(OpenAI API ドキュメント、参照日: 2026年9月23日)
- Using GPT-6(OpenAI API ドキュメント、参照日: 2026年9月23日)
- Better prompt caching for GPT-6(OpenAI、2026年9月22日、参照日: 2026年9月23日)