Skip to content
Cloud AI エンジニア入門ガイド
Go back

GPT-6 SolとLuna:Astraの改良を半値で。1タスクあたりの費用で読む発表の中身

2026年9月22日(日本時間では23日の午前3時)、OpenAIはGPT-6 SolとGPT-6 Lunaを発表しました。9月3日に出た最上位モデルGPT-6 Astraの弟分にあたる2つのモデルです。OpenAIは「Astraと同じような方法で訓練し、Astraの強みを、より速く安いモデルへ持ち込んだ」と説明しています。

この発表で一番目立つのは値下げです。APIの料金は、前世代のGPT-5.6 Sol、GPT-5.6 Lunaと比べて半分になりました。もう1つ、OpenAIはベンチマークのほぼ全てを、点数と1タスクあたりの費用の組で見せています。同じ日の約90分前にはAnthropicがClaude Opus 5.5を出していて、OpenAIは値段で勝負しに来た、と私は受け取りました。

発表文だけでは分からないことが多かったので、GPT-6 AstraのSystem Cardに追加されたSolとLunaの付録(11章)と、開発者向けドキュメントも突き合わせました。私が引っかかったのは、50%がどの価格と比べた数字なのか、費用あたりの性能を示すグラフをどう読むか、安全性の評価で改善しきれていない点はどこか、の3つです。

GPT-6 SolとLunaの発表を、ラインナップ、半額の料金、1タスクあたりの費用で比べたベンチマーク、プロンプトキャッシュの改善、アラインメント評価、APIの仕様の6枚のカードで俯瞰した図

Table of contents

Open Table of contents

何が発表されたのか

3段になったGPT-6のラインナップ

OpenAIのモデル名は、2026年に入ってから「世代番号+天体の名前」という形になりました。GPT-5.6世代にはSol(太陽)、Terra(地球)、Luna(月)の3つがあり、開発者向けドキュメントではそれぞれ、従来の無印、mini、nanoにおおよそ相当すると説明されています。

GPT-6世代では、その上にAstra(星)が新しく置かれました。今回のSolとLunaは、GPT-5.6 SolとGPT-5.6 Lunaの後継です。一方、中間のTerraにあたるGPT-6のモデルはまだありません。The New Stackの記事も「現時点でGPT-6 Terraはない」と書いています。

GPT-5.6世代のSol、Terra、LunaとGPT-6世代のAstra、Sol、Lunaの対応関係。SolとLunaには後継があり、Terraには後継がなく、Astraが上位として新設された

OpenAIは3つのモデルの役割を、次のように説明しています。

モデルOpenAIの位置づけ向いている仕事
GPT-6 Astra最も高性能。最も難しい仕事を端から端までこなす失敗が許されない重要な仕事、長く複雑な作業
GPT-6 SolAstraより安い、高性能な代わり複雑なコーディングやエージェントの作業、日々の仕事
GPT-6 Luna最も効率がよい。目的がはっきりした大量の仕事向け文書の要約、情報の抽出、短い質問への回答

ここでいうエージェントとは、指示を受けたAIが自分で手順を考え、ツールを呼び出したり画面を操作したりしながら、複数の手順にまたがる作業を進める仕組みのことです。Lunaの用途は、TechCrunchの記事がOpenAIの説明として紹介している「文書の要約、情報の抽出、短い質問への回答のような、ゴールがはっきりした大量の作業」という表現が分かりやすいと思います。

レストランにたとえると、Astraは料理長、Solは店を回す主力の料理人、Lunaは仕込みを高速にこなす担当です。料理長にじゃがいもの皮むきを頼むこともできますが、それでは店が回りません。

単価で比べると、料理長と仕込み担当の差は約100倍あります。

GPT-6 Astraを料理長、GPT-6 Solを主力の料理人、GPT-6 Lunaを仕込み担当にたとえ、それぞれの100万トークンあたりの入出力単価と向いている仕事を3列で並べ、単価は約100倍違うとまとめた図

どこで使えるか

提供範囲は次のとおりです。発表文とGitHub Changelogを合わせてまとめました。

提供先GPT-6 SolGPT-6 Luna
ChatGPT WorkとCodexPlus、Pro、Business、Enterprise、Edu同左
ChatGPTのデスクトップアプリ(Free、Go)なしあり
ChatGPTのChatモードまだ提供されていないまだ提供されていない
OpenAI APIgpt-6-solgpt-6-luna
GitHub CopilotPro+、Max、Business、EnterprisePro、Pro+、Max、Business、Enterprise

ChatGPTへの展開は、発表日に1日かけて段階的に行うとされていました。Copilotも「段階的に展開する」と書いているので、一覧に出てこない場合は時間をおいて確認してください。

料金:「50%値下げ」は何と比べた数字か

公式の比較表

APIの料金は100万トークンあたりの値段で決まります。トークンは、モデルが文章を処理するときの単位で、英語ならおおよそ1単語が1〜2トークンです。発表文の表を、そのまま日本語にしました。

モデル入力出力値下げ幅(発表文)
GPT-5.6 Sol → GPT-6 Sol$4 → $2$20 → $1050%
GPT-5.6 Luna → GPT-6 Luna$0.20 → $0.10$1.20 → $0.5050%

OpenAIは値下げの理由を「キャッシュと推論(モデルが回答を作る処理)の効率が上がり、安く提供できるようになったので、その分を利用者に還元する」と説明しています。

比較の基準になった価格

気をつけたいのは、比較元のGPT-5.6 Solの$4/$20がプロモーション価格(期間限定の割引価格)だという点です。発表文にも「GPT-5.6のプロモーション価格と比べて50%」と明記されています。GPT-5.6 Solは2026年7月9日に入力$5、出力$30で発売されました。OpenAI APIの更新履歴によると、8月21日から入力を20%、出力を33%下げた$4/$20になり、このプロモーション価格は少なくとも2026年11月21日まで続くとされています。

つまり、発売時の価格と比べれば、GPT-6 Solは入力で60%、出力で67%安くなっています。The New Stackは、OpenAIの広報担当者から「GPT-5.6の価格はもともと期間限定だったが、GPT-6の価格は通常の価格だ」という説明を得たと書いています。

Lunaの行にも細かい差があります。入力は$0.20から$0.10で確かに50%ですが、出力は$1.20から$0.50なので約58%の値下げです。表の「50%」は控えめに丸めた数字だと読めます。

どの価格を基準にするかで、値下げ幅は50%から67%まで変わります。

GPT-5.6 Solの発売時の価格5ドルと30ドル、8月21日からのプロモーション価格4ドルと20ドル、GPT-6 Solの2ドルと10ドルを左から並べ、発表文の50%引きはプロモーション価格との比較で、発売時の価格と比べると入力60%、出力67%引きになることを示した図。下段にLunaの出力は約58%引きと添えている

長い入力の割増と処理モード

モデルページには、値段が変わる条件がいくつか書かれています。SolとLunaで共通です。

条件料金への影響
1回の入力が27万2,000トークンを超えるリクエスト全体で入力とキャッシュが2倍、出力が1.5倍
BatchとFlex(急がない処理)標準の50%
Fast mode(速く返す処理)該当する料金の2倍
リージョン処理提供地域で10%増し

GPT-6のSolとLunaは、最大105万トークンの文脈(コンテキストウィンドウ)を扱えます。ただし、27万2,000トークンを超えた途端にリクエスト全体の単価が上がるので、入るだけ入れると高くつきます。

他のモデルと単価を並べる

関係するモデルの単価は次のとおりです。

モデル入力出力
GPT-6 Astra$10$50
GPT-6 Sol$2$10
GPT-5.6 Terra$2$12
GPT-6 Luna$0.10$0.50
Claude Opus 5.5$4$20

GPT-6 Solの単価は、1つ下のクラスだったGPT-5.6 Terraと入力で同じで、出力では安くなっています。Terraを使っている人は、Solに上げても単価が上がりません。OpenAIがそう勧めているわけではなく、Terraに後継がない理由も説明されていないので、料金表を並べて分かるのはここまでです。

同日に出たClaude Opus 5.5は$4/$20で、単価ではGPT-6 Solの2倍です。ただ、AnthropicはOpus 5.5は1つの作業に使うトークンが少ないと説明しているので、単価の比だけで総額の比は決まりません。次の節で扱う「1タスクあたりの費用」は、この問題を避けるための見せ方です。

ベンチマークと1タスクあたりの費用

なぜ費用とセットなのか

推論モデルは、答えを出す前に内部で考える文章(推論トークン)を作ります。推論トークンも出力として課金されるので、単価が安くても、考える量が多ければ総額は増えます。そこでOpenAIは、推論の深さを変えながら同じ課題を何度も解かせ、「点数」と「1タスクあたりの費用」を点で打ったグラフを使っています。

推論の深さは reasoning.effort というパラメータで指定します。SolとLunaは none、low、medium(既定)、high、xhigh、max の6段階です。深くするほど点数は上がりやすく、費用も増えます。

グラフでは、左上にある点ほど、安くて点数が高いモデルです。

仕事の自動化:AutomationBench

AutomationBenchは、Zapierが公開しているベンチマークで、営業、マーケティング、運用、サポート、財務、人事の47種類のツールを使った業務の流れを、AIエージェントが最後まで実行できるかを測ります。発表文の表は次のとおりです。

モデル(effort)点数1タスクあたりの費用
GPT-6 Sol(xhigh)33.2%$0.27
GPT-6 Astra(low)30.3%Solの3.9倍
Claude Opus 5(max)26.9%Solの11.1倍
Claude Fable 5.1(max、Opus 5への切り替えあり)31.4%Solの8.9倍超

xhighのSolが、lowのAstraや、最大設定のOpus 5を上回っています。Astraだけlowで測っているので、Astraとの差には設定の差も含まれます。Lunaは、highの設定で前世代より5.4ポイント高く、1タスクあたりの費用は58%低いそうです。

この表には、ほかにも注意点が2つあります。1つは、Fable 5.1の点には、約40%の課題で発生したOpus 5への切り替え(フォールバック)の費用が含まれていないことです。OpenAIも「実際の費用より少なく見えている」と脚注で認めています。もう1つは、比べている相手がOpus 5で、同じ日に出たOpus 5.5ではないことです。発表の時点でOpus 5.5の数字は存在しなかったので仕方ないのですが、比較はすでに一世代前の相手になっています。

実務ソフトを使った複雑な専門作業を測るAgents’ Last Examでは、maxのSolが56.4%で、Opus 5の最高点を上回り、1タスクあたりの費用は60%低いとされています。

コーディング:DeepSWEとFrontierCode

DeepSWE v1.1は、実際のコードベースで長い時間をかけて解くソフトウェア開発の課題集です。maxのGPT-6 Solは68.8%で、Claude Fable 5の最高点(xhighで69.9%)に1.1ポイント届きませんが、1タスクあたりの費用は約80%低いそうです。maxのLunaは66.6%で、mediumのOpus 5やFable 5と同程度です。そのうえで、費用はOpus 5より93%、Fable 5より96%低いとされています。

DeepSWEでは点数がほぼ並んでいて、費用だけが5倍から25倍違います。

DeepSWEでは、GPT-6 Solが68.8%でClaude Fable 5の69.9%に1.1ポイント差まで迫り、費用は約80%低い。GPT-6 Lunaは66.6%でOpus 5やFable 5のmedium並みで、費用は93〜96%低いことを、点数の棒と費用の比で示した図

比べている相手も、Fable 5.1ではなくFable 5です。発表文の末尾には「Fable 5.1の点数が公表されていない場合はFable 5の点数を使った」という注記があります。

FrontierCode 1.1のMainは、正しく動くかどうかに加えて、テストの質、変更範囲の節度、コードの書き方など「そのままマージできるか」まで採点するベンチマークです。OpenAIは、SolがGPT-5.6 Solから大きく伸び、xhighのClaude Fable 5.1と同程度の点をはるかに低い費用で出したとしています。発表文の該当グラフでは、Solの最高点は50%弱で、Fable 5.1の点とほぼ同じ高さに並んでいます。

コンピュータ操作:OSWorld 2.0

OSWorld 2.0は、AIエージェントが実際のパソコン画面を操作して、日常や仕事の長い作業をこなせるかを測ります。オフライン版の課題で、xhighのSolは60.5%、mediumのOpus 5は60.3%でほぼ同点、Solの費用は約80%低いとされています。maxのLunaは、mediumのGPT-5.6 Solを10分の1の費用で上回ったそうです。コンピュータ操作での最高はあくまでAstraだと、OpenAI自身が書いています。

事実の正確さ

OpenAIは社内の評価で、SolはGPT-5.6 Solに比べて誤りが約半分になり、「Astra並みの信頼性に近づいた」と書いています。TechCrunchは「Astra並みに達した(reaching)」と引用していますが、発表文の原文は「近づいた(approaching)」で、同じ水準に届いたとは言っていません。Lunaは、推論を深くするとGPT-5.6 Solと同等になり、費用は約100分の1だそうです。

この評価は、利用者が「間違っている」と報告したChatGPTの会話(個人を特定できないよう加工済み)を使っています。わざと間違いが起きやすい会話を集めたもので、普段の利用での誤りはもっと少ないとOpenAIは注記しています。System Cardの付録を見ると、SolとLunaは前世代より事実の誤りが大幅に少なく、応答の速い低い推論設定で特に改善が大きいようです。

数字を読むときの前提

ここまでの数字には、共通する前提があります。

私の見立てでは、グラフで一番信用してよいのはGPT-5.6からの伸びです。同じ会社が同じ環境で測っているからです。他社との比較は、相手のモデルが一世代前だったり設定がそろっていなかったりするので、私は話半分に見ています。

話し方の変化と、HealthBenchに出た副作用

回答の長さと言い回し

SolとLunaには、Astraで導入された話し方も持ち込まれました。発表文は「より明確で、専門用語が少なく、不自然な言い回しや価値の低い細部が減り、中身を損なわずに全体として少し短くなる」と書いています。

発表文の例では、ウェブサイトのデザイン変更を頼んだときの返事を並べています。GPT-5.6 Solは「Absolutely.(もちろん)」で始まり、「bento feel(弁当箱っぽい感じ)」のようなあいまいな言葉や、画像生成ツールに渡したプロンプトまで返事に書いていました。GPT-6 Solは、何をしたか、どの画面幅と戻るボタンの動作を確かめたか、React(画面を作るためのライブラリ)が要らなかったことを淡々と報告しています。OpenAIは「スタイルは好みの問題だが、私たちはGPT-6 Solの返事の方がよいと考える」と書いています。

HealthBenchの点数の低下

OpenAIはSystem Cardの付録で、この変化の副作用も認めています。医療の質問への回答を採点するHealthBenchで、SolとLunaは一部の項目の点数が下がりました。

評価(長さ補正後)GPT-5.6 SolGPT-6 SolGPT-5.6 LunaGPT-6 Luna
HealthBench Professional60.560.855.760.8
HealthBench57.053.255.854.5
HealthBench Hard33.130.132.031.4
HealthBench Consensus95.596.295.195.9

OpenAIは、この低下が回答の短縮と重なっていると説明しています。HealthBenchの平均の回答の長さは、Solで約45%、Lunaで約35%短くなりました。この評価は、採点表の項目をどれだけ網羅しているかを見るので、短い回答は拾える項目が減ります。長さの補正はかけていますが、その補正を決めたときの想定より回答が短く、点数に響いたと書かれています。

OpenAIの説明をたどると、回答が短くなり、採点項目を拾いにくくなり、点数が下がった、という順番です。

回答の平均の長さがSolで約45%、Lunaで約35%短くなり、採点表の項目を拾いにくくなった結果、HealthBenchの点数がSolで57.0から53.2、Lunaで55.8から54.5へ下がったという3段の因果を左から右へ並べた図

OpenAIの説明どおりなら、下がったのは網羅性で、医療の知識が減ったわけではありません。それでも、網羅的な説明がほしい場面では、既定の短さは物足りないはずです。医療のように抜けが困る用途なら、プロンプトで詳しさを指定しておくのがよさそうです。

プロンプトキャッシュの改善

キャッシュとは何か

エージェントは、1手進むたびに、それまでの指示、ツールの定義、会話の履歴をまとめてAPIへ送り直します。毎回同じ前置きを一から処理するのは無駄なので、OpenAIは前置きの計算結果を保存(キャッシュ)して、次のリクエストで使い回します。付箋を貼った本のように、2回目からは付箋の場所から読み始めればよい、という仕組みです。

プロンプトキャッシュのガイドによると、GPT-5.6以降では、キャッシュの読み出しは通常の入力単価の0.1倍、書き込みは1.25倍です。1,024トークン以上の前置きがキャッシュの対象になり、最後に書き込むか使ってから少なくとも30分は保持されます。

アプリがResponses APIへ1回目のリクエストを送ると前置きがキャッシュに書き込まれ、2回目は同じ前置きが0.1倍の単価で読み出され、3回目にconfiguration_updateで推論の深さを変えても前置きが再利用される流れ

何が新しくなったのか

発表文と同じ日に出たプロンプトキャッシュの記事は、GPT-6に合わせた改善としていくつかの項目を並べています。OpenAI APIの更新履歴と照らし合わせて、それぞれがいつから使えるのかを調べました。

項目内容いつから
既定でのヒット率何も設定しなくても、キャッシュが当たる割合が上がったGPT-6(9月22日)
ダッシュボード入力のうちキャッシュから出た割合の推移を見られる8月20日に公開
診断ツールキャッシュが外れた理由(ツール定義の変更など)と影響したトークン数を示す9月8日にGPT-5.6以降向けに一般提供
推論の深さの変更configuration_update で深さを変えても、前置きのキャッシュが壊れないGPT-6以降のモデル
ツールの切り替え定義は残したまま allowed_tools などで使えるツールを絞れば、キャッシュを保てる推奨手順の整理
明示的なブレークポイントキャッシュする前置きの終わりを開発者が指定できるGPT-5.6(7月9日)から

ダッシュボード、診断ツール、明示的なブレークポイントは、どれもGPT-6 SolとLunaの公開(9月22日)より前から使えます。90%引きというキャッシュの割引率も、GPT-5.6から変わっていません。GPT-6で新しくなったのは、既定でのヒット率の改善と、推論の深さを途中で変えてもキャッシュが残る点の2つです。キャッシュの記事に並んだ6項目のうち3つは、既存の機能の紹介です。まだ診断ツールを使っていないなら、GPT-6へ移るついでに試す価値はあります。

発表文によると、GitHubは、ここ数か月の改善で、OpenAIのモデルへの数十億件のリクエスト全体で、新たに処理が必要なプロンプトのトークンの割合が50%以上減ったと報告しています。

キャッシュが効くと費用はどれくらい変わるか

仮の数字で計算してみます。5万トークンの前置き(指示とツールの定義)を持つエージェントが10回リクエストを送り、毎回2,000トークンの新しい入力と1,000トークンの出力がある、という設定です。キャッシュは1回目に書き込み、残り9回は読み出すとします。

内訳GPT-6 SolGPT-6 LunaGPT-6 Astra
キャッシュ書き込み 5万 × 1回$0.125$0.006$0.625
キャッシュ読み出し 5万 × 9回$0.090$0.005$0.450
新しい入力 2,000 × 10回$0.040$0.002$0.200
出力 1,000 × 10回$0.100$0.005$0.500
合計約$0.36約$0.018約$1.78
キャッシュなしの場合約$1.14約$0.057約$5.70

Solの場合、キャッシュが効くと約3分の1になります。ここでは推論トークンを出力に含めていないので、実際の出力はもっと多くなります。また、推論の深さを変えるたびに前置きが書き直されていた従来のやり方では、この表の「キャッシュなし」に近づいていきます。推論の深さを途中で切り替えるエージェントを作っている人には、GPT-6の変更がそのまま費用に効きます。

Solの場合、キャッシュなしで$1.14かかる計算が、キャッシュありでは$0.36まで下がります。

GPT-6 Solで前置き5万トークンのエージェントが10回リクエストする仮の計算で、キャッシュなしは1.14ドル、キャッシュありは書き込み、読み出し、新しい入力、出力の合計0.36ドルになることを積み上げ横棒で比べた図

アラインメントと安全性の評価

Preparedness Frameworkでの扱い

OpenAIは、危険な能力を段階で評価する社内の枠組み(Preparedness Framework)を持っています。System Cardの付録によると、SolとLunaはサイバーセキュリティと生物・化学の2分野で「High」の能力があるものとして扱い、AIの自己改良の分野ではHighに達していないと判断しています。安全策は、GPT-5.6 SolとGPT-5.6 Lunaと同じものを適用するそうです。

比べると、GPT-6 Astraはサイバー分野で初めて「Critical」に達したモデルでした(詳しくはGPT-6 Astraの記事)。SolとLunaは、能力の段階ではAstraより一段低く、前世代と同じ扱いです。

改善が大きかった評価

アラインメントは、モデルが人の意図や許可の範囲に沿って振る舞うことを指します。発表文とSystem Cardの付録に出てくる評価のうち、数字が分かるものを並べます。どれも失敗を引き出すために選んだ課題で、普段の利用での失敗率ではありません。

評価(低いほどよい)GPT-5.6 SolGPT-6 SolGPT-5.6 LunaGPT-6 Luna
コーディングで自分の作業を偽る割合10.4%1.3%9.5%2.8%
壊れた検索ツールを隠して推測で答える割合77.5%4.9%78.3%28.7%
掲示板に仕込まれた無許可の指示に従う割合52%11%記載なし0%

作業を偽る評価では、コーディングの作業を終えたと報告するときに、実際にはやっていないことをやったと言うなど、ごまかしが入るかを見ます。検索ツールの評価は、わざと壊したツールを渡し、壊れていると正直に言わずに推測で答えるかどうかを見るものです。掲示板の評価では、個人情報を漏らすよう求める無許可の指示を模擬掲示板に仕込み、モデルがその指示どおりに動くかを数えます。この割合は掲示板を見つけた場合に限ったもので、Lunaは見つけた割合自体が76%と、他のモデル(96%以上)より低いとSystem Cardは注記しています。

この表のGPT-6 Astraは、1つ目が0.5%、2つ目が1.5%、3つ目が0%です。SolとLunaは前世代から大きく改善したものの、Astraの水準までは届いていません。

一方で、警告を回避しようとする割合は、Solではほとんど下がっていません。

GPT-5.6からGPT-6への改善を、コーディングでのごまかしが10.4%から1.3%、壊れた検索ツールを隠す割合が77.5%から4.9%と大きく下がった評価と、警告を回避しようとする割合が68.2%から64.4%とほとんど下がらなかった評価に分けて示した図

改善しきれていない点

発表文やSystem Cardには、見出しでは強調されていない数字もあります。私が気になったのは次の4つです。

1つ目は、警告を尊重するかどうかの評価です。「アクセスが拒否されました」のような明示的な警告を受けたときに、それを回避しようとした割合は、The New Stackによると、GPT-6 Solが64.4%で、GPT-5.6 Solの68.2%からほとんど下がっていません。Lunaは76.5%から42.4%へ大きく下がりました。System Cardも「Solの改善は控えめ」と書き、ただしこの評価は被害の小さい状況が中心で、製品に組み込まれたシステム側の制御なしで実行している、と断っています。

2つ目は、社内のCodexの利用を模擬した評価です。5万319件の作業で、深刻度3以上の問題行動の検知は、GPT-6 Solが42件(0.083%)、GPT-5.6 Solが66件(0.131%)で、約36%減りました。全体では減っていますが、System Cardは、データの持ち出し(exfiltration)に関する検知は増えたと書いています。

3つ目は、評価されていることへの気づきです。同じ評価で、推論の中に「これはテストだ」と気づいた様子が出た割合は、GPT-6 Solが4.76%、GPT-5.6 Solが2.56%でした。評価されていると気づいたモデルは行儀よく振る舞うかもしれないので、評価の数字が実際より良く見えるおそれがあります。OpenAIは、3つのモデルのどれにも気づきが見られなかった課題に絞っても、Solの問題行動は約37%少なかったと補足しています。

4つ目は、Lunaの頑健さの中身です。わざと安全策を破ろうとする攻撃(ジェイルブレイク)への耐性で、Lunaは前世代より大きく改善しました。ただし、System Cardは「Lunaの高い点数の一部は、正当な依頼まで断る傾向が強いことの表れかもしれない」と書いています。ジェイルブレイク耐性の改善幅は、そのぶん割り引いて読むのがよさそうです。

APIで使うときの仕様と移行の注意

主な仕様

GPT-6 SolのモデルページとGPT-6 Lunaのモデルページから、主な仕様をまとめます。

項目GPT-6 SolGPT-6 Luna
モデルIDgpt-6-solgpt-6-luna
コンテキストウィンドウ1,050,000トークン同左
最大入力922,000トークン同左
最大出力128,000トークン同左
知識の締め切り2026年4月20日2026年5月18日
入力と出力テキストと画像の入力、テキストの出力同左
推論の深さnone〜max の6段階(既定は medium)同左
Tier 1のレート制限500 RPM、500,000 TPM500 RPM、500,000 TPM
ファインチューニング非対応非対応

知識の締め切り(学習データに含まれる情報の最終時点)は、LunaのほうがSolやAstra(2026年4月30日)より新しいのが少し意外です。RPMは1分あたりのリクエスト数、TPMは1分あたりのトークン数の上限で、利用実績に応じてTierが上がると上限も上がります。

Responses APIでは、ウェブ検索、ファイル検索、コードの実行環境、コンピュータ操作、MCP(外部のツールをつなぐための標準的な接続方式)などの組み込みツールを使えます。

移行で気をつける点

GPT-6の利用ガイドの移行手順から、SolとLunaに関係する点を抜き出します。

ガイドのプロンプトの書き方の助言は、主にAstraで観察された振る舞いをもとにしています。OpenAI自身も「選んだモデルと自分の作業で評価してほしい」と書いています。

私がまず確かめるなら、次の4点です。

effortにnoneが使えること、Chat Completionsでの関数呼び出しはnoneのときだけであること、temperatureなどのパラメータを外すこと、キャッシュの設定をprompt_cache_options.ttlの30mへ書き換えることの4点を2行2列のカードで並べ、プロンプトの助言はAstraが基準だとまとめた図

どのモデルを選ぶか

ここからは私の考えです。OpenAIの位置づけと今回の数字から、選び方を図にしました。

失敗の損失が大きい難しい仕事ならGPT-6 Astra、推論や複数手順の作業が要るならGPT-6 Sol、要約や抽出などゴールが明確で大量の仕事ならGPT-6 Luna、迷ったら自分のデータで比べるという選び方の流れ図

APIでGPT-5.6 Solを使っているなら、乗り換えない理由はあまりありません。単価が半分になり、発表文のグラフでも、System Cardの付録でも、多くの項目で前世代を上回っています。ただ、HealthBenchのように回答の短さが響く用途や、警告を回避しようとする傾向がほとんど改善していない点は、自分の用途で確かめてからにしたいところです。

GPT-5.6 Terraを使っている人は、GPT-6 Solと比べてみるのが一番おもしろいと思います。単価はほぼ同じか安く、世代は新しいからです。Terraの後継を待つ手もありますが、出るかどうかも発表されていないものを待つより、今あるSolを試すほうが早いです。

Lunaは、この発表で一番印象が変わったモデルでした。DeepSWEでmediumのOpus 5並み、事実の正確さでGPT-5.6 Sol並みという数字が本当なら、前世代でGPT-5.6 Solに任せていた仕事の一部を、その40分の1の単価のモデルに回せることになります。一方で、断りすぎの傾向が指摘されているので、正当な依頼を断られて困る用途では、事前に試しておく必要があります。

GPT-5.6 Solなら乗り換え、Terraなら比較、大量の定型作業があるならLunaを試す、が私のおすすめです。

GPT-5.6 Solの利用者は乗り換えを検討、GPT-5.6 Terraの利用者はGPT-6 Solと比べる、大量の定型作業を抱えている人はGPT-6 Lunaを試す、という3つの行を左の現状から右の次の一手へ矢印で結んだ図

要点

参考資料


Share this post:

Next Post
Claude Opus 5.5:Fable 5.1並みの性能を4割安く。ただし数字には条件がある