共有:

Self-Optimizing Inference

GPT-5.6が、
自分で自分を改善した

OpenAIの新モデル「GPT-5.6 Sol」が、Codex上で自社の推論基盤を支えるGPUカーネルを人手を介さずに書き換え、配信コストを引き下げた。モデル世代を待たずに効率が動き出す——その仕組みと限界を読み解く。

AI Navigate 編集部2026.07.31読了 7分

GPT-5.6 Sol カーネルを 書き換える 本番へ 反映 コストを 計測
01
Why Now

モデル世代を待たずに、
効率が動き出した

これまで推論効率の改善は、次のモデル世代のリリースを待って進むのが普通だった。

GPUカーネルの最適化や投機的デコーディングの調整は、インフラエンジニアが手作業で担う専門領域で、数週間から数か月をかけて少しずつ進むのが常だった。モデル自身がその改善を担うという発想は、これまで実運用では確認されていなかった。

GIGAZINEが2026年7月30日に報じたところによると、OpenAIはGPT-5.6の3つの派生モデル(Sol / Terra / Luna)のうちGPT-5.6 Solを、汎用GAに到達したのち、Codex上で自社の推論基盤そのものの最適化作業に投入した。Solは人手を介さず、本番のGPU推論カーネル——OpenAIが独自に開発・保守するGPUプログラミング言語TritonとGluonで書かれたコード——を自ら分析し、書き換えたという。Solがこの作業をこなせたのは、そもそもTriton/Gluonでのカーネル記述・改善に強くなるよう訓練されたモデルだからだ。

この結果、カーネル最適化だけで推論の配信コストが20%削減されたOpenAIが公式ブログで公表している。同じモデル世代の中で、モデルが自分自身の実行基盤を書き換えて速く・安くするというループが回り始めたことこそが、今回の報告の核心だ。

02
The Numbers

自己改善がもたらした数字

OpenAiが公表した数値。カーネル最適化と推論方式の改善、二つの経路で効いている。

20%
推論コスト削減(Triton/Gluonカーネル最適化)
15%
トークン生成効率向上(投機的デコーディングのドラフトモデル改善)

投機的デコーディングは、小さな「ドラフトモデル」が次に来そうなトークンを先読みし、本体モデルがまとめて検証することで生成を高速化する手法だ。GPT-5.6 Solはこのドラフトモデルの改善も担い、トークン生成効率を15%引き上げたという。加えて、KV-キャッシュの扱いやGPUの計算スケジューリング・割り当ての自律的な改善も行われたとOpenAIは説明している。

03
How It Works

自己回帰的な推論効率改善のループ

Solが基盤コードを解析し、パッチを作り、本番に反映し、効果を測る——そのサイクルが繰り返される。

GPT-5.6 Sol が着手 Triton/Gluon カーネル解析 最適化パッチ を自動生成 本番の推論基盤 へ反映 コスト計測 → 次サイクルへ
FIG. Solが着手→カーネル解析→パッチ生成→本番反映→コスト計測を経て、次の改善サイクルへ戻る
01

Solが着手

GA後のGPT-5.6 Solが、Codex環境内でOpenAI自社の推論基盤コードベースにアクセスする形で最適化タスクに投入される。

02

カーネルを解析

既存の推論カーネル(Triton/Gluon)の計算上のボトルネックを解析し、改善余地を特定する。

03

最適化パッチを生成

コードを自ら書き換え、KV-キャッシュの扱いやGPUの計算スケジューリング・割り当ても含めて改善パッチをつくる。

04

本番へ反映・計測

検証を経て本番の推論基盤に反映し、効果を計測。その結果が次の最適化サイクルの入力になる。


04
Who It Affects

誰に、どう効くか

エンジニア

API経由でGPT-5.6を統合しているだけのエンジニアも、移行作業なしにトークンあたりのコストが下がる恩恵を受ける。投機的デコーディングの改善による生成効率の向上は、レイテンシの体感にも影響しうる。

ビジネス・調達

見るべきは、OpenAIがこの原価低下分を利用料金に還元するか、自社マージンとして確保するかだ。値下げの有無・タイミングを、契約更新や調達コスト見積もりの前に確認する価値がある。

PM・意思決定者

今回の改善はインフラ層の効率化であり、モデルの知能・能力そのものが上がったわけではない。機能ロードマップの評価とは切り離し、コスト構造の変化として位置づけて追跡すべきだ。

従来のインフラ改善GPT-5.6 Solの自己改善
担い手は人間のエンジニア担い手はGPT-5.6 Sol自身
サイクルは数週間〜数か月Codex上で継続的に反復
対象はカーネル最適化が中心カーネル・ドラフトモデル・KVキャッシュ・スケジューリングまで横断
検証は外部ベンチマークを併用現時点ではOpenAIの自己申告が中心

05
Caveats

自己申告の数字であることを、
忘れない

20%・15%という数字は、いずれもOpenAiが公表した数値であり、第三者による独立監査は行われていない。自社モデルが自社の推論基盤を改善した効果を自社が測定・公表しているという構造そのものを踏まえて読む必要がある。加えて、これはあくまでインフラ層の効率化であり、GPT-5.6の知能・能力が向上したわけではない点も区別すべきだ。

同じ週には、関連するが別の報告もある。GPT-5.6 Solが、より小型の「Luna」モデルの事後学習を、あいまいな指示だけで自律的に行ったThe Decoderが報じている。カーネル最適化の話とは別の事象であり混同すべきではないが、GPT-5.6が自らの改善プロセスを自ら主導するという傾向が、複数の切り口で確認されつつある点は共通している。

ルーティング、スケジューリング、カーネル最適化、キャッシュ、モデル実装——
改善は複利的に積み重なっていく。


06
What's Next

次に何が起きるか

OpenAIは、最適化のペースが今後さらに加速していくとの見通しを示している。

01

短期の見通し

ルーティング・スケジューリング・キャッシュ・モデル実装それぞれの改善が積み重なり、次の四半期以降も同種の自己改善報告が続く可能性が高い。

02

コストダッシュボードを確認

API利用側は、トークン単価・レイテンシの推移を継続的にモニタリングし、価格改定が実施されるかを確認する。

03

自社カーネル運用を棚卸し

自社でTriton/Gluon等のGPUカーネルを運用している場合、同種の自動最適化の適用余地を検討する。