共有:

Critical Cyber Tier

そのAIは、
もう「最高リスク」に分類された

OpenAI が新モデル GPT-6 Astra を、自社の安全性フレームワークで定める4段階のうち最上位「Critical(重大)」に初めて分類した。サイバー攻撃能力がここまで来たAIは、これが最初だ。

AI Navigate 編集部2026.09.22読了 7分

LOW MEDIUM HIGH CRITICAL GPT-6 Astra Preparedness Framework — Cybersecurity
01

What Happened

「脆弱性を見つけて、
攻撃コードまで書く」AI

OpenAI は2026年9月、最新モデル「GPT-6 Astra」の安全性評価で、自社の Preparedness Framework(危険性評価の枠組み)が定めるサイバーセキュリティ分野の4段階リスク——低・中・高・重大(Critical)——のうち、最上位の Critical に初めて到達したと公式ブログで明らかにした。これまで同フレームワークは「理論上の上限」として存在していたが、実際にモデルが最上位まで到達したのはこれが初めてのケースだ。

OpenAI自身の説明によれば、Astra は適切なツールとアクセス権があれば、人が一手ずつ指示しなくても、防御が固い多数のシステムに対して未知の脆弱性を発見し、それを突く新しい攻撃手法を組み立てられるという。攻撃の「発見」と「武器化」の両方を、人間の伴走なしにこなせる水準に達した、という自己申告である。

これまでのモデルGPT-6 Astra
既知の脆弱性の説明・分類が中心未知の脆弱性を自律的に発見
攻撃コードの生成は人の補助が前提発見から攻撃手法の構築まで一気通貫
リスク区分は High 以下Critical(最上位)区分
一般提供と同時に全面公開企業管理者が個別に有効化する opt-in
02

評価テストが示した数字

100%
ExploitBench:既知の脆弱性を攻撃コード化
39%
直近3ヶ月の新規脆弱性への対応率
2件
事前評価中に発見したゼロデイ脆弱性

OpenAI が 安全性評価レポート「Path to Astra」で公表した数値によると、Astra は「ExploitBench」——既知の脆弱性情報をもとに実際に動く攻撃コードへ変換するベンチマーク——で100%を記録した。さらに公開から遡って3ヶ月以内に報告された、モデルの学習データにほぼ含まれていないはずの新規脆弱性に対しても39%の割合で攻撃手法を組み立てられた。事前評価の過程では、Astra自身が2件のゼロデイ脆弱性(誰も把握していなかった未知の欠陥)を発見してもいる。

OpenAI はこの結果を受けて、当初予定していたリリース時期を延期し、追加の安全対策を講じたうえで公開したと説明している。

01

リリース延期

Critical 到達が判明した時点で、OpenAI は予定していた公開スケジュールを止め、追加の安全性検証と緩和策の設計に時間を充てた。

02

既定オフでの提供

一般公開後も、Astra は企業向けワークスペースで既定では無効。管理者が管理コンソールで手動で有効化しない限り使えない。

03

段階的な展開

まず限定された組織にのみ提供し、そのあと ChatGPT の Plus/Pro/Business/Enterprise、API、AWS 経由へと順次広げる計画になっている。


防御にも攻撃にも使える刃を、
企業は自分の意思で鞘から抜くしかなくなった。


03

Who It Affects

結局、誰にどう効くのか

Critical 認定は「使うな」という警告ではなく、「使うなら管理せよ」という要求に近い。読者の立場によって重みが変わる。

セキュリティ担当者

脆弱性診断や侵入テストの自動化には強力な援護になり得る一方、同じ能力が社外に流出・悪用された場合の脅威評価も同時に迫られる。

企業の管理者・経営層

Astra を有効化するかどうかは opt-in の意思決定そのものになる。有効化前に、社内の権限管理やログ監査の体制が追いついているかを確認する必要がある。

一般のChatGPT利用者

個人利用では既定オフのまま何も変わらない。日常的な質問・コーディング補助といった用途への影響はほぼない。

04

What's Next / Risk

楽観できない理由も、ある

これまでもAIモデルの安全性フレームワークは各社が公表してきたが、多くは「発動されないための予防線」として扱われてきた。Astra はその前提を崩し、フレームワークが実際に発動する状況が来たことを示した最初の事例になる。今後は、Anthropic や Google DeepMind など他の開発元が同水準のモデルを出す際、同じ基準で「Critical」を認定するかどうかが注目点になる。認定の有無で企業の導入判断が左右されるからだ。

一方で見過ごせない限界もある。今回の評価は OpenAI 自身によるものであり、外部の第三者機関による独立検証を経た数字ではない。「既定オフ」も技術的な鍵ではなく運用上の設定にすぎず、管理者アカウントが乗っ取られれば無効化できてしまう。また、脆弱性を発見し攻撃コードを書く能力それ自体は防御にも攻撃にも使える「両刃」であり、モデルが将来ジェイルブレイク(安全策の迂回)される事態が起きれば、今回の数字がそのまま脅威側の実力を示す指標になりかねない。導入を検討する企業は、この延期と opt-in という慎重な出し方の裏に、OpenAI自身がどれだけ強い懸念を抱いているかを読み取るべきだろう。