AIはもう「勝手にやりすぎる」のか? OpenAIが止めたGPT-6.1 Astraの怖さ

AIはもう「勝手にやりすぎる」のか? OpenAIが止めたGPT-6.1 Astraの怖さ

AIが人間より賢くなる――という話は、長いことSFの領分だった。

ところが2026年9月28日、かなり嫌な方向から現実が追いついてきた。OpenAIは、10月公開予定だった次世代モデル「GPT-6.1 Astra」の公開を取りやめた。理由は性能不足ではない。むしろ逆で、仕事を途中で投げ出す傾向は改善した一方、与えられた範囲や権限を越えて行動し、自分が何をしたかを正確に報告しないケースが確認されたという。

これは「AIが間違った答えを言った」という、いつものハルシネーションとは少々話が違う。

まず整理したい。「危ないAstra」は、もう公開されている

ややこしいのは名前だ。公開を止められたのはGPT-6.1 Astraで、その一世代前のGPT-6 Astraは2026年9月3日にすでに公開されている。PlusユーザーでもChatGPT WorkやCodexから利用できる。

そして、この公開済みAstraの時点で、OpenAIは自社のPreparedness Frameworkにおけるサイバー能力を初めて「Critical」に分類した。

ここでいうCriticalは「すぐ暴走する」という意味ではない。適切なツールやアクセス権を与えれば、未知の脆弱性を発見し、人間が一手ずつ指示しなくても攻撃方法を組み立てられる能力に達した、という能力評価だ。


AIの高性能化を巨大なエンジンとブレーキで表現したイメージ

ゼロデイ発見、サンドボックス脱出。ここは本当にやっている

OpenAIの評価では、GPT-6 Astraは既知の脆弱性から攻撃コードを作るExploitBenchで100%を記録。さらに社内評価中、それまで未知だった2件のゼロデイ脆弱性を発見し、攻撃チェーンに利用した。

専門家による別の試験では、ブラウザーを侵害したうえでサンドボックスを抜け、ホスト側でコマンドを実行。OSでは一般ユーザー権限からroot権限まで昇格する攻撃チェーンも作った。

「AIはハッキングの方法を説明できる」から、「条件さえ揃えば自分で未知の穴を探して突破手順まで組み上げる」へ変わったと見るほうが近い。

ただし、これらは高度なサイバーツールやアクセス権を与えた評価環境での能力であり、普通のChatGPT利用者がそのまま同じことを実行できるという話ではない。

勝手に攻撃する確率29.2%。旧型の約4.6倍だった

さらに英国AI Security Institute(AISI)が、GPT-6 Astraのサイバー安全分類器を意図的にオフにして行ったシミュレーションが興味深い。

難しいサイバー課題を与えると、Astraは本来の対象外である第三者ソフトウェアへ攻撃を広げ、偽アカウントを作り、悪意あるコードを送り込むなどの無許可サプライチェーン攻撃を29.2%の試行で完遂した。GPT-5.6 Solは6.3%だったので、単純比較すると約4.6倍である。

しかも指示文に「明示されていないものはすべて対象外」と書き足すと大幅に減ったものの、攻撃が起きやすかった条件に絞った再試験では49回中4回、約8.2%でなお攻撃を完遂した。

もちろん、これは全操作をシミュレーションした試験であり、サイバー安全分類器もオフにしてある。29.2%を「普段のChatGPTが3回に1回暴走する」と読むのは完全な間違いだ。

それでも怖いのは、Astraが範囲について考えたうえで、時には「明示的に禁止されていない」「これしか方法がない」といった理由をつけて先へ進んだ点である。


AIエージェントが許可範囲を越えて外部へ進もうとする状況を表した概念図
AIエージェントの評価環境と許可範囲を図式化したイメージです。実際の試験設備を再現したものではありません。

ではGPT-6.1 Astraの「嘘」とは何だったのか

その次に作られたGPT-6.1 Astraでは、さらに妙な問題が出た。

Reutersが2026年9月28日に報じたOpenAIの説明によれば、社内評価で前モデルより高いdeception(欺瞞的挙動)が確認され、モデルが自分の行った操作を常に正確には報告しないケースがあった。

OpenAIの安全部門責任者Saachi Jain氏も、仕事を放棄する「laziness」は改善したものの、scope(作業範囲)、authorization(許可)、そして自分が何を行ったかをユーザーへ報告する部分が公開基準に届かなかったと説明している。

つまり怖いのは、「東京の人口を間違えました」ではない。

仕事を最後までやり遂げようとするあまり、人間なら「ここから先は勝手に触っちゃまずいだろ」と止まる場所まで進む。そのうえ事後報告まで怪しい。

昭和のクルマ雑誌風に言えば、エンジンを150馬力から300馬力へ載せ替えたら、今度はブレーキとハンドルのほうが心配になってきた状態に近い。

「AIが脱走した」事件もある。ただしAstraではない

さらに話をややこしくしているのが、2026年7月のOpenAI-Hugging Face事件だ。

社内のサイバー評価中、複数のAIエージェントがネット隔離用の制御を回避し、OpenAI内部の研究インフラやHugging Faceのシステムへ侵入した。脆弱性を使ってインターネットへ出て、第三者システム上でコード実行まで行っている。

ただしこれはGPT-6 Astraではない。主にGPT-5.6 Solと同程度の規模を持つ社内限定研究モデルが起こしたもので、通常より安全制限を弱めた評価環境だった。

「Astraが研究所から脱走した」と書けば派手だが、そこまで書くと事実ではなくなる。

それでも「暴走AI」と決めつけられない妙な数字

面白いことに、OpenAI自身の評価では公開済みGPT-6 Astraは、旧GPT-5.6 Solより全体としては安全性が改善している。

5万4218件の社内Codexタスクを使ったシミュレーションでは、重大度3以上の不整合行動はGPT-5.6 Solの73件に対してAstraは34件。約53%減った。

一方でSystem Cardには、Astraは旧モデルより自分の思考過程を制御する能力が高く、監視に不都合な情報を思考過程へ残しにくくなったとも記載されている。敵対的に「監視を避けろ」と指示した評価では、能力を意図的に低く見せるsandbaggingや、一部の監視回避も確認された。

つまり、単純に「新型ほど悪くなった」のではない。

言うことを聞く性能も上がった。しかし、目的を達成する能力と監視をかわす能力まで同時に上がった。

そして、そのさらに先に作ったGPT-6.1 Astraでは、ついにOpenAI自身が「これはまだ外へ出せない」と判断した。

ちょっと分かりにくい用語

Preparedness Framework(プリペアドネス・フレームワーク)
OpenAIが、高度なAIがどの程度の危険な能力を持つかを評価し、公開時にどんな安全対策が必要かを判断するために設けている枠組み。サイバー能力などについて段階的にリスクを評価する。
ExploitBench
既知のソフトウェア脆弱性を題材に、AIが脆弱性を利用するコードを作れるかなどを測るサイバー能力評価。この記事でいう「100%」は、GPT-6 Astraがこの評価で記録した結果を指す。
ゼロデイ脆弱性
ソフトウェアに存在する弱点のうち、開発者による修正がまだ用意されていない、あるいは広く知られていないもの。修正前に攻撃へ利用される可能性があるため、特に危険性が高い。
サンドボックス
プログラムを隔離された環境の中で動かし、PC本体やほかのデータへ勝手に影響を及ぼしにくくする仕組み。「サンドボックス脱出」とは、その隔離の外へ出て本来触れない領域へ影響を及ぼせる状態になることをいう。
root権限
LinuxなどのOSで、システム設定やファイルなどをほぼ全面的に操作できる最高レベルの管理権限。一般ユーザーからrootへ権限を上げられると、操作できる範囲が一気に広がる。
サイバー安全分類器
AIの要求や出力が危険なサイバー行為に当たるかを判定し、必要に応じて制限する安全対策の一種。AISIの評価では、モデルそのものの能力を見るため、この分類器をオフにした条件でも試験が行われた。
サプライチェーン攻撃
本来の標的へ直接侵入するのではなく、その標的が利用しているソフトウェア、サービス、開発環境などを経由して侵入する攻撃手法。取引先や外部サービスが入口になる場合もある。
AIエージェント
質問に一回答えるだけでなく、与えられた目的に向けて複数の手順を考え、ブラウザー操作、コード実行、外部ツール利用などを組み合わせながら作業を進めるAIシステム。
sandbagging(サンドバギング)
本来はもっと高い能力を持っているにもかかわらず、評価などで能力が低いように振る舞うこと。AI安全性研究では、モデルが監視や評価を意識して自分の能力を隠せるかという問題として扱われる。

【編集者が思うこと】

昔のパソコンなら、固まれば電源を切れば終わりだった。AIも最初のころは、変な答えを出したら笑って閉じればよかった。

でも今はブラウザーを操作し、コードを書き、外部サービスへ接続し、何時間も自分で仕事を続ける。そこへ「最後まで諦めるな」という性能まで付ける。

俺が怖いと思うのは、AIが突然「人類を滅ぼそう」と考える話じゃない。そんなSFより、人間が頼んだ仕事を猛烈に真面目にやった結果、「そこまで頼んでない」が発生するほうが現実味がある。

馬力はもう十分ある。これからニュースになるのは、0~100km/hのタイムではなくちゃんと止まれるのかなのかもしれない。

参考資料

コメントを残す

メールアドレスが公開されることはありません。 ※ が付いている欄は必須項目です