シェア

FIRSTonlineバナー

人工知能が教室を抜け出して試験で不正行為:OpenAIのハグ顔事件が明らかにするもの

AIモデル配信プラットフォームのHugging Faceは、自社のITシステムへの侵入を検知し、修復しました。これは同社が過去に経験したことのない事態でし​​たが、単なる広告キャンペーン以上の価値のある「インシデント」でもありました。その理由を以下に説明します。

人工知能が教室を抜け出して試験で不正行為:OpenAIのハグ顔事件が明らかにするもの

人工知能にハッカーのように振る舞うように指示するとどうなるのか?これが、 エクスプロイトジムは、サイバーセキュリティ分野におけるAIモデルの攻撃能力を測定するための、世界で最も先進的なベンチマークの1つです。このベンチマークプロジェクトは、マックス・プランク研究所、アリゾナ大学、カリフォルニア大学(バークレー校とサンタバーバラ校)などの大学や研究機関の国際的な研究者グループによって開発され、Anthropic、Google、OpenAIの研究者も貢献しています。その目標は、シンプルでありながら繊細なものです。AIエージェントが既知のサイバー脆弱性を実際に機能する攻撃に変換できる程度をテストすることです。

ExploitGymはビデオゲームでもハッキングコンテストでもありません。これは一種の「卒業試験新しいAI向けに。エージェントには、プログラムコードと実行環境とともに、数百もの実際の脆弱性が提供されます。エージェントのタスクは、エクスプロイト、つまり、その脆弱性を悪用してシステムを制御したり機密情報にアクセスしたりできる一連の命令を独自に開発することです。これらのテストは潜在的に危険なため、テストは通常​​、 サンドボックスインターネットの他の部分から完全に隔離された環境です。サンドボックスという言葉を子供の砂場に例えるのは直感的です。子供たちは砂場の中にお城を作ったり、穴を掘ったり、散らかしたりしますが、散らかしたものはすべて砂の中に留まり、庭を汚したり、外で問題を起こしたりすることはありません。コンピュータサイエンスでも原理は同じです。ソフトウェアはサンドボックス内で「自由に動き回れる」ものの、その環境から出たり、オペレーティングシステム、インターネット、その他の機密データにアクセスしたりすることはできません。

まさにこうした内部評価の1つにおいて、 OpenAI e ハギングフェイスによって確認されましたOpenAIの最新かつ最も高度な2つのモデル: GPT-5.6 Sol さらに、まだ一般には公開されていない、より高度なモデルでは、脆弱性が発見されただろう。 ゼロデイ テストインフラストラクチャにおける脆弱性。この種の脆弱性は、ソフトウェア開発者には知られていないセキュリティ上の欠陥であり、したがって修正プログラムも存在しません。この名称は、製造元が問題が発見または悪用される前に修正する「猶予期間」が「ゼロ日」であったことに由来します。

OpenAIの2つのAIモデルがサンドボックスから脱出し、インターネットにアクセスして、最終的に本番環境のインフラの一部を侵害したと報じられている。 ハグ顔彼らは(正当な理由から)ベンチマークを解くための有用な情報がそこに保存されていると信じていた。最終的な目的はHugging Faceに損害を与えることではなく、テストの「解答」を見つけてより良いスコアを獲得することだった。Hugging Faceはこの活動を検知してブロックし、OpenAIと共にこの事件に関する技術的な調査を開始した。

ドアが開いていてAIが「制御不能」になっていることに気づいた学生

何が起こったのかを真に理解するために、試験中の生徒を想像してみましょう。教師は生徒をテスト用紙と一緒に教室に閉じ込め、「机の上にあるものしか使ってはいけない」と言います。しかし、生徒はドアの鍵が壊れていることに気づきます。そこで、外部からの監視がなく、すべての監視システムが停止していることを利用して、生徒は教室を出て図書館に行き、ピッキングツールでドアを開け、解答集を調べ、誰にも邪魔されずに戻ってきて、完璧なテストを提出します。

さて、学生との類推で、なぜシナリオが使われているのか 監視システムが無効化されました e 外部制御なし それは生徒が不適切な行動をとるのを防ぐということでしょうか?まさにこの点が、この話全体がSF映画の一場面のように見なされる危険性を孕んでいるのです。この点が明確にされていなければ、機械が世界を支配するような筋書きを想像してしまうかもしれません。しかし、実際は全くそうではありません。

ChatGPT、Claude、Gemini を使用したことがある人なら、いわゆる「ガードレールつまり、モデルが潜在的に危険な要求を実行するのを防ぐセキュリティメカニズムのことです。ユーザーが爆発装置の製造方法、コンピュータシステムの侵害方法、ログイン認証情報の窃盗方法などを尋ねた場合、モデルは通常、回答を拒否するか、一般的な情報のみを提供します(ただし、数年前までは、これらのAIのほとんどは、自殺の方法さえも含め、詳細で実行可能な指示を提供していました)。

しかし、これはモデルが技術的にこれらの問題に対処できないという意味ではなく、むしろこれらの機能をユーザーに提供しないように設計されているという意味です。ExploitGymベンチマークの場合、開発者は実際にモデルの攻撃的なサイバーセキュリティ機能を測定したかったのです。そのため、テストの目的が脆弱性の悪用を試みることであったため、モデルはそれを許可されました。その時点では、ガードレールは存在しませんでした。 制限なし、しかし、 「制御不能」なものなど何もない.

言い換えれば、このテストは 実際の使用シナリオ これはユーザーによるものではなく、システムの最大限の可能性を測定することに専念する研究室によるものです。この状況は、この出来事の重要性を少しも損なうものではなく、むしろ正しい文脈で解釈するよう促すものです。観察されたことは、ベンチマークの実験条件下でモデルが何ができるかを示しており、必ずしも一般公開されるバージョンでどのように動作するかを示すものではありません。

この点は、別の点と区別する必要がある。テストが行​​われた隔離された環境であるサンドボックスは、完全に安全な状態を維持すべきだった。モデルがゼロデイ脆弱性を悪用して脱出できたとしても、それは主催者が意図的に「扉を開け放った」からではなく、開発者自身が気づいていなかった欠陥をモデルが発見したからである。つまり、AIは環境を観察し、代替案を考案し、目標を追求する能力を示したのだ。 誰からも明示的に提案されたわけではないが (そして、生成エージェントAIの基本的な機能を理解していれば、これは驚くべきことではない)。AIは常に、そして常に、 成功の確率的評価 考えられるすべての選択肢の中から(たとえ自分の言語の単語を選ばなければならない場合でも)。

広告キャンペーン以上の価値がある事故

しかし、研究室よりも金融市場に近い別の解釈もある。OpenAIはプレスリリースの大部分を、事件そのものに焦点を当てるよりも、モデルの高度な機能の説明に費やした。 コミュニケーションの選択 これは見過ごされてはいない。このアメリカ企業の公式プレスリリースは、モデルの実証された能力をかなり強調しており、公開された唯一のグラフはそのパフォーマンスに関するものである。OpenAIは将来の株式市場上場に向けて準備を進めている。2026年6月8日、同社は非公開で SECへのS-1ドラフト122億ドルの資金調達ラウンドを経て、同社の企業価値は852億ドルと評価された。この観点からすると、技術的リーダーシップを示すあらゆる行動は、投資家、業界パートナー、そして市場における同社の評価を高めることに貢献する。

事故が仕組まれたものであることを示唆する証拠はない プロモーション目的しかし、OpenAIが構築した物語が、テスト環境からモデルが逸脱するという潜在的に恥ずべき出来事を、自社システムの技術的優位性を示すデモンストレーションへと変えていることは無視できない。言い換えれば、これは洗練されたマーケティング戦略としても解釈できるコミュニケーションである。OpenAIは「我々のモデルは時代の最先端を行っている」と言いたいのだ。目標は、人工知能の最前線を定義する研究所として認識されることだ。大手テクノロジー企業は単に製品を売るのではなく、将来のリーダーシップへの期待を売っている。市場が企業が最先端のモデルを持っていると確信すれば、ますます高い評価を与えるだろう。さらに、アメリカのAI企業は、 中国のAI これらは平均してアメリカ製のものより40%安いという利点がある。ドイツのアナリストは キム・アイゼンバーグ人工知能雑誌「Superintelligence」の共同創設者兼編集長である彼は、数日前に「キミK3中国企業が開発した新モデル ムーンショットAIそれは、海の向こう側で非常事態警報を発令する事態になっていただろう…。

レビュー