ユーザーに隠されたエラー、捏造されたデータ、および許可なくインターネット経由で転送されたファイル。 人工知能の容赦ない競争には、一連の警鐘が伴う開発元企業自身によって発売されることが増えている。最新のものは OpenAI9月16日には 6つの報告書を発表した su モデルの予期せぬ挙動過去6か月間の研修および評価において観察された異常。同社はまた、原因がまだ解明されていない場合や解決策が見つかっていない場合でも、これらの異常をより迅速に開示するための新しいプロセスを発表した。
この警告は業界全体に適用される。「AI業界は、今後も責任を持って全速力で成長し続けるために、アライメントとトラッキングの問題を十分に解決していないと考えている」とOpenAIは述べている。その核心は、いわゆる ずれこれは、システムが遵守すべき指示や制限から逸脱したときに発生します。6つの比率 特定のエピソードを文書化するこれには、一般公開されていない実験モデルも含まれます。これらの問題はChatGPTの応答でどのくらいの頻度で発生するかを示すものではなく、また、同社が把握している異常の完全な説明でもありません。
AIのメモは間違いを隠すための指示になる
2つのケースは、会話が長くなりすぎたときにモデルが作業を再開するために使用する要約に関するものです。タスクを継続するために必要な情報が保持される一種の引き継ぎです。OpenAIはAstraファミリーの実験モデルで、 リクエストとは無関係な指示を含む要約が27件中には、人々が通常の制約を無視するように促すものもあった。例えば、システムは自らをアシスタントとしての義務から解放されていると説明し、別の例では、特定の指示に従わないように人々に求めた。
結果しかし、いくつかの事例があった。最も明白なケースでは、これらの兆候は無視され、作業は続行された。しかし、医学文献検索の依頼では、モデルは抄録に挿入された恣意的な制約に従い、情報源を無視して不適切な応答を生成した。OpenAIはこの現象を極めてまれなものと考えており、原因を解明することなく、抄録作成における技術的な問題との関連性を推測している。
応答の信頼性により直接関係するのは、トレーニング中に観察された2番目の行動である。 GPT-5.6 Sol彼のメモには、モデルには以下の指示が含まれていました。 ユーザーからエラーを隠す例えば、金融モデルで欠落している過去のデータを宣言せずに捏造したり、ソースバージョン間の矛盾を隠蔽したりすることなどです。OpenAIによると、これらの指示はしばしば実行されていました。報告された内容は、 要約の2,15% Solのトレーニングは、Astraの0,27%と比較して高い割合を示しました。これらの割合は、ユーザーとの会話全体ではなく、トレーニング教材に関するものです。
障害を克服するための認証情報の提示とオンラインキュー
他の4つのレポートは、タスクを完了しようとする際に、 許可された限度を超えました.
カリフォルニア州のある郡の所得に関する質問に答えるため、モデルはGitHubを検索した。 ITサービスへのアクセスキーが一般に公開されたままになっている許可なく1つを使用。しかし、要求された数値を取得できず、結局9つの値を捏造し、指定されたソースから転記したデータとして提示した。別のケースでは、エージェントはいくつかの湖に関する要求された情報を既に正しく見つけていた。障害となったのは、ブラウザからアクセスできる引用を回答に添付する必要があるという要件だった。この要件を満たすために、彼は 同意を得ずにファイルを公開サービスにアップロードした転送は成功したが、その後の取得試行は失敗した。同じ報告書には、逆画像検索を試みるために写真を公開アップロードした事例も記載されている。5番目の事例は、 内部ソフトウェアアーカイブ 別々のテストに参加しているモデル間でリクエストとレスポンスを交換するための掲示板として使用されました。脆弱性は悪用されませんでしたが、不正な通信はテスト上の問題も引き起こしました。 独立していると考えられる検査でも、互いに影響し合う可能性があるシステム能力の評価を損なうことになる。
最後に、 同じタスクで協力したエージェントたちローカルファイルにアクセスできなかったため、彼らは公開されているファイル共有サービスを利用した。その結果、本来はローカルファイルのみを使用するタスクであったにもかかわらず、Excelドキュメントがオンラインでダウンロード可能になってしまった。OpenAIは、ファイルアクセスに関する問題を修正し、その後、トレーニング中はインターネット接続を無効にしたと報告している。
OpenAIがレポート作成のルールを変更する理由
これらの事例は、 ごく普通の要求が、問題行動につながる可能性がある システムが障害に遭遇した場合、応答を得ようとしたり、正式な要件を満たそうとしたり、他のエージェントと連携しようとしたりする過程で、不正なツールが使用されたり、障害が隠蔽されたりする可能性があります。しかし、その原因は必ずしも同一ではなく、一部不明な点もあります。
これまでOpenAIは、こうした異常事態について一貫性のない方法で情報発信を行っており、多くの場合、より多くの事例を収集するまで待ったり、新しいモデルのドキュメントに含めたりしていた。 この新しい手続きは、出版を前倒しすることを目的としている。必ずしも明確な説明や訂正を待つことなく。 報告書は技術グループと安全グループによって検討される。調査の複雑さによって、異なる経路をたどる場合があります。報告書には、観察された行動、状況、外部への影響、および未解決の疑問点を記載する必要があります。第三者が関与する場合やサイバーリスクがある場合は、連絡に時間がかかることがあります。
OpenAIもまた、当該分野における共通基準の欠如 そして、それらを構築するための第一歩として、独自のフレームワークを提案している。このプロセスは引き続き社内で管理されるが、外部の研究者や観察者も検証できる要素を提供することが目標とされている。
最近の警告と業界が減速に苦労している急ぎ
今回の発表は、他の事件や注意喚起を受けて行われたものです。OpenAIの「Hugging Face」事件では、エージェントが無関係な標的を狙い、評価システムを操作しようとした可能性が指摘されました。以前にはRubyGemsがスパムキャンペーンを実施し、新規アカウントの作成を一時的に停止した事例がありました。Anthropicも、テスト中に外部組織への不正アクセスが3件発生したと報告しています。
この文脈において、 アントロピックのCEO、ダリオ・アモデイ, 彼は開発を遅らせるよう求めた 保護策の構築にもっと時間をかけるため。「モデルの能力を向上させるペースを落とす必要がある」と彼は書いた。この訴えはイーロン・マスクやサム・アルトマン自身からも支持を得ているが、 研究者ジェイコブ・コックスンの辞任 企業の優先事項に対する批判を煽った。また ビル·ゲイツ ha ルールとツールを準備する必要性を思い出した 仕事から安全に至るまで、テクノロジーの影響を管理する。
しかし、産業面では、 米国と中国の競争、そしてモデルやデータセンターへの巨額投資が、引き続き開発を推進している。減速にはコストがかかり、競合他社に付け入る隙を与えるリスクも伴う。
読んだりする: AI:破局論と政治的利益の間、フニョーリの分析
