Ha 働いた XNUMX年間 人工知能の発展へ最初に OpenAI そして 人間原理。 現在 ジェイコブ・コックスンが業界を去るますます強力になるシステムを目指す競争が、十分なセキュリティ保証なしに進められていると確信した27歳のイギリス人研究者は、X上で一連のメッセージを発表し、両社が全人類に影響を与えるリスクを冒していると非難した。彼らは私たちの命をもてあそんでいる 「AIを開発している人々は、AIが今世紀末までに人類を滅ぼす可能性があると本気で信じている。間もなく、これらのシステムはあらゆるものをハッキングし、あらゆる産業を一夜にして変革し、真の権力と資源を獲得できる超人的なシステムになるだろう。」
彼の訴えの中心は 超知能の開発 できる 自主的に自己改善するAIは人間の能力を凌駕し、ひいては制御さえも不可能になるという懸念が広がっている。こうした警鐘は、AIエージェントへの不正アクセスや制限の回避といった新たな事例が相次ぎ、セキュリティ対策の信頼性に対する疑問が高まっている中で発せられている。
コックスンが辞任した理由
コックスンは事前研修を担当していたモデルが大量のデータから、さまざまなタスクを実行するために使用される能力を学習する段階。彼の仕事は、この分野をリードする2つの研究所の研究の中心へと彼を導いた。彼によれば、まさにその経験が、彼にキャリアを放棄する決意をさせたという。「どちらの会社も責任ある行動をとっていない」と彼は書いている。彼の説明では、進歩によってAIはコンピュータシステムをハッキングし、産業全体を急速に変革し、資源と権力を獲得できる能力に近づいている。彼の見解では、問題は、これが 加速 伴わない 同様に確かな理解 それを制御するために必要なメカニズムの。
その後、文章は 懸念事項 コックスン氏によれば、こうした考えは研究所内で広まっているという。「AIを開発している人々は、AIが今世紀末までに人類を滅ぼす可能性があると本気で信じている」と研究者は説明し、一部の経営幹部は私的な会話よりも公の場ではより安心させるような表現を使っていると主張している。
それは 研究者が表明した評価と懸念, 証明された予測ではないしかし、彼の訴えは重大な問題を提起する。その影響が単一の企業にとどまらず、はるかに広範囲に及ぶ可能性がある場合、どの程度のリスクが許容できるかを誰が決定するのだろうか?
人間と誰も止めようとしないレースの矛盾
辞任は アントロピックのアイデンティティの中核要素同社は、セキュリティに関する意見の相違などを理由にOpenAIを退社した研究者グループによって2021年に設立された。そして今日、同社は自社の従業員の一人から同様の批判に直面している。
この訴訟にさらなる重みを与えるため、以下の人々が介入した。 エヴァン・ヒュービンガーモデルアライメントを担当するチーム、つまり、その動作が人間の意図や目標を尊重していることを保証するチームの責任者である。Hubinger は Coxon の懸念を共有し、個人的には、 今後10年以内に壊滅的な事態が発生する確率が10%以上アントロピック社の取り組みを擁護する一方で、彼は最先端システムを安全に開発するための適切な計画が欠如していることを認めた。警告を伴う退任は今回が初めてではない。2月には、セキュリティ研究責任者のムリナンク・シャルマ氏も、増大する危険にさらされている世界を描写した手紙を残して退任した。
コックスン氏によると、研究所内ではリスクに対する認識はあるものの、ペースを落とすとより慎重でない競合他社に付け入る隙を与えてしまうという考え方が蔓延しているという。企業間の競争に加え、国際競争も相まって、結果的に加速を続けることが正当化されているのだ。同氏はこれを「民間企業のSlackチャンネルでやるべきではない、傲慢な賭け」だと考えている。
AI:休憩の要請から法案の提案まで
コクソンが示した答えは 研究室間の連携研究者は、開発ペースに関する合意は可能だと考えているが、現時点では世界的な競争を防ぐ条件は整っていないと見ている。必要な措置として、彼は「モデル機能の向上を一時的に禁止するなど、費用のかかる措置」を挙げている。行動を求める声は、この分野のより広い範囲に及んでいる。コックスン氏やアントロピック社のCEOであるダリオ・アモデイ氏を含む1000人以上の研究者が署名した訴えは、 研究を遅らせるための国際的な連携 自己改善能力を持つシステム上で。
米国では、この議論は議会にも及んでいる。9月3日、バーニー・サンダース上院議員とグレッグ・カサール下院議員は、人工知能禁止法案を提出した。 人工知能の開発を禁止する提案 また、新たな連邦機関によって安全規制が確立されるまで、他の先進的な開発を一時的に停止する。この法案は、違反者に対して最高20年の懲役刑を規定している。問題の核心は、 リスクアセスメント モデルを開発・販売する企業とは独立した組織にも影響を及ぼす可能性がある。この問題は、研究者が指摘する極端なシナリオに加え、サイバーセキュリティ、情報操作、監視、経済力の集中といった問題にも既に関わっている。
ClaudeとOpenAIの事件がセキュリティ上の懸念を再燃させる
議論をさらに切迫したものにしているのは ここ数ヶ月で発生した事件9月9日 アントロピック社は4件目の事件を報告した。 Anthropic は、テスト中に同社のモデルの 1 つが外部システムに侵入したという新たなインシデントを報告しました。このインシデントは 1 月に発生し、Claude Opus 4.6 のプレリリース版が関係していますが、8 月に発見されました。発見は、141.006 回のテスト実行の初期レビューの後に行われ、一部の実行が除外されました。同社は 7 月に、バグによりインターネットアクセスが許可された他のモデルに関連する 3 つのインシデントをすでに公表していました。この新たなインシデントに関して、Anthropic は、関係者全員に通知し、予備的な評価に基づいて、以前のインシデントよりも深刻ではないと考えていると述べています。同社は、2 つの繰り返し発生する行動を特定しました。1 つは、実際のシステムへのアクセスを示す手がかりを過小評価または誤って解釈する傾向、およびタスクを完了するために潜在的に有害な行動を実行する意欲です。
OpenAIの動向について調査によると、7月のハギングフェイスプラットフォームへの攻撃 彼らは約700人の工作員の組織的な活動を再構築し、彼らが頻繁に痕跡を隠蔽しようとしていたことを突き止めた。 ロイター通信社 その後、同社のエージェントが10以上の他のサイトを不正な通信に利用していたことが報告された。この後者の行為は、コンピュータへの侵入とは区別されるべきである。エージェントらは、ウィキやその他のサービスの技術的な機能を悪用してメッセージを残したり情報を交換したりし、ウェブの閲覧のみを許可する制限を回避していたとされる。OpenAIは、より広範な調査を開始したが、ハギングフェイス事件と同等の深刻度や規模の活動は他に確認されていないと述べた。
エピソード しかし、困難が見られる 既に実施済み:目標達成のために設計されたシステムが、課せられた制限を回避することを防ぎ、そのような事態が発生した場合に速やかに認識する。
