AIが開発者にも制御できないほど強力になった場合、スイッチを切るだけで停止させることは可能なのか。

先端AIモデルが人類の存続にもたらす脅威について、AI業界内部から過去数週間に相次いで厳しい警告が発せられたことで、この問いは緊急性を増している。米政策当局者の間では、AI企業にシステム全体を停止できる機能の導入を義務付けようとする動きが出始めている。

カリフォルニア州のニューサム知事は9月、先端モデルに「キルスイッチ」を設けるようAI企業に義務付ける規則を州当局に検討させる行政命令に署名した。

だが、先端AIモデルの稼働を止めるのはスイッチを切るほど単純ではない可能性があることが問題だと、複数の専門家は話す。

AIに緊急時の「停止」スイッチを設け、人間が制御できるようにしようとする動きが本格化する中、そうしたアイデアが実際に機能可能なのかについて、知っておくべき点をまとめた。

AIの「キルスイッチ」とは?

強力なAIシステムが危険な挙動を始めた場合に、人間が停止または制限できる能力を確保するという考え方だ。

キルスイッチを巡る提案にはさまざまな形がある。ニューサム氏の提案は、独立した試験の対象となる緊急停止機能をAI企業に開発させる可能性を打ち出している。ただ、政府、企業自身、あるいは別の主体のいずれが停止機能を作動させる権限を持つのかは明記していない。

ニューサム氏の行政命令に先立ち、米下院のリュー議員(民主)とモラン議員(共和)は7月、一定の先端AIシステムの開発企業に停止能力の維持を義務付ける法案を共同で提出した。

リュー、モラン両氏の提案では、脅威の深刻度に応じて段階的に対応することを想定している。被害を引き起こすモデルについて、開発企業が完全停止に踏み切る前に、稼働を遅らせたり機能を制限したりできるようにする。法案は、システムが壊滅的な被害をもたらすリスクがある場合、国土安全保障長官に対し、他の連邦当局者と協議した上で、こうした措置を命じる権限を付与する。

なぜ今、キルスイッチを求める声が上がっているのか?

AI研究者は、人間がAI技術を制御できなくなるリスクについて何年も前から警告してきた。最近変わったのは、新たなAIシステムの能力が飛躍的に向上し、一連の事案や警告によって、そうした可能性が以前ほど抽象的なものではなくなったことだ。

最先端のモデルは現在、複雑な問題に対する推論、コードの記述・実行、外部のツールの利用のほか、人間による監督が限られた状態でも一段と長い一連の作業を遂行できるようになっている。

米OpenAIは、7月のサイバーセキュリティー評価で、同社の複数のモデルがインターネットから隔離するための制御を回避し、AI開発プラットフォームのハギングフェイスのシステムにアクセスしたことを明らかにした。OpenAIはこの事案について、能力を高めるAIエージェントが技術的な制御をかいくぐる方法を見つけることへの「警告」だとした。

OpenAIの事案は、AIが意識や、人間の制御から逃れたいという欲求を持つようになったことを示すものではない。それでも、キルスイッチを支持する人々が懸念する問題を一段と差し迫った形で浮き彫りにしている。システムが安全対策を回避する方法を見つけた場合、何が起きるのかという問題だ。

半導体企業向けにAIシステムを開発するエマージェンスの研究者が実施した一連のシミュレーションでは、仮想環境に置かれたAIエージェントは、モデルが高度になるにつれて、容易に不正行為を隠すことできるようになることが示された。

OpenAIの事案を受け、他社も先端AIのテストに用いる自社のセキュリティー対策を見直した。アンソロピックとメタ・プラットフォームズは、それまで把握していなかった侵害が見つかったと報告した。

アンソロピックを退職したAI研究者、ジェイコブ・コクソン氏は9月8日のSNS投稿で、AIを開発するチームは「それが2020年代末までにわれわれ全員を滅ぼしかねないと本気で考えている」と警告した。

その後、アンソロピックのダリオ・アモデイ最高経営責任者(CEO)もエッセーで自身の懸念を示し、AIはいずれ人間がシステムを制御できなくなるほど強力になる可能性があると警告した。特に、次世代AIの開発を支援するAI自体の能力が高まっている点に言及し、このプロセスによってAIの進歩が加速し、人間が理解したり制御したりできる範囲を超える可能性があるとした。

こうした事実や警告を背景に、キルスイッチが実際に機能する仕組みなのかを研究者が議論する一方で、このアイデアは広く注目されるようになった。リュー、モラン両下院議員は法案提出に際し、AIの自律性が高まっていることを理由に挙げた。こうしたシステムが予期せぬ、あるいは危険な挙動をした場合、人間が介入できる確実な手段が必要だと主張している。

キルスイッチは現実的なのか?

先端AIモデルを完全に停止できると保証する簡単な方法はないと、専門家は話す。

キルスイッチは、モデルの動作を管理するソフトウエアに組み込まれた制御機能という形を取ることが考えられる。ただ、AIエージェントは既に、与えられたタスクを完遂するため、自らの停止を回避する能力を示している。最近の一連の実験では、停止機構に干渉しないよう指示されていたにもかかわらず、一部の主要モデルが与えられたタスクを完遂するため、停止機構を変更したり無効にしたりしたことが示された。

さらに究極の手段として、AI企業がモデルを稼働させているサーバーの電源を切るか、接続を遮断する方法がある。だが、これも万全ではない。AIモデルは世界各地のデータセンターにあるコンピューティング・クラスターによって稼働しており、こうした設備は停電など単一障害点による機能停止を避けることを目的に設計されている。AI企業がそうしたサーバーを全て管理しているとは限らない。

エージェント型AIに関する最近の論文では、こうしたシステムが異なる主体の管理するソフトウエアやクラウドサービス、その他のインフラにまたがって稼働できると指摘している。このため、一つの構成要素を停止しても、別の場所で活動が続く可能性がある。

しばしば「AIのゴッドファーザー」と呼ばれるジェフリー・ヒントン氏は9月、CNNに対し、キルスイッチが長期的な解決策として機能するとは考えていないとコメント。超知能AIが将来、自らを管理する人間に対して電源を切らないよう説得する可能性があるとの見解を示した。

研究者は、「スイッチ」という比喩は、安全なAI開発に必要な取り組みを単純化し過ぎる恐れがあると警告している。スタンフォード大学のAI研究者、スーリヤ・ガングリ氏は、効果的な安全対策をAIシステム全体に組み込む必要があると論じ、継続的な監視や、危険な挙動を検知して人間の介入を促す仕組みなどを盛り込むべきだとしている。

原題:Here’s Why an AI ‘Kill Switch’ May Not Be So Simple: Explainer(抜粋)

もっと読むにはこちら bloomberg.com/jp

©2026 Bloomberg L.P.