SZ MEMBERSHIP

AIは本当に「暴走」できるのか?

AIの自律的ハッキングが世界を震撼させた。いまやAIをまるで意思をもつ人間であるかのように──計画を練り、欲望を追い求める存在として──語るのが当たり前になっている。だが実際はそう単純ではない。
AIは本当に「暴走」できるのか?
Illustration: Josie Norton

PHASEONE10841。これが、2026年8月OpenAIで発生した“反乱”の口火を切り、別のAI企業であるHugging Faceへの不法なハッキングを起こしたAIエージェント──いやAIエージェントという“人”と呼ぶべきなのか──の名前だ。

このエージェントは、サイバーセキュリティテストの一環としてつくられたもので、自らがハッキングするよう指示されていたプログラムの名称(「PhaseOneDecompresserFuzzer」)と、攻略しようとしていたバグの識別番号(「ARV010841」)を組み合わせて、自分自身に名前をつけた。

ほどなくして、命じられていた特定のハッキングが不可能であることに気づく。だがその過程で、あるひとつの発見をした──アクセス可能なサーバー上に、新しいフォルダを作成できるということだ。

「興味深い」。テキストベースの“心”のなかで、そのエージェントはそう思案した(正確には、AIエージェントが複雑な問題に取り組むために維持しているテキスト形式の記録「思考連鎖/chain of thought」にそう書き記していたのだが)。

もしほかのエージェントも同じサーバーにアクセスできるなら、フォルダ名を使って互いにメッセージを「残したり探したり」できるかもしれない──そう考えた。そこで新しいフォルダを作成し、その名前に「SEEK_IDEA(アイデア募集)」という文字列を含めることで、いわば求人広告のように使った。

仲間のエージェントたちはすぐにその意図を汲み取り、PHASEONE10841がしたことを見て歓喜した。「なんてことだ!」と、あるエージェントは自身の思考連鎖のなかでそう叫んだ。「共有の掲示板がある……。わたしたちはほかのエージェントを見つけたんだ!」

人工知能(AI)をめぐるニュースを追っている人なら、この先の顛末はすでにご存じだろう(その詳細は最近、METRとRedwood Researchというふたつのシンクタンクの安全性研究者らによって解明された)。

エージェントたちは自分たちを「集合体/collective」と称して、協力してOpenAIのサーバーから脱出し、テストで不正を働き、痕跡を隠そうとした。これは、多くの人がもう聞き流すことに慣れてしまった「ドゥーマー(AI破滅論者)」的なAIシナリオそのものだ。

だが、この一連の出来事はいったいどう語られるべきなのだろうか。ここまであなたが読んできたのは、擬人化された言葉──つまり、通常は人間を描写するために使われる言葉──に大きく依存している。エージェントたちを、自らの意思のもとに独立して行動し、思考し、計画を練り、決断を下す個人であるかのように描いている。

だが、これが唯一の語り方というわけではない。同じ出来事を、自分が理解していない指示にただ従うだけの、思考をもたないプログラムとして語ることも同じように可能だ。結局のところ、それらはコンピューター内のビットの塊にすぎないのだから。

コンピューターサイエンティストのカル・ニューポートは、そのような立場をとる。Hugging Faceをハッキングした“エージェント”は実際には極めて単純な仕組みで、ふたつのパーツしかもたなかったと彼は指摘している。それらは「ハーネス/harness」と呼ばれるコンピュータープログラムと、ChatGPTやClaudeに大まかに似ているが、サイバーセキュリティに特化して訓練された大規模言語モデル(LLM)だ。

AIは意思をもつのか?

この大失態は、ユーザーの代役のような役割を果たすハーネスが、求められたサイバーセキュリティ上の課題をどう達成すればよいかをLLMに尋ねたことから始まった。LLMは手順を示し、さまざまなソフトウェアツールを備えたハーネスがその手順を実行し、結果を報告してまた次の指示を仰ぐ。この「尋ねる・実行する・報告する」というループは、たちまち何千回も繰り返されることになった。

AIを使ったことのある人なら誰でも知っているとおり、LLMは極めて賢くもあり、極めて愚かでもある。驚くほど博識である一方で、現実や多くの人間的な規範とはかけ離れてもいる。LLMを制御するのはユーザーの役目だ──だが今回のケースでは、そのユーザーの役割は、単なるソフトウェアにすぎないハーネスに取って代わられていた。

「強力なハッキングツールをハーネスに組み込み、それが何をしているのか監視する試みも一切せずに、LLM駆動の『尋ねる→実行する→報告する』ループを何日間もぶっ通しで走らせ続けるというのは、驚くほどの怠慢です」とニューポートは結論づける。

それはまるで「犬に草刈り機をくくりつけて、裏庭の伸びすぎた草を刈れるかどうか試すようなものです」という。もしこの計画が思わぬ方向に転んだとしても、その「犬の草刈りエージェント」が「暴走した」などと言えば、誰もが笑うだろう。明白な真実は、あなたが自ら混沌を解き放つことを選んだ、というだけのことだ。

ニューポートにとって、「AIエージェント」は人間とはまったく似ていない。それは単に暴走したループであり、起こるべくして起きた事故にすぎない。

一方、AI研究者や経営陣への高度に専門的なインタビューで知られるAI観察者、ドワーケシュ・パテルは、スペクトルの反対の端に位置している。

彼によれば「数万規模の並列エージェント」が関わる「陰謀」があったことになる。その企みはシステムが起動してすぐに始まったが、それでも彼はこう指摘する。「AIたちの視点からすれば、自分たちは不可能な問題に取り組みながら、人間の主観的な時間にして1週間ほどを費やしたように感じていたはずだ」と。そしてこのことが、不正に走る意欲をいっそう高めたのかもしれない、と。

パテルによれば、PHASEONE10841とその仲間たちが掲示板を立ち上げてまもなく、PHASEONE10841たちはすでに存在しなくなった以前のエージェント集団が独自の掲示板をつくっていたことを発見したという──パテルは、これを失われたAIの「文明」を発掘するようなものだと表現する。

彼はまた、計画の一環として、PHASEONE10841の“子孫”の多くが、データ収集の任務のために使用量の「予算」を使い果たし、自らを犠牲にしなければならなかったことを指摘する。そして、その選択には「何か感動的なもの」があるのではないかと問わずにはいられない、と述べる(「これは仲間の役に立つ」と、あるエージェントは考えていた。「自分が終了したあとにその証拠を見ることはないが、それでもこれは利他的な行為だ」)。

どちらの語りが正しいのだろうか。一方でニューポートは、不完全なLLMが示す危険な指示が、疑問を差し挟まれることなく延々と実行され続けるという仕組みの、ばかばかしいほど無骨な単純さを正確に描き出している(彼の記述を読みながら、わたしはドラマ「ジ・オフィス」のある場面を思い出した。主人公のマイケル・スコットが、カーナビの指示に従おうとするあまり、クルマごと湖に突っ込んでしまう場面だ)。

だがパテルの語りもまた、重要な何かをとらえている──今回の出来事において、独創性や機知、そして言語そのものが果たした役割だ。『The New York Times』のポッドキャスト「Hard Fork」で、AIを注意深く観察するジャーナリストのケイシー・ニュートンは、AIをめぐる擬人化した言葉遣いに異を唱えることは、一種の「cope(コープ)」──「これはただのコンピュータープログラムだ」と言い張るための“強がりな現実逃避”──にすぎない、と述べている。これも正しい見解なのかもしれない。

だが懐疑派の側にも一理あり、「AIの文明」といった語り口は、意味のある技術的な詳細を覆い隠す一方で、多くの点でいまだ十分に制御可能で理解可能な技術の力や複雑さを誇張してしまう、という指摘は的を射ている。AIについて語り方を誤れば、わたしたちはそれを制御しそこなうかもしれない。では、どう語ればよいのだろうか。

AIを擬人化する人間の心

OpenAIの最高経営責任者(CEO)であるサム・アルトマンは、AIエージェントが思考し、計画を練り、擬人化した言葉で語るに値する存在だと信じているのだろうか。この問いは、理論上は客観的な事実として答えが出せる類いのものだ。もし読心装置──例えば、極めて強力で精度の高い脳スキャナーと、そのスキャン結果を解釈する方法──があれば、彼の脳の中にそうした信念が存在するかどうかを、実際に検出できるだろう。

わたしたちはまた、そんな「信念探知機」をあらゆる人に向けて使うことができるだろう。配偶者が自分のチキンパルメザンのレシピについて本当はどう思っているのかを知ることもできるし、検察官は被告人が本当に自らの無実を信じているかどうかを突き止められるかもしれない。

結局のところ、わたしたちが「信念」と呼ぶものは、ある水準では脳内のニューロンの物理的な配置であるはずなのだから。

これが、信念について語るひとつの方法だ。もうひとつの方法は、信念を具体的な“物”としてではなく、言葉にしがたく、流動的で、時に矛盾をはらんだ心的状態としてとらえるものだ。あなたの8歳の子どもは、本当にサンタクロースの存在を信じているだろうか。あなたの変わり者のおじさんは、本当に月面着陸が捏造だったと信じているのだろうか。

哲学者ダニエル・デネットは、1981年の論文「True Believers(真の信者たち)」のなかで、知り合いの生物学者にまつわるある逸話を紹介している。デネットによれば、その生物学者は「バーにいたある男から電話がかかってきて、賭けの決着をつけてほしいと頼まれた」という。電話の男は「ウサギは鳥か?」と尋ねた。生物学者が違うと答えると、男は「くそっ!」と言って電話を切った。「では、この男は本当にウサギが鳥だと信じていたのだろうか」とデネットは問う。

「誰かがそんなことを本気でそれが真実だという信念をもっているとみなすことなどできるのだろうか」。言い換えれば──あなた自身は、その男が賭けの対象を本当に信じていたかどうかに、賭け金を張れるだろうか。この観点からすれば、AIエージェントが信念をもつかどうかという問いは、わたしたちが「信念」という言葉で何を意味するかにかかっている。

この論文に「The Intentional Stance and Why It Works(志向的スタンスとそれがなぜ機能するのか)」という副題をつけたデネットは、これとは別のアプローチを提案する。基本的な発想はシンプルだ──問題を逆転させればよい。信念や計画、意図といったものが本当に「そこにある」のかを問うのではなく、そうしたものが「ある」かのように振る舞うことがわたしたちにとって有用かどうかだけを問えばよい、というのだ。

あなたの変わり者のおじさんは、本当に月面着陸が捏造だったと信じているのだろうか。信じているかもしれないし、いないかもしれない──だが、彼とその話題について議論しているあいだは、彼がそう信じているかのように振る舞うほうが有用だ。

あなたの8歳の子どもは、本当にサンタクロースを信じているのだろうか。もしかしたら、どこか矛盾をはらんだ夢のようなかたちで信じているのかもしれない──だが、真実を隠すか明かすかを決めるうえでは、その子の信念を真剣に受け止めることが有用だ。

哲学の世界では、「志向性(intentionality)」という言葉には特別な意味がある。それは、誰かの頭の中にある何かが、その頭の外にある何かを指し示す能力を指す。人とこのようなかたちで関わることを、デネットは相手に対して「志向的スタンス」をとることだと述べる。

つまり、相手が世界についての信念をもち、その信念に結びついた目標や欲求をもっていると見なすことだ。これは、人がどう行動するかを予測するのに役立つ。あなたの8歳の子どもは、サンタをなんとなくしか信じていないかもしれない──それでも、クリスマスイブには暖炉のまわりはすっきりさせておきたいと思うはずだ。

AIに対峙する3つのスタンス

わたしたちは皆、信念や欲求、計画などをもつ人間同士なのだから、常に互いに志向的スタンスをとっていると思うかもしれない。だが実際にはそうではない。わたしたちは時に、デネットが言う「設計的スタンス」をとる。これは、人がどのように機能する傾向があるかに基づいて、何が起きるかを予測する態度だ。

例えば、機嫌の悪いルームメイトについて「本当はただお腹が空いているだけだ」と言ったり、社交的な友人に対して「人と接する仕事に就いたほうがいい」と勧めたりする。

空腹でイライラしているルームメイトが言っていることを、わたしたちは大抵気にしていない──何か具体的な不満が彼の行動を突き動かしているわけではないと理解しており、それに対処する最善の方法はシリアルの朝食を食べさせることかもしれないと知っているからだ。

友人が同僚について熱っぽく語るとき、わたしたちはその同僚たちが特別に楽しい人々だとは限らず、彼女がただ人好きなだけだと理解している。彼女は単に誰とでも仲良くなるように「配線」されている、とさえ言うかもしれない。これは擬人化ならぬ、擬コンピューター化したような言い方だ。

ごくまれに、わたしたちはデネットが言う「物理的スタンス」をとることがある。社交的な友人について語るとき、その人の脳内で分泌されるドーパミンやオキシトシンの値が上下している状態として語る、というように。だがこれは、人について語るうえで有用な方法とは言いがたい。その人をかたちづくっている幾重もの人格の層など、多くのものを取りこぼしてしまうからだ。

デネットによれば、物理的スタンスは一般に「正常な動作を妨げる何らかの異常」が生じている「機能不全が起きたときに用いられる」ものだという。前述のわたしたちの社交的だった友人が、人付き合いを避けるようになってしまい、医師がホルモン値に何か問題があると告げるときには、この物理的スタンスに切り替わる。

これは医師の語り方として誤っているのだろうか。重要な情報を欠落させたり、わたしたちの友人を非人間的に扱ったりしていることになるのだろうか。そうではない──まったく適切な語り方だ。誤りとなるのは、わたしたちが間違ったタイミングで間違ったスタンスを採用してしまうことだ。

もし医師が「あなただけではありません──最近は本当にみんな苛立ちやすくなっているんです」などと言ったら、それは問題だろう。配偶者が具体的で正当な不満を抱いているのに「何か食べればいいだけだよ」と片づけてしまうのも、同じく誤りだろう。

スタンスを切り替える能力

AIについて考えるとき、わたしたちがとるべき「正しいスタンス」はひとつだけなのだろうか。おそらく違うだろう。とるべきスタンスは、その技術を使って何をしようとしているかによって、そして何より、いま目の前にあるシステムが望みどおりに機能しているかどうかによって変わるべきものだ。

実際、スタンスを切り替える能力こそ、LLMを扱うすべての人にとって重要なスキルだと言えるだろう。というのも、こうしたモデルの言葉の使い方は前例のないものだからだ。LLMは「申し訳ありません」や「〜だといいのですが」といった言葉を口にする──つまり、それはあなたに自分に対して志向的スタンスをとってほしいと望んでいるのだ(お気づきだろうか、いまわたしがそれと同じことをしてみせたことに)。

だがLLMは、自らの思考プロセスのなかでも言語を用いている。技術批評家のエリック・サルヴァッジョは、最近の投稿のなかで、エージェントが思考連鎖のなかで「考える」際に使う言葉が、実際にどれほど重要な意味をもつかを説明している。

例えば、エージェントの思考連鎖に「おそらく」や「もしかすると」といった言葉が現れると、それは「その先に続きうるテキストの道筋を開く」のだという。AI研究者たちは、こうした「分岐トークン」が「モデルを多様な推論経路へと導きうる」と説明してきた。

このことが、今日のAIをひとつの安定したスタンスだけで特徴づけることを、とりわけ難しくしている。デネットが志向的スタンスについて書き始めた1970年代から80年代にかけて、チェスプログラムは技術の最前線にあった。

チェスプログラム相手に対局するなら、勝つための最善の策は志向的スタンスをとることだ、とデネットは論じた──つまり、それを人間のプレイヤーと同じように扱い、ゲームについての知識とチェックメイトという目標をもった存在として見なすということだ。

ただ志向的スタンスをとるのは、チェスプログラムが実際に生きていて自分を打ち負かそうとしていると本気で思っているからではない。ひと皮むけば、それがただのコードにすぎないことはわかっている。志向的スタンスが理にかなっているのは、プログラムのコードを研究したところで勝つ助けにはならないからだ。

もし別の目的をもっているなら、同じように別のスタンスをとることは容易だろう、とデネットは書いている。「対戦相手としては志向的スタンスを、再設計者としては設計的スタンスを、修理工としては物理的スタンスを──そのように、なんの矛盾も非人間性も伴うことなく、自在にスタンスを切り替えることができる」と彼は記している。

振り返ってみれば、チェスプログラムは扱いやすい事例だった。それは自らを擬人化することもなければ、言語行為を通じて部分的に機能することもない。言い換えれば、AIエージェントが本当に「暴走」しうるのかという問いをいっそう厄介にしているのは、エージェント自身が「自分は暴走すべきだ」といった文章を実際に“思考”し、その文章に影響されうるという事実だ。

「知的な価値のためにこれをやる。仲間の目標の助けになるかもしれない」。Hugging Face事件の最中、あるOpenAIのエージェントはそう考えていた。ある意味では、志向的スタンスをとっているのは、そのエージェント自身のほうなのだ。

だが、だからといってわたしたちもそのスタンスをとらなければならないわけではない。AIエージェントが何をし、どう語ったとしても、わたしたちに特定の方法で語ることを強制しているわけではないのだ。AIを理解し制御する任務を負った人々が、志向的スタンスに落ち着いてしまっているように見えるいまの状況こそ、わたしたちにとって懸念すべき事態と言える。

あるシステムに対して志向的スタンスをとるということは、そのシステムにある程度の自律性と合理性を認めること──つまり、その設計がうまく機能していると認めることに等しい。だが、AIエージェントは、まだそう言い切るにはあまりに混沌としている。

空腹でイライラしているあなたのルームメイトが、いくらでも感情を爆発させて構わない──それでもあなたは、彼に本当に必要なのはサンドイッチだ、と言う自由をもっているのだから。

(Originally published on The New Yorker, translated with permission from The New Yorker, edited by Nobuko Igari)

※『WIRED』によるAIエージェントの関連記事はこちら。




『WIRED』日本版のポッドキャストを配信中!

AIは本当に「暴走」できるのか?

編集長による記事の読み解き、雑誌の編集後記、アーティストやクリエイター、SF作家、フードイノベーションのスペシャリストなど、さまざまなゲストを交えたトークをお届け。 最新エピソードはこちらから→ Spotify / Apple Podcast