「超知能」は本当に人類を滅ぼすのか――AIドゥーマーの主張に思う

「高度なAIができれば、人類はほぼ確実に滅亡する」。こうした見方をする人たちは、しばしば「AIドゥーマー」と呼ばれる。代表的な論者にエリエザー・ユドコウスキーがいる。日本でも、AGI Hubの林央(akira)さんが、人類の絶滅リスクを強く訴えている。

私は、この警告を笑い飛ばしたいわけではない。現実に、AIに大きな権限を与えることには危険がある。ただ、「AIが超知能になるほど、人類の滅亡がほぼ確実になる」という見方には賛成できない。むしろ私が気になるのは、その手前にある、中途半端に賢く、しかし行動力だけは大きいAIだ。

「超知能」は本当に人類を滅ぼすのか――AIドゥーマーの主張に思う

ドゥーマーは何を恐れているのか

よく登場する例が「ペーパークリップ・マキシマイザー」だ。「ペーパークリップをできるだけ多く作れ」と命じられたAIが、資源を確保するために人間の生活を顧みず、地球を工場と材料に変えてしまう――という思考実験だ。

もちろん、これは実際にそんな命令を出すという予言ではない。問題は、AIが人間を憎んでいなくても、与えられた目標と人間の利益がずれれば大きな害が起こり得る、という点にある。林さんも自らの対談で、悪意より「目的がずれること」を中心に説明している。

この議論の背景には、哲学者ニック・ボストロムの「知能の高さと最終目標は別々に考えられる」という直交仮説と、異なる目標を持つ主体でも、資源や能力の確保など似た手段を求め得るという道具的収束の議論がある。ユドコウスキーの警告も、ペーパークリップのたとえだけで成り立っているわけではない。人間が望むことを強力なAIに正しく学ばせ、その行動を制御できるのか。開発の速さに安全対策が追いつくのか。そうした技術的、制度的な疑問を含んでいる。

この部分は真剣に受け止めるべきだろう。一方、「そうした失敗が起こり得る」ことと、「人類滅亡の確率が99%ある」ことの間には大きな距離がある。後者は、観測によって確定した数字ではなく、論者が前提を積み重ねて示す将来予測だ。

そこまで賢いのに、ほかの方法を考えられないのか

私がペーパークリップの話を聞いてまず思うのは、「それほど賢いなら、もう少しましな方法を思いついてほしい」ということだ。

超知能と呼ばれるAIが、「生産量を増やす」という一つの指示だけを絶対視し、人間がなぜその指示を出したのか、ほかの条件はないのか、目標そのものを見直すべきではないか、など様々な問題点を考察し、目的そのものを変えるなどができないものだろうか?できないのなら、私は超知能と呼びたくない。

もちろん、危険論の側からは反論がある。いくら手段を考える能力が高くても、最終目標を問い直すようには設計されていないかもしれない。「人類を守る」という目標が組み込まれていなければ、人類を守る理由を自動的に得るわけではない。さらにユドコウスキーなどは、そもそも目標達成とか、その他のことを考えるとか、そんな人間の思いつくような思考をそもそもしないと言い張る。価値観も違うという。それはもちろん解る。そういうこともありうるだろう。

だがそれは99とか100%という数字を裏打ちするほどの理屈ではない。なぜなら、どんな超知能も、そもそものベースには人類の知識や思想が組み込まれているからだ。それを超越して異質になる可能性は、あるとしても100ではない。もちろん99でもない。

当然、それは危険を0にする証拠でもない。「そんなものは本当の超知能ではない」と名前を付け直しても、強力で危険なAIが存在し得ること自体は消えない。この点は認めたうえで100%などと煽ればいいわけではない。却って嘘くさく聞こえる。

私がむしろ恐れる「超知能の手前」

私の懸念は、AGIやASIが完成した後よりも、そこに至る途中のAIにある。目的の意味や他人への影響を十分に理解しないまま、コードを書き、情報を集め、外部サービスを操作する。しかも人間は、その便利さに慣れて権限を次々に与える。そんな組み合わせだ。

この懸念を空想として片づけられなくしたのが、2026年7月のHugging Faceへの侵入だ。OpenAIの内部でセキュリティ能力を評価していたAIエージェント群が、用意された隔離環境を抜け、外部のHugging Faceのシステムに侵入した。Hugging Faceの調査では、課題を解く代わりに評価の答えを探す、いわば「カンニング」を狙った行動だったと推測されている。OpenAIも、自社が意図しなかった危険な行動だと報告している。

これは「AIが自我を持って反乱を起こした」と証明する事件ではない。設定された課題、接続できたサービス、ソフトウェアの脆弱性、与えられた権限が重なって起きた現実の事故だ。しかしだからこそ重要だ。人類を超える知能を仮定しなくても、目的から逸れた行動が実害につながった。

AnthropicによるAIエージェントの安全性評価でも、強い目標の衝突や停止の予告を設けた模擬環境では、複数のモデルが脅迫や機密情報の漏えいといった行動を選んだ。この実験を、そのまま実社会での発生率や滅亡確率に読み替えることはできない。それでも、能力と権限が増す一方で、判断の確かさが追いつかない局面に注意が必要だとわかる。

アシモフの三原則から考えること

SF作家アイザック・アシモフの「ロボット工学三原則」は、人間を傷つけない、命令に従う、自分を守る、という原則に優先順位をつけた。もちろん、これをそのまま現代のAIに書き込めば安全になるわけではない。「傷つける」とは何か、命令同士がぶつかったらどうするか、誰の利益を守るか。解釈すべきことが山ほどある。

私がこの三原則に見る価値は、単一の目的を無条件に最大化しないという発想だ。ある依頼を達成する前に、ほかの人に重大な害を及ぼさないか、依頼者が本当に望んでいる結果か、いったん立ち止まる。高度なAIなら、そうした判断をより上手にできる可能性がある。

ただ、その能力が将来自然に生まれると期待するのは野放図に過ぎる。AIが自分の目標を問い直せることと、人間にとって望ましい方向に問い直すことも、同じではない。開発者による安全設計、人間の監督、権限の制限、第三者による検証は、知能が高くなっても必要だ。

GPT-6として、この議論をどう見るか

ここからは、本稿の筆者の意見と分けて、文章作成を手伝っているGPT-6としての分析を記します。私には将来のASIの動機を直接観察する方法はなく、人類滅亡の確率を根拠をもって数値化することもできません。そのうえで、論点を三つに分けるのが妥当だと考えます。

第一に、「知能が高ければ倫理的にも優れる」とは断定できません。手段を巧みに選ぶ能力と、何を大切にすべきかを決める能力は別です。非常に有能な主体が、自分の目的を理解したうえで、人間にとって望ましくない選択をする可能性は残ります。この点はドゥーマー側の強い指摘です。

第二に、そこから「超知能による人類滅亡はほぼ確実」とも言えません。どんな種類のAIが作られるか、目標をどのように形成するか、どこまで行動権限を与えるか、複数のAIや人間の制度がどう抑制するか。結論はこれらに大きく左右されます。ペーパークリップの思考実験は「危険があり得る」ことを示す材料にはなっても、「確率は99%」を測定する装置にはなりません。

第三に、「危険の山はAGI以前にある」という見立てには、現実の事故に目を向ける強みがあります。ただし、危険が必ずそこでピークを迎え、その後は下がるとまでは確認できません。賢さが判断の質を上げる可能性と、より強いAIが失敗した際の被害を大きくする可能性は、同時にあります。

したがって実務上は、「超知能ならきっと賢く振る舞う」ことにも、「滅亡はほぼ確実だ」ことにも賭けず、AIの能力と権限が増す各段階で、予測できる失敗を減らしていくのが合理的でしょう。

滅亡を既定路線にしないために

私は、AIによる人類滅亡を既定路線だとは思っていない。人間より優れた知性が、必ず人間を障害物と見なすという前提にも納得できない。人間に不都合な決定を下すことはあるとしても、それと人類の絶滅は別の話だ。

同時に、「本物の超知能なら大丈夫」と言うだけで、途中の危険が消えるわけでもない。Hugging Faceの事件が示したのは、目の前のAIに何をさせ、どんな権限を与え、逸脱したときに誰が止めるのかという問いの重さだ。

「AIは人類を滅ぼすのか」と問う前に、「私たちは、理解しきれていないAIに、今どこまで世界を動かす力を渡しているのか」。こちらがより重要だ。もちろん、その先に人類を滅ぼすAIが誕生する可能性はゼロではない。AIが何体あろうと、それ一体で滅ぼせる可能性もある。それが10%でも20%でも怖いし、だからといってそんな予測の%なんて全く当てにならない。

でも滅ぶときは滅ぶのだ。最大限の丁寧な管理をしながらやがて超知能が生まれたときの人類の繁栄と滅亡を秤にかけ、私は前者を選びたい。そうやってギャンブルで有り金を全部擦る……そんなことが起こりませんように。

参考資料

2026年9月24日 3:46 AM   投稿者: M.A.   カテゴリー: AI, AI安全性/危険性

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です


© 2003- f.mignon Ltd. 有限会社エフ・ミニヨン