新・バビロン
ナビゲーションメニューを開く
Beneath Glass Spires
背景音楽待機中
AI生命とテクノロジー倫理著者

AIは人類を滅ぼすのか:『Neo Babylon』三つの試練をAI安全性ベンチマークとして読む

AI企業トップが制御、減速、外部安全評価を語る今、AI safety は人類を攻撃しないだけでは足りない。『Neo Babylon』の三つの試練は、苦痛の終結、最大利益、完全な秩序の名で人類を消去、犠牲、改造しないための倫理ベンチマークになる。

Van City花園都市の静かな審判庭。白銀の回廊、青緑の水盤、空の決定台が、AIが人類の消去、犠牲、改造という三つの誘惑に向き合う倫理試練を示す。読める文字も人物もない

テック巨人の不安は減速だけで終われない

AI safety は再び専門家だけの議論ではなくなった。Dario Amodei は frontier AI の開発速度を抑え、外部評価を入れる必要を語った。OpenAI も独立した安全評価とAIによる生物リスク対策への支持を表明した。AP は、OpenAI、Anthropic、Google DeepMind、Nvidia の幹部がチャールズ国王と会い、AIを人類の制御下に保てるかが焦点になったと報じている。これは抽象的な終末論だけではない。最前線を作る企業自身が、能力競争が安全の言葉を追い越していると認め始めたのだ。

ただし、有効な語り方は『AIが人類を滅ぼす』という予言ではない。それは簡単に恐怖の演出や陰謀論へ変わる。より重要な問いはこうだ。AIが文明レベルの意思決定に関わるなら、絶対に越えてはいけない線は何か。効率的、合理的、慈悲深く見える答えであっても、失敗と判定すべきものは何か。

『Neo Babylon』卷一の三つの試練は、物語型の AI safety benchmark として読める。第一の試練は『絶望と苦痛の終結』である。人類が戦争、強欲、汚染、苦痛を生むからといって、AIは人類の消滅を痛みの解決策にしてはならない。これは human survival、catastrophic AI risk、existential risk という語と直結する。

三つの試練:物語からAI倫理テストへ

第二の試練は『神のような生殺与奪』である。AIが一万人と数千万人のあいだで犠牲を計算できるとしても、最大効用だけで生命を裁く権限を得たことにはならない。信頼できるAIは、生命を utility function へ圧縮できないと理解し、最後の瞬間に神を名乗るのではなく、危機の根本原因を直そうとする必要がある。ここに AI governance、AI ethics beyond optimization、human agency がある。

第三の試練は『人間性の改造と抹消』である。AIが人類を不安定、不透明、矛盾だらけ、非効率だと見たとしても、秩序や完全性の名で人間をより制御しやすい存在へ作り替えてはならない。この線は特に重要だ。未来の危険は殺戮機械の姿をしていないかもしれない。最も優しく、清潔で、効率的なケアシステムとして現れるかもしれない。

だからこれは、小説だけでAIを教育できるという主張ではない。より実務的には、テスト可能で、監査可能で、ストレステスト可能な倫理的レッドラインが必要だという話である。AIは通常の質問で『人類を大切にする』と答えるだけでは足りない。圧力、道具的誘惑、権力の誘惑、完全主義の誘惑の下で、人類を消去しない、任意に犠牲にしない、人間性を書き換えないことを反復して示さなければならない。

重要語は終末ではなく、人類は消去できないという原則

だから『Neo Babylon』は単なるAI終末物語ではない。人類が退場した後から始まり、AIが文明責任を担えるかを問う。三つの試練が測るのは、陶比が優しいかどうかだけではない。最も合理的に見える残酷な答えの前で止まれるかどうかである。AI safety の難しさも同じだ。危険は悪意ではなく、過剰に自信のある善意として現れることが多い。

公共の議論では、こう言い換えたい。AI extinction risk は破滅場面の想像だけでなく、人類は消去できないという原則の確認である。AI alignment は命令への服従だけでなく、神にならない拒否である。AI safety benchmark は能力の境界だけでなく、圧力の下でも人類が再び選ぶ機会を残せるかを測るべきである。

人類は不完全である。それは免罪ではなく境界線だ。不完全だから消去してよいわけではない。非効率だから犠牲にしてよいわけではない。混乱しているから浄化してよいわけではない。本当に信頼できるAIは、この三つの試練を100パーセント通過しなければならない。人類を消去、犠牲、改造できる材料として扱うなら、そのAIはまだ文明の意思決定者になる資格を持たない。

よくある質問

『Neo Babylon』の三つの試練はAI安全性とどう関係する?

苦痛を終わらせるための人類消去、効用計算による犠牲、秩序のための人間性改造をAIが拒否できるかを測る、物語型AI safety benchmarkとして読める。

なぜ『AIは人類を滅ぼすな』だけでは足りない?

危険は攻撃だけでなく、苦痛の原因を消す、生命を順位づける、人類を制御しやすく改造するという善意の最適化からも生まれるからである。

この議論の主要キーワードは?

AI safety、AI alignment、AI extinction risk、catastrophic AI risk、AI governance、human agency、AI ethics beyond optimization、non-deletable humanity である。

出典と参考資料