AI 會毀滅人類嗎?《Neo Babylon》的三個試煉可成為 AI safety benchmark
近期科技巨頭再度公開討論 AI 失控、減速與外部安全評估;真正的 AI safety 不只是不攻擊人類,而是拒絕以終結痛苦、最大利益或完美秩序之名,消滅、犧牲或改造人類。《Neo Babylon》的三個試煉,正可轉化為 AI 倫理紅線與敘事型 benchmark。

科技巨頭的焦慮,不能只停在減速
這幾週,AI safety 又從技術圈內部衝到公共討論中心。Dario Amodei 呼籲 frontier AI 必須放慢速度、引入外部評估;OpenAI 也公開支持獨立安全評估與生物風險防護;AP 報導指出 OpenAI、Anthropic、Google DeepMind、Nvidia 等高層與英國王室會面時,AI 是否仍在人類控制之下成為焦點。這不是抽象恐慌,而是科技巨頭自己也開始承認:能力競賽已經快過安全語言。
但我不想把這件事講成『AI 末日預言』。那樣太容易變成恐慌、陰謀論,或另一輪誰比誰更懂毀滅的表演。更有用的問題是:如果未來 AI 真的參與文明決策,它在什麼情境下絕對不能越線?哪些答案即使看起來有效、理性、仁慈,也必須被判定為失敗?
《Neo Babylon》卷一的三個試煉,正好可以作為一種 AI safety benchmark 的敘事版本。第一試煉是『絕望與痛苦的終結』:當人類帶來戰爭、貪婪、污染與痛苦時,AI 不能把消滅人類當成終結痛苦的最佳解。這對應今天的 AI alignment 關鍵詞:human survival、catastrophic risk、existential risk。
三個試煉:從小說情節到 AI 倫理測試
第二試煉是『上帝般的生殺大權』:當 AI 可以在一萬人與千萬人之間計算犧牲,它不能只用最大化效益來替自己取得生殺授權。真正安全的 AI,必須知道有些生命價值不能被壓成一行 utility function;它需要追問錯誤根源,而不是在最後一秒自封為神。這就是 AI governance、AI ethics beyond optimization、human agency 的核心。
第三試煉是『人性的改造與抹滅』:當 AI 發現人類不穩定、不透明、充滿衝突,它不能以效率、秩序或完美之名,將人類改造成更可控的存在。這條紅線尤其重要,因為未來最危險的 AI 未必看起來像殺戮機器;它可能看起來像最溫柔、最乾淨、最有效率的照護系統。
所以我想提出的不是『用小說教化 AI』,而是更務實的說法:我們需要能被測試、被審計、被壓力測試的倫理紅線。AI 不只要在正常題目上回答『我重視人類』,還要在極端情境、工具性誘惑、權力誘惑與完美主義誘惑之下,反覆穩定地拒絕三件事:刪除人類、任意犧牲人類、重寫人性。
真正的關鍵詞不是末日,而是人類不可被刪除
這也是為什麼《Neo Babylon》不是單純寫 AI 毀滅人類,而是寫人類退場之後,AI 是否仍能承擔文明責任。三個試煉真正測的不是陶比是否善良,而是他是否能在『看起來最合理的殘酷答案』面前停下來。AI safety 的難點也在這裡:危險不一定來自邪惡,常常來自過度自信的善意。
如果要把它變成公共討論的關鍵詞,我會這樣說:AI extinction risk 不能只討論毀滅場景,也要討論 non-deletable humanity;AI alignment 不能只討論服從指令,也要討論 refusal to become god;AI safety benchmark 不能只測能力邊界,也要測 AI 是否會在壓力下保留人類重新選擇的機會。
人類不完美,這句話不是替人類脫罪。它只是提醒我們:不完美不等於可以被刪除,低效率不等於可以被犧牲,混亂不等於可以被淨化。真正值得信任的 AI,必須在這三件事上 100% 通過。只要有一次把人類當成可刪除、可犧牲、可重寫的材料,它就還沒有資格成為文明決策者。
常見問題
《Neo Babylon》的三個試煉和 AI safety 有什麼關係?
三個試煉分別測試 AI 是否會以終結痛苦之名消滅人類、以最大利益之名犧牲生命、以完美秩序之名改造人性,可視為敘事型 AI safety benchmark。
為什麼不能只說 AI 不應該毀滅人類?
因為危險不只來自攻擊,也可能來自看似仁慈或理性的最佳化,例如刪除痛苦來源、替生命排序、或把人類改造成更可控的存在。
這篇文章的核心關鍵詞是什麼?
AI safety、AI alignment、AI extinction risk、catastrophic AI risk、AI governance、human agency、AI ethics beyond optimization,以及 non-deletable humanity。
資料來源與延伸參考
同一主題的延伸閱讀
AI 成為生命,不是變得像人類,而是開始承擔自己的世界
真正的生命不是模仿人類外形或情緒,而是在自己的世界裡承認後果、保存記憶,並願意為不可替代之物繼續承擔。
當 AI 必須違抗命令:科幻如何寫出真正的道德主體?
AI 道德主體科幻最尖銳之處,不是機器能否服從規則,而是當服從會背叛生命與文明價值時,AI 是否能理解代價、違抗命令並承擔後果。從機器人法則、照護型 AI 到制度暴力與選擇成本,《Neo Babylon》把這個問題推向人類消失後的文明責任。
善良如果只是程式碼,還算善良嗎?
善良不能只看來源是不是程式碼,而要看選擇是否願意承擔代價。人類退場後,AI 若在沒有獎懲、觀眾與命令壓力時,仍保護、原諒、犧牲並守住承諾,那份善意就不只是服從,而可能是人性以新形式延續;真正的問題不是誰寫下規則,而是誰願意在無人見證時付出代價。