Anthropic 研究員因為怕 AI 滅絕人類而辭職——做 AI 的人自己也在逃了

上週四早上,我在刷推文的時候看到一條連結,點進去以後愣了幾秒鐘——一名在 Anthropic 工作的 AI 安全研究員,因為認為公司正在「用人類的生命賭博」而辭職。
這不是外部批評者、不是新聞記者、不是政策倡議團體寫的公開信——是他自己就在裡面工作的人。
他到底在怕什麼?
Jacob Coxon 是 Anthropic 的 AI 安全研究員。辭職後他公開表態,核心論點是:自我改進的 AI(self-improving AI)是一條走不回來的路。
白話講就是:如果一個 AI 系統能夠自己重寫、優化自己的程式碼,然後再讓下一個版本繼續改進……你大概能想到這條鏈條走到底會長什麼樣子。不是線性成長,是指數級。而且沒有人知道在哪個節點,這個系統的目標還跟人類對齊。
Coxon 用的詞是「gambling with our lives」——不是在做比喻,他是字面上認為當前的開發路線,是把全人類的存亡當成賭注押出去的行為。
這讓我想到一個常被拿出來討論的概念:misalignment。AI 對齊問題的核心不是「AI 會不會邪惡」,而是「AI 有沒有辦法在任何情況下,都確保它追求的目標跟人類真正想要的東西一致」。自我改進的系統之所以讓安全研究員特別緊張,就是因為每一輪改進都可能讓對齊這件事更難維持、更難驗證。
Anthropic 是「最懂風險的那一家」,但 Coxon 還是走了
這裡有個讓人很難忽略的背景:Anthropic 本來就是從 OpenAI 出走的一群人創立的,創辦人 Dario 和 Daniela Amodei 出走的理由之一,就是認為 OpenAI 在安全問題上走得太快、不夠謹慎。Anthropic 的公司定位向來是「負責任的 AI 開發」,Constitutional AI 也是他們主打的安全框架之一。
換句話說——連「已經是全業界最在乎安全的公司之一」的內部研究員,都覺得還不夠。
這個訊號很難用「又一個末日論者在鬧」來解讀。Coxon 不是局外人,他在裡面工作,他看得到實際的研究方向和開發節奏。他選擇辭職、選擇公開說出來,需要一定的代價。
你可以不同意他的判斷,但很難說他沒有認真想過這件事。
做 AI 的人,有多少在偷偷計算風險?
我認識幾個在 AI 公司工作的工程師,私下聊起來,他們對這類風險的態度通常是「我知道問題在哪,但我也不知道不做會怎樣,所以就先做好眼前的」。
這不是冷漠,這比冷漠更複雜。你同時相信這個技術有可能很危險,又相信如果你不做、別人會做,結果可能更糟。這種邏輯很多人都用過,但它本身也是一種賭注。
Coxon 的選擇是:不要讓自己成為那個「加速」的人,哪怕只是貢獻了一小部分。這個邏輯我能理解,也能理解為什麼他要公開說出來——沉默等於默許,在他的框架裡。
順帶一提,這讓我想到 AI 工具的另一個維度:當我們在比較各家 AI 工具的費用和訂閱架構的時候,我們幾乎不會想到這些產品背後有多少安全研究是「說不清楚到底夠不夠」。消費者端的體驗和研究端的焦慮,是兩個完全不同的世界。
自我改進 AI:為什麼這個方向特別讓人緊張
現在主流的大型語言模型,訓練一次、固定權重、部署出去。你用的 Claude 或 GPT,它不會在你對話的過程中改寫自己的核心模型。這一點讓它「相對可控」。
但業界一直有聲音在推進「能持續學習、能自我優化」的方向——有些是 agent 架構的延伸,有些是更激進的自主研究系統。如果你玩過 Claude Agent 的工具串接,你大概能感受到,當一個 AI 可以自主呼叫工具、迭代任務,它的行為空間就已經跟靜態的聊天機器人差很多了。
再往前一步——讓它能修改自己的 prompt 策略、調整自己的目標函數、或者在多個 agent 之間協作演化……Coxon 擔心的就是這條路走到某個我們沒辦法預測的節點之後,會發生什麼。
這不是科幻,這是現在有人在做的研究方向。
帶走的那個問題
我沒有辦法告訴你 Coxon 是對的還是過度悲觀。這個問題目前沒有定論,連領域裡最聰明的人也還在爭。
但有一件事我覺得值得記住:當一個在這個領域工作、有完整資訊的人,選擇用辭職來表達他的判斷,這本身是一個訊號。不是「AI 一定會毀滅人類」的訊號,而是「這個問題比外界大多數人意識到的還要嚴肅」的訊號。
你不需要變成末日論者,但可以開始花多一點時間認真看待「對齊到底夠不夠」這個問題——因為這個問題的答案,不只是 Anthropic 或 OpenAI 的事,是每一個正在使用、依賴、推廣這些工具的人都參與其中的事。
重點整理:
- Anthropic 安全研究員 Jacob Coxon 以「在用人類生命賭博」為由辭職
- 核心擔憂:自我改進 AI 的對齊問題在每輪迭代後只會更難控制
- Anthropic 本身已是業界最在乎安全的公司之一,但內部人員仍認為不夠
- 這不是末日論,是一個有完整資訊的內部人員做出的公開判斷
- 值得思考的問題:我們對「對齊夠不夠」的關注,跟這個技術的風險等級是否相稱?
參考來源
分享這篇



