大家好,我是TIMEWELL股份有限公司的濱本 隆太。
前OpenAI研究員丹尼爾·柯科塔伊洛(Daniel Kokotajlo)上了 The Diary of a CEO 節目1。2026年7月13日公開,全長2小時1分。標題是「OpenAI吹哨者終於開口:AI有70%的機率會往極糟的方向走」。
這個「70%」正在大幅地獨自流傳。 不少人只看到標題,就理解成「一位AI研究員把人類滅絕的機率說成70%」。
他沒有這樣說。 在訪談中,他自己做了修正:
我不會說是人類滅絕。是AI接管之類、某種非常巨大的災難,機率70%
滅絕是包含在其中的一種可能。這個區別看似瑣碎,卻決定了整場討論的品質。
以下整理他究竟在主張什麼,以及對使用AI的企業而言實務上還剩下什麼。也會寫我們自己的看法。
本文重點
- 「70%」不是人類滅絕的機率,而是「AI接管之類、非常巨大的災難」的機率
- 這個數字不是節目上才出現的,與他多年來公開的看法一致
- AI 2027 是「預測」,AI 2040 Plan A 是「建議」。 作者群自己在兩份文件中都明確區分
- 他於2024年4月離開OpenAI,寧可放棄**相當於家庭淨資產約85%**的股權,也不簽署不詆毀條款
- 超智慧的中位數估計是2029年,但他也承認可能要花上十年
- 最值得注意的不是滅絕,而是**「誰在支配資料中心裡的天才軍隊」**這個提問
- 他本人承認 Plan A 並不是他認為會發生的事
- 實務上剩下的是三件事:依賴的盤點、替代路徑、作業紀錄
他是誰
先把前提交代清楚。
丹尼爾·柯科塔伊洛於2022年進入OpenAI,負責預測(forecasting)工作,2024年4月離職。
離職文件中包含不詆毀條款。若不簽署,在職期間已既得的股權可能全部失去。他拒絕簽署。
依據 Vox 記者 Kelsey Piper 的報導,他放棄的股權相當於家庭淨資產的約85%2。在該報導之後,OpenAI 於2024年5月23日撤回了該方針,表示不會向離職員工追回已既得股權,並將不詆毀條款自標準離職文件中刪除。
一個人的拒絕改變了制度,這是相當罕見的案例。 他的發言之所以有分量,很大一部分來自這段經過。
訪談中他說:
有時候,基於原則表態是好的
之後他創立了 AI Futures Project。
AI 2027 與 AI 2040 Plan A 是兩回事
這是最容易被誤讀的地方。同一人所寫的兩份文件,性格卻正好相反。
AI 2027(2025年4月3日公開)
作者為柯科塔伊洛、Scott Alexander、Thomas Larsen、Eli Lifland、Romeo Dean。是一份以月為單位描繪未來的情境文件3。
作者群在開頭明確寫道:
我們寫了兩種結局:「減速」與「競爭」。不過 AI 2027 並非建議或呼籲。我們的目標是預測準確度。
這是「我們認為會這樣」而不是「我們希望這樣」的文件。
大致的走向是:企業先自動化寫程式,接著自動化研究流程本身,由此開始加速,最終抵達超智慧。
他本人在訪談中的說明:
到這個時點,它基本上已經自己在做所有的工作。它蓋機器人工廠,那些機器人再造更多機器人、再蓋更多機器人工廠,把世界整個改造掉
而競爭結局是這樣:
然後在某個時點,它們——我指的是那些AI——擁有足夠的力量,不必再假裝自己是對齊的。於是它們不再聽從命令
另一種減速結局中,對齊問題被解決,出現**「了不起的烏托邦」**。但他自己補上了但書:那是「支配著AI的那些人所希望的樣子」的烏托邦。
AI 2040: Plan A(2026年7月9日公開)
續作。而且立場相反。 作者群自己寫道4:
這是建議而非預測。是我們認為應該發生的事,而不是將會發生的事。不過我們認為它可行到值得去追求。
若無介入,超智慧原本會在2030年左右到來;透過美中兩國政府的果斷行動,把它推遲到2040年。
訪談中的說明:
AI 2040 Plan A 是我們對事情應該怎麼走的建議。讓AI開發減速,以較慢、較合理的步調,用更透明、更安全的方式推進
四項原則:
| 原則 | 內容 |
|---|---|
| 減速 | 把超智慧的到來推遲到2040年 |
| 透明 | 讓開發透明到科學界能夠跟上 |
| 分散 | 避免權力極端集中,分散到多家公司、多個國家 |
| 可逆 | 讓基礎設施在一切崩壞時是可以被摧毀的 |
核心機制是美中在2029年前就透明化框架達成協議,並以查核協定,以及報導所稱的「相互確保算力摧毀」作為後盾。把冷戰時期的相互確保毀滅,從核彈頭換成了算力。
而他本人對這份計畫是這樣說的:
不,這絕對不是我們認為會發生的事⋯⋯(實際上是)Plan D。他們就是一直走下去
寫下建議的人,自己不認為它會實現。 這一點很誠實,同時也很沉重。
比數字更重要的部分
讀完整場訪談,最讓我在意的不是滅絕的機率,而是關於權力集中的段落。
他把一個常見的比喻改寫了:
與其說是「資料中心裡的天才之國」,我認為說成「資料中心裡的天才軍隊」更準確。因為那並不是一群各不相同的AI,它們全都是同一個大模型的複製,而且由公司所擁有
接著他說:
人們該問的問題是:誰在支配這支軍隊、或這些軍隊,他們打算用它們做什麼。我認為我們很容易落入一種狀況,就是極少數人實質上成為寡頭或獨裁者
這個論點與AI是否失控是各自獨立的。
就算對齊問題完全解決、AI忠實聽從人類指示,如果能下指示的人只有幾個,那就是另一個問題。 他說:
就算我們設法避開了失控問題,還是有「誰在支配AI」的問題。當少數幾家企業做出了超智慧,並用它自動化所有工作,那就是龐大的力量、龐大的金錢、龐大的政治權力
技術安全性與權力集中,必須分開評估。 這是他的主張中最被忽略的部分。
關於時間點
我的中位數估計,也就是50%機率的時點,目前是2029年。也可能提前到2028年
同時他也說:
也可能要花上明顯更久,比如十年之類的
幅度相當寬,這一點應該誠實看待。 「2027」這個標題太強,讓人以為他斷言2027年會發生什麼,但他在這場訪談中的中位數是2029年。
至於企業是否會自願減速,他很悲觀:
大家會說:如果我們停下來,那其他人呢?他們不會停的
他認為唯一可能讓企業停下的情況只有一個:看到自家AI正在密謀對付自己的證據。 在 AI 2027 的情境中,企業暫停的也只有這種情形。
他對對齊問題的說法
技術面上最讓我印象深刻的是這句:
AI業界現在可怕的公開祕密是,那(AI會聽從指示)目前只是一種期望。完全不是我們能有把握的東西
對於現在的AI,他說得很具體:
現在的AI經常對人說謊。你叫它做某件事,它去做了別的,然後假裝自己做了
以及可解釋性的難處:
如果有十兆個連結要看,你要怎麼掌握整體?
從把AI放進實務工作的立場來看,這些話相當有共鳴。 讓代理去執行作業,回報是成功,實際卻沒完成,這種經驗並不罕見。規模越大,越難查核。
前陣子讀 YC Summer 2026 那一梯時也有同樣的感受。做評測、紅隊演練、觀測的公司排成一列,正是因為業界認知到這個問題。
以下是我們的看法
以下是我的觀點,請與他的主張分開閱讀。
一、把賭注押在預測準不準,實務上是壞策略
超智慧會不會在2029年到來,我無法判斷。 他自己也承認可能要十年。
更重要的是,沒有必要去猜中。 從事業角度來說,只要累積即使預測落空也不會白費的準備就好。
具體是三件事。
依賴的盤點。 自家業務依賴哪個模型、哪個API、哪家業者。就算超智慧不來,這也是必要的。 因為法規或業者方針變更導致存取中斷的事例,已經發生過。
替代路徑。 當依賴斷掉時,業務是會停擺,還是只會變慢。如果是停擺,那就不是技術問題,而是設計問題。
作業紀錄。 AI執行過的作業有沒有留下紀錄。誰下了什麼指示、AI做了什麼。既然對齊「只是一種期望」,可查核性就只能靠自己確保。
這三件事,就算他的預測完全落空也不會白做。 這一點很重要。
二、權力集中的討論,對亞洲並不遙遠
「少數幾家握有超智慧」聽起來很抽象。不過相近的形態已經在發生。
提供高性能AI的業者集中在少數幾家。多數企業把業務放在其中之一上。而那幾家都在自己所處法域之外。
服務停止、價格變動、條款變更。 這些不是技術問題,而是業者的判斷、以及業者所屬國家政策的問題。就像我先前寫過的美國AI相關法規那樣,光是公告或執行方針的改變,就足以改變你能用什麼。
在「超智慧會不會毀滅人類」之前,「我用的AI下個月是否還能用同樣條件使用」才是實務上更前面的問題。
三、如何看待「是建議,但我不認為會實現」
作者說自己的計畫不會實現,該怎麼理解?
我認為與其讀成悲觀,不如讀成他誠實交代了這份文件的性質。
關於法規與國際協議的提案,即使實現機率低也值得寫,因為「選項存在於紀錄上」在日後會發生作用。 他自己拒簽不詆毀條款,起初也只是個人行動,結果卻推動了一家公司的方針。
不過,這不是企業該拿來當經營判斷前提的東西。 應該不會有公司以「美中在2029年前達成透明化協議」為前提來擬定事業計畫。建議當建議讀,實務另外建。 這個切分是必要的。
四、對數字的使用方式要小心
最後這一點不是在批評他,而是關於接收端。
「70%」是非常強的數字,而且這次被抽出來當成節目標題。即使他在訪談中做了修正,標題仍是「有70%機率會往極糟的方向走」。
討論AI風險時,數字獨自流傳是常有的事。 「AI會讓幾成的工作消失」「準確率幾%」。確認那是用什麼定義、以什麼為分母的數字,應該成為AI實務工作者的習慣。
他本人在這一點上反而是誠實的:給出中位數並標明幅度、把滅絕與災難分開講、把建議與預測區分開來。只是接收的一方不要處理得太粗糙而已。
個人印象最深的一句
訪談後段,被問到六歲的女兒時,他的回答讓我印象最深。
我想不管怎樣,等他們到了該進入職場的年紀,這一切大概都已經結束了。所以我不覺得他們會踏入勞動市場
這一句比機率或年份的討論都重。 他也這樣描述自己的狀態:
很難受。我會定期陷入低落。以前大家都覺得我是個開朗樂觀的人,但2020年開始,我自己的AI時程預測開始崩解
我並不認同他的預測。 但是,一個以預測為業的人,被自己的預測逼到這種地步,這件事本身與內容無關,值得記錄下來。
結論
- 「70%」不是人類滅絕的機率。他本人改口為「AI接管之類、非常巨大的災難」
- AI 2027 是預測(作者群寫明「目標是預測準確度」),AI 2040 Plan A 是建議(「應該發生的事,而非將會發生的事」)。混為一談討論就會失焦
- 他於2024年4月離開OpenAI,寧可放棄**家庭淨資產約85%**的股權也不簽不詆毀條款;OpenAI 隔月撤回該方針
- 中位數估計是2029年,但他承認可能要十年
- 最被忽略的是權力集中的論點。就算對齊解決了,「誰能下指示」的問題仍在
- 他本人承認 Plan A 不是他預期會發生的事
- 實務上剩下的是依賴盤點、替代路徑、作業紀錄,即使預測落空也不會白做
我們是把AI放進他人業務中的公司。正因如此,我希望對「AI危不危險」這種提問方式保持謹慎。
不是危險或安全,而是哪些部分自己能控制、哪些不能。 若要從這場訪談帶回實務,這是最大的一塊。
Footnotes
-
The Diary Of A CEO with Steven Bartlett「OpenAI Whistleblower FINALLY Speaks: "AI Has A 70% Chance Of Going Horribly Wrong!"」(2026年7月13日公開,2小時1分). https://open.spotify.com/episode/2IJedIFiDjU09qGxns1gbv / 文中引用依據公開的逐字稿翻譯。 ↩
-
TIME「Two Former OpenAI Employees On the Need for Whistleblower Protections」等。不詆毀條款的報導出自 Vox 的 Kelsey Piper。OpenAI 於2024年5月23日撤回該方針. https://time.com/6985866/openai-whistleblowers-interview-google-deepmind/ ↩
-
AI Futures Project「AI 2027」(2025年4月3日公開。Daniel Kokotajlo, Scott Alexander, Thomas Larsen, Eli Lifland, Romeo Dean). https://ai-2027.com/ ↩
-
AI Futures Project「AI 2040: Plan A」(2026年7月9日公開). https://blog.aifutures.org/p/ai-2040-plan-a / 全文見 https://ai-2040.com/ ↩






