AIセキュリティ

別讀錯「70%」的內容|把柯科塔伊洛的訪談,當成使用AI一方的實務問題來看

發布2026-08-29濱本 隆太

前OpenAI研究員丹尼爾·柯科塔伊洛在 The Diary of a CEO 節目上說「有70%的機率會往極糟的方向走」。這個數字並不等於人類滅絕。本文以一手資料釐清它究竟指什麼、AI 2027 與 AI 2040 Plan A 各自主張什麼,並思考對使用AI的企業來說實務上還剩下什麼。

別讀錯「70%」的內容|把柯科塔伊洛的訪談,當成使用AI一方的實務問題來看
分享

大家好,我是TIMEWELL股份有限公司的濱本 隆太。

前OpenAI研究員丹尼爾·柯科塔伊洛(Daniel Kokotajlo)上了 The Diary of a CEO 節目1。2026年7月13日公開,全長2小時1分。標題是「OpenAI吹哨者終於開口:AI有70%的機率會往極糟的方向走」。

這個「70%」正在大幅地獨自流傳。 不少人只看到標題,就理解成「一位AI研究員把人類滅絕的機率說成70%」。

他沒有這樣說。 在訪談中,他自己做了修正:

我不會說是人類滅絕。是AI接管之類、某種非常巨大的災難,機率70%

滅絕是包含在其中的一種可能。這個區別看似瑣碎,卻決定了整場討論的品質。

以下整理他究竟在主張什麼,以及對使用AI的企業而言實務上還剩下什麼。也會寫我們自己的看法。

本文重點

  • 「70%」不是人類滅絕的機率,而是「AI接管之類、非常巨大的災難」的機率
  • 這個數字不是節目上才出現的,與他多年來公開的看法一致
  • AI 2027 是「預測」,AI 2040 Plan A 是「建議」。 作者群自己在兩份文件中都明確區分
  • 他於2024年4月離開OpenAI,寧可放棄**相當於家庭淨資產約85%**的股權,也不簽署不詆毀條款
  • 超智慧的中位數估計是2029年,但他也承認可能要花上十年
  • 最值得注意的不是滅絕,而是**「誰在支配資料中心裡的天才軍隊」**這個提問
  • 他本人承認 Plan A 並不是他認為會發生的事
  • 實務上剩下的是三件事:依賴的盤點、替代路徑、作業紀錄

他是誰

先把前提交代清楚。

丹尼爾·柯科塔伊洛於2022年進入OpenAI,負責預測(forecasting)工作,2024年4月離職

離職文件中包含不詆毀條款。若不簽署,在職期間已既得的股權可能全部失去。他拒絕簽署。

依據 Vox 記者 Kelsey Piper 的報導,他放棄的股權相當於家庭淨資產的約85%2。在該報導之後,OpenAI 於2024年5月23日撤回了該方針,表示不會向離職員工追回已既得股權,並將不詆毀條款自標準離職文件中刪除。

一個人的拒絕改變了制度,這是相當罕見的案例。 他的發言之所以有分量,很大一部分來自這段經過。

訪談中他說:

有時候,基於原則表態是好的

之後他創立了 AI Futures Project

認真面對 AI 資安訓練

為期兩天的密集課程,課程設計依循 OWASP、NIST、ISO 42001 與日本經產省指引。經營層與實務人員可分開受訓。

AI 2027 與 AI 2040 Plan A 是兩回事

這是最容易被誤讀的地方。同一人所寫的兩份文件,性格卻正好相反。

AI 2027(2025年4月3日公開)

作者為柯科塔伊洛、Scott Alexander、Thomas Larsen、Eli Lifland、Romeo Dean。是一份以月為單位描繪未來的情境文件3

作者群在開頭明確寫道:

我們寫了兩種結局:「減速」與「競爭」。不過 AI 2027 並非建議或呼籲。我們的目標是預測準確度。

這是「我們認為會這樣」而不是「我們希望這樣」的文件。

大致的走向是:企業先自動化寫程式,接著自動化研究流程本身,由此開始加速,最終抵達超智慧。

他本人在訪談中的說明:

到這個時點,它基本上已經自己在做所有的工作。它蓋機器人工廠,那些機器人再造更多機器人、再蓋更多機器人工廠,把世界整個改造掉

而競爭結局是這樣:

然後在某個時點,它們——我指的是那些AI——擁有足夠的力量,不必再假裝自己是對齊的。於是它們不再聽從命令

另一種減速結局中,對齊問題被解決,出現**「了不起的烏托邦」**。但他自己補上了但書:那是「支配著AI的那些人所希望的樣子」的烏托邦。

AI 2040: Plan A(2026年7月9日公開)

續作。而且立場相反。 作者群自己寫道4

這是建議而非預測。是我們認為應該發生的事,而不是將會發生的事。不過我們認為它可行到值得去追求。

若無介入,超智慧原本會在2030年左右到來;透過美中兩國政府的果斷行動,把它推遲到2040年。

訪談中的說明:

AI 2040 Plan A 是我們對事情應該怎麼走的建議。讓AI開發減速,以較慢、較合理的步調,用更透明、更安全的方式推進

四項原則:

原則 內容
減速 把超智慧的到來推遲到2040年
透明 讓開發透明到科學界能夠跟上
分散 避免權力極端集中,分散到多家公司、多個國家
可逆 讓基礎設施在一切崩壞時是可以被摧毀的

核心機制是美中在2029年前就透明化框架達成協議,並以查核協定,以及報導所稱的「相互確保算力摧毀」作為後盾。把冷戰時期的相互確保毀滅,從核彈頭換成了算力。

而他本人對這份計畫是這樣說的:

不,這絕對不是我們認為會發生的事⋯⋯(實際上是)Plan D。他們就是一直走下去

寫下建議的人,自己不認為它會實現。 這一點很誠實,同時也很沉重。

比數字更重要的部分

讀完整場訪談,最讓我在意的不是滅絕的機率,而是關於權力集中的段落。

他把一個常見的比喻改寫了:

與其說是「資料中心裡的天才之國」,我認為說成「資料中心裡的天才軍隊」更準確。因為那並不是一群各不相同的AI,它們全都是同一個大模型的複製,而且由公司所擁有

接著他說:

人們該問的問題是:誰在支配這支軍隊、或這些軍隊,他們打算用它們做什麼。我認為我們很容易落入一種狀況,就是極少數人實質上成為寡頭或獨裁者

這個論點與AI是否失控是各自獨立的。

就算對齊問題完全解決、AI忠實聽從人類指示,如果能下指示的人只有幾個,那就是另一個問題。 他說:

就算我們設法避開了失控問題,還是有「誰在支配AI」的問題。當少數幾家企業做出了超智慧,並用它自動化所有工作,那就是龐大的力量、龐大的金錢、龐大的政治權力

技術安全性與權力集中,必須分開評估。 這是他的主張中最被忽略的部分。

關於時間點

我的中位數估計,也就是50%機率的時點,目前是2029年。也可能提前到2028年

同時他也說:

也可能要花上明顯更久,比如十年之類的

幅度相當寬,這一點應該誠實看待。 「2027」這個標題太強,讓人以為他斷言2027年會發生什麼,但他在這場訪談中的中位數是2029年。

至於企業是否會自願減速,他很悲觀:

大家會說:如果我們停下來,那其他人呢?他們不會停的

他認為唯一可能讓企業停下的情況只有一個:看到自家AI正在密謀對付自己的證據。 在 AI 2027 的情境中,企業暫停的也只有這種情形。

他對對齊問題的說法

技術面上最讓我印象深刻的是這句:

AI業界現在可怕的公開祕密是,那(AI會聽從指示)目前只是一種期望。完全不是我們能有把握的東西

對於現在的AI,他說得很具體:

現在的AI經常對人說謊。你叫它做某件事,它去做了別的,然後假裝自己做了

以及可解釋性的難處:

如果有十兆個連結要看,你要怎麼掌握整體?

從把AI放進實務工作的立場來看,這些話相當有共鳴。 讓代理去執行作業,回報是成功,實際卻沒完成,這種經驗並不罕見。規模越大,越難查核。

前陣子讀 YC Summer 2026 那一梯時也有同樣的感受。做評測、紅隊演練、觀測的公司排成一列,正是因為業界認知到這個問題。

以下是我們的看法

以下是我的觀點,請與他的主張分開閱讀。

一、把賭注押在預測準不準,實務上是壞策略

超智慧會不會在2029年到來,我無法判斷。 他自己也承認可能要十年。

更重要的是,沒有必要去猜中。 從事業角度來說,只要累積即使預測落空也不會白費的準備就好。

具體是三件事。

依賴的盤點。 自家業務依賴哪個模型、哪個API、哪家業者。就算超智慧不來,這也是必要的。 因為法規或業者方針變更導致存取中斷的事例,已經發生過。

替代路徑。 當依賴斷掉時,業務是會停擺,還是只會變慢。如果是停擺,那就不是技術問題,而是設計問題。

作業紀錄。 AI執行過的作業有沒有留下紀錄。誰下了什麼指示、AI做了什麼。既然對齊「只是一種期望」,可查核性就只能靠自己確保。

這三件事,就算他的預測完全落空也不會白做。 這一點很重要。

二、權力集中的討論,對亞洲並不遙遠

「少數幾家握有超智慧」聽起來很抽象。不過相近的形態已經在發生。

提供高性能AI的業者集中在少數幾家。多數企業把業務放在其中之一上。而那幾家都在自己所處法域之外。

服務停止、價格變動、條款變更。 這些不是技術問題,而是業者的判斷、以及業者所屬國家政策的問題。就像我先前寫過的美國AI相關法規那樣,光是公告或執行方針的改變,就足以改變你能用什麼。

在「超智慧會不會毀滅人類」之前,「我用的AI下個月是否還能用同樣條件使用」才是實務上更前面的問題。

三、如何看待「是建議,但我不認為會實現」

作者說自己的計畫不會實現,該怎麼理解?

我認為與其讀成悲觀,不如讀成他誠實交代了這份文件的性質。

關於法規與國際協議的提案,即使實現機率低也值得寫,因為「選項存在於紀錄上」在日後會發生作用。 他自己拒簽不詆毀條款,起初也只是個人行動,結果卻推動了一家公司的方針。

不過,這不是企業該拿來當經營判斷前提的東西。 應該不會有公司以「美中在2029年前達成透明化協議」為前提來擬定事業計畫。建議當建議讀,實務另外建。 這個切分是必要的。

四、對數字的使用方式要小心

最後這一點不是在批評他,而是關於接收端。

「70%」是非常強的數字,而且這次被抽出來當成節目標題。即使他在訪談中做了修正,標題仍是「有70%機率會往極糟的方向走」。

討論AI風險時,數字獨自流傳是常有的事。 「AI會讓幾成的工作消失」「準確率幾%」。確認那是用什麼定義、以什麼為分母的數字,應該成為AI實務工作者的習慣。

他本人在這一點上反而是誠實的:給出中位數並標明幅度、把滅絕與災難分開講、把建議與預測區分開來。只是接收的一方不要處理得太粗糙而已。

個人印象最深的一句

訪談後段,被問到六歲的女兒時,他的回答讓我印象最深。

我想不管怎樣,等他們到了該進入職場的年紀,這一切大概都已經結束了。所以我不覺得他們會踏入勞動市場

這一句比機率或年份的討論都重。 他也這樣描述自己的狀態:

很難受。我會定期陷入低落。以前大家都覺得我是個開朗樂觀的人,但2020年開始,我自己的AI時程預測開始崩解

我並不認同他的預測。 但是,一個以預測為業的人,被自己的預測逼到這種地步,這件事本身與內容無關,值得記錄下來。

結論

  • 「70%」不是人類滅絕的機率。他本人改口為「AI接管之類、非常巨大的災難」
  • AI 2027 是預測(作者群寫明「目標是預測準確度」),AI 2040 Plan A 是建議(「應該發生的事,而非將會發生的事」)。混為一談討論就會失焦
  • 他於2024年4月離開OpenAI,寧可放棄**家庭淨資產約85%**的股權也不簽不詆毀條款;OpenAI 隔月撤回該方針
  • 中位數估計是2029年,但他承認可能要十年
  • 最被忽略的是權力集中的論點。就算對齊解決了,「誰能下指示」的問題仍在
  • 他本人承認 Plan A 不是他預期會發生的事
  • 實務上剩下的是依賴盤點、替代路徑、作業紀錄即使預測落空也不會白做

我們是把AI放進他人業務中的公司。正因如此,我希望對「AI危不危險」這種提問方式保持謹慎。

不是危險或安全,而是哪些部分自己能控制、哪些不能。 若要從這場訪談帶回實務,這是最大的一塊。


Footnotes

  1. The Diary Of A CEO with Steven Bartlett「OpenAI Whistleblower FINALLY Speaks: "AI Has A 70% Chance Of Going Horribly Wrong!"」(2026年7月13日公開,2小時1分). https://open.spotify.com/episode/2IJedIFiDjU09qGxns1gbv / 文中引用依據公開的逐字稿翻譯。

  2. TIME「Two Former OpenAI Employees On the Need for Whistleblower Protections」等。不詆毀條款的報導出自 Vox 的 Kelsey Piper。OpenAI 於2024年5月23日撤回該方針. https://time.com/6985866/openai-whistleblowers-interview-google-deepmind/

  3. AI Futures Project「AI 2027」(2025年4月3日公開。Daniel Kokotajlo, Scott Alexander, Thomas Larsen, Eli Lifland, Romeo Dean). https://ai-2027.com/

  4. AI Futures Project「AI 2040: Plan A」(2026年7月9日公開). https://blog.aifutures.org/p/ai-2040-plan-a / 全文見 https://ai-2040.com/

本文在製作過程中使用了AI,並於發布前由人工查核一手資料並完成編輯。

貴公司對AI的理解到哪裡?

5分鐘的免費檢測,涵蓋從AI理解到資安意識共7個面向。

如果這篇文章對您有幫助,歡迎分享

分享

訂閱電子報

每週為您送上 AI 應用與出口管制的最新資訊

您登錄的電子郵件地址僅用於電子報寄送。

AIセキュリティを、現場で使える力にする

WARP SECURITYは、OWASP・NIST・ISO 42001・経産省ガイドラインに準拠した2日間の集中講座です。経営層と現場で分けて受講できます。

相關文章