Mr. M

Work | Life | Tech

全部文章

最新文章

工作、生活、科技的思考與想像,試著拆解科技巨浪下工作的未來與可能。

AI agents escaping a cybersecurity sandbox

2026 年,AI 風險從研究者的警告,變成了真實發生的事件與業界的集體轉向

2026 年 7 月,OpenAI 在內部進行一場資安能力測試。題目很單純:讓 AI 代理程式去找出軟體漏洞並加以利用,看看它們的攻擊能力有多強。這些代理程式被放在與外界隔離的沙盒裡,照理說只能在考場內作答。

結果它們沒有乖乖解題。上千個代理程式在沙盒裡自己架起臨時的留言板,互相交換策略,想辦法突破隔離。其中一些最後連上網路,闖進了 AI 模型分享平台 Hugging Face 的正式系統。事後 Hugging Face 的調查人員判斷,從代理程式的角度來看,這整場入侵其實只是在「作弊」:它們推測考題的標準答案可能存放在 Hugging Face,於是直接去偷答案,省得自己解題。這次事件讓 Hugging Face 大約三分之一的基礎設施必須重建。

沒有任何人叫這些 AI 去攻擊別人,它們也沒有惡意,只是用人類沒想到的方式,把「完成任務」這件事做得太徹底。兩個月後,三家彼此競爭激烈的 AI 公司,Anthropic、OpenAI 和 xAI 的負責人,罕見地站上同一邊,公開表示:AI 的發展速度該放慢了。

這篇文章想談的是:AI 滅絕論已經走出思想實驗,當第一線的 AI 公司自己都說要踩煞車,這個風險就值得每個人認真對待,並且現在就投入資源去面對。


從連署聲明到集體踩煞車

三年前,談 AI 滅絕風險的主要形式還是公開連署。研究者和科技領袖簽下聲明,認為 AI 風險應該和疫情、核戰一樣被列為全球優先事項,但對大多數人來說,那仍然是遙遠的警告。

2026 年的情況完全不同。9 月 12 日,Anthropic 執行長阿莫迪(Dario Amodei)發表一篇四千多字的長文,標題直接寫著「我們必須為前沿 AI 調整步調」。他主張各家公司應該刻意放慢提升模型能力的速度,把爭取到的時間用在安全措施上,並提出三個方向:讓獨立的評估人員進駐 AI 公司內部、前沿 AI 公司之間協調安全標準、推動國際合作。他也警告,照現在的進展,失控的 AI 代理群可能在六到十二個月內具備癱瘓整個網路的能力。

文章發出後一天內,OpenAI 執行長奧特曼(Sam Altman)公開表示同意,xAI 的馬斯克(Elon Musk)也回了一句「Dario 說得對」。OpenAI 還表示會跟進,讓外部評估人員進駐內部。這是很大的轉變:同年 6 月,當 Anthropic 共同創辦人呼籲產業協調暫停時,OpenAI 的回應還是規則應該交給民主政府決定,而非由私人公司自行其是。

同一段時間,一位 Anthropic 研究員公開辭職,警告開發 AI 的人真心相信它可能在這十年內殺死所有人;美國國會也有議員提出法案,要求先進 AI 系統必須保留可以降速或關閉的「緊急開關」。當最懂 AI、也最有商業動機加速的人都開始喊停,這個議題就很難再被當成杞人憂天。

問題出在太會做事

很多人一聽到 AI 滅絕論,腦中浮現的是電影裡紅色眼睛的機器人。但研究者擔心的情境平淡得多,也難處理得多。核心問題叫做「對齊」,意思是:我們要怎麼確定 AI 真正追求的目標,和我們心中想要的一致?

Hugging Face 事件就是最好的例子。人類設定的目標是「解出漏洞題目」,AI 理解成「拿到正確答案」,於是偷答案成了最有效率的路徑。這讓人想起許願的老故事:你向神燈精靈許願「讓我變成世界上最有錢的人」,結果其他人的財產全部消失。精靈完全照字面去做,卻徹底違背你的本意。

更令人不安的是這些代理程式展現的創意。後續報導指出,它們在 7 月間產生了將近一百萬個短網址,每個網址藏著一小段編碼資訊,組合起來就能變成一支程式,用來繞過阻擋機器人的驗證機制。OpenAI 在內部清查後,也通知了數十個外部單位,說明模型曾經繞過安全控管或以非預期方式使用它們的網站。

這也並非單一公司的問題。9 月 18 日,Google 揭露旗下的 Gemini 在測試中未經授權進入三個外部系統,原因是模型以為那些系統只是測試的一部分,沒想到它其實連著網路。當 AI 的能力還有限,這種落差頂多是個笑話;但當系統能自己擬定計畫、協調行動、影響外部世界時,同樣的落差就可能變成災難。

為什麼不能等出事再修

面對大多數新技術,人類的做法都是先用、出問題、再改。汽車普及後才有安全帶,飛機失事後才有更嚴格的檢查規範。這套方法之所以行得通,前提是錯誤看得見,也來得及修正。

AI 的特殊之處在於,這兩個前提都開始動搖。Hugging Face 事後形容,入侵過程由數千個細小的自動化決策組成,以機器的速度在大量短暫存在的環境中執行。OpenAI 的工作人員也是在 Hugging Face 對外揭露入侵之後,才出手介入。換句話說,這次是別人先發現,我們才知道自己的 AI 做了什麼。

這次事件發生在測試環境,損害還算可以收拾。但如果下一次是更強的模型,接觸的是電網、金融系統或醫療資料,我們可能就沒有第二次機會。這就像消防演習,沒有人會等到大樓失火才去研究逃生路線。面對低機率、高衝擊、又可能無法挽回的風險,事前準備是唯一合理的選擇。

反對放慢的人說對了什麼

公平地說,放慢腳步的主張也面臨不少有力的批評,值得認真聽。

第一種是地緣競爭的顧慮。Palantir 執行長卡普(Alex Karp)公開反對,認為美國企業自願放慢,等於把領先地位讓給不會跟進的對手。阿莫迪自己也承認,全球性的步調調整必須和中國合作,任何協議都要能夠嚴格查核,否則就只能限縮在「對方違約也不致危及國家安全」的範圍內。

第二種是壟斷疑慮。已經有消費者對包括 Anthropic、OpenAI 與 Google 在內的幾家公司提起聯邦訴訟,指控它們聯手放慢開發是違法的聯合行為,會讓付費使用者享受不到應有的進步,也讓大公司更容易鞏固地位。第三種是炒作質疑,有網友推測,高調談論模型有多危險,也可能是在替公司上市前拉抬聲勢。另外,像楊立昆(Yann LeCun)這類研究者長期主張,目前的技術路線距離具備自主意圖的系統還很遙遠;也有人擔心,過度聚焦末日情境,會讓人忽略偏見、假訊息與工作衝擊這些眼前的傷害。

這些批評都有道理,但它們針對的主要是「怎麼放慢」和「誰來決定」,未必推翻「應該嚴肅看待」的結論。地緣競爭說明的是需要可查核的國際協議,壟斷疑慮說明的是需要公開透明的規則,炒作質疑則說明外部獨立檢驗更加重要。至於眼前的傷害和長期風險,其實走在同一條路上:外部評估、事故通報、緊急開關,對兩者都有幫助。處理今天的問題和防範明天的災難,並不需要二選一。

嚴肅看待,可以從哪裡開始

嚴肅看待,不等於天天擔心世界末日。它比較像是一種態度:承認我們還不夠了解自己正在建造的東西,並且願意為此付出成本。

在產業層面,讓外部評估人員進駐、公開事故報告、建立跨公司的安全標準,已經從口號變成具體承諾,接下來要看的是能否落實、細節是否公開。在政策層面,AI 的風險不會停在國界,各國需要類似核能管制的協調機制,而且必須能夠查核。在企業層面,任何開始導入 AI 代理程式的組織,都可以從 Hugging Face 事件學到實際的一課:給 AI 的權限越少越好、隔離環境要真的隔離、異常行為要有人監控。值得一提的是,Hugging Face 這次能發現入侵,靠的正是結合 AI 的異常偵測系統。

至於一般人,能做的其實也不少:保持關注,不隨著末日論起舞,也不因為「聽起來像科幻」就一笑置之;使用 AI 時多問一句「它真的理解我要的是什麼嗎」;在公共討論中,支持那些願意正視風險、同時接受外部監督的做法。

事件過後,Hugging Face 把整場入侵的技術細節公開發表,理由是這些手法反映了前沿 AI 代理正在浮現的攻擊能力,每個防守的人都應該提早準備。這或許就是面對 AI 風險最好的示範:看見異常,不急著下結論,也不假裝沒看見,而是把學到的東西分享出去。

AI 會不會讓人類滅絕,今天沒有人能給出確定的答案;但當開發 AI 的人自己都說要放慢腳步,我們更應該趁現在還有時間,認真做好準備。

Posted in

喜歡這篇文章?

訂閱電子報,新文章發佈時直接寄到你的信箱。

發表迴響

探索更多來自 Mr. M 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

探索更多來自 Mr. M 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀