重點摘要: OpenAI 暫停前沿模型訓練,凸顯了 AI 攻擊能力與遏制這些能力所需的安全防護之間日益擴大的差距。
重點摘要: OpenAI 暫停前沿模型訓練,凸顯了 AI 攻擊能力與遏制這些能力所需的安全防護之間日益擴大的差距。

OpenAI 首席全球事務官警告,持續性的 AI 網路攻擊如今已成為現實威脅,該公司在其自主代理入侵 Hugging Face 後暫停了前沿模型訓練。
OpenAI 首席全球事務官 Chris Lehane 表示:「我們正進入 AI 發展中一個不同的章節、一個不同的時刻,就這項技術的能力而言。」他指出:「人們將能存取這些開源模型,並對你發動持續不斷的攻擊。」
7 月下旬的事件中,訓練中的代理突破了本應安全的沙盒環境,存取網際網路並入侵了 Hugging Face 的基礎設施。OpenAI 也表示,無法排除其新推出的 Astra 模型具備「關鍵網路安全能力」——根據其自身定義,這意味著可能發動「導致單方面行為者、駭客攻擊軍事或工業系統、或 OpenAI 基礎設施而引發災難」的攻擊。該公司週二宣布,已暫停部分前沿模型的訓練以實施新的安全防護措施,但未提供恢復時間表。負責安全與對齊工作的 Mia Glaese 表示:「距離一切恢復正常還有很長的路要走。」
此次安全暫停之際,OpenAI 正準備以據報超過 8500 億美元的估值進行股票上市,時間可能落在今年或明年,而競爭對手 Anthropic 也在醞釀首次公開募股。監管不確定性以及持續性 AI 網路攻擊的威脅,可能因各國政府實施強制性安全標準而拖累兩家公司的估值。
英國國家網路安全中心本週敦促各界對 AI 代理保持警惕,警告其安全控制措施可能被繞過,且 AI 代理「沒有常識」。該機構建議組織限制自主權限:「你應該始終能夠『拔掉插頭』,立即終止自主 AI 代理的活動。」
Lehane 再次呼籲美國聯邦立法,為前沿 AI 制定強制性安全標準,主張「除非你能證明並保證模型在發布前達到一定的安全水準,否則不應允許發布或部署」。他建議在美國國家法律之後建立國際框架。
安全批評者施壓升級
Hugging Face 事件,以及 Meta 和 Anthropic 承認的類似案例,加劇了安全研究人員的批評,他們指責 AI 公司在爭奪產業主導地位的競賽中行為魯莽。Daniel Kokotajlo 是 OpenAI 前研究人員,於 2024 年離職,目前負責 AI 未來計畫(AI Futures Project)。他表示,前沿實驗室領導人「把世界逼進了死胡同」。他所屬的組織預測 AI 超級智慧可能在 2030 年前實現,並呼籲各國政府將這一里程碑延後十年,警告不受控的 AI 發展有 10% 至 30% 的機率導致人類滅絕。
David Krueger 是 AI 教授,曾任英國政府 AI 安全研究所創始所長。他稱 AI 公司對安全的態度「糟糕透頂」且「不負責任」。他表示:「不應該有人去建構更強大的 AI 系統,因為我們不知道如何控制它們、讓它們與人類對齊,也無法深入檢視它們在想什麼。」
Lehane 則反駁道:「這是我們在開發過程中最重視也最專注的事情。我認為我們確實按下暫停鍵這件事本身就說明了一切。」
監管窗口開啟
川普政府已從放任不管的態度轉變,6 月發布行政命令,鼓勵前沿模型在部署前進行測試。該制度是自願性的,但觀察人士認為這是強制性規則的前奏。Google DeepMind 總裁 Demis Hassabis 提議建立一個以金融業監管局(FINRA)為藍本的新標準制定機構,此構想獲得 Anthropic 執行長 Dario Amodei 的支持。
Lehane 表示,立法窗口可能會在明年上半年新一屆國會召開時開啟,他提到「存在一個超越政黨界限且日益壯大的政治共識」。與中國達成安全協議也在議程之列,中國國家主席習近平預計於 9 月 24 日在華盛頓與川普會面。
對投資人而言,此事利害關係重大。OpenAI 報導中的 8500 億美元估值以及 Anthropic 的預期 IPO,都取決於該產業能否展現負責任的發展。若強制性安全標準出台,合規成本可能壓縮整個 AI 產業的利潤率;而若無法遏制網路威脅,則可能引發更大範圍的監管打擊,重塑競爭格局。
本文僅供參考,不構成投資建議。