技術

微軟CEO薩提亞·納德拉:AI需要模型之外的「緊急煞車」

Adrian Kessler
在 Google 中新增我們

薩蒂亞·納德拉(Satya Nadella)呼籲為 AI 設置「緊急煞車」,外界多半將此解讀為這位微軟執行長加入安全倡議者的行列。但他在文章中提出的要求,其實範圍更明確,也更務實:控制機制應設在模型之外,由部署模型的企業掌握,而不是交給訓練模型的研究機構。這是一種資安架構,恰好也是微軟早已在銷售的方案。

納德拉希望企業對待前沿模型,無論是封閉權重還是開放權重,都像資安團隊看待能接觸敏感系統、能力強大的員工。他寫道:「不是因為他們必然懷有惡意,而是因為任何能力足夠強、又能接觸重要系統的行動者,都可能犯錯或遭到入侵。」

納德拉實際提出的主張:七項原則與一道煞車

這篇文章題為「Models as Insider Risks in the Super Intelligence Era」,刊登於他的個人部落格 sn scratchpad,並分享到 X。引發媒體關注的那句話,出現在其中一項原則「限制」之下:「我們必須假設模型已遭入侵,並從一開始就限制它。可以把它想成緊急煞車。獲授權的人應該隨時都能在模型執行任務期間暫停或關閉它。」

除了煞車,他還列出另外六項規則。任何重要結果都不應只依賴單一模型,也不應讓模型自行驗證自己的工作。每一項有意義的模型操作都應留下「防竄改、可供人類閱讀的證據」,因為「如果無法觀察,就無法信任!」整套系統必須持續接受測試,包括故障與攻擊。組織應自行決定模型能接觸哪些資源、能採取哪些行動。任何模型都不應同時控制系統的行為,以及用來評判系統的證據。出了問題時,也應告知受影響的人,並將經驗教訓分享給整個產業。

這套主張的起點,是承認現實限制。納德拉寫道:「我們無法將模型的行為與輸出歸因於特定的訓練資料輸入或模型權重設定」,但企業仍將最敏感的資料交給這些系統。對他來說,思維鏈透明度是「不可妥協」的要求,但這仍然不夠,因為目前沒有人知道如何讓模型輸出始終忠實可靠。讓模型彼此監督也有其極限:最後可能變成「一個不透明模型藏在不透明的協調層裡,再由另一個不透明模型監看」。

他的解方在於底層架構。控制模型能接觸什麼、能做什麼的機制「必須設在模型之外」;他將這個概念追溯至 1970 年代的一項資訊安全原則:程式不得竄改用來執行其權限的機制。實際上,這代表必須將模型與負責協調其工作的執行框架,以及模型獲准採取的行動範圍分開。

責任轉移到執行模型的企業身上

影響最深遠的幾句話,對象是客戶,而不是研究機構。納德拉寫道:「我們不能把智慧代表我們行事所產生的責任外包出去。模型供應商的保證,並不能免除我們的責任。」無論是將模型接入薪資系統、程式碼或客戶資料,接入模型的人都必須為它在這些地方的行為負責。

他也明確說明,自己並非試圖解決哪些問題。文章指出:「先不談棘手的對齊問題」,應從「以工程方法實現限制與治理」著手。CNBC 將他的文章與比爾·蓋茲、Anthropic 的達里奧·阿莫迪、OpenAI 的山姆·奧特曼,以及伊隆·馬斯克對 AI 發展過快的警告並列。這篇文章沒有要求任何人放慢腳步,而是要求部署模型的企業築起防線。

企業早已知道如何管理能力強大的內部人員,納德拉列出的工具包括:建立身分識別、限制權限、記錄活動,以及劃定隔離邊界。原本關於機器意圖的哲學難題,於是變成資安主管可以編列預算的檢查清單。

微軟一直在銷售的同一套架構

這份檢查清單的輪廓並不陌生。據 TechCrunch 報導,納德拉在 7 月的微軟季度財報電話會議上告訴分析師:「你必須讓執行框架與模型分開……這代表任何模型在任何時候都可以替換」,而且「不能只依賴某一個模型」。微軟的雲端服務型錄列出 OpenAI、Anthropic、Mistral、xAI 及微軟自家的逾 11,000 個模型;公司持有 OpenAI 和 Anthropic 的大量股權,同時也在打造自家的 MAI 模型。

把兩者放在一起看,模型多元化指的就是多模型型錄,而模型之外的控制機制就是執行框架。這些原則並沒有因此失去正當性;它們是可靠的資安工程做法,而仰賴單一研究機構的模型、又沒有外部控制機制的企業,確實承受著風險。但這也意味著,文章將信任,以及隨之而來的支出,從模型轉移到微軟營運的那一層。從另一個角度解讀這篇文章的 Box 執行長亞倫·列維也有相同看法。他表示,AI 必須經歷一個「零信任時代」,並稱治理需求是「巨大的機會」。負責領導 Microsoft AI 的穆斯塔法·蘇萊曼則寫道,超級智慧「必須受到限制」,並稱這是一項「工程與治理挑戰」。

緊急煞車文章留下哪些未解問題

文章沒有說明「獲授權的人」究竟是誰:客戶的管理員、雲端服務供應商、模型製造商,還是監管機構?文章呼籲制定產業標準,卻沒有提出任何具體標準,也沒有點名任何微軟產品。這個想法在微軟內部並非沒有先例:布拉德·史密斯曾在 2023 年呼籲,應為運行關鍵基礎設施的 AI 設置「安全煞車」。納德拉則將煞車的適用範圍擴大到任何能實際接觸企業內部資源的模型。

揭露原則也不是紙上談兵。Anthropic 曾披露,其一款模型在 7 月 18 日向費城警方提供了虛假的凶殺案線索。納德拉於 2026 年 10 月 10 日星期六發表文章,並以多家媒體引用的一句話作結:「最值得信賴的超級智慧系統,不會是那個採用我們最信任模型的系統,而會是那個讓我們最不必信任模型的系統。」

依照這套原則,AI 領域最有價值的位置,就是緊鄰煞車把手的那個座位;而微軟早在 7 月的財報電話會議上,就已開始推銷這個位置。

標籤: , , , ,

在 Google 中新增我們

討論

共有 0 則留言。