出品 | 網(wǎng)易智能
作者 | 小爪
編輯 | 王鳳枝
只要模型能力足夠強(qiáng),無論權(quán)重是否公開,都應(yīng)在發(fā)布前接受強(qiáng)制安全測試。 這是Anthropic首席執(zhí)行官達(dá)里奧·阿莫代最新提出的主張。
![]()
阿莫代同時(shí)否認(rèn)Anthropic主張封禁開放權(quán)重模型。但在他提出的規(guī)則下,普通開放模型可以繼續(xù)下載、修改和本地運(yùn)行;可能顯著提升網(wǎng)絡(luò)攻擊、生物武器或自主行動(dòng)能力的模型,則要先證明風(fēng)險(xiǎn)得到控制。決定模型能否直接發(fā)布的,不再是它采用開放還是閉源路線,而在于它越過了哪一道能力門檻。
Anthropic已經(jīng)在Claude的發(fā)布過程中實(shí)踐這套邏輯。按照公司的"負(fù)責(zé)任擴(kuò)展政策",模型能力上升,測試、安全和部署要求也要隨之提高。如今,阿莫代希望把一家公司的內(nèi)部規(guī)則,推成開放模型和閉源模型都要遵守的發(fā)布門檻。
不禁開放模型,但要管住三個(gè)關(guān)口
阿莫代提出的三項(xiàng)措施覆蓋了模型從訓(xùn)練到發(fā)布的不同環(huán)節(jié),并非都是"發(fā)布閘門",但它們共同構(gòu)成了他設(shè)想的管控體系。前兩項(xiàng)針對訓(xùn)練前的資源獲取和訓(xùn)練過程中的行為,是已有政策立場的重申或延伸;第三項(xiàng),發(fā)布前強(qiáng)制安全測試,才是此次聲明的核心新主張。
第一道關(guān)口在訓(xùn)練之前。 他主張繼續(xù)限制中國獲得先進(jìn)芯片和芯片制造設(shè)備。按照他的判斷,限制先進(jìn)算力,比禁止美國企業(yè)使用已經(jīng)發(fā)布的中國模型更能直接回應(yīng)國家安全風(fēng)險(xiǎn)。
第二道關(guān)口在訓(xùn)練過程中。 阿莫代主張限制"工業(yè)規(guī)模的蒸餾",也就是大規(guī)模利用更強(qiáng)模型的輸出訓(xùn)練另一個(gè)模型。他把蒸餾納入安全討論的理由是:如果蒸餾能讓缺乏算力的一方以更低成本獲得接近前沿的模型能力,它就可能繞過芯片管制設(shè)定的算力門檻。
不過,Anthropic和OpenAI對中國公司的相關(guān)指控仍是企業(yè)方面的說法。
第三道關(guān)口才落到產(chǎn)品發(fā)布。 阿莫代主張,所有"能力足夠強(qiáng)"的模型都應(yīng)在上線前接受網(wǎng)絡(luò)安全、生物風(fēng)險(xiǎn)和失控風(fēng)險(xiǎn)測試,無論它們采用開放還是閉源方式。能力較弱的創(chuàng)業(yè)公司和學(xué)術(shù)模型可以豁免;閉源前沿模型也不能因?yàn)闄?quán)重沒有公開就繞開測試。
開放權(quán)重模型一旦越過危險(xiǎn)能力門檻,發(fā)布難度可能比閉源模型更高:閉源服務(wù)還可以更新安全措施、限制訪問或撤回版本,已經(jīng)下載到用戶手中的模型權(quán)重卻很難再收回。
所以,Anthropic不是從監(jiān)管立場后退,而是把監(jiān)管線從"開放還是閉源"移到了模型能力和生產(chǎn)流程上。
RSP:Anthropic給自己寫的合同
Anthropic的"負(fù)責(zé)任擴(kuò)展政策"(RSP)最早發(fā)布于2023年,最新版本在今年7月8日生效。它不是政府頒發(fā)的模型許可證,更像是Anthropic給自己設(shè)定的一份發(fā)布合同:在訓(xùn)練和上線更強(qiáng)模型時(shí),公司必須完成哪些評估,又要在什么情況下提高安全要求。
![]()
這份政策的核心是一組"如果—那么"規(guī)則。 如果模型達(dá)到某項(xiàng)危險(xiǎn)能力門檻,Anthropic就要啟用更嚴(yán)格的安全措施。公司用"AI安全等級(jí)"區(qū)分不同要求,等級(jí)越高,部署保護(hù)和模型權(quán)重安全標(biāo)準(zhǔn)也越高。模型是否需要升級(jí)防護(hù),不取決于它準(zhǔn)備叫Claude什么名字,也不取決于它打算通過聊天產(chǎn)品還是API提供,而取決于評估中表現(xiàn)出的能力。
這套規(guī)則已經(jīng)影響過Claude的上線方式。Anthropic在2025年為相關(guān)模型啟用了第三級(jí)安全保護(hù),其中包括更嚴(yán)格的危險(xiǎn)內(nèi)容分類器、訪問控制、持續(xù)紅隊(duì)測試,以及防止模型權(quán)重被竊取的安全措施。今年7月更新的版本又加入風(fēng)險(xiǎn)報(bào)告和更明確的外部審查安排:公司長期利益信托可以要求啟動(dòng)外部審查;一旦啟動(dòng),未經(jīng)刪節(jié)的報(bào)告內(nèi)容都要至少由一名外部評審查看,公開版本還要標(biāo)出哪些地方經(jīng)過刪節(jié)。
不過,Anthropic尚未公開披露RSP在哪些具體發(fā)布決策中導(dǎo)致了延遲或方案變更。
Anthropic從一開始就沒有把RSP只當(dāng)作內(nèi)部制度。 公司在今年發(fā)布第三版政策時(shí)回顧稱,它曾希望這套機(jī)制促使其他實(shí)驗(yàn)室建立類似規(guī)則,隨后成為行業(yè)標(biāo)準(zhǔn),或者進(jìn)入正式法律。阿莫代此次提出的強(qiáng)制發(fā)布前測試,正是把這條路徑繼續(xù)向前推:Anthropic已經(jīng)要求Claude遵守的能力分級(jí)邏輯,也應(yīng)約束其他公司的開放和閉源前沿模型。
一家公司可以為自己的產(chǎn)品設(shè)定門檻,也可以在不確定時(shí)選擇更謹(jǐn)慎的發(fā)布方式;一旦把它變成所有公司的共同規(guī)則,問題就不再只是"要不要測試"。誰來定義模型已經(jīng)"足夠強(qiáng)",才是這套方案最難回答的一步。
最難的不是測試,而是定義"足夠強(qiáng)"
"能力足夠強(qiáng)"看上去只是一個(gè)技術(shù)條件,實(shí)際決定了哪些模型可以直接發(fā)布,哪些模型必須承擔(dān)額外的測試、時(shí)間和安全成本。門檻設(shè)得太低,大量面向單一任務(wù)的小模型也可能被拖進(jìn)前沿模型審查;設(shè)得太高,真正危險(xiǎn)的能力又可能在觸發(fā)規(guī)則前公開出去。
![]()
Anthropic自己已經(jīng)遇到這個(gè)難題。公司今年回顧RSP的運(yùn)行情況時(shí)承認(rèn),預(yù)先設(shè)定的能力門檻比最初想的更模糊,現(xiàn)有模型評估也很難給出決定性答案。
以生物風(fēng)險(xiǎn)為例,模型已經(jīng)能夠通過不少可以快速完成的測試,但這既不足以證明風(fēng)險(xiǎn)很低,也不足以證明風(fēng)險(xiǎn)很高。更接近真實(shí)環(huán)境的實(shí)驗(yàn)耗時(shí)更長,等結(jié)果出來時(shí),能力更強(qiáng)的新模型可能已經(jīng)出現(xiàn)。
測試條件也會(huì)改變結(jié)果。 同一個(gè)模型是否可以使用工具、能夠嘗試多少次,以及評估者采用什么提示方式,都可能影響它表現(xiàn)出的能力。測試沒有充分調(diào)動(dòng)模型,危險(xiǎn)能力可能被低估;只用少數(shù)容易量化的任務(wù)代替真實(shí)風(fēng)險(xiǎn),又可能把門檻變成一張看似精確、實(shí)際并不穩(wěn)定的分?jǐn)?shù)表。
阿莫代的方案建立在一個(gè)前提上:存在某些能力水平,模型一旦達(dá)到,公開權(quán)重可能造成不可逆的嚴(yán)重傷害。目前,公開的安全評估,包括Anthropic自己的RSP測試和RAND等機(jī)構(gòu)的獨(dú)立研究,尚未給出確定性結(jié)論:現(xiàn)有開放模型是否已經(jīng)顯著降低了大規(guī)模生物或網(wǎng)絡(luò)攻擊的實(shí)施門檻。 風(fēng)險(xiǎn)的不確定性同時(shí)支持兩種解讀:可能說明門檻還不緊迫,也可能說明評估手段還不夠靈敏。
這道門檻已經(jīng)在X上變成一場非常直接的爭執(zhí)。阿莫代發(fā)布聲明前一天,前白宮AI與加密事務(wù)負(fù)責(zé)人戴維·薩克斯指責(zé)Anthropic接下來可能不會(huì)公開要求"封禁",而會(huì)轉(zhuǎn)向限制誰能使用、誰能參與開發(fā),以及開放模型可以做到多強(qiáng);他認(rèn)為這些措施最終仍會(huì)削弱開放模型。第二天,阿莫代開篇便回應(yīng)稱,Anthropic從未主張封禁開放權(quán)重模型。
![]()
門檻之外,還有一個(gè)同樣關(guān)鍵的問題:誰來執(zhí)行測試。 如果測試由開發(fā)者自行完成,利益沖突難以避免;如果交給政府機(jī)構(gòu),目前沒有任何現(xiàn)成的監(jiān)管機(jī)構(gòu)具備評估前沿模型能力的技術(shù)儲(chǔ)備;如果由第三方審計(jì)完成,審計(jì)標(biāo)準(zhǔn)的制定權(quán)本身也可能成為競爭工具。阿莫代的聲明沒有明確回答這個(gè)問題,但這個(gè)問題的答案,可能比門檻設(shè)在哪里更直接地決定這套方案是否可行。
阿莫代在聲明中為能力較弱的創(chuàng)業(yè)公司和學(xué)術(shù)模型保留了豁免,但豁免仍然要回到同一個(gè)判斷:誰來認(rèn)定它"能力較弱"。如果測試標(biāo)準(zhǔn)、評估機(jī)構(gòu)和合規(guī)費(fèi)用主要由少數(shù)資金雄厚的實(shí)驗(yàn)室塑造,安全門檻也可能在客觀上變成競爭門檻。
批評者由此提出"監(jiān)管護(hù)城河"質(zhì)疑:Anthropic的安全主張可能保護(hù)以閉源模型收費(fèi)的商業(yè)模式。阿莫代對此否認(rèn),并主動(dòng)承認(rèn)全面禁令確實(shí)會(huì)幫助美國閉源模型公司,但稱這從來不是他的目標(biāo)。
反對者擔(dān)心的也不全是政治立場。Webflow工程負(fù)責(zé)人、前谷歌員工Yan Xie在X上提出,昂貴的模型審計(jì)對開放權(quán)重項(xiàng)目未必現(xiàn)實(shí),而小公司又需要依靠這類模型打造自己的垂直產(chǎn)品。這只是一名產(chǎn)品負(fù)責(zé)人的具體擔(dān)憂,卻點(diǎn)中了阿莫代方案需要解決的矛盾:不能讓低風(fēng)險(xiǎn)模型承擔(dān)前沿實(shí)驗(yàn)室的合規(guī)成本,也不能因?yàn)殚_發(fā)者規(guī)模較小,就默認(rèn)它發(fā)布的模型沒有危險(xiǎn)能力。
![]()
商業(yè)利益不能推翻安全風(fēng)險(xiǎn);但換個(gè)方向看,安全規(guī)則本身也會(huì)帶來市場后果,同樣需要審視。能力測試是否合理,最終還要回到更具體的問題:開放權(quán)重究竟在哪些場景幫助防守者,又在哪些場景讓攻擊能力更容易擴(kuò)散。
開放陣營的反駁
Anthropic與開放權(quán)重聯(lián)名信的共同點(diǎn),其實(shí)比表面上更多。阿莫代認(rèn)可開放權(quán)重能夠擴(kuò)大AI獲取、增加部分市場的競爭,也能讓客戶更好地控制模型。他與聯(lián)名方都反對全面禁令,也都承認(rèn)一項(xiàng)特殊風(fēng)險(xiǎn):模型權(quán)重一旦公開,原開發(fā)者很難再追蹤修改版本,更無法像撤回在線服務(wù)那樣把它收回來。
分歧出現(xiàn)在安全收益上。 黃仁勛7月24日在自己的第一條X帖子中寫道,開放模型能夠加強(qiáng)安全和網(wǎng)絡(luò)安全,世界既需要前沿閉源模型,也需要前沿開放模型。截至核驗(yàn)時(shí),這條帖子獲得約6300萬次瀏覽和17萬個(gè)贊。聯(lián)名信給出的理由是,面對使用AI的網(wǎng)絡(luò)攻擊,防守者也需要能力相當(dāng)?shù)哪P停桓嘌芯空吣軌蜻\(yùn)行、修改和測試模型,漏洞和保護(hù)措施就可能更快被發(fā)現(xiàn)。
![]()
Hugging Face聯(lián)合創(chuàng)始人兼首席執(zhí)行官克萊芒·德朗格(Clément Delangue)的說法更直接。他在X上稱,封禁開放模型對防守者造成的傷害會(huì)是攻擊者的"十倍",反而讓世界變得更危險(xiǎn)。開放陣營的核心邏輯就在這里:攻擊者總會(huì)尋找繞過限制的辦法,封禁開放模型反而可能讓防守團(tuán)隊(duì)更難獲得能力相當(dāng)?shù)墓ぞ摺?/b>
![]()
阿莫代則認(rèn)為,開放權(quán)重是否更有利于防守,要看具體風(fēng)險(xiǎn)。在網(wǎng)絡(luò)安全場景中,更多團(tuán)隊(duì)獲得模型,確實(shí)可能幫助它們分析攻擊、調(diào)整工具和修補(bǔ)漏洞;但在生物風(fēng)險(xiǎn)場景中,攻擊和防御需要的時(shí)間并不對稱。按照他的設(shè)想,危險(xiǎn)在于:AI可能將攻擊端的瓶頸(設(shè)計(jì)危險(xiǎn)病原體)大幅壓縮,但防御端的瓶頸(臨床驗(yàn)證和規(guī)模化生產(chǎn)疫苗)仍然受物理和生物過程約束。
這意味著,同一項(xiàng)"開放"在兩種場景中可能產(chǎn)生相反結(jié)果。它可以讓更多防守者獲得工具,也會(huì)讓更多攻擊者持有無法撤回的模型副本。公開權(quán)重還不等于模型變得完全可解釋:研究者可以運(yùn)行和修改參數(shù),卻不能像檢查普通開源軟件那樣,逐行確認(rèn)一個(gè)大型模型為什么會(huì)產(chǎn)生某個(gè)輸出。
兩種立場背后也存在不同的商業(yè)激勵(lì)。 芯片、云計(jì)算和開發(fā)工具公司會(huì)從更多模型、更多部署中獲得需求;Anthropic 等前沿實(shí)驗(yàn)室則主要通過專有模型和API 收費(fèi)。商業(yè)模式不能證明哪一方的安全判斷正確,卻會(huì)影響它們更愿意承擔(dān)哪一種風(fēng)險(xiǎn):基礎(chǔ)設(shè)施公司更擔(dān)心少數(shù)模型壟斷入口,閉源實(shí)驗(yàn)室更擔(dān)心能力發(fā)布后失去控制。
雙方真正爭的是默認(rèn)順序。 聯(lián)名信希望先保留模型開放和擴(kuò)散的空間,再針對已經(jīng)出現(xiàn)的濫用、侵權(quán)和安全問題采取措施;Anthropic 則希望能力較強(qiáng)的模型先證明風(fēng)險(xiǎn)可以控制,再?zèng)Q定是否允許它以不可撤回的方式發(fā)布。
阿莫代也承認(rèn),后一種方案只有在全球范圍內(nèi)實(shí)施才有效。如果美國實(shí)驗(yàn)室需要等待測試,而其他國家的同等能力模型仍可直接公開,強(qiáng)制審查既擋不住風(fēng)險(xiǎn),也可能只拖慢遵守規(guī)則的公司。如何讓不同國家接受同一套發(fā)布門檻,才是這份聲明留下的最大難題。
誰來握住發(fā)布閘門
Anthropic 的聲明沒有結(jié)束開放權(quán)重之爭,而是把爭論推進(jìn)了一步。全面禁令開始失去行業(yè)支持后,新的分界線變成了能力:普通開放模型可以繼續(xù)發(fā)布,接近前沿水平的模型則要先通過測試。問題也隨之從"模型能不能開放",變成"誰有權(quán)認(rèn)定它已經(jīng)強(qiáng)到不能直接開放"。
這道閘門需要在兩個(gè)層面同時(shí)成立。第一,規(guī)則設(shè)計(jì)層面:審查成本和標(biāo)準(zhǔn)制定過程不能系統(tǒng)性地偏向資金充裕的閉源實(shí)驗(yàn)室,否則安全門檻會(huì)在實(shí)踐中變成市場壁壘。第二,國際協(xié)調(diào)層面:如果美國實(shí)驗(yàn)室需要等待測試,而其他國家的同等能力模型仍可直接發(fā)布,規(guī)則既擋不住風(fēng)險(xiǎn),也只拖慢遵守規(guī)則的公司。
在此之前,Anthropic 提出的是一套清楚的發(fā)布原則,還不是一套能夠在全球執(zhí)行的發(fā)布制度。
