![]()
![]()
題圖:《AI BUBBLE》Beeple
文|Sleepy
現(xiàn)在這些 AI 公司,它們嘴上最警惕的那個(gè)東西,往往就是它們手上正在拼命造的那個(gè)東西。
開會(huì)談風(fēng)險(xiǎn),他們談得比誰都懇切,說這技術(shù)跑得太快,總得有人管管。會(huì)一散,模型照常發(fā)布,一個(gè)比一個(gè)強(qiáng),時(shí)間表一個(gè)比一個(gè)緊。
同一撥人,同一張嘴,上午警告,下午加速。你要說他們是裝的,又不像,可那臺(tái)滾滾向前的機(jī)器也是真的,一天都沒停下來過,而且越跑越快。
Anthropic 最新發(fā)布的模型 Fable 5 就活了三天。
6 月 9 日上線,6 月 12 日被叫停。那天下午 Anthropic 接到美國(guó)政府電話,給了 90 分鐘。傍晚五點(diǎn)二十一分,正式指令到達(dá),一切外國(guó)國(guó)民不論身在何處都不能繼續(xù)使用這個(gè)模型了,連 Anthropic 自己的外籍員工都不行。理由是國(guó)家安全。
![]()
國(guó)家安全這四個(gè)字,落到一個(gè)模型身上,聽著有點(diǎn)重。可它落得下來,是因?yàn)?Fable 不簡(jiǎn)單。這模型是 Anthropic 一直沒放出來的 Mythos 的「安全版本」,通過一層安全護(hù)欄確保人們無法用它來進(jìn)行網(wǎng)絡(luò)攻擊、科學(xué)研究等可能造成嚴(yán)重后果的事情。但 Amazon 卻向美國(guó)政府提交了一份報(bào)告,說有人能夠越獄,直接通過 Fable 調(diào)用 Mythos 模型,美國(guó)政府擔(dān)心的就是這一點(diǎn),于是果斷重拳出擊。
Anthropic 大概是全世界最認(rèn)真對(duì)待 AI 風(fēng)險(xiǎn)的公司。但無奈這兩年模型能力成長(zhǎng)得太快了,整條賽道只認(rèn)一個(gè)方向,往前。
Anthropic 比同行更早開始提醒大家如果這樣下去可能會(huì)有技術(shù)失控的風(fēng)險(xiǎn),甚至主動(dòng)說過,政府應(yīng)該有權(quán)攔住危險(xiǎn)的模型。
沒想到美國(guó)政府真動(dòng)手那天,第一個(gè)被攔住的是它自家的模型。
Amazon 提示了風(fēng)險(xiǎn),美國(guó)政府要護(hù)住國(guó)家,Anthropic 在做它認(rèn)定該做的安全防護(hù)工作。每個(gè)人都盡了責(zé),合起來卻沒迎來一個(gè)圓滿的結(jié)果。
這看著像終于有人給行業(yè)踩了腳剎車,其實(shí)不是。一個(gè)模型上線三天就被一道命令叫停,恰恰說明沒人肯自己慢下來,才輪到外頭動(dòng)手。要是公司、安全研究者、客戶和美國(guó)政府之間真有一套坐下來一起減速的辦法,事情走不到國(guó)家安全一刀切這一步。何況這一刀切下去,停的只有 Anthropic 一家,別人都還在跑。
Fable 這三天不是行業(yè)開始減速的證據(jù),是沒人能讓它好好減速的證據(jù)。
![]()
剎車也能成為競(jìng)爭(zhēng)力
Fable 5 從一開始就是個(gè)折中的產(chǎn)物。
Anthropic 手里真正鋒利的模型是 Mythos。它沒有公開就是因?yàn)槟芰μ珡?qiáng)了。2026 年 4 月,公司通過 Project Glasswing 把 Mythos 的預(yù)覽版交給一批安全機(jī)構(gòu),讓他們拿去找漏洞。
找漏洞這件事,本來就難分善惡。同一個(gè)能力,找出來是為了把洞補(bǔ)上,還是為了順著洞鉆進(jìn)去,取決于擁有這個(gè)能力的是誰。
可 Anthropic 終究也在這個(gè)每天都加速一點(diǎn)的賽道上。到了 6 月,它還是把這類能力推向了公眾。Fable 是 Mythos 的安全版本,高風(fēng)險(xiǎn)的請(qǐng)求會(huì)退回到更受限的 Opus 4.8,上線前做過紅隊(duì)測(cè)試,流量留存三十天,方便發(fā)現(xiàn)有人越獄。它同時(shí)還是一件商品,有定價(jià),有客戶評(píng)測(cè),有試用期,要賣錢,要在投資人眼里好看。
安全做成競(jìng)爭(zhēng)力,這本身就是個(gè)擰巴的事。競(jìng)爭(zhēng)力的意思是跑得比別人快,安全的意思是別跑太快。Anthropic 想讓這兩件事同時(shí)成立,可怎么同時(shí)成立,它自己到今天大概也沒太想明白。
創(chuàng)始人 Dario Amodei 做過 OpenAI 的研究副總裁,Anthropic 的一批創(chuàng)始成員也是從 OpenAI 出來的。他們見過模型一代代變強(qiáng)時(shí)人有多興奮,也知道那股興奮底下壓著什么。
![]()
OpenAI 后來的事可以拿來做參照。Altman 被解雇,五天后又回來,反過來把董事會(huì)重組了。Superalignment 團(tuán)隊(duì)成立時(shí)說四年解決安全問題,可不到一年就解散了。
Anthropic 是那場(chǎng)風(fēng)波之后長(zhǎng)出來的另一個(gè)答案。它說,強(qiáng)大的模型我們也要造,但要把剎車寫進(jìn)制度里。負(fù)責(zé)任擴(kuò)展政策到 2026 年已經(jīng)更新到 3.0,按安全等級(jí)給模型分級(jí)。他們說,技術(shù)在指數(shù)式地飛速發(fā)展,定規(guī)矩的世界還沒追上來,所以政府應(yīng)該有權(quán)攔住危險(xiǎn)的部署。
一邊自己造模型,一邊主動(dòng)說政府該有權(quán)攔模型。這背后得有一種信念,你得相信那只大手會(huì)謹(jǐn)慎地用權(quán),會(huì)走程序。這種立場(chǎng),我原先是有幾分敬重的。可 Fable 的三天,說明了這份信念有多不靠譜。
今年年初,Anthropic 就和五角大樓為 Claude 的軍事用途吵過一架。它做了 Claude Gov 給美國(guó)政府客戶用,但拒絕大規(guī)模的國(guó)內(nèi)監(jiān)控,也拒絕沒人盯著的致命自主武器。
在它看來,這是責(zé)任的邊界。在國(guó)家安全那套體系看來,邊界本身就是麻煩,因?yàn)檫吔缫馕吨悴豢贤耆摹?/p>
Anthropic 說的安全,是不要失控。國(guó)家安全體系說的安全,是一切都能掌控。
連剎車是什么都談不攏,誰還談得上證明自己擔(dān)得起責(zé)任。Anthropic 很快發(fā)現(xiàn)自己證明不了,因?yàn)楣饪孔约翰恍小?/p>
![]()
不能停,也不敢停
6 月初,Anthropic 提了一個(gè)想法,前沿實(shí)驗(yàn)室也許得協(xié)調(diào)著一起放慢,甚至一起暫停,給社會(huì)和政策留出追上來的時(shí)間。
協(xié)調(diào)。
為什么非得協(xié)調(diào)。因?yàn)橐患夜咀约郝聛恚澜绮粫?huì)因此更安全。Anthropic 停了,OpenAI 不一定停,Google 不一定停,資本市場(chǎng)絕不會(huì)停。
所以一個(gè)人單方面克制,在這種局面里算不上什么美德。先停下來的那個(gè),不會(huì)被記住,只會(huì)被頂替。
Anthropic 的問題,從來不是要不要負(fù)責(zé)。它很清楚自己要負(fù)責(zé)。真正的問題是,在別人未必負(fù)責(zé)的時(shí)候,一個(gè)人到底能負(fù)到哪一步。
過去的工業(yè)事故再?gòu)?fù)雜,總歸能找到一個(gè)相對(duì)清楚的源頭。可前沿 AI 不是這樣。一個(gè)模型的能力,來自算力,來自論文,來自開源社區(qū),來自投資人催著增長(zhǎng),也來自國(guó)家想要技術(shù)上的優(yōu)勢(shì)。每一塊都能撇清自己,說做決定的不是我。可這些塊拼到一起,就把世界推到了今天這一步。
責(zé)任拆散了,加速度還能保持住。
Anthropic 一邊在政策文件里寫 AI 跑得太快、治理跟不上,一邊發(fā)布新模型。
我并不是想說 Anthropic 是虛偽的。Anthropic 早就不是那個(gè)靠理想主義就能活下去的小實(shí)驗(yàn)室了。它得跟 OpenAI、Google、xAI 搶,得應(yīng)付融資和 IPO 的預(yù)期。硅谷嘴上都很敬重安全,可真到掏錢下注的時(shí)候,看的還是誰的模型更強(qiáng)。
所以它只能把事情拆成兩半。自己能做的,先做起來。需要整個(gè)行業(yè)一起做的,另外列出來,等別人。
務(wù)實(shí),也無奈。
Fable 就生在這條夾縫里。車停不下來,那就給車裝一套更復(fù)雜的剎車片。夾縫里逼出來的東西,注定兩頭都不討好。
![]()
站在中間
Fable 上線之后,最先不滿意的不是美國(guó)政府,是做安全的那批人。
IBM X-Force 的研究者 Chompie 說,F(xiàn)able 會(huì)拒掉一大堆只是沾點(diǎn)邊的安全請(qǐng)求,有時(shí)候讓它讀一篇博客都能觸發(fā)。
![]()
安全護(hù)欄想分辨的是意圖,可模型眼前只有語言和上下文。它分不清你掏出工具是要修門還是撬鎖,索性把兩種人一起攔下。
兩天之后,一份報(bào)告遞進(jìn)了美國(guó)政府的房間,從那一刻起,這件事就不再是 Anthropic 自己評(píng)判自己的安全設(shè)計(jì)了。
Anthropic 反復(fù)強(qiáng)調(diào)一個(gè)時(shí)間差。發(fā)布之前,它幾次知會(huì)過美國(guó)政府,美國(guó)政府沒反對(duì),甚至參與過發(fā)布前的測(cè)試,公司是拿到了部署許可的。三天之后,同一套系統(tǒng)忽然告訴它必須下架。
Anthropic 說,美國(guó)政府始終沒給出具體的細(xì)節(jié)。它自己看過演示,覺得那不過是幾個(gè)已知的、不算嚴(yán)重的漏洞,換別的公開模型一樣做得到。一直到聲明發(fā)出,美國(guó)政府拿出來的也只是口頭上的說法。
這個(gè)模型,開發(fā)者不滿意,美國(guó)政府也覺得不滿意。Anthropic 站在中間,里外不是人。
Fable 這件事的背后是一整條不信任鏈的運(yùn)行使然。一圈轉(zhuǎn)下來,每一環(huán)都在防著上一環(huán)。到最后,社會(huì)也很難再相信,這里頭還有誰真能把責(zé)任擔(dān)起來。
![]()
e/acc 是一種氣候
這個(gè)問題難就難在,每一方都覺得自己在負(fù)責(zé),而且都說得通。每個(gè)人手里,都攥著一份局部的正當(dāng)。
可怕的就在這兒。每個(gè)人都只為自己那一小塊負(fù)責(zé),加起來,卻沒有誰為整件事負(fù)責(zé)。責(zé)任被切成了碎片。公司內(nèi)控,模型評(píng)測(cè),出口管制,客戶需求,國(guó)家競(jìng)爭(zhēng),投資回報(bào),每一片都映出一點(diǎn)真的東西,沒有哪一片映得出全部。
當(dāng)連定義都統(tǒng)一不了,所有人唯一不會(huì)爭(zhēng)的方向,就只剩一個(gè)「快」。
Effective accelerationism,縮寫 e/acc,這幾年成了一套挺鮮明的技術(shù)樂觀主義。把技術(shù)往快里推,不用管監(jiān)管、社會(huì)結(jié)構(gòu)和倫理,相信進(jìn)步能解決掉那些大問題。
不是每家公司都自稱 e/acc,Anthropic 就更不會(huì)。可一種主張,從來不需要所有人認(rèn)可就改變大環(huán)境。
能力上的競(jìng)賽,燒不完的算力,融資的時(shí)間表,國(guó)家之間的較勁,軍方的需求,開發(fā)者對(duì)更強(qiáng)工具的饑渴。這些東西合在一起,就成了一種氣候。有人不喜歡這種氣候,可也得在里面過日子,跟所有人一樣。
強(qiáng)如 Anthropic,是這個(gè)加速時(shí)代里少數(shù)幾個(gè)反復(fù)念叨剎車的人,到頭來還是得先證明自己跑得夠快。
技術(shù)加速不需要一個(gè)壞人,它只需要每一個(gè)好人都覺得自己不能第一個(gè)停下來。
![]()
剎車一直都在
Fable 這件事就是把剎車交出去的代價(jià)。你盼著公權(quán)力介入,是因?yàn)樾袠I(yè)的自律不夠。可公權(quán)力不一定按你期待的方式運(yùn)轉(zhuǎn)。國(guó)家安全這臺(tái)機(jī)器最熟練的動(dòng)作不是協(xié)商,是封鎖、許可和例外。
AI 早就不是一件能畫清邊界的技術(shù)了。當(dāng)一個(gè)前沿模型同時(shí)嵌進(jìn)商業(yè)、科研、國(guó)防和基礎(chǔ)設(shè)施,還有誰有能力決定它不該被怎樣用。
所有人都知道速度太快。可速度本身,已經(jīng)成了活下去的條件。
一百多年前,也有過一次沒人敢叫停的加速。
1914 年 8 月 1 日傍晚五點(diǎn),德皇威廉二世下令全軍總動(dòng)員。命令剛發(fā)出去幾分鐘,倫敦來了一封電報(bào),說只要德國(guó)不打法國(guó),英國(guó)就能讓法國(guó)置身事外。德皇大喜,他本來最怕兩線作戰(zhàn),這下好了,全部兵力都能調(diào)去東邊對(duì)付俄國(guó)。他轉(zhuǎn)頭對(duì)總參謀長(zhǎng)小毛奇說,那我們就只往東打。
小毛奇說,辦不到。
他給的理由是,一支上百萬人的軍隊(duì),怎么開拔、走哪條鐵路、幾點(diǎn)幾分到哪個(gè)站臺(tái),全按計(jì)劃排死了。這套時(shí)刻表是用整整一年磨出來的,磨好之后,一個(gè)字都改不了。
后來很多歷史學(xué)家都講過這個(gè)故事。講的人多半把它當(dāng)成一個(gè)關(guān)于機(jī)器的寓言,說現(xiàn)代戰(zhàn)爭(zhēng)的機(jī)器精密到了這個(gè)地步,連開機(jī)器的人都按不住。
可再后來,人們又翻出一件事。那套時(shí)刻表,其實(shí)是改得動(dòng)的。鐵路部門每年都演練怎么臨時(shí)改線、改時(shí)間,東線的方案也一直備著。火車真要掉頭,掉得過來。
也就是說,剎車一直都在。
那一夜真正發(fā)生的,不是沒有剎車,是站在閘邊上的那個(gè)人,一口咬定剎車碰不得。他沒去問能不能改,他太確定不能改了。
于是火車?yán)^續(xù)一列列往西邊開,把一場(chǎng)本來能關(guān)在三個(gè)國(guó)家之間的沖突,拖成了一場(chǎng)把整個(gè)歐洲都埋進(jìn)去的大戰(zhàn)。沒有人想要這個(gè)結(jié)果。每個(gè)人當(dāng)時(shí)都覺得,自己只是在做那件最該做、也最沒法不做的事。
我之所以想起這列火車,是因?yàn)?AI 的加速也是這樣一列已經(jīng)發(fā)動(dòng)的車。它不是哪個(gè)人造出來的,是算力、資本和國(guó)家的野心,一節(jié)一節(jié)掛上去,自己往前開。車上坐著所有人,每個(gè)人都在做手邊最該做的事,火車還是一直往前開。
這是 AI 時(shí)代讓我感不安的地方。危險(xiǎn)不是沒人看見,剎車也不是真的不存在。喊剎車的人就坐在車?yán)铮牢kU(xiǎn)的人腳還踩在油門上。
這個(gè)行業(yè)最警惕的東西,往往就是它自己正在拼命造的那個(gè)東西。Fable 本該是個(gè)讓所有人停下來看一眼的例子。可等我寫完這些,新模型又發(fā)布了幾個(gè),都說自己最強(qiáng)。
愿意先踩剎車的人,一個(gè)都沒有。
參考資料
[1] Anthropic: Claude Fable 5 and Claude Mythos 5
[2] Anthropic: Statement on the US government directive to suspend access to Fable 5 and Mythos 5
[3] Anthropic: Responsible Scaling Policy Version 3.0
[4] Anthropic: Policy on the AI Exponential
[5] Anthropic: Claude Gov models for U.S. national security customers
[6] Axios: Anthropic had 90 minutes to take down Fable after Trump admin demand
[7] Axios: How Amazon and the White House ended Anthropic's Fable
[8] TechCrunch: Cybersecurity researchers aren't happy about the guardrails on Anthropic's Fable
[9] Washington Examiner: Amazon researchers use Anthropic AI to find cybersecurity weaknesses
[10] AP: A former OpenAI leader says safety has taken a backseat to shiny produc
[11] WIRED: OpenAI's Long-Term AI Risk Team Has Disbanded
[12] Business Insider: OpenAI and Anthropic keep warning about a future they're building at breakneck speed
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.