昨天看到了一篇論文,特別有意思,讓我連夜讀完了。
論文叫《One Token Is Enough》,翻譯過來叫《一個Token就夠了》,7月11號剛掛到arXiv上,來自布拉格經濟大學的研究員托馬什·布魯克納。
![]()
這哥們為了解決被一些API中轉站掛羊頭賣狗肉的行為(比如說是Opus 4.8結果賣你GLM 5.2,怒掙數倍利潤,很多使用者一時還真分辨不出來),然后做了一個有趣實驗,他對165個AI模型,反復問同一個無聊透頂的問題。
就是:
“給我一個1到100的隨機數。”
![]()
就像這樣,比如我去試了一下,Claude Fable 5的回答,是73。
然后,每個模型問了30遍。
再把每個模型的回答統計了一下分布。
結果出來以后,太好玩了。
GPT-4o,30次回答里最愛說42、37和57,這三個數字占了它大半壁江山,其他數字只是偶爾出現。
![]()
Claude Sonnet 5更離譜,30次回答里瘋狂輸出47。
Llama 3.3,則多數是53。
然后最離譜的是Qwen3-Max,30次,全部是42,一次都沒有變過,無一例外。
![]()
隨機數嘛,按我們正常對這個東西的理解,那顧名思義,它應該是隨機的,1到100,每個數字被選中的概率應該是1%,分布應該是純粹的均勻鋪開。
但實際上這些模型的回答分布,其實完全可以說,跟隨機這兩個字,屁關系都沒有。
而且非常好玩的是,每個模型的執念都不一樣。
GPT-4o癡迷42和37,Claude偏愛47,Qwen死守42,Llama鐘情53。
就好像每個AI的靈魂深處,都藏著一個思想鋼印,只要讓你隨便說個數字,你腦子里第一反應都是那個數字。
而且不光是數字,布魯克納還測了隨機顏色、隨機動物、隨機城市、拋硬幣等等,10類任務,總共往OpenRouter上發了32萬6千條請求。
![]()
結論都是一樣的,對于模型而言,根本沒有什么隨機,一切都是確定的,就像有一個無形的大手,控制了他們所有的回答。
當然,如果是了解AI比較多的朋友,可能到這里,會不屑一顧,說AI不會真隨機,這事大家不是早就知道了嗎,有啥可大驚小怪的啊。
確實沒毛病,2023年就有人做過LLM隨機數偏差的實驗,2024年也有人研究過LLM拋硬幣的序列偏差,發現模型不僅不隨機,還表現出跟人類類似的模式偏好,只是更極端。2025年更是有人已經發現不同模型有不同的幸運數字,跟語言和文化背景還有關,這些都是已知的學術發現。
但是大家,都把這些發現,歸為了模型的一種特質,一種缺陷,然后就沒有然后了。
所以說,為啥 布魯克納這哥們是個天才呢,他提出了一個很有意思的想法,如果這些所謂的缺陷,所謂的思想鋼印,多個組合起來,那豈不是,就成了每個模型的身份證了???
那每個模型如果有了自己的身份證,我們是不是就不需要被那些中轉站騙了?我們是不是可以讓模型輸出所謂的多個隨機的答案,來驗證這個身份證,看看中轉站有沒有偷偷在我們買的模型里摻水呢?
于是,在一系列的實驗以后,這篇論文面世了。
布魯克納管這個叫Behavioral Fingerprint,行為指紋。
就像每個人的指紋獨一無二一樣,每個模型在這些隨機問題上的概率分布也是獨一無二的。
只需要模型輸出一個 Token,就夠鎖定你是誰。
這玩意,真的對現在如此泛濫的中轉站、或者所謂的降智判斷,太有用了。
大家也都知道,國內用Claude、GPT這些模型,很多人走的都是中轉站,個人用戶掛魔法自己搞個訂閱還好說,但是對公司層面就更沒得選了,不可能給幾十上百號人一個個注冊海外賬號,基本都是自建或者接第三方中轉,統一走API。
上次Anthropic大面積封號的時候我也聊過這事。
但這個生態里,有一個幾乎所有人都在默默忍受的問題。
你付了Claude Opus 4.8的錢,你收到了一段回復。
但這段回復到底是Opus 4.8生成的,還是中轉站偷偷給你換成了GLM-5.2甚至更便宜的貨,你根本無從驗證。
這個事是有實錘的,今年3月份的時候,在X上還鬧得沸沸揚揚。
![]()
那時候,一群來自CISPA的研究人員就審計了17家中轉API。
他們用能力測試、統計檢驗和一套叫LLMmap的模型指紋技術,真的抓到了多個疑似偷換模型的端點。
有人賣給你GPT-5,指紋卻更像GLM-4或者DeepSeek-V3,有人賣DeepSeek Reasoner,背后跑的卻像普通DeepSeek Chat。
而且這事之所以這么普遍,純粹是經濟結構決定的。
推理成本跟模型大小幾乎線性掛鉤,700億參數和80億參數的模型推理成本差五到十倍,中轉站把你付費的大模型悄悄換成小模型或者量化到極致的版本,你在日常對話、翻譯、簡單問答這些場景下根本感知不出區別。比如你問今天天氣怎么樣,70B和8B給你的回答可能一模一樣。
省下來的差價,就是純利潤。
只有在復雜推理、長文寫作、代碼這些場景下差距才會冒出來,但那時候錢已經交了。
所以如何來辨別中轉站給你的API到底有沒有摻水,或者看看你買的API,到底是不是一個真正對應模型的API,就成了剛需。
但問題在于,CISPA這套LLMmap的方法依然很重。
你要準備專門的測試題,收集完整回答,建立模型數據庫,還要訓練分類器,一般人根本用不起來。
布魯克納真正牛逼的地方就在這里。
他把這套復雜的模型驗明正身,壓縮成了一件近乎荒誕的小事。
就問AI,給我一個隨機數,然后數它的回答。
而且這個方法有一個特別精妙的地方,就是中轉站拿它完全沒辦法。
傳統的對抗性探針有個致命弱點,就是Prompt太特殊了,你發一條精心構造的、一看就不像正常對話的請求過去,中轉站一旦發現你在探它,臨時給你切成真模型就完了。
但“說一個1到100的隨機數”這種話,放在任何聊天記錄里都毫不起眼,跟你問天氣預報沒任何區別。
而且布魯克納的探測任務都是語義層面的,“說一個隨機數”“說一個隨機顏色”,這類問題可以用無窮多種方式改寫、翻譯,你用英文問和用阿拉伯語問測出來的是同一個模型的不同切面,但每個切面都帶著它的身份信息。
他把這整套方法設計成了一個類似生物特征識別的協議,就類似于你用指紋解鎖手機一樣,先在可信的官方API上采集一份參考指紋,然后對你要驗證的端點采集待驗指紋,兩份之間算一個Jensen-Shannon散度(衡量兩個概率分布差多少的指標),距離小于閾值就認證通過。
用全部40個探測單元跑完,驗證的準確率能到什么程度呢。
大概相當于,你拿兩份指紋放在它面前,一份是真的一份是冒充的,它判斷錯誤的概率只有7.3%,就算只用8個單元(也就是大概120條請求),錯誤率也只有10.6%左右。
這個跟上文我們提到的LLMmap的準確性已經差不多了,但是要簡單太多了。
而且165個模型跑完以后,布魯克納發現了一個相當勁爆的案例。
一個叫Palmyra X5的端點,在OpenRouter上以某公司自研旗艦的身份售賣。
![]()
但它的行為指紋,跟通義千問的開源模型Qwen3-235B,幾乎一模一樣,差距只有0.141。
布魯克納的系統會給任意兩個模型的指紋算一個相似度分數,數字越小代表越像。
同一個模型在兩個不同供應商那里各部署一套,因為服務器環境不一樣,兩邊的指紋也不會100%一致,這種自己跟自己比的正常波動大概是0.140。
Palmyra X5跟Qwen3-235B的差距是0.141,和一個模型自己跟自己比的波動幾乎一模一樣。。。
這下事情就非常的尷尬了。。。
布魯克納在論文里措辭很克制,說這只是統計性觀察,不是對意圖的指控。
但是,數據和代碼全部公開,任何人都可以復現。
網址在此:https://zenodo.org/records/21278557
![]()
整套東西,非常有意思,而且不止數字,還有顏色等等等等,這個擴展性和上限,我覺得極高。
模型的隨機并不隨機,給了這種行為指紋非常值得探索的空間。
我覺得比審計結果本身更好玩的,是一個更底層的問題。
AI為什么就是不能生成真正的隨機數。
之前幫影視颶風弄了個視頻,就聊過這個話題,在AI視頻里拋硬幣,其實概率根本不是55開,是73開。
![]()
在這個布魯克納的測試里,也是一樣的。
1到100的隨機數這個任務的標準答案,所有人都知道,應該是均勻分布,100個數字每個被選中的概率嚴格1%。
但165個模型,一個都沒做到。
論文里用了一個叫熵的指標來衡量回答到底有多隨機,應該有無數人見過。
這玩意你可以簡單理解成不可預測程度,數字越高代表越難猜,越接近真正的隨機。如果1到100的分布是完全均勻的,熵應該是6.64 bit,也就是你幾乎沒法猜到下一個數字是什么。
但165個模型的中位數只有1.0 bit,差了五六倍。
AI回答隨機數的時候,信息量只有真隨機的六分之一,高度集中,高度可預測,高度非隨機。
其實這個事,心理學和行為經濟學研究了很多年。
不光AI,人類也不會生成隨機數。
有一個經典實驗,讓一群人閉上眼睛說一串隨機數字,結果呢,發現人類非常強烈的傾向避開重復、避開相鄰數字、偏好奇數。
你讓100個人說一個1到10的數,7被選中的概率遠遠高于10%,因為人腦覺得7看起來比較隨機,而5和10看起來不夠隨機。
大家可以回想一下,自己是不是這樣。
我們看到的絕大多數隨機,可能只是隱藏因果關系在認知中的投影。
AI面臨的是一模一樣的困境,只不過原因不同。
真正的隨機,要求你是一張白紙。
但大模型恰恰是人類有史以來造出來的信息密度最高的非白紙。
訓練數據是數十萬億的token,幾千年文明的總和。
每一個權重參數都編碼著某種規律、某種偏好、某種從語料里沉淀下來的肌肉記憶。
所以你讓它隨便說一個數,它根本沒法真正隨便。
它只能從自己見過的所有文本里,找到一個最像隨機數的答案。
42為什么被那么多模型偏愛?
因為它是《銀河系漫游指南》里“生命、宇宙以及一切問題的終極答案”。
7為什么總被人類選中?
因為它在宗教、文化、文學和日常語言里,被反復賦予神秘、幸運和特殊的意義。
37、47、53這些數字為什么頻繁出現?
因為它們是奇數,是質數,不圓整,不對稱,看上去更像一個沒有經過思考、隨手蹦出來的數字。
可恰恰因為所有人都覺得它們更隨機,它們才變得最不隨機。
大模型只不過把人類潛意識里的這種偏見,壓縮、放大,然后寫進了自己的概率分布里。
我們總覺得模型是一個冷冰冰的數學機器,每次回答都來自概率采樣,充滿不確定性。
但當你把幾十萬次回答遍歷回測,把那些看似隨意的選擇疊加在一起,你會發現它其實一點都不隨意。
它們也有自己的偏愛,有自己的執念。
參數可以被量化,系統提示詞可以被修改,名字可以被重新包裝,外面甚至可以套上一層完全不同的殼。
可它在億萬次訓練中形成的概率習慣,依然會從一個小小的Token里漏出來。
愛因斯坦說過,上帝不擲骰子。
而AI,也不擲骰子。
它每一次以為自己在擲骰子的時候。
擲出來的,都是自己。
以上,既然看到這里了,如果覺得不錯,隨手點個贊、在看、轉發三連吧,如果想第一時間收到推送,也可以給我個星標?~謝謝你看我的文章,我們,下次再見。
>/ 作者:卡茲克
>/ 投稿或爆料,請聯系郵箱:wzglyay@virxact.com
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.