硅谷突然開始嫌token太貴了。
有一陣子了,整個AI行業沉浸在智能體遞歸進化到AGI的樂觀氛圍里。在Anthropic創造的敘事里,更貴的token永遠有它成立的道理。但過去一周,三個幾乎同時出現的信號,揭開了這一表層敘事下,另一種完全不同的現實。
第一,微軟內部開始大規模限制Claude Code的使用。理由并不復雜,因為它太貴了。負責Windows、Microsoft 365、Outlook、Teams和Surface的“體驗+設備”部門,必須在6月底前停用Claude Code,并將工作流遷移到自家的GitHub Copilot CLI。
但很難說,這只是一場內外部產品之爭。據稱,這次斷供,財務部門扮演了關鍵角色。盡管工程線用得很爽,一致反饋,Claude Code對生產力提升巨大;但負責預算的高管們,卻沒有看到代碼規模的增長,為相應軟件帶來收入的暴漲。你到處都能看到AI,除了在營收報表上。
更耐人尋味的是,上個月,微軟對外服務的GitHub Copilot,剛宣布全面轉向按量計費。智能體正在持續燃燒token,當微軟面對自己的外部客戶時,也不想被薅了羊毛。它對自己“停用”是節流,對客戶“改價”是開源,本質上都是為了把成本與價值的賬本重新對齊。在這場由智能體主導的token燃燒面前,即使是微軟這樣財大氣粗的科技巨頭,也感受到了一絲壓力,AI成本開始進入預算約束。
一方面,前沿水平的單位token價格正在上升。硅谷三大巨頭正在試探API客戶的承受能力。谷歌新近發布的Gemini-3.5-Flash,價格顯著上漲,是同類Gemini-3.1-Flash-Lite的6倍,也接近Gemini-3.1-Pro的價格。OpenAI 的GPT-5.5價格是GPT-5.4的兩倍,而考慮到新的分詞器,Claude-Opus-4.7的價格約為Opus-4.6的1.46倍。
另一方面,智能體及其harness,正在改變token經濟學。它追求更高的性能,更高的速度,也就是更高的單位token成本;token也越來越多地承擔系統控制的角色,其代價就是額外的調度復雜性、token開銷與延遲累積,從而顯著推高總體消耗。在用戶開始輸入提示前,智能體就會提前塞進去各種內容,使得智能體的單次任務負載中位水平,來到了10萬token量級。
![]()
現在,所有的大模型廠商,都在演化為智能體廠商。OpenAI聯合創始人Greg Brockman認為,單單一個模型,已經不再構成產品本身。未來的token經濟學將在這一趨勢下展開。
第二件事,是DeepSeek宣布V4-Pro永久降價75%。這不是促銷,不是新用戶補貼,也不是互聯網的燒錢換規模。這意味著DeepSeek跑通了某種結構性的成本優勢。硅谷風投YCombinator合伙人很好奇,模型優化與芯片協同,在其中起到了多大的作用。
現在,據Artficial Intellgence統計,運行其指定測評任務的成本,V4 Pro僅為Gemini-3.1-Pro-Preview的約1/3,GPT-5.5的約1/12,Claude-Opus-4.7的約1/19。
年初,DeepSeek在DualPath論文中,揭示了在Angetic AI場景下,KV緩存命中率高居95%。壓縮與管理KV緩存,不僅是降低單位token成本的關鍵,也將AI的成本函數“與上下文長度線性相關”重構為“僅與新增決策相關”。這使得智能體可以在長時間、多輪交互中持續運行,而不會因為歷史上下文的膨脹而成本失控,從而將 AI 從“被調用的工具”轉變為“持續運行的過程”。
2026/02/27 完整閱讀 >
這也將影響模型下游的產品設計。盡管DeepSeek的性能,仍然落后硅谷半年左右,但它仍然在迅速獲得市場。在OpenRouter上,調用V4-Flash模型的請求,一直都在增長。甚至,基于V4的“原生”智能體產品也在涌現。Reasonix專為DeepSeek的緩存機制,打造了一套harness框架,核心目標就是“省錢”。DeepSeek正在招募harness工程師,也許它將成為新的領域的“價格屠夫”。
![]()
第三件事,是華為對“韜(τ)定律”的探索與實踐。在這一框架下,在晶體管密度受限的情況下,華為開始從底層器件、電路、芯片與系統層面,同步壓縮數據傳輸時間與能耗。該公司已經圍繞超節點,同步推進統一總線UB-Mesh、Hi-ONE近封裝光學、背面供電以及近存計算等技術,也在嘗試將鯤鵬與昇騰實現“邏輯折疊”,實現單位算力token吞吐上的“時間擴展”。
2026/05/26 完整閱讀 >
是折疊,而不是堆疊。這意味著它有別于當前行業嘗試的2.5D封裝,是在Z軸方向上,在cell層面邏輯與計算拓撲的重構。無論是半導體專家,還是金融分析師,美國都相當關注華為這次戰略方向的選擇。Bernstein喊出了這是另一個“DeepSeek時刻”。
![]()
在今天IEEE中國的直播中,華為進一步提到,鯤鵬950是第一代折疊的“超級CPU”。在其他因素基本不變的情況下,鯤鵬950通過重新組織CPU核與互聯結構,使關鍵路徑長度顯著縮短。它的垂直折疊后的微架構投影面積減少約40%,平均線延遲下降約8%,僅此一項就帶來了約468MHz的頻率增益;而時鐘樹縮短與時鐘偏差優化,則進一步貢獻了接近100MHz的額外提升。最終,這顆原本運行在2.6GHz的CPU核,被直接推升至3.2GHz,同時能效提升超過10%。華為已在規劃鯤鵬960,它將更激進,CPU內核直接參與邏輯折疊。
此外,最近,華為展示了基于自研板上裸片封裝(DoB)封裝技術的大容量SSD系列,目前已量產61.44TB和122.88TB兩款產品,245TB版本也在規劃中。華為還有自研高帶寬內存HiBL 1.0。
這不禁令人想到,DeepSeek深度適配了昇騰950,也將得益于整個超節點的“時間擴展”。DeepSeek降價,或許已經暗示整個本土AI算力生態的進程。在這次的V-4版本中,DeepSeek還未將Engram等技術融入模型,它將更有效地將“記憶”根據訪問頻次依次卸載到對應的存儲層級中去。外界甚至傳言V-4.1會很快到來。
2026/01/14 完整閱讀 >
三條線索交匯在一起,指向一場更深層的競爭:token正在從一種“技術單元”變為一種“生產要素”,而它的經濟學,正在被納入工業化式的邏輯。
在這場競爭里,本質上存在兩條同時推進的效率邊界。一條在算力工廠內部,圍繞吞吐、延遲與成本的三角尋找最優解;一條在工廠大門之外,在“更貴但更強”與“夠用但廉價”之間爭奪市場最優點。
第一條,是AI工廠自身的效率邊界。在黃仁勛的框架下,推理的token經濟學,是一條在吞吐量(TPS/兆瓦)與交互性(TPS/用戶)之間展開的價值曲線。吞吐量越高,能響應更多用戶,單價就越低,速度也就越慢;而對延遲極為敏感的高價值場景,硬件成本也就需要分攤給更少的并發用戶。
在固定算力與能源約束下,同時實現更大的token吞吐量、更低的推理延遲與更低的單位成本,是一個“不可能三角”。行業正在努力拓展帕累托最優的邊界,也就是把整體瓶頸往上推,然后再在三者之間做出新一輪權衡。這也是為什么,在財報會議上,黃仁勛越來越多地談論Groq LPU與Vera CPU;他同樣非常擔心華為這個真正擁有垂直整合能力的競爭對手。
第二條邊界,則存在于AI供給與市場需求之間。更高智能、更高成本的模型,與“足夠智能、但足夠便宜”的模型之間,存在一個不斷移動的市場最優點。盡管高價值的token,對應著更迅速的產品迭代速度,但是能夠支付這樣預算的客戶,并非沒有上限;而大量低價格的token,服務于更廣泛的市場,也將創造一個總量更為龐大的市場。
昂貴的token,仍然需要在AI應用的最后一環證明自己。如果AI真的在創造規模增量市場,那么,科技巨頭們更可能在保持原有員工規模大致不變的基礎上,利用AI順勢大幅擴張市場,而不是大量裁員,或為AI轉型和AI投資騰預算與編制。用AI代替員工,在相當程度上只能說明,整個需求市場并沒有對應token成本的大幅擴張。
2026/05/22 完整閱讀 >
DeepSeek真正的市場競爭力,在于它在中國建立起一套可復制、可擴展的“AI工廠”路線圖,把“有效智能”帶進了工業品的價格區間。編碼軟件公司Replit首席執行官也說,中國研究者實際上公開分享了真正的人工智能突破,惠及所有人,包括小型(甚至可能是大型)美國實驗室。幾十年來,那些“低技術”實體經濟無法以有意義的方式數字化,并非不想,而是因此它們的利潤率無法承受這樣的成本。
杰文斯悖論的成立,在于成本的不斷下降。但硅谷正在發生的一切,并非這樣。價值主要沿著前沿模型、云巨頭、芯片巨頭與能源巨頭,甚至與監管密切相關的平臺集中;全球萬億美元上市公司已經達到12家,其中9家是在2023年后躋身這一俱樂部。它們幾乎都受益于這一輪AI浪潮,但是AI之外的其他部門,被擠出到這場盛宴之外。
黃仁勛在電話會議上,將ACIE業務敘事錨定在全球工業與企業經濟活動約50–80萬億美元的宏觀底盤之上;馬斯克在SpaceX招股書中,將其AI企業服務的可獲取市場空間鎖定在約22.7萬億美元;中國在“人工智能+”行動中,將2030年新一代智能終端、智能體等應用普及率設定在90%以上。這些數據所指向的,正是token經濟學的工業化競爭的未來。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.