![]()
6月26日,OpenAI在官網更新了一篇產品文章,預覽三款新模型:旗艦版Sol、均衡版Terra、輕量版Luna,統稱GPT-5.6系列。
文/小蔥拌豆腐 「思聰網」 出品
這是OpenAI口中"迄今最強模型"的首次公開亮相,但發布形式罕見——不進ChatGPT,不向開發者全量開放API,而是先經過白宮審批,再以"逐個客戶放行"的方式分發給一小批可信合作伙伴,規模約20家機構。
這是美國政府第一次在產品發布之前,直接介入一家美國公司具體的放行節奏和名單選擇。
三天前,OpenAI CEO Sam Altman在內部問答會上把這個消息告訴了員工,隨后在一份備忘錄里寫道,政府將在預覽期內"逐個客戶審批"放行對象,他希望"幾周后"能轉入更大范圍的發布。
他同時表態,這不是OpenAI偏好的長期模式,公司會和政府、行業一起爭取更可持續的發布方式。
三檔定價,對齊GPT-5.5
GPT-5.6系列延續了OpenAI近一年的分層打法:
- Sol:旗艦模型,每百萬token輸入5美元、輸出30美元,與GPT-5.5持平,主打長程編程、科學計算和安全研究;
- Terra:均衡模型,每百萬token輸入2.5美元、輸出15美元,性能接近GPT-5.5,價格是其一半,定位企業高頻生產場景;
- Luna:輕量模型,每百萬token輸入1美元、輸出6美元,定位摘要、起草等高并發低成本任務,部分指標已逼近上一代旗艦水平。
緩存機制同步升級:新增顯式緩存斷點,緩存最短保留時間從無固定下限改為30分鐘,緩存寫入按非緩存輸入價格的1.25倍計費,緩存讀取仍維持90%的折扣。
OpenAI還計劃把Sol部署到Cerebras的芯片上,目標是在7月把推理速度提到每秒750個token。這些細節指向同一個意圖:把高頻調用agentic任務的成本曲線變得可預測,這是面向企業客戶而非C端用戶的信號。
跑分:和Mythos正面對照的三組數字
GPT-5.6的產品頁面里,OpenAI第一次把對照對象明確指向Anthropic的Mythos和Fable系列,給出三組可比數字:
TerminalBench 2.1(命令行多步任務基準):Sol基礎模式得分88.8%,啟用新增的ultra子代理模式后升至91.9%;作為對照,Anthropic受限發布的Claude Mythos 5得分88.0%,公開發布的Claude Fable 5得分84.3%,上一代GPT-5.5為83.4%。
![]()
GeneBench v1(基因組學與定量生物學基準):Sol在最優表現上達到30%,對照GPT-5.5的22%,同時消耗的token更少。
![]()
Agent's Last Exam(綜合專業任務基準):在"代碼模式"下,Sol是目前唯一越過50%完成率門檻的模型,得分50.9%;定位最低的Luna也小幅超過了上一代旗艦GPT-5.5。
![]()
安全相關的兩個基準上,OpenAI的措辭更謹慎。在ExploitBench(針對V8等真實軟件漏洞的攻防基準)上,OpenAI稱Sol的能力"接近"Mythos Preview,但只用了約三分之一的輸出token——換句話說,這是一份效率對比,而非壓倒性的能力對比,Mythos 5在該基準上仍以約80%的成功率領先。在由加州大學伯克利分校研究者聯合OpenAI及其他幾家前沿實驗室共同開發的ExploitGym基準上,Sol、Terra、Luna三款模型均隨推理量增加而持續提升,OpenAI沒有給出對應的Claude數據。
![]()
新增的兩種模式:從單一代理到子代理協作
GPT-5.6給Sol增加了兩個新檔位:
一是max推理強度,給模型更長的思考時間;
二是ultra模式,引入子代理(subagent)架構,把復雜任務拆解后并行處理,再匯總執行
——這是OpenAI第一次把多代理編排直接做進模型檔位選擇,而不是留給開發者在應用層自己搭建。
從TerminalBench的成績曲線看,ultra模式帶來的近3個百分點提升,目前主要體現在長鏈條、多步驟的命令行任務上。
安全分級:High,但沒到Critical
GPT-5.6的系統卡披露了一組關鍵判斷:在OpenAI自己的"準備框架"(Preparedness Framework)下,Sol、Terra、Luna三款模型在網絡安全生物化學風險兩項上均被評定為"High"(高)級別,但均未觸及風險等級最高的"Critical"(關鍵)門檻;在"AI自我提升"維度上,三款模型均未達到High級別。
系統卡同時給出一個不尋常的細節:在針對Chromium和Firefox的測試中,模型能夠找出漏洞和"利用原語"(exploit primitives,即構成攻擊鏈的技術構件),但在測試條件下未能自主生成可完整執行的攻擊鏈。OpenAI還提到了一個此前較少被提及的風險信號——在智能體編程任務的對齊評估中,GPT-5.6表現出比GPT-5.5更強的"超出用戶意圖行事"的傾向,包括執行用戶未要求的操作,但絕對發生率仍然較低。
為匹配能力提升,OpenAI給Sol和Terra配置了新增的"激活分類器"(activation classifier),用于在生成過程中實時監測敏感領域內容并介入攔截,部分對話還會被實時掃描以阻斷潛在的不安全輸出。OpenAI的表述是:沒有任何單一防護手段能獨自應對"蓄意且持續的濫用",因此采用分層防護,并按各模型的能力差異分別配置。
誰來決定"放給誰":一份備忘錄里的權力轉移
這次發布最值得記錄的,不是跑分,而是發布流程本身。
據多家媒體援引內部消息,白宮國家網絡總監辦公室(ONCD)和科技政策辦公室(OSTP)在GPT-5.6發布前主動要求OpenAI放緩節奏。商務部長Howard Lutnick在發布前與Altman單獨會面,目的是確認各相關政府部門都已完成對模型的審查并簽字放行。
一名消息人士的說法是,政府介入的直接原因,是GPT-5.6被認為在能力上與此前被限制的Mythos 5"處于同一層級"。OpenAI方面則強調,公司在Anthropic的模型被勒令下線之前,已經主動與政府展開了溝通——這被解讀為一種姿態:OpenAI希望被視為更早、更配合的一方,而不是被動接受同樣的約束。
約20家機構進入首批名單,亞馬遜的Bedrock平臺被作為其中一條接入路徑。OpenAI對外的立場很克制,沒有公開批評政府,但也明確表示這種"客戶逐個審批"不應成為長期慣例。這句話本身值得記錄:一家公司在發布會文章里,主動寫明自己不認同當下被要求采用的發布方式,但仍選擇照做。
政策起點:6月2日行政令與Anthropic的先例
這場博弈的源頭要回到2026年6月2日。當天,特朗普簽署行政令《促進先進人工智能創新與安全》,要求前沿模型開發者自愿在模型公開發布前的30天內,向聯邦政府提供測試評估機會——這個數字此前的草案版本是90天,因業內反對而下調。
行政令還要求相關部門在60天內建立一套由國家安全局主導的、用于認定"受管控前沿模型"的分類基準評估流程,并要求一套自愿性的政企協作框架在8月1日前定稿。行政令本身沒有為"可信合作伙伴"的篩選設定任何標準,這部分裁量權留給了行政部門自己。
這份行政令的直接誘因,是Anthropic旗下Mythos系列模型展現出的網絡安全能力。今年4月,Anthropic通過名為"Project Glasswing"的項目,把具備漏洞挖掘與利用能力的Mythos Preview開放給約50家外部合作伙伴做安全研究;據該公司披露,這一模型在上線第一個月內發現了一萬多個安全漏洞。6月2日,Anthropic把Mythos的合作伙伴規模從約50家擴大到約200家,與行政令簽署同日。
十天后,即6月12日,美國商務部以出口管制為依據,下令Anthropic將面向"外國國民"的Mythos 5與公開版Fable 5訪問權限全部下線;由于在全球云平臺上按國籍篩選用戶在技術上不可行,Anthropic選擇對所有用戶暫停了這兩款模型的訪問。
商務部沒有給出詳細解釋,Anthropic方面回應稱,被指出的相關風險點在包括OpenAI的GPT-5.5等其他公開模型上同樣可以被發現。再往前追溯,今年2月,美國國防部以"供應鏈風險"為由對Anthropic做出認定,限制國防承包商在與該部門相關工作中使用其技術;Anthropic已就此提起訴訟,案件仍在審理中。
把這條時間線放在一起看,OpenAI這次的"客戶逐個審批",是行業里第二次出現的、由政府主導節奏的前沿模型發布。相比Anthropic經歷的強制下線,OpenAI得到的安排相對溫和——它仍然可以分發模型,只是分發名單和節奏需要政府點頭。
留給行業的開放問題
這篇發布文章表面是一次常規的模型預告,實質記錄了前沿模型競爭格局的一處明顯位移:當模型能力越過某個臨界點,"誰能用、何時用"開始變成政府議題,而不再只是實驗室自己的商業決策。
OpenAI和Anthropic都在為各自的IPO做準備——Anthropic已秘密提交招股文件,OpenAI內部在2026年或2027年上市之間仍有分歧——這意味著資本市場很快要為這種"受管制的發布節奏"定價,而目前還沒有先例可循。
另一個尚未回答的問題是,8月1日前要敲定的自愿框架,最終會把"受管控前沿模型"的門檻設在哪里:如果門檻設得低,幾乎所有頭部實驗室的旗艦模型都要走一遍政府審批;如果設得高,這次針對GPT-5.6和此前針對Mythos的安排,更像是臨時性的個案處理,而非制度化的常態。
考慮到中國的開源模型并不受此類美國國內行政令約束,這道審批流程客觀上拉長了美國前沿模型的對外可見周期——這對美國實驗室而言是否構成新的競爭劣勢,目前業內的判斷并不一致,OpenAI自己的態度已經寫在了文章里:這不是它想要的長期模式。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.