大家好,我是 Ai 學習的老章
這兩天 Codex 社區有個 issue 吵得挺兇
核心就一個問題:明明選了 gpt-5.5 + xhigh,為什么有些復雜任務只想了一小會兒,就直接給答案了
更刺激的是,很多本地日志里都出現了同一個數字:516
發生了什么
GitHub 上有人開了一個很硬核的 issue,標題大意是:gpt-5.5 在 Codex 里出現了 516 / 1034 / 1552 這類固定推理長度聚集,可能和復雜任務表現下降有關
這個 issue 到我寫稿時還開著,作者掃了 2026 年 2 月 1 日到 6 月 27 日之間的 Codex 本地記錄,一共分析了 390,195 條響應級別的 token 記錄,覆蓋 865 個 session
最扎眼的幾組數字是:
指標
數值
總響應記錄
390,195
session 數
865
正好等于 516 的事件
3,363
gpt-5.5在所有響應里的占比
19.3%
gpt-5.5 在 516 事件里的占比
82.0%
gpt-5.5 的 516 / 大于等于 516 比例
44.0%
非 gpt-5.5 的 516 / 大于等于 516 比例
1.3%
這組數據看完,第一反應就是:這不像自然波動
因為復雜任務的推理長度,正常應該跟任務難度、上下文、工具調用、輸出結構一起變化
如果某個模型大量卡在同一個點,尤其還集中在 516、1034、1552 這種固定位置,就值得認真查
516 為什么刺眼
作者的說法:Codex telemetry 里出現了一個 gpt-5.5 特有的固定 token 聚集異常,看起來像某種閾值化的推理預算行為
這個表更能說明問題:
模型
響應記錄
516 / 大于等于 516
gpt-5.5
75,401
44.0%
gpt-5.4
25,214
19.8%
gpt-5.2
247,575
0.34%
gpt-5.3-codex
13,333
0.0%
gpt-5.3-codex-spark
26,179
0.0%
更麻煩的是,516 聚集變強的同時,整體推理強度還在下降
2026 年 5 月,516 聚集比例沖到 53.30%,但平均推理 token 只有 106.9,P90 只有 344
如果只看體感,用戶會覺得“模型變快了”
但如果復雜任務也這么快,那就很危險
快,有時候是聰明
有時候是提前收工
最有意思的糖果題
這個 issue 還關聯了另一個更早的復現實驗
測試題大概是這樣:袋子里有蘋果、桃子、西瓜三種糖,每種糖有圓形和五角星兩種形狀,形狀可以靠摸出來,味道不能靠摸出來
問題是:至少摸多少顆,才能保證同時拿到不同形狀的蘋果和桃子
正確答案是 21
可怕的地方來了
在 gpt-5.5 + xhigh 的幾次 fresh conversation 里,有些運行直接進入最終回答,沒有中間進展提示,十幾秒就結束,最終答成了 29
而這些錯誤運行,本地日志里都是:
reasoning_output_tokens: 516
phases: ["final_answer"]
成功運行則明顯不同
它會先發出短暫進展提示,繼續想更久,推理 token 上千甚至幾千,最后答出 21
這個對照很有殺傷力
因為它把抽象的 token 異常,落到了一個具體任務上:短路徑更容易錯,長路徑更容易對
評論區已經變成復現實驗場
這條 issue 現在有 100 多條評論,很多人都在貼本地復現結果
有人用 codex-cli 0.142.5 跑糖果題,9 次可見結果里只有 3 次正確,錯誤運行全部落在 516 或 1034
也有人貼出兩臺機器的本地日志:gpt-5.5 的 516 / 大于等于 516 比例分別接近 50.1% 和 47.9%
還有人補充了一個很關鍵的觀察:這些數字像一把梳子
516 只是第一檔
還會出現:
516
1034
1552
2070
2588
3106
它們之間的步長是 518
所以有人把這個模式叫做 518n - 2
評論里也有人貼了本地統計圖,整體看起來確實不像一個孤立偶發問題:
![]()
Codex 516 本地復現統計截圖
當然,這里必須加一句冷水
看到 516,不等于這次回答一定錯
評論里也有人提醒,516 可能只是某個量化后的正常停止點,只有 OpenAI 內部才能確認真實原因
但問題在于:當它頻繁出現在復雜任務里,并且和錯誤答案、快速結束、無中間進展同時出現時,用戶就很難安心
臨時繞法靠譜嗎
評論區給了不少臨時辦法
第一類是提示詞繞法
比如讓模型“慢慢想”“至少思考 60 秒”“復雜任務要充分驗證”
有人反饋有緩解,也有人說效果有限
這類辦法我會當成止痛片
能用,但不要當根治
第二類是改 Codex 的基礎指令
有人認為問題和 Intermediary updates 相關,也就是 Codex 要求工作中定期發進展提示的那段指令
有用戶把這段刪掉后,糖果題 20 次全對,且沒有再出現 516、1034、1552
但也有人說,在真實工作里這個辦法只能緩解,后面仍然能看到 516
所以我的判斷是:這個繞法對某些測試有效,但目前還不能證明它能覆蓋真實編碼任務
第三類是本地代理或插件
有用戶做了本地代理,檢測到 518n - 2 這類可疑停止點時,讓模型繼續想一輪,再把結果合并給 Codex
也有人做了 hook 插件,在高風險回合結束時提醒用戶,避免把可疑回答直接用于復雜重構
這類方案思路更工程化,但也更折騰
普通用戶短期可以先不碰
我建議怎么用 Codex
如果你現在重度用 Codex,我建議先做幾件事
下面這張圖,把我的處理順序簡單畫出來:
![]()
Codex 516 事件排查路徑
第一,復雜任務不要盲信第一次答案
尤其是架構設計、數據庫遷移、權限改造、支付流程、安全修復這種任務
如果它十幾秒就結束,還沒有明顯的探索、檢查、運行測試過程,要多留個心眼
第二,關鍵任務要求它實際驗證
不要只讓它“解釋一下”
直接要求它跑測試、讀日志、復現錯誤、對比輸出
只要能落到真實文件、真實命令、真實結果,幻覺空間就會小很多
第三,能用 5.4 或 Codex 專用模型做交叉檢查時,就交叉一下
這個 issue 里的數據看,gpt-5.3-codex 和 gpt-5.3-codex-spark 沒有出現同樣的 516 聚集
gpt-5.4 也有一定比例,但低很多
如果你手上有多個模型可選,復雜任務可以讓另一個模型復核關鍵結論
第四,別把“xhigh”當成保險箱
這次最尷尬的地方就在這里
用戶以為自己選了最高思考檔位,結果本地記錄卻顯示一些回合非常短
在官方給出解釋前,我會把 xhigh 當成傾向設置,別把它當絕對保證
這事真正值得關注的地方
我覺得這個 issue 最有價值的地方,不只是吐槽某次回答錯了
它把 AI 產品一個很隱蔽的問題暴露出來了:用戶看見的是“模型名”和“思考檔位”,實際發生的是一整套運行時策略
里面可能有路由、預算、緩存、調度、前端流式處理、工具協議、基礎指令
任何一層變化,都可能影響最終質量
對于用戶來說,最難受的是不可解釋
你明明付費選了更高檔位,卻不知道這次到底有沒有真正多想
你明明讓它做復雜任務,卻不知道它是認真檢查完才給答案,還是在某個固定位置提前結束
所以我更希望 OpenAI 做兩件事
第一,確認 516 / 1034 / 1552 / 2070 這些固定值到底意味著什么
第二,給復雜任務一個更透明的質量信號
哪怕不暴露內部推理,也至少應該讓用戶知道:這次回答有沒有完整走完預期的高強度路徑
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.