這一次,沒有閑聊,沒有熱身題。我直接拋出了三道需要鏈?zhǔn)酵评淼挠埠穗y題——一道涵蓋模式覆蓋與二階矩的概率題,一道涉及滑輪慣性和松弛纜繩翻轉(zhuǎn)的物理題,還有一道極度依賴依賴閉包計(jì)算、跨天容量約束和三級(jí)平局裁決的 Python 題。兩款模型通過同一接口,使用完全相同的提示詞和接近的輸出上限進(jìn)行測(cè)試,且均無工具與網(wǎng)絡(luò)接入。
先說結(jié)論:GPT-5.6-SOL 交出了三題全部可見的完整答案,數(shù)學(xué)和物理的參考結(jié)果完全正確。kimi-k3 則在第一輪 6500 token 限制下直接因 finish_reason=length 被截?cái)啵瑪?shù)學(xué)、物理均無任何可見輸出;即便將上限提至 10000 token,輸出依然被攔腰切斷。編程題更慘,請(qǐng)求在 245 秒后讀取超時(shí)。而 GPT-5.6-SOL 的代碼實(shí)現(xiàn)獨(dú)立驗(yàn)證通過了依賴閉包、容量、平局規(guī)則,甚至能處理無效依賴和循環(huán)依賴,但其內(nèi)置示例斷言中卻藏了一個(gè)期望值錯(cuò)誤——完美提醒我們,“代碼邏輯正確”和“示例測(cè)試全過”完全是兩碼事。
![]()
一句話:這場(chǎng)實(shí)測(cè)在推理完整性、穩(wěn)定性和可用性上,差距之大遠(yuǎn)超預(yù)期。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.