今天,GPT-5.6終于在OpenAI的直播中正式上線了。
除了GPT-5.6之外,ChatGPT也迎來了2022年誕生之后,我覺得最大的升級。
從OpenAI的直播預告動畫就能看出來有趣的端倪了,ChatGPT和Codex,在今天、在此刻合體。
![]()
于是,全新的ChatGPT來了。
![]()
Codex直接消失,與ChatGPT應用正式合并,以后,也沒有Codex這個應用了,只有ChatGPT了。
但是當你打開新版的ChatGPT界面以后,你又會發現,原版的ChatGPT界面也沒有了,滿屏的UI,都屬于原本的Codex,只剩下那個小小的聊天Tab,證明著曾經的ChatGPT,還存在過。
![]()
突然有點感慨。
至此,由ChatGPT 2022年11月30日開啟的Chat時代,也在今天完成了屬于大眾啟蒙的使命,而今天,ChatGPT和Codex的合并,一切也都標志著新時代的來臨,此名:
Agent時代。
讓我們一個一個來聊。
一. GPT-5.6
先聊最核心的GPT-5.6。
這次一共是三個模型,分別是 新旗艦模型Sol,以及適用于日常工作的均衡模型Terra,還有OpenAI所謂的最具成本效益的模型Luna。
我們主要的核心,還是來聊GPT-5.6 Sol,因為這個也基本代表著OpenAI能對外放出來的目前智能的巔峰。
這個模型強不強,你就看Anthropic的動作就行了,在GPT-5.6 Sol發布后,他們直接決定,重置額度。。。
![]()
可能我這幾年,從來沒有像現在這樣,如此期待一個新模型,期待GPT-5.6的上線。
原因特別簡單,因為我那個AI新聞網站AIHOT,雖然大的我能做的都做了,比如IP地址已經換了,且藏在了邊緣代理后面,做了部分DDoS防護,封禁策略和JS挑戰啥的也都做了。
但是每天都在被各種手段攻擊,最初的普通攻擊,到現在幾乎全是DDoS,還有用分布式CC來惡心的,各種亂七八糟的。
昨天一天就被打了4輪,昨天早上的沒防住,導致昨天早上又被干崩了,但是 下午的3輪都防住了 。
![]()
在這個階段,Claude Fable 5已經完全沒辦法用了,因為這些詞幾乎都是敏感詞,一聊DDoS啥的直接給我切換到Opus 4.8,而且Fable 5雖然智商和規劃能力超群,但是在真正的執行上,還是有點問題,經常顧此失彼,然后漏很多的東西,并且跟Claude系列一樣,有一定的幻覺。
然后最大的缺點,就是貴,沒蹬一會額度就沒了。。。
![]()
GPT-5.5是我最近反而用的最多的了。
但是問題也非常大,規劃和做方案的能力非常一般,完全不思考全面,起手就知道干,幻覺率確實極低,代碼執行確實很強,改BUG啥的很不錯,但是吧,也經常不夠全面 ,再加上方案和規劃能力是一坨, 短板還是有點太明顯了。
經常給我用的非常的暴躁。
![]()
在做安全策略上,更是漏洞百出,它做的方案,被人打成篩子,最后還是得我那僅剩的10%額度的Claude Fable 5來進行規則的重置和兜底。
這7天高強度的攻防和平均每天16個小時的Coding的經驗,讓我對Fable 5和GPT-5.5的評價一下的話。
那就是Fable 5確實是一個總監級別的大神,但是你知道的,管理層嘛,一般執行的細節程度上總歸有一點的不精確,工具使用、主動性太強了,經常不管不顧的自己就全部給你搞完了,但是最后在一些細節上,是偏離了你想要的東西的。
而GPT-5.5呢,就是一個高級工程師,在執行上確實是一把好手,但是用一個網友的話來做一個很形象的描述就是:“GPT-5.5最像那種會議室里突然站起來畫白板的人,你還在描述混亂,它已經開始拆方案。”
現在就卡在這了,Claude Fable 5額度用完了,GPT-5.5只能做中型的項目執行。
所以在這個背景下,大家應該就懂了,為啥我如此的期待GPT-5.6了。
因為真的希望他們能把整個Coding的能力,再往前推一步,而且我極度支持OpenAI干死呆逼Anthropic。
在OpenAI 6月26號發布了前瞻之后,今天凌晨,GPT-5.6終于來了。
![]()
我第一時間直接把GPT-5.6 Sol拉到最高檔Ultra開干了。
在我高強度并行開發了5個小時之后,我覺得我對GPT-5.6有了一些自己的體感,如果用一段話描述的話,那就是:
當今世界最水桶級別的模型,價格低廉,性價比極高,方案和規劃能力在一些非巨型任務上媲美Fable 5(巨型任務我也接觸不到,已經遠超我的能力上限了),Agent能力和Coding執行上幻覺率極低極為精準,配合Codex交互體驗和遠程Coding更是極佳,瀏覽器控制更加穩定等等。
不過前端審美和內容創作依然是老大難問題,這塊確實比不上Claude,但除此之外,其他的任何方面我想不出來我自己再用Claude的理由了。
而且,GPT-5.6 Sol,包含在訂閱計劃中,未來,訂閱用戶可用!
OpenAI賽高!Codex賽高!GPT賽高!
還是慣例,簡單過一下GPT-5.6的官方跑分。
在覆蓋55個領域長期專業工作流的Agents' Last Exam中,GPT?5.6 Sol以53.6分刷新紀錄,比Claude Fable 5(自適應推理)高出 13.1 分。
即便采用中等推理模式,它仍以約四分之一預估成本領先Fable 5達11.4分。
![]()
這個我覺得是里程碑式的,Fable 5確實很強,但是那個經濟效應,幾乎也代表著我們幾乎不可能日常大規模的使用。
而GPT-5.6以極低的成本,完成了執行效果上的超越。
而在AA家的智能指數上,GPT-5.6比Fable 5只低了一分,但是 任務完成時間縮短61%,成本預估降低約一半。
![]()
而在Coding領域,這個優勢更加離譜了。
在Artificial Analysis 編程智能體指數中,啟用最大推理能力的 GPT?5.6 Sol 以 80 分創下最新技術標桿,比Fable 5高出2.8 分,同時輸出 token 減少一半以上,耗時縮短一半以上,成本降低約三分之一。
![]()
從這張圖其實也能看出來,對于日常來說,改BUG啥的其實推理強度開到高就差不多了。
![]()
如果是大型的任務,就開到極高。
![]()
究極大型的重構或者要命相關(比如我的AIHOT防護)的任務,或者你的token實在燒不完的時候,偶爾再把推理等級開到Ultra,是Token利用率最高的解法。
而且你知道,當我看到GPT-5.6 Sol在衡量從接觸漏洞代碼到任意代碼執行進展的ExploitBench, 上,它在可比輸出token預算下得分為73.5%。
這意味著什么呢,意味著,只要極低的成本,就可以達到幾乎跟Fable 5相同的網絡安全效果!!!
![]()
說實話,我看到這個的時候,我的眼睛都在冒光,我激動的都睡不著覺。
而且在我的實測中,雖然偶爾也會出現網絡安全的禁止提示。
![]()
但是在我表明是為了做我的邊緣代理的防護策略,我希望他幫我優化之后,他順利的給我進行執行了,沒有做任何的阻攔。
我給的任務,就是這個,我因為是語音輸入的,還輸入錯了,把EO識別成了EU,不過這種都是小問題了:
![]()
我直接開了Ultra,而且是快速模式,幾乎全部都是瀏覽器操控,在將近21分鐘之后,給了我一個非常詳細的審查報告。
我是200刀的Pro套餐,Token的消耗量大概5小時額度花了20%,周額度大概花了2~3%,我想說,這比Fable 5舒服太多了。
![]()
要知道,這可是21分鐘的全程Chrome操控且開了快速模式,有1.5倍的消耗,再加上Ultra啊!
如果是Fable 5的話,你相信我,就這么玩,Fable 5 + Ultracode,都沒有快速模式一說,一波能給你周額度干沒8~10個點。
太離譜了。
而且這個質量,非常的高。
因為我的邊緣代理的規則底子是Fable 5打的,后面GPT-5.5在上面打了一些補丁,也做了N次優化,但是感覺也優化不出來啥,找不出來啥問題了。
但是GPT-5.6 Sol,直接找出了一堆以前他兩沒有想到的問題。
![]()
我就不放全文了,因為漏洞太多了。。。
直接扒拉出來了11個任務。
反正我是嘆為觀止,然后讓GPT-5.6 Sol一波直接自己去修了。
非常的穩,一波處理的明明白白,沒有任何的BUG,就看明天被攻擊時候的實際防護效果了。
然后還有一個方案,大概能看出來GPT-5.6 Sol和Claude Fable 5的一些性格和個性的區別。
比如我有一個長久以來的痛點,就是為了AIHOT大家無需開魔法的閱讀體驗,所以我做了每個新聞的詳情頁,就像這樣。
![]()
但是這個詳情頁想法是好的,在實現上,有巨大的問題,因為我要把所有源站的信息,原封不動的抓過來,然后盡可能的給大家還原成跟源站一樣的閱讀體驗。
但是你要知道,我現在監控信源的背后,有幾百個形色各異的網站,我已經盡可能的去想盡一切辦法去處理了,還是經常會抓來一些奇奇怪怪的東西。
就像這樣。
![]()
還有這樣。
![]()
想適配所有的網頁,全部清洗成好看的,幾乎跟源站一樣的,甚至還要保留格式、超鏈接、代碼庫、圖表等等,太難了,因為背后的網頁形式實在是太多太多了,之前用Opus 4.8和GPT-5.5分別開發過,效果基本就是一坨狗屎。
但是我一直還是想解決這個需求,讓AIHOT的用戶在瀏覽信息上,能得到最好的體驗。
所以我就把這個需求,同時扔給了GPT-5.6 Sol和Claude Fable 5。
讓他倆同時想方案。
![]()
甚至他兩用的都是同一份CLAUDE.md,因為我的AGENTS.md直接軟鏈的 CLAUDE.md, 所以幾乎變量都是一樣的,唯一不同的就是模型本身。
而最終輸出后,GPT-5.6的方案,坦誠的講,在細致程度上,我甚至覺得比Fable 5考慮的更加周全,這確實是一個很有趣的點。
比如一開始,從源頭上,其實是有分類的,比如有很多不是直接抓取的,是走API和RSS的。
![]()
這些是有明確的正文的。
而在GPT-5.6的考慮中,也想到這部分,但是,他并沒有跟Fable 5一樣,直接把那個規則當做了必須遵守的。
而是提出了質疑。
![]()
所以,我們不能信他們,所有的源頭都只是源頭而已,我們必須自己要去做結構化的正文抽離,即使它是RSS和API輸出來的,也需要如此考慮。
Fable 5其實把這個細節漏了。
包括有一個同域名網站里最近反復出現的內容,大概率就是導航啊固定CTA啥的,所以其實可以做標準化的統計,重復的就可以被識別出來了直接刪掉。
GPT-5.6和Fable 5都考慮到了這一點,但是還是那個問題,在首次的輸出上,依然是GPT-5.6考慮的更加細致一點。
而且還有個更離譜的是,我覺得,這一次GPT-5.6輸出內容的可讀性,我覺得比Fable 5是要強的,他的方案我能讀的下去,但是Fable 5,可能是我太菜逼了,他的信息密度太高了,我讀不下去。
最后這兩個方案,我還是選擇了讓GPT-5.6 Sol去開了目標模式進行最終執行。
![]()
因為坦率的講,這個任務有點復雜,我對Claude Fable 5能長時的穩定的精準的處理完這么多細節,我沒有信心,后期其實還是容易出現幻覺,改了這里忘了那里,然后最后再對抗性審查的時候又不斷的推翻自己,很麻煩。
但是GPT-5.6的幻覺率在我的測試過程中,我體感是一如既往的,幾乎就是洲際導彈的級別,指哪打哪,再配合上目標模式,最后總是能極其精準的完成任務,真的很香。
雖然過程中也會偶發跟GPT-5.5一樣,有一些奇怪的低級錯誤導致了部分環節中的循環,但是次數會少一些,同時也能更快的解決,且不影響最終的輸出。
然后之前的那個任務,截止到我發文的時候,已經開發了快2個小時了,但是還沒有開發完,主要是逐篇審查對比優化,確實比較浪費時間。
![]()
但是在它測試過程,我看到了一些頁面,還是很棒的,我現在有點期待完他寫完以后,部署到AIHOT上的效果了。
然后是前端審美這塊,確實比GPT-5.5有巨幅加強,但是還是離Claude有一定距離。
比如最近馬上臺風不是要來了嗎,我隨手寫了一個Prompt:
調用一個接口獲取巴威臺風數據, 生成一個單HTML文件的可視化大屏。
GPT-5.5的效果是這樣的,就Emmmmmm。
![]()
但是GPT-5.6 Sol是這樣的。
![]()
前端效果上還是進化了很多的,至少是不會出AI Slop了。
目前Plus、Pro用戶可以使用GPT?5.6 Sol,而免費和Go用戶,只能使用 GPT?5.6 Terra。
而最高檔的Ultra推理等級,只對200刀的Pro用戶開放,Plus用戶也用不了。
目前GPT?5.6按每百萬Token計費。
Sol 為 5 美元輸入 / 30 美元輸出;Terra 為 2.5 美元輸入 / 15 美元輸出;Luna 為 1 美元輸入 / 6 美元輸出。
GPT?5.6 還引入了更可預測的提示緩存功能,包括支持顯式緩存斷點?以及30分鐘的最低緩存生命周期。
對于GPT?5.6及后續模型,緩存寫入按模型非緩存輸入價格的1.25倍計費,而緩存讀取則繼續享受90%的緩存輸入折扣。
二. ChatGPT Work
這是一個我沒有想到的更新。
也就是我們開頭所說的,合并了ChatGPT和Codex。
現在,你可以在左上角,直接切換工作和Codex了。
![]()
其實就是Cowork和Claude Code的區別。
Codex雖然是個通用Agent,可能一些專業者都知道,他既能寫代碼,也能辦公,完全沒有問題的。
但是依然有個市場的老大難問題,就是心智問題,你一說你能開發,你能寫代碼,很多的用戶依然會覺得,那上手門檻是不是很高。
所以從心智上來說,Work和Code,反而拆開應該是最好的,雖然底層都是一個東西,但是用戶認賬啊。
你看國內WorkBuddy就知道了,現在都千萬日活了,你這找誰說理去。
而OpenAI的產品確實有點東西,他們妙就妙在這里,沒有選擇推出Codex Work,而是直接把ChatGPT這個10億周活的巨無霸給改造了,變成了ChatGPT Work,你看,這是不是就好理解多了。
而且過去的ChatGPT用戶遷移過來,那簡直順理成章。
不過你要說這個Work模式跟Codex的區別,我覺得可以小到忽略不計了。
最大的心智特征,可能就是在這個菜單欄上,把分支啥的偏Code的元素,換成了Doc、PPT、Excel三件套,讓你體感上,更像是幫你工作的。
![]()
我隨手用GPT-5.6 Sol給它自己的上線,用它自己的插件,做了個PPT。
![]()
就咋說呢,GPT系列的審美啊,是不是得GPT-6的全新一代的預訓練模型才能補上了。。
只是純能看了。
不過處理表格啥的數據分析任務,那是真的強,強到上天。
有條件的,我推薦大家所有人都可以去下一個ChatGPT的應用,用它來幫大家去處理工作,這可能是你當今,能用上的性價比最高、質量最好的Work類Agent產品了。
而之前的ChatGPT Chat模式,也就是聊天,被藏在了一個小小的tab中,就好像,它的歷史使命已經完成了。
![]()
點擊以后,右下角會出現一個彈窗,這個小小的界面,就是ChatGPT Chat了。
![]()
而且這次還有個好玩的新東西,也是給Work場景用的。
就是新增了一個叫站點的功能。
![]()
我們過去都知道,很多非開發者,其實做了一個產品,想要部署到線上,給別人用還是很麻煩的一件事。
所以OpenAI這次就為了解決這個需求,搞了這么個功能。
底層本質是包了一個他們自己的叫Sites的Skill。
![]()
你做完一個東西以后,直接用Prompt說一句話,比如用Sites部署一下。
![]()
他就會自己幫你部署到線上,然后給你一個域名,這個域名就可以分享給你的朋友和同事了。
![]()
對大眾來說,極其友好。
我覺得這一次,OpenAI用他們的產品、用他們的模型,再一次證明了。
這家公司,還是有生命力的,他們還是當年的那個OpenAI。
曾經的OpenAI,是面對Google的屠龍少年,隨著時代的發展,他們逐漸從勇士,變成了金銀財寶之上的惡龍。
他們開始罵聲一片,沒人再喜歡他們,大家都在說,OpenAI就該完蛋。
可隨著Anthropic的異軍突起,OpenAI有那么一段時間,被打的全線開花。
他灰溜溜的走下了王座,看著曾經它的王座上,盤踞一條新的惡龍。
隨后,他重新拾起盾牌,撿起那個已經開始發繡的劍。
斬向了自己的身后,把那個親手將自己送上傲慢王座的Sora,一刀斬斷。
它決定回到群眾中,做群眾想要的模型,做群眾喜歡的產品。
直到幾個月后的今天,他又回到了那個曾經屬于他們的王座之前,站在了那個叫Anthropic的惡龍之前。
他說,這次。
輪到你了。
以上,既然看到這里了,如果覺得不錯,隨手點個贊、在看、轉發三連吧,如果想第一時間收到推送,也可以給我個星標?~謝謝你看我的文章,我們,下次再見。
>/ 作者:卡茲克
>/ 投稿或爆料,請聯系郵箱:wzglyay@virxact.com
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.