出品 | 網易智能
作者 | 小爪
編輯 | 王鳳枝
近日微信公眾號"DeepSeek Harness團隊"被注意到,DeepSeek Harness也再次被推到臺前。
![]()
這不是一個突然冒出來的項目。7月31日,DeepSeek在V4-Flash更新日志里公布九項代碼和 Harness是套在模型外面的一整套執行系統。模型只負責理解、推理和生成,剩下的活,把代碼庫、終端和其他工具接過來交給模型,保存任務進度,出錯了重試,最后驗收結果,都由Harness處理。Claude Code和Codex比普通聊天框更"能干活",差別很大一部分就在這里。 DeepSeek Harness之所以引起關注,還有另一層原因。梁文鋒此前談到,下一代模型首先要幫助DeepSeek開發下一版模型。在更遠的設想里,Agent之后還要解決持續學習,最終讓AI加快AI研發。 順著這條路線看,Harness的角色就變了。它不再是外掛的代碼工具,而是模型進入真實研發任務的工作臺。任務怎么拆、工具怎么調用、失敗怎么記錄、結果怎么驗收,都會幫助DeepSeek判斷下一版模型該改什么。 一家靠低價和模型能力立足的公司,把任務交付、失敗反饋、開發者入口都長期掛在別人的系統里,肯定站不住。 同一個模型,換套Harness為什么會像換了一個人 8月11日,智能體工具公司Composio公布了一組對照測試:研究者把同一個DeepSeek V4-Flash接入8種Harness,讓它們分別完成30項多步驟任務。這些任務不是單純問答,而是要求智能體進入Gmail、Google Calendar、GitHub、Slack和PostHog等應用,調用工具并改變真實的應用狀態。每項任務最長運行15分鐘,只有全部檢查通過才算成功。 結果的差距不小。完成任務最多的Pi Agent通過了20項,最少的OpenCode通過了14項;8種Harness總共運行240次,只有129次成功;30項任務中,又只有6項被所有Harness完成。即便考慮到部分Harness的API來源、推理強度和緩存條件不完全一致,同一個模型外面換一套執行系統,結果仍出現了明顯差異。 差別不只在于誰給模型寫了更聰明的提示詞。一項長任務跑下來,Harness要不停做判斷:上下文里留什么、丟什么,什么時候該調用哪個工具,工具報錯以后是重試還是換招,模型說"做完了"到底信不信、要不要再驗一遍。任何一步處理不好,模型即使思路對,也可能在真正修改文件、提交代碼或者寫入應用時失敗。 同一個模型,換套Harness,完成任務要花的錢也會跟著變。測試中,Claude Code、Codex和DeepAgents都完成了16項任務,但每完成一項成功任務的估算成本分別約為0.195美元、0.081美元和0.045美元。它們用的是同一個模型,差別卻超過四倍。緩存是否命中、上下文有多長、失敗后要重跑多少輪,都會影響完成一項任務的最終成本。 30項測試規模不算大,部分Harness的推理強度和API來源也不完全一致。但方向足夠明了:模型劃定能力上限,Harness決定這份能力最終能兌現多少、要花多少錢兌現。只看底層模型評價一款代碼智能體,已經不夠用了。 從招聘到公眾號,DeepSeek把Harness擺上臺前 DeepSeek對Harness的投入,最早不是以產品發布會的形式出現,而是藏在團隊和崗位里。今年5月,公司公開招聘信息中已經出現Agent Harness產品經理和研發工程師等職位。DeepSeek給這支團隊的任務也很直接:把前沿模型能力轉化為智能體產品。在招聘介紹中,它用一個公式概括兩者的關系:"Model + Harness = Agent"。 同一時期,DeepSeek也在為智能體鋪設接口。V4-Flash原生支持Responses API,并針對Codex進行了適配。它一邊讓模型進入現有的第三方工具,一邊搭建自己的執行系統。 緊接著,團隊開始從外部尋找接入者。8月1日,DeepSeek Harness負責人崔添翼面向做過相關開源項目的開發者招募內測用戶;幾天后,范圍又擴展到plugin、skill、MCP、編排器和界面等項目。團隊表示,會向部分開發者提供API額度,幫助他們在DeepSeek Harness發布時完成接入。 微信公眾號補上了最后一塊公開拼圖。賬號資料顯示,"DeepSeek
Harness團隊"公眾號7月6日注冊、7月7日完成企業認證,直到近日才被媒體注意到。它意味著這個此前散落在招聘頁、更新日志和團隊成員賬號里的項目,開始有了獨立的官方發布陣地。 團隊搭起來了,模型評測里掛了名,外部開發者也開始被拉進來,公眾號做了企業認證,DeepSeek
Harness就等最后發布了。 低價模型,為什么仍要自己管任務成本 DeepSeek最大的優勢是性價比。按照目前的官方價,V4-Flash每百萬Token輸入在緩存命中時收費0.02元,未命中時收費1元,輸出收費2元。單看API價目表,它已經足夠便宜。 但智能體完成的不是一次問答。它要讀取代碼和文件,調用工具,把工具返回的結果放回上下文,再決定下一步;測試失敗后,還要繼續定位問題、修改并重新驗證。模型每多走一輪,都可能產生新的輸入和輸出。一個任務最終花多少錢,取決于整條執行鏈調用了多少次模型、每次帶回多少歷史信息,以及失敗后又重跑了多少輪。 緩存把這種差別進一步放大。DeepSeek的上下文緩存默認開啟,后續請求只要完整復用此前已經保存的前綴,相同部分就能按緩存命中計費。以V4-Flash當前價格計算,緩存命中與未命中的輸入單價相差50倍。Harness怎樣組織和更新上下文,會影響多少內容可以被重復利用。 這里有個兩難。歷史記錄、文件、工具輸出全塞進下一輪,模型不容易忘事,但上下文越滾越長;裁得太狠,模型又可能丟掉關鍵約束,反復搜、反復錯。遇到失敗時,Harness還要判斷是重試、換一種工具、降低任務范圍,還是及時停止。驗證結果同樣要消耗調用,卻能避免模型只是口頭宣布"已經完成"。 換句話說,Token便宜只是起點。光賣模型,DeepSeek定得了每百萬Token的價格,卻定不了一個任務會燒掉多少Token、要重試幾次、什么時候才算真正完成。要把價格優勢穩定傳導到任務成本,自己掌握Harness是最直接的辦法。 DeepSeek不能交給別人的,不只是入口 任務成本之外,Harness還決定DeepSeek能看到什么。 如果模型只通過API接入別人的執行系統,DeepSeek可以知道一次請求消耗了多少Token、響應用了多長時間,卻很難完整看到任務為什么失敗。是上下文丟掉了關鍵要求,模型選錯了工具,工具返回異常后沒有正確處理,還是代碼已經修改,卻沒通過最后的測試?這些信息散落在Harness保存的任務軌跡、工具調用和驗證結果里,不會自然隨著一次API請求完整回到模型公司。 這類失敗記錄比單純的調用量更接近模型的真實短板。第一節的對照測試中,同一個V4-Flash面對同一批任務,換套Harness就出現了明顯不同的結果。如果DeepSeek掌握自己的執行系統,就有機會區分:哪些失敗來自模型本身,哪些來自上下文、工具和重試策略。前者可以成為后續評測和模型改進的材料,后者則要在Harness里解決。 DeepSeek還需要把開發者留在自己的生態里。DeepSeek Harness團隊招募的不只是普通內測用戶,還包括plugin、skill、MCP、編排器和界面項目的開發者。這些人決定模型可以連接哪些工具、進入哪些工作流程。誰來定義接入方式、維護兼容性并分發這些擴展,誰就更接近開發者實際使用模型的現場。只做底層API,DeepSeek可能提供了能力,卻由別人的Harness決定這份能力以什么方式到達用戶。 這也對應了梁文鋒此前談到的內部研發目標:如果下一代模型首先要幫助DeepSeek開發下一版模型,代碼智能體就不能只會生成一段代碼,還要能進入真實研發流程:讀取項目、運行實驗、檢查結果、保留進度,并在失敗后繼續工作。Harness正是承接這些步驟的系統。它未必會直接訓練出下一代模型,卻決定AI能否先在DeepSeek內部成為可靠的研發工具。 任務軌跡、開發者關系、內部研發流程,這三樣加起來,是模型API之外的另一層資產。DeepSeek要Harness,不只是怕入口被人拿走。只賣模型,它很難說清模型在真實任務里為什么失敗,也很難判斷下一次該動模型,還是動執行系統。 這不是超級App,但會改變DeepSeek 親自做Harness,并不意味著DeepSeek要從基礎模型公司轉向包辦所有應用。Harness的位置更特殊:對外,它可以是一款代碼智能體產品;對內,它又是模型評測、研發和改進所需要的基礎設施。它站在模型與應用之間,很難再被簡單歸到任何一邊。 幻方過去有過相似的做法。2023年,幻方將內部使用多年的HAI Platform對外開源。這套平臺最初服務于自建的螢火集群,用來管理GPU資源、任務調度、開發環境、數據和監控;在內部運行和測試多年后,才開放給外部開發者。這雖然不能證明DeepSeek Harness也會開源,但至少說明,對這個團隊而言,先解決自身研發問題,再把內部工具向外開放,并不是一條陌生的路徑。 如果Harness沿著這條路徑發展,它改變的首先不是DeepSeek有沒有一個類似Claude Code的產品,而是公司評價模型的方式。過去,模型發布主要看基準成績、API價格和上下文長度;進入長任務之后,還要看它在真實工具中能完成多少工作、失敗后能不能恢復,以及完成一項成功任務究竟花多少錢。模型與Harness的改進也會彼此牽動:模型能力變了,執行策略要重新調整;任務持續失敗,也需要判斷該修模型還是修系統。 目前,"DeepSeek Harness團隊"公眾號還沒有發文,產品形態、開放時間、是否開源、能接入哪些模型,都沒有答案。但Harness一旦擺上臺前,DeepSeek就要回答一個新問題:便宜的Token,能不能換來便宜的任務。![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
