![]()
Agent背后,是工程化的系統性交付。
作者|Lynn
編輯|鄭玄
企業正在為一堆「不產生價值的 Token」買單。這句 Palantir 公司 CEO 在節目里說的話,一經播出就廣泛流傳。拋開背后的商業競爭不談,這句話被廣泛傳播,就是因為戳中了當下人們的體感,行業的注意力,漸漸從「模型多強,用了多少 Token」變成:這些 token 到底幫我解決了什么,智能是否真的轉變成了生產力。
Agent 這個產品形態,當初有多 fancy,如今就有多祛魅。一個任務扔進去,模型自顧自跑上幾個小時,token 嘩嘩地掉,交付回來的東西卻不一定能用。
模型強是前提,但只靠模型不夠,還需要整套讓能力收攏、穩定交付的工程。
從這個視角來看百度搭子最近的成績,會更有意思。WAIC2026 上,百度搭子入選大會「鎮館之寶」,并且是十大獲獎展品中唯一的通用智能體產品。榮譽只是表象,背后的數字是:自全量上線以來,用戶日均提問次數漲了 20 倍。這說明,用戶不是來試幾個新鮮問題,而是開始把資料整理、信息檢索、PPT 生成、內容創作這些真實任務交給它。
![]()
01
單點能力跑不遠
先說一個越來越公認的事實:做好 Agent,不是給模型套一個 API。
同一款底層模型,交給不同團隊,跑出來的結果可以差很遠。因為一個任務從進來到交付,中間要過很多關:理解用戶需求,拆解小步驟,每一步該調什么工具、哪個系統,執行完還要判斷質量、必要時自己返工,最后把過程里的經驗沉淀下來。長鏈路操作魯棒性考驗的就是工程。
如果說模型決定了 Agent 智能的上限,harness 決定了它能不能穩定地摸到上限,它決定了模型往哪走、調什么、何時停、錯了怎么辦。
這也解釋了智能體賽道早期的一個現象。不少產品靠一個亮眼功能,或者蹭一波模型紅利跑了出來,熱鬧一陣,沒多久就很少再被提起。Agent 產品多,卡在半途的 Agent 也很多。
因此在 Agent 類的產品中,除了靈光一現的設計,更需要踏實的技術積累。百度搭子在信息檢索這一關上幻覺更少、找得更準,靠的不僅僅是模型的智能,還有百度多年搜索的經驗——怎么判斷信息可信、怎么在一堆結果里定位到有價值的那條,這些經驗被搬進了 Agent 的執行鏈里。再往上一層,每一步該調哪個工具、哪個系統,背后是百度搜索、網盤、地圖等成熟能力被接入同一條執行鏈。
在 OpenClaw 生態的公開 Agent 評測 PinchBench 上,百度搭子以 93.3% 和 93.2% 拿下前兩名。真正值得看的是一組對照:同一款底層模型,放進百度搭子的框架能跑到 93.3%,換到 Anthropic、OpenAI 自己的框架里,則是 89.0% 和 91.6%。模型沒變,成績的差異,就說明了外面這層工程的實力。
![]()
工程之外,還有一關平時不被注意,但做不好不但會影響產品體驗,甚至會帶來后果的事情:安全。Agent 要替人類刪文件、改系統、發數據,權限就不能是完全敞開的。百度搭子從權限、審計、隔離、確認四個維度兜底——員工能用哪些技能、碰哪些數據是限定的,所有操作可追溯,沙箱和本機環境完全隔離,刪除、外發這類高危動作必須人工點頭才執行。這套東西不性感,卻決定了企業客戶敢不敢把 Agent 放進真實流程。
大規模落地還有另外一個關鍵:成本。6 月的引擎升級里,在任務效果不降的前提下,執行過程的 token 消耗壓低了 75%。約等于用四分之一的 token,做完了原來的工作量。而 token 能壓下來,又跟百度自己有模型、有云、有芯片布局分不開。正是因為每一層都有布局,聯合優化帶來的空間才能夠更大。
換句話說,跑出一個搭子,背后是一整個百度。
02
從個人到企業,在真實任務里長出場景
工程是說給行業聽的。另一方面,對用戶來說,一個 Agent 好不好,就一條,能不能把他真正頭疼的事辦了。
老萬,70 歲,長白山的野生動物攝影師,手里攢了一百多 TB 的紅外相機和監控素材。他最頭疼的不是拍,是看——幾個小時的視頻,靠人眼一幀幀回放,挑出有動物出現的畫面,眼睛先扛不住。他不會寫代碼,也沒有團隊,只是用平常說話的方式給百度搭子下了個指令:把有野生動物的畫面挑出來、單獨建個文件夾、再按我的習慣整理一份監測日志。原來要靠人眼熬著一幀幀回放的活,現在他說完需求就能拿到挑好的片段和整理好的日志——70 歲的眼睛,從這道工序里解放了出來。
杭哥,在杭州開縫紉教室,教零基礎學員三天速成。他最耗神的環節,是把學員「想要通勤一點」「想顯瘦但別太夸張」這樣模糊的話,變成能落地的服裝方案。過去要反復溝通、反復改圖,一張效果圖能耗掉一天。現在他把學員的描述丟給百度搭子,效果圖、版型建議、面料推薦、制作成本,連帶上課用的課件大綱,一次對話就出來了。
這兩個案例的共同點是,用戶并沒有在學習一套復雜軟件,也沒有為了某個垂直需求單獨搭系統。他們只是把目標說出來,百度搭子把背后的工具、數據和流程組織起來。
這兩個人都是自己所在領域的專家,沒有技術背景。他們的麻煩過去也不是花錢就能解決的。一個攝影師、一個縫紉老師,不會為篩素材、畫版型去搭一套系統,市面上也沒有正好接住這種活的工具。現在可以實現的,是過去他們夠不著的一副外掛:一句日常的話,就能調動一整套本來不屬于個人的能力。
能實現如此專業的系統性能力交付,可以從百度搭子成長路徑來看。
百度搭子的成長路徑,并不是先做一個輕量聊天工具,再慢慢加功能。更準確地說,它一直圍繞「完成任務」來擴展能力:個人版補齊多端共享記憶、Browser Use、PPT 生成和自媒體專業套件,企業版則把這些能力帶進團隊協作、權限管理和組織資產沉淀。
![]()
最新長出來的一個場景,有點出人意料。世界杯期間,百度搭子進了央視頻的《超級綠茵場》,在「AI 戰術分析時刻」里,把進球、跑位、防守漏洞,拆成普通觀眾能看懂的戰術。把同一套分析能力挪到看球這件事上,它就多出了點陪伴的意味。有意思的是,讓它能陪你看球的,正是它平時用來干活的那套分析能力,它能去到哪些場景,其實不由它預設,而由有人把什么樣的問題帶到它面前。
03
一個 Agent 能走多遠,取決于背后的系統
一個 Agent 能走多遠,短期看它現在能做什么,長期看它靠什么越做越好。
答案在那條鏈的內部。全棧的各層之間,不僅在技術層面能夠默契耦合的,也成為了數據優化的天然通道。智能體被用起來,產生真實的任務數據,這些數據回過頭優化模型;模型的需求,又牽動著芯片和算力怎么調度;產業里的真實場景,則反過來檢驗這個智能體到底有沒有解決問題。轉得越快,迭代越快,成本壓得越低,落地也越深。
![]()
所以,百度搭子站上 WAIC『鎮館之寶』的位置,并不是一個孤立的展會榮譽。公開評測里的成績,說明它在長任務執行上跑出了結果;央視頻世界杯里的戰術分析,說明它能進入高關注度的大眾內容場景;日均提問次數 20 倍增長,說明用戶正在把真實任務交給它。
Agent 這場比賽當然才剛開始。但至少在這個階段,行業已經不只是在看誰的模型更強、誰消耗的 Token 更多,而是在看誰能把智能穩定地轉化成結果。百度搭子這次被放到 WAIC 智能體 C 位,真正被看見的,也是這件事。
*頭圖來源:百度搭子
本文為極客公園原創文章,轉載請聯系極客君微信 geekparkGO
極客一問
你認為一款 Agent
能走多遠的核心因素是什么?
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.