![]()
AI Agent 時代,大家都該關注哪些數據?耗時、完成率、點贊數、Token 消耗……
指標滿天飛,但我們卻很難理直氣壯地說:“我真的知道什么才是‘好的智能體’。”
過去一年,行業標準的更新速度遠超產品經理的修正速度,許多原本被奉為圭臬的數據指標,在模型能力升級的第二天就成了誤導團隊的“增長陷阱”。
作為昆侖萬維 Skywork 超級智能體的核心操盤手,Phoebe對這種“度量困境”有著極深的感觸。她主導的 Skywork 產品面向全球用戶提供辦公與創意生產力服務,其復雜的業務場景要求 Agent 必須在“創造力”與“交付確定性”之間找到極細微的平衡。
7 月 17-18 日,在由 CSDN 與奇點智能研究院聯合舉辦的2026 奇點智能產品大會上,Phoebe 將帶來「如何打造好的Agent 度量框架及踩坑指南」的實戰分享,為你揭秘天工智能體如何在不斷的“踩坑”中,構建出一套支撐產品長期進化的評價體系。
![]()
深度劇透:拆解 Skywork 的 Agent 度量框架
在 Phoebe 看來,目前 AI Agent 產品評價體系最大的誤區,在于將“智能”量化成了“步驟”。
在 Skywork 的迭代實踐中,團隊經歷過三個階段的深度復盤:
指標的“截面”陷阱:在早期探索中,團隊曾過度關注交互頻率與任務完成率。結果發現,這種指標只會誘導模型去“湊”答案,反而犧牲了 Agent 的推理深度;
尋找“長期價值”的錨點:Skywork 團隊開始意識到,Agent 產品需要長期指標。他們發現,優秀的智能體不應只追求快速響應,而應追求“任務質量的遞增”;
提出“頂尖實習生”假說:這是 Phoebe 團隊最具價值的實踐。他們將 Agent 的衡量標準,與現實世界中“頂尖實習生”的評價標準對齊——不僅要完成任務,更要有反思、能糾錯、懂業務上下文、且具備持續的交付一致性。
在 Skywork 主打的辦公和創意生產力場景中,用戶不需要一個全知全能但缺乏人情味的“神”,而是需要一個“靠譜、有悟性、能閉環、懂反饋”的幫手。
在本次奇點智能產品大會上,Phoebe 將深度剖析“頂尖實習生”與“好的智能體”在衡量標準上的共性:
懂上下文與悟性:不僅能執行指令,還能理解弦外之音(對應 Agent 的意圖識別與長期記憶能力);
靠譜閉環與交付質量:交 辦的創意或辦公任務,能給出超出預期的初稿,并具備自我修正能力(對應 Agent 的規劃與反思能力);
主動性與邊界感:知道何時主動推進,何時向人類求助(對應 Agent 的人機協同與 Human-in-the-loop 機制)。
在“奇點”降臨的時刻,產品管理的底層邏輯正在被重寫。AI Agent 的度量,不僅關乎產品的體驗上限,更決定了商業閉環的成敗。
Phoebe 帶來的不僅是一份踩坑指南,更是昆侖萬維 Skywork 團隊在 AI 原生時代一份深度實戰。
![]()
Phoebe:15 年 AI ToC 產品的“長期主義者”
從百度的語音搜索到昆侖萬維 Skywork 天工智能體,Phoebe 擁有超過 15 年的 AI ToC 產品深耕經驗。她親歷了 AI 應用從“點狀查詢”到“鏈式執行”的演變。目前負責的 Skywork 超級智能體產品,是昆侖萬維在大模型應用側的戰略級作品,致力于為全球用戶提供具備自主規劃與創造能力的辦公協同伙伴。
![]()
關于奇點智能產品大會
奇點智能產品大會由全球產品經理大會升級而來,AI 時代,產品的底層邏輯正在被重寫,AI 正成為產品的底座能力,不再是一次性功能,而是貫穿數據、系統、組織與商業模式的長期工程。
7 月 17-18 日,北京金隅喜來登大酒店。
如果你也在為 Agent 產品的度量指標而焦慮,如果你也想聽聽那些在國際化競爭中摸爬滾打出來的真理,歡迎來到現場,與 Phoebe 及 40+ 位行業領軍人物共同探討智能體產品的真實進化法則。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.