昨天, Anthropic 發(fā)布研究報(bào)告《智能體編碼與專業(yè)知識(shí)的回報(bào)》。
![]()
報(bào)告基于約40萬(wàn)次Claude Code會(huì)話數(shù)據(jù),揭示了一個(gè)反直覺(jué)的結(jié)論:編碼智能體不是在消滅專家,而是在獎(jiǎng)勵(lì)那些真正懂業(yè)務(wù)的人。
核心數(shù)據(jù)顯示,在智能體編碼中,人類負(fù)責(zé)約70%的規(guī)劃決策(做什么),Claude負(fù)責(zé)約80%的執(zhí)行決策(如何做),"人們決定構(gòu)建什么,智能體決定如何構(gòu)建"。
更驚人的是,非軟件職業(yè)用戶的編碼成功率與軟件工程師幾乎持平(驗(yàn)證成功26% vs 30%,部分成功88% vs 89%),十個(gè)最大職業(yè)群體的成功率差距都在7個(gè)百分點(diǎn)以內(nèi)。
真正拉開(kāi)差距的是領(lǐng)域?qū)I(yè)知識(shí)而非編程能力。專家用戶每次指令觸發(fā)的Claude行動(dòng)量是新手用戶的2.4倍(12 vs 5),輸出文字量是5倍(3200 vs 600字)。
遇到麻煩時(shí),新手放棄率高達(dá)19%,而中高級(jí)用戶僅5-7%。但關(guān)鍵發(fā)現(xiàn)是:從新手到中級(jí)的躍升收益最大,中級(jí)到專家的邊際提升很小,"對(duì)領(lǐng)域的工作掌握捕捉了大部分收益,而深度專業(yè)化只增加了更多一點(diǎn)"。
七個(gè)月內(nèi),調(diào)試類會(huì)話占比從33%暴跌至19%,操作軟件、數(shù)據(jù)分析、文檔寫作翻倍。任務(wù)經(jīng)濟(jì)價(jià)值平均上漲25%,構(gòu)建類任務(wù)漲幅達(dá)43%。
報(bào)告暗示了一個(gè)勞動(dòng)力市場(chǎng)的重新洗牌:當(dāng)"表現(xiàn)得像管理者"能帶來(lái)更高成功率時(shí),懂業(yè)務(wù)的人+AI工具正在取代會(huì)寫代碼的人。
以下為報(bào)告全文——
《智能體編碼與專業(yè)知識(shí)的持久回報(bào)》
關(guān)鍵發(fā)現(xiàn)
在先前工作的基礎(chǔ)上,我們引入了一個(gè)研究交互式智能體編碼的框架,基于對(duì)2025年10月至2026年4月期間約40萬(wàn)次Claude Code會(huì)話的隱私保護(hù)分析。我們?cè)u(píng)估了任務(wù)構(gòu)成、人機(jī)協(xié)作以及成功率。
在典型的會(huì)話中,人類做出大部分規(guī)劃決策(做什么),而Claude做出大部分執(zhí)行決策(如何做)。一個(gè)人帶入會(huì)話的領(lǐng)域?qū)I(yè)知識(shí)越多,Claude在每個(gè)指令下完成的工作就越多。
在編碼任務(wù)上,每個(gè)主要職業(yè)的成功率——完成用戶設(shè)定目標(biāo),并有可驗(yàn)證的證據(jù)如通過(guò)測(cè)試或提交工作——平均而言與軟件工程師幾乎相同。
一個(gè)人擁有的領(lǐng)域?qū)I(yè)知識(shí)越多,會(huì)話以成功結(jié)束的可能性就越高——盡管中級(jí)用戶與專家用戶之間的差距不大。
在我們觀察的七個(gè)月里,用于調(diào)試的會(huì)話占比下降了近一半,使用轉(zhuǎn)向了更多端到端的智能體使用:部署和運(yùn)行代碼、分析數(shù)據(jù)以及編寫非代碼文檔。
在這七個(gè)月里,典型任務(wù)的估計(jì)價(jià)值——通過(guò)與自由職業(yè)工作發(fā)布的比較來(lái)估算——在幾乎所有類型的工作中都上升了——平均約25%。
引言
智能體編碼已經(jīng)起飛。自2025年底以來(lái),GitHub項(xiàng)目中帶有編碼智能體活動(dòng)的占比翻了一番以上,Claude Code用戶現(xiàn)在平均每周使用該工具20小時(shí)。
沒(méi)有正式編碼經(jīng)驗(yàn)的人能否成功指導(dǎo)智能體完成復(fù)雜的技術(shù)工作?這些工具的迅速采用和改進(jìn)對(duì)知識(shí)工作整體意味著什么?雖然我們還沒(méi)有這些問(wèn)題的完整答案,但我們從Claude Code的使用數(shù)據(jù)中尋找早期信號(hào)。
本報(bào)告提供了關(guān)于Claude Code在實(shí)踐中如何使用的證據(jù),基于對(duì)2025年10月至2026年4月期間約23.5萬(wàn)人約40萬(wàn)次交互式會(huì)話的隱私保護(hù)分析。
它建立在先前專注于Claude Code會(huì)話中自主性衡量以及Claude Code如何改變Anthropic工作的工作基礎(chǔ)上。
在這里,我們引入了一個(gè)描述交互式AI編碼助手使用的框架:正在做什么樣的工作、誰(shuí)在做什么、以及是否成功。我們關(guān)注通過(guò)命令行界面(CLI)、Claude.ai或Claude Code桌面應(yīng)用使用Claude Code的情況。
通過(guò)跟蹤智能體編碼使用如何隨著模型能力提升而變化,我們可以更好地理解這些工具如何影響編碼專業(yè)人員和知識(shí)工作者的勞動(dòng)力市場(chǎng)。
Claude Code上發(fā)生的事情可能是知識(shí)工作走向何方的一個(gè)預(yù)覽,因?yàn)橹悄荏w正嵌入到非編碼工作中。我們發(fā)現(xiàn)Claude正在處理更復(fù)雜、更有價(jià)值的任務(wù)。與此同時(shí),智能體編碼中仍然存在明確的分工:人們決定構(gòu)建什么,智能體決定如何構(gòu)建。
我們還看到證據(jù)表明,領(lǐng)域?qū)I(yè)知識(shí)而非編碼熟練度放大了工具的有效使用。特別是,領(lǐng)域?qū)<腋l繁地成功,并且更容易從錯(cuò)誤和誤解中恢復(fù)。
然而,專家與中級(jí)用戶之間的差距不大——表明在某個(gè)領(lǐng)域的熟練度足以幾乎與深度掌握者一樣有效地使用該工具。
這些發(fā)現(xiàn)為我們提供了對(duì)勞動(dòng)力市場(chǎng)可能轉(zhuǎn)變的早期解讀。
在我們的數(shù)據(jù)中,成功取決于一個(gè)人對(duì)試圖解決的問(wèn)題理解得有多好,而不是他們是否受過(guò)編碼培訓(xùn)。
如果這些模式在整個(gè)經(jīng)濟(jì)中持續(xù)存在,這表明雖然智能體編碼工具可能正在吸收一些以實(shí)施為主的工作,但它們也在獎(jiǎng)勵(lì)那些對(duì)工作中解決的問(wèn)題有扎實(shí)理解的人。
編碼智能體并沒(méi)有替代領(lǐng)域?qū)I(yè)知識(shí)——工人帶入智能體的理解越多,智能體就能完成越高質(zhì)量的工作。
分工
人們使用Claude Code做什么
為了了解人們使用Claude Code做什么,我們將每個(gè)會(huì)話分類為九種工作模式之一——最能描述會(huì)話試圖完成的單一活動(dòng)。
四種模式涉及直接編寫或維護(hù)代碼:構(gòu)建新東西、修復(fù)損壞的東西、測(cè)試代碼以及編排其他智能體或自動(dòng)化管道。
另一個(gè)類別是操作軟件——部署、配置、運(yùn)行管道、監(jiān)控系統(tǒng)。
兩個(gè)類別更多是關(guān)于確定要做什么:理解現(xiàn)有系統(tǒng)如何工作,以及在做出改變之前進(jìn)行規(guī)劃。還有兩個(gè)采取與代碼無(wú)關(guān)的行動(dòng),或代碼對(duì)最終產(chǎn)品來(lái)說(shuō)是附帶的:分析數(shù)據(jù),以及通過(guò)演示文稿和其他基于散文的文檔進(jìn)行交流。
約56%的會(huì)話包括編寫(25%)、修復(fù)(26%)或測(cè)試和編排代碼(5%)。操作軟件占17%,14%的會(huì)話是規(guī)劃或探索,13%產(chǎn)生分析或散文(圖1)。
![]()
圖1:九種工作模式 每個(gè)交互式會(huì)話被分類為最能描述其試圖完成的單一模式。
我們通過(guò)讓模型閱讀其記錄來(lái)分類每個(gè)會(huì)話,然后使用我們的隱私保護(hù)分析工具,對(duì)照為每個(gè)會(huì)話自動(dòng)記錄的遙測(cè)數(shù)據(jù)進(jìn)行檢查,包括是否添加或刪除了任何代碼行。
兩個(gè)來(lái)源具有高度一致性——例如,我們分類器標(biāo)記為創(chuàng)建或修改代碼的會(huì)話中,超過(guò)90%在遙測(cè)數(shù)據(jù)中顯示了代碼更改。
誰(shuí)決定什么
Claude Code的自主性有多高?能力評(píng)估表明上限很高且正在上升:在METR的時(shí)間跨度評(píng)估等基準(zhǔn)測(cè)試中,前沿模型現(xiàn)在可以自主完成需要人類數(shù)小時(shí)的軟件任務(wù),沿途克服障礙。
但實(shí)際使用情況如何?在這里,我們看看在實(shí)際會(huì)話中由人和Claude進(jìn)行多少引導(dǎo)。
我們從兩個(gè)角度研究這個(gè)問(wèn)題。首先,我們關(guān)注人們?cè)诙啻蟪潭壬蠈Q策委托給Claude,其次我們看看他們給Claude多少行動(dòng)。
為了理解會(huì)話中的決策分工,我們基于會(huì)話內(nèi)容構(gòu)建了一個(gè)隱私保護(hù)的決策歸因分類器。我們要求分類器列出會(huì)話中所有有意義的決策。
我們將這些決策分為規(guī)劃(做什么、采取哪種方法、什么算完成)和執(zhí)行(更改哪些文件、編寫什么代碼、使用什么語(yǔ)言、運(yùn)行哪些命令)。然后分類器將每個(gè)決策歸因于Claude或用戶,給每個(gè)會(huì)話兩個(gè)數(shù)字:用戶規(guī)劃決策的份額和用戶執(zhí)行決策的份額。
平均而言,人們做出約70%的規(guī)劃決策,但只做出20%的執(zhí)行決策(圖2)。在實(shí)踐中,智能體編碼中存在明確的分工——人們決定構(gòu)建什么,智能體決定如何構(gòu)建。
為了理解會(huì)話中行動(dòng)的委托,我們查看會(huì)話的結(jié)構(gòu)而非內(nèi)容。Claude Code會(huì)話涉及Claude和用戶來(lái)回交換提示(來(lái)自用戶)和行動(dòng)(由Claude采取)——用戶寫一個(gè)提示,Claude去做一些工作,然后用戶寫另一個(gè)提示,如此循環(huán)。在典型會(huì)話中,約有四次這樣的回合。
在我們2025年10月至2026年4月的歷史數(shù)據(jù)中,用戶發(fā)送的每個(gè)提示平均觸發(fā)約10個(gè)Claude行動(dòng)——有時(shí)超過(guò)100個(gè)。在每個(gè)回合中,Claude讀取文件、編輯代碼、運(yùn)行命令,并平均寫出2,400字的輸出。
Claude在檢查點(diǎn)之間完成的工作量很大程度上取決于誰(shuí)在做出決策。當(dāng)用戶保持對(duì)執(zhí)行的控制(即做出超過(guò)80%的執(zhí)行決策)時(shí),Claude每個(gè)回合采取的行動(dòng)更少(約8個(gè)行動(dòng))。
當(dāng)Claude控制規(guī)劃(即做出超過(guò)80%的規(guī)劃決策)時(shí),它采取最高數(shù)量的行動(dòng)(約16個(gè))。
![]()
圖2:Claude在規(guī)劃和執(zhí)行決策中的份額
Claude而非用戶歸因的規(guī)劃決策份額(做什么)和執(zhí)行決策份額(如何做)在會(huì)話中的分布。在典型會(huì)話中,用戶做出約70%的規(guī)劃決策,而Claude做出約80%的執(zhí)行決策。
專業(yè)水平
從每個(gè)記錄中,Claude按五級(jí)量表從新手到專家評(píng)估用戶的明顯專業(yè)知識(shí)。
專業(yè)知識(shí)分類器尋找三個(gè)信號(hào):用戶如何精確地表達(dá)他們的指示、他們要求Claude驗(yàn)證什么,以及用戶傾向于糾正Claude還是Claude傾向于糾正用戶。請(qǐng)注意,專業(yè)知識(shí)捕捉的東西與職位頭銜或一般能力截然不同,而且關(guān)鍵的是,它是特定于任務(wù)的。
一位資深工程師問(wèn)他們的第一個(gè)Rust問(wèn)題,在Rust方面是新手。一位從未使用過(guò)Python的會(huì)計(jì)師,但確切地告訴Claude Python腳本必須執(zhí)行哪些對(duì)賬規(guī)則,并在月末結(jié)算時(shí)發(fā)現(xiàn)它處理不當(dāng)?shù)倪吘壡闆r,在該任務(wù)上是專家。
下表顯示了我們?nèi)绾卧诜诸惼髦卸x每個(gè)專業(yè)水平,以及來(lái)自智能體編碼會(huì)話公共數(shù)據(jù)集SWE-chat的示例請(qǐng)求。被歸類為新手的對(duì)話給出沒(méi)有隱含領(lǐng)域特定知識(shí)的通用指示。專家對(duì)話傳達(dá)了對(duì)代碼庫(kù)和技術(shù)環(huán)境的深入了解。
![]()
表1:專業(yè)知識(shí)分類器
示例意譯、匿名化并濃縮了我們分類器標(biāo)記的真實(shí)會(huì)話。表中使用的許多會(huì)話來(lái)自智能體編碼會(huì)話的公共數(shù)據(jù)集SWE-chat。
我們量化專業(yè)知識(shí)與Claude每個(gè)提示的輸出和活動(dòng)之間的關(guān)系。在典型的新手會(huì)話中,每個(gè)提示觸發(fā)約5個(gè)Claude行動(dòng)和約600字的輸出,而專家會(huì)話觸發(fā)的行動(dòng)鏈長(zhǎng)度是其兩倍多(12個(gè)行動(dòng)),攜帶的輸出是其五倍(3,200字)(圖3)。
這種新手與專家會(huì)話之間的差距出現(xiàn)在每種工作和每個(gè)任務(wù)價(jià)值帶中。
這些指標(biāo)補(bǔ)充了我們先前關(guān)于Claude Code的報(bào)告中對(duì)自主性的衡量,該報(bào)告跟蹤了智能體運(yùn)行多長(zhǎng)時(shí)間以及人們多久自動(dòng)批準(zhǔn)其行動(dòng)。
相比之下,我們的決策歸因衡量捕捉了整個(gè)會(huì)話中誰(shuí)做出實(shí)質(zhì)性決策,而我們每個(gè)提示的輸出和行動(dòng)衡量衡量每個(gè)人類提示觸發(fā)了多少Claude的自主活動(dòng)。
![]()
圖3:Claude為更專業(yè)的用戶每個(gè)提示做得更多
Claude為更專業(yè)的用戶每個(gè)提示產(chǎn)生更多行動(dòng)(左欄)和文本輸出(右欄)。方框跨越四分位距(在中位數(shù)處分割)。須線代表第5到第95百分位。白點(diǎn)是幾何平均值。兩個(gè)上升趨勢(shì)在統(tǒng)計(jì)上都是顯著的(p < 0.001),每個(gè)相鄰級(jí)別的步驟也是如此,并且在控制工作模式、任務(wù)價(jià)值、月份、職業(yè)和模型家族的回歸中仍然顯著(每個(gè)專業(yè)水平行動(dòng)增加9%,輸出增加13%),標(biāo)準(zhǔn)誤差按用戶聚類。
誰(shuí)使用Claude Code,以及用于什么
用戶
為了了解誰(shuí)在從事這項(xiàng)工作,我們從會(huì)話記錄中推斷每個(gè)用戶的職業(yè),將其映射到勞工統(tǒng)計(jì)局標(biāo)準(zhǔn)職業(yè)分類(SOC)分類法中的23個(gè)主要群體之一。
分類器被指示僅依賴信號(hào),如智能體在會(huì)話開(kāi)始時(shí)加載的項(xiàng)目上下文、其文件的名稱和結(jié)構(gòu)、他們引用的任何工件(例如,法律文件、臨床數(shù)據(jù)、財(cái)務(wù)報(bào)告、課程等)以及他們使用的詞匯。它被明確指示不要將編碼行為視為編碼職業(yè)的證據(jù)。
只有當(dāng)有明確信號(hào)表明軟件或數(shù)據(jù)工作是用戶的工作時(shí),會(huì)話才被分類為編碼SOC代碼(計(jì)算機(jī)和數(shù)學(xué)職業(yè))。律師構(gòu)建腳本以自動(dòng)標(biāo)記文件夾合同中缺失條款的會(huì)話被映射到法律職業(yè),即使會(huì)話的工作主要是軟件。當(dāng)沒(méi)有關(guān)于用戶職業(yè)的信號(hào)時(shí),會(huì)話保持未分類。
我們能夠在約70%的會(huì)話中推斷職業(yè)。在這一組中,計(jì)算機(jī)和數(shù)學(xué)職業(yè)——涵蓋大多數(shù)軟件相關(guān)工作的類別—— unsurprisingly 是最大的群體。其次是商業(yè)和金融運(yùn)營(yíng);藝術(shù)、設(shè)計(jì)和媒體;管理;以及生命、物理和社會(huì)科學(xué)。我們樣本中增長(zhǎng)最快的非軟件職業(yè)群體是管理、銷售和法律職業(yè)。
工作
2025年10月至2026年4月期間,使用Claude Code完成的工作構(gòu)成發(fā)生了顯著變化。
最明顯的變化是用于修復(fù)損壞代碼的會(huì)話占比從33%下降到19%(圖4)。取而代之的是,我們看到更多圍繞代碼的工作占比增加。操作軟件從14%增長(zhǎng)到21%。編寫和數(shù)據(jù)分析大致翻了一番,從約10%增長(zhǎng)到20%。
任務(wù)本身也變得更有價(jià)值。我們通過(guò)詢問(wèn)工作在自由職業(yè)市場(chǎng)上的成本來(lái)近似每個(gè)會(huì)話的經(jīng)濟(jì)價(jià)值,對(duì)照真實(shí)發(fā)布的公共數(shù)據(jù)集進(jìn)行校準(zhǔn)。按此衡量,平均會(huì)話的估計(jì)價(jià)值在10月至4月期間上升了27%。
這種增長(zhǎng)適用于多種工作。構(gòu)建、操作和修復(fù)類任務(wù)的價(jià)值分別增長(zhǎng)了約43%、34%和32%。
這些價(jià)格估算是粗略的,因此我們主要用它們來(lái)比較不同時(shí)間的任務(wù),而不是作為字面美元價(jià)值來(lái)解讀。
![]()
圖4:2025年10月至2026年6月Claude Code工作的構(gòu)成和價(jià)值
七個(gè)月窗口期內(nèi)每種工作模式的會(huì)話占比。修復(fù)損壞代碼的會(huì)話占比從33%下降到19%,而操作軟件、分析數(shù)據(jù)和編寫文檔的占比增長(zhǎng)。
成功取決于用戶帶來(lái)什么
任務(wù)的估計(jì)價(jià)值是了解Claude Code如何幫助人們完成工作的一種方式。另一個(gè)角度是查看有多少會(huì)話是成功的,以及會(huì)話的哪些特征與成功相關(guān)。
在我們所有的成功衡量中,我們看到了一個(gè)清晰的模式:一個(gè)人在會(huì)話中表現(xiàn)出的專業(yè)知識(shí)越多,會(huì)話成功的可能性就越高。
大部分收益集中在專業(yè)水平量表的低端——新手會(huì)話與中級(jí)會(huì)話之間的差距大于中級(jí)與專家之間的差距。
在轉(zhuǎn)向成功會(huì)話的特征之前,我們應(yīng)該精確說(shuō)明我們?nèi)绾魏饬砍晒ΑN覀儫o(wú)法觀察用戶的真實(shí)世界結(jié)果,也無(wú)法直接詢問(wèn)他們是否從Claude那里得到了他們想要的東西。
相反,我們依賴兩種互補(bǔ)的基于記錄的衡量。第一種,判定成功,來(lái)自閱讀完整記錄并決定人是否成功完成了他們?cè)O(shè)定要做的事情的分類器(選項(xiàng):成功、部分成功、失敗、無(wú)明確目標(biāo))。然后兩個(gè)配套分類器評(píng)估該判斷證據(jù)的強(qiáng)度以確定驗(yàn)證成功。成功信號(hào)分類器尋找成功的可驗(yàn)證證據(jù)。
特別是,它尋找與工作匹配的git活動(dòng)如提交和拉取請(qǐng)求,以及測(cè)試套件通過(guò),以及用戶的明確確認(rèn)。它將會(huì)話從"無(wú)信號(hào)"評(píng)分到"弱信號(hào)"(1)到"多個(gè)硬信號(hào)"(5)。
一個(gè)并行的失敗信號(hào)評(píng)分事情出錯(cuò)的證據(jù)——錯(cuò)誤、失敗的測(cè)試、重試、用戶反對(duì)輸出。驗(yàn)證成功要求會(huì)話被判定為成功且至少有一個(gè)硬可驗(yàn)證的成功信號(hào)。
對(duì)于以下側(cè)重于會(huì)話中成功或失敗程度的分析,我們排除了被成功結(jié)果分類器判定為"無(wú)明確目標(biāo)"的會(huì)話,這約占我們完整樣本的7.7%。
專業(yè)知識(shí)的回報(bào)
那么什么樣的會(huì)話最成功?事實(shí)證明,上述會(huì)話的專業(yè)知識(shí)評(píng)級(jí)對(duì)會(huì)話的成功至關(guān)重要。
有人可能擔(dān)心專業(yè)知識(shí)不是真正的驅(qū)動(dòng)因素——也許專家只是選擇了不同的任務(wù),或在其他方面有所不同。
在本節(jié)中,我們通過(guò)比較做相同類型工作、相同估計(jì)價(jià)值、同一個(gè)月、同一主題、來(lái)自同一廣泛職業(yè)群體的人的會(huì)話,并詢問(wèn)人的評(píng)級(jí)專業(yè)知識(shí)如何影響結(jié)果,來(lái)部分解決這一擔(dān)憂。
![]()
表2:源自分類器的成功和失敗定義
示例意譯并總結(jié)了來(lái)自智能體編碼交互公共數(shù)據(jù)集SWE-chat的真實(shí)會(huì)話,由我們的分類器標(biāo)記。
在我們所有的成功衡量中,一個(gè)人在會(huì)話中表現(xiàn)出的專業(yè)知識(shí)越多,會(huì)話成功的可能性就越高。被評(píng)為新手的會(huì)話達(dá)到我們最嚴(yán)格的衡量——驗(yàn)證成功——的時(shí)間為15%,至少部分成功的時(shí)間為77%。被評(píng)為中級(jí)或以上的會(huì)話達(dá)到驗(yàn)證成功的時(shí)間為28-33%,至少部分成功的時(shí)間為91-92%(圖5)。
在每種衡量中,大部分收益來(lái)自從新手到中級(jí);在中級(jí)和專家之間,斜率下降。在附錄中,我們給出了圖5背后回歸的詳細(xì)信息。
![]()
圖5:專業(yè)知識(shí)與會(huì)話如何結(jié)束
按用戶在該任務(wù)上的評(píng)級(jí)專業(yè)知識(shí)(從新手到專家的五級(jí)量表)劃分的會(huì)話結(jié)果。左面板包括所有會(huì)話。中間和右面板限制在遇到麻煩(失敗信號(hào)>3)的會(huì)話,并顯示仍以各種成功和失敗定義結(jié)束的比例。每個(gè)點(diǎn)是調(diào)整后的比率——我們通過(guò)僅比較共享相同工作模式、相同任務(wù)價(jià)值帶、同一個(gè)月、相同任務(wù)主題和相同用戶類型(軟件相關(guān)職業(yè)與否)的會(huì)話來(lái)估計(jì)專業(yè)水平之間的差異。這些點(diǎn)背后回歸的詳細(xì)信息在附錄中。須線是樣本均值的置信區(qū)間(大多數(shù)在此圖中太小而不可見(jiàn))。這些圖排除了被成功結(jié)果分類器判定為無(wú)明確目標(biāo)的會(huì)話。
在沿途遇到挑戰(zhàn)的會(huì)話中出現(xiàn)了類似的梯度。當(dāng)失敗信號(hào)記錄到失敗的驗(yàn)證證據(jù)時(shí),我們說(shuō)一個(gè)會(huì)話遇到麻煩。這可能是錯(cuò)誤、失敗的測(cè)試、多次嘗試做同一件事,或用戶表達(dá)沮喪或不滿意。在遇到麻煩的會(huì)話中,驗(yàn)證成功的比例從新手評(píng)級(jí)會(huì)話的4%上升到專家評(píng)級(jí)會(huì)話的15%,考慮了上述所有控制(圖5)。查看更寬松的衡量,我們發(fā)現(xiàn)至少部分成功的比例對(duì)于新手為60%,對(duì)于中級(jí)到專家會(huì)話為80-81%。
我們還跟蹤反向關(guān)系——專業(yè)知識(shí)與各種失敗衡量。請(qǐng)注意,在此分析中,被判定為失敗的會(huì)話是那些甚至沒(méi)有部分成功的會(huì)話。我們說(shuō)一個(gè)遇到麻煩的會(huì)話被放棄,如果它被判定為失敗且沒(méi)有編寫代碼行:用戶看起來(lái)是新手的會(huì)話中有19%最終被放棄,而其他人為5-7%。
換句話說(shuō),經(jīng)驗(yàn)最少的用戶在努力實(shí)現(xiàn)他們追求的結(jié)果時(shí)更有可能放棄。專業(yè)知識(shí)的部分價(jià)值似乎是指引智能體走向正確方向的能力。
職業(yè)可能不如專業(yè)知識(shí)重要
軟件相關(guān)職業(yè)的人在其會(huì)話中約30%達(dá)到驗(yàn)證成功,而其他職業(yè)的用戶約26%達(dá)到驗(yàn)證成功。在產(chǎn)生代碼的會(huì)話(即添加或修改至少一行代碼的會(huì)話)中,這些數(shù)字分別為34%和29%(圖6)。
軟件相關(guān)職業(yè)與其他職業(yè)之間的差距在我們的更寬松的成功定義下縮小——兩組在產(chǎn)生代碼的會(huì)話中達(dá)到至少部分成功的比例分別為89%和88%。
這五點(diǎn)的差距很小,而且在七個(gè)月內(nèi)既沒(méi)有擴(kuò)大也沒(méi)有縮小,盡管兩組的成功率都有所提高。在產(chǎn)生代碼的會(huì)話中,我們數(shù)據(jù)集中十個(gè)最大的職業(yè)中每一個(gè)在驗(yàn)證成功方面都在軟件工程師的七個(gè)百分點(diǎn)之內(nèi)。
管理職業(yè)在驗(yàn)證成功方面最高,略高于軟件工程職業(yè)。他們更高的驗(yàn)證成功率可能反映了轉(zhuǎn)移到指導(dǎo)智能體的管理技能。但它們也可能部分反映了我們的衡量:驗(yàn)證部分依賴于記錄中的明確確認(rèn),而管理者在得到他們要求的東西時(shí)可能更有可能進(jìn)行溝通。
![]()
圖6:按推斷職業(yè)劃分的編碼會(huì)話中的驗(yàn)證和判定成功率
在添加或更改至少一行代碼的會(huì)話中,按用戶推斷的職業(yè)群體劃分的滿足嚴(yán)格成功定義——判定成功和驗(yàn)證成功——的會(huì)話占比,針對(duì)十個(gè)最大的群體。每個(gè)群體都在軟件/數(shù)學(xué)用戶(SOC代碼計(jì)算機(jī)和數(shù)學(xué)職業(yè))的七個(gè)百分點(diǎn)之內(nèi)。誤差條是按不同賬戶計(jì)算的95%置信區(qū)間。
展望未來(lái)
本報(bào)告中的結(jié)果提供了一個(gè)關(guān)于智能體編碼如何放大某些形式的知識(shí)和技能,同時(shí)替代其他形式的初步圖景。在產(chǎn)生代碼的會(huì)話中,每個(gè)主要職業(yè)的成功率都在軟件相關(guān)職業(yè)的幾個(gè)百分點(diǎn)之內(nèi)。編碼智能體似乎正在使編碼背景對(duì)成功編程的相關(guān)性降低。
與此同時(shí),成功的會(huì)話更可能表現(xiàn)出領(lǐng)域?qū)I(yè)知識(shí)。被評(píng)為專家的會(huì)話達(dá)到驗(yàn)證成功的頻率是新手會(huì)話的兩倍以上,當(dāng)會(huì)話遇到麻煩時(shí),新手放棄會(huì)話的比率是其他人的數(shù)倍。協(xié)作的形態(tài)為這一圖景增添了更多色彩——領(lǐng)域?qū)<夷軌蛑笇?dǎo)Claude用他們給出的每個(gè)指令完成更多工作。
因此,引導(dǎo)Claude走向成功的能力更多來(lái)自對(duì)領(lǐng)域的掌握,而不是編寫代碼的能力。任何領(lǐng)域具有這種掌握的人現(xiàn)在可能能夠做他們以前無(wú)法做的技術(shù)工作。沒(méi)有任何這種專業(yè)知識(shí)的人從同一工具中獲得的收益將少得多。而收益主要來(lái)自能力,而非精通——對(duì)領(lǐng)域的工作掌握捕捉了大部分收益,而深度專業(yè)化只增加了更多一點(diǎn)。
這些發(fā)現(xiàn)是初步的。與我們的大多數(shù)研究一樣,我們無(wú)法衡量真實(shí)世界的結(jié)果,如會(huì)話中編寫的代碼是否實(shí)際使用或隨后被丟棄,或它是否產(chǎn)生經(jīng)濟(jì)上寶貴的工件。
此外,本報(bào)告排除的非交互式使用是活動(dòng)的相當(dāng)大一部分。為其開(kāi)發(fā)衡量框架是未來(lái)工作的優(yōu)先事項(xiàng)。我們所有的會(huì)話分類都依賴于模型對(duì)記錄的閱讀。
在附錄中,我們展示了我們的分類器以預(yù)期方向跟蹤獨(dú)立遙測(cè)數(shù)據(jù),并在大多數(shù)會(huì)話上與強(qiáng)參考模型一致。但分類器在大規(guī)模驗(yàn)證方面仍然具有挑戰(zhàn)性,而Claude Code會(huì)話增加了進(jìn)一步的困難,因?yàn)樗鼈兛赡芴L(zhǎng)太復(fù)雜,無(wú)法讓人類標(biāo)簽作為真實(shí)標(biāo)準(zhǔn)。
本報(bào)告中的圖景將隨著模型、用戶以及他們之間分工的變化而更新。我們希望這些衡量將使我們能夠跟蹤重大轉(zhuǎn)變的發(fā)生。例如,如果專業(yè)知識(shí)的回報(bào)開(kāi)始隨時(shí)間減少,那將表明模型開(kāi)始提供用戶目前帶來(lái)的基本判斷,以及這些工具的收益正在超越領(lǐng)域?qū)<覕U(kuò)大。
如果軟件職業(yè)之外用戶成功完成的編碼會(huì)話占比繼續(xù)增長(zhǎng),這可能表明軟件生產(chǎn)正在成為每個(gè)領(lǐng)域普通工作的一部分,而不是單一職業(yè)的產(chǎn)物。
這些轉(zhuǎn)變將改變誰(shuí)從智能體編碼中受益,以及受益多少,并對(duì)勞動(dòng)力市場(chǎng)中最受重視的東西產(chǎn)生影響。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.