![]()
互聯(lián)網(wǎng)最大的「保安」,現(xiàn)在要當(dāng)最大的「收銀員」了。
作者|靖宇
7 月 1 日,Cloudflare 發(fā)了一篇博客,標(biāo)題很溫和,叫「你的網(wǎng)站,你的規(guī)則」。但內(nèi)容一點(diǎn)也不溫和——從 9 月 15 日起,所有使用 Cloudflare 的網(wǎng)站,默認(rèn)屏蔽混合用途的 AI 爬蟲。只要你的頁面上有廣告,AI 的訓(xùn)練爬蟲和 Agent 爬蟲就進(jìn)不來。除非你自己去后臺(tái)手動(dòng)打開。
注意這個(gè)邏輯翻轉(zhuǎn):以前是「默認(rèn)允許,你可以選擇屏蔽」,現(xiàn)在是「默認(rèn)屏蔽,你可以選擇允許」。
這是互聯(lián)網(wǎng)基礎(chǔ)設(shè)施層,第一次對(duì) AI 數(shù)據(jù)獲取方式進(jìn)行系統(tǒng)性「立法」。
做出這個(gè)決定的背景是一個(gè)標(biāo)志性的事件,互聯(lián)網(wǎng)上的 bot 流量,已經(jīng)超過了人類流量。
Cloudflare CEO Matthew Prince 說,這個(gè)里程碑比所有人預(yù)期的都來得早,原本預(yù)計(jì)要到 2027 年才會(huì)發(fā)生。換句話說,今天你打開的大多數(shù)網(wǎng)頁,「看」它們的主要不是人,而是機(jī)器。
而如何規(guī)范來自 AI 的流量,既有可能決定了所有網(wǎng)站的未來,也決定了網(wǎng)絡(luò)守門人 Cloudflare 自己的發(fā)展軌跡。
01
最嚴(yán)厲的「爬蟲政策」
根據(jù)官方介紹,Cloudflare 把 AI 爬蟲拆成了三類。
第一類叫「Search」,就是為搜索服務(wù)建索引的傳統(tǒng)爬蟲,Google 干了二十多年的那種。
第二類叫「Agent」,是實(shí)時(shí)代用戶去訪問網(wǎng)頁的 AI 代理,比如你讓 ChatGPT 幫你查個(gè)信息、填個(gè)表單,它背后就有一個(gè) Agent 爬蟲在替你跑腿。
第三類叫「Training」,就是大規(guī)模抓取內(nèi)容用于模型訓(xùn)練的爬蟲。
三類分開標(biāo)注。網(wǎng)站主可以分別對(duì)每一類設(shè)置「允許」或「屏蔽」。你想讓搜索引擎找到你?可以。你想讓 AI 代理幫你的用戶查信息?也可以。但你不想讓 AI 公司白嫖你的內(nèi)容去訓(xùn)練模型?那你可以單獨(dú)把 Training 關(guān)掉。
這個(gè)分類本身就是一把刀,直接捅向了 Google。
Google 的 Googlebot 是一個(gè)典型的「混合爬蟲」——它同時(shí)為 Google 搜索建索引,也為 Google 的 AI 功能(比如 AI Overviews)采集數(shù)據(jù)。Google 確實(shí)提供了一個(gè)叫 Google-Extended 的工具,允許網(wǎng)站選退 AI 訓(xùn)練。但問題在于,Googlebot 這個(gè)核心爬蟲本身,依然會(huì)同時(shí)為搜索引擎內(nèi)置的 AI 功能收集數(shù)據(jù)。
搜索和 AI 的數(shù)據(jù)需求,在 Google 的架構(gòu)里就沒有被真正分開過。
這意味著什么?Cloudflare 的數(shù)據(jù)說得很清楚:因?yàn)榫W(wǎng)站想保持在 Google 搜索中的可見性,就不得不讓 Googlebot 進(jìn)來,而 Googlebot 進(jìn)來了,AI 訓(xùn)練的數(shù)據(jù)也就一并拿走了。Google 因此獲得了大約兩倍于其他 AI 公司的網(wǎng)頁內(nèi)容訪問量。
Cloudflare 這次還加了一條「最嚴(yán)規(guī)則優(yōu)先」的原則。如果一個(gè)爬蟲同時(shí)執(zhí)行搜索和訓(xùn)練兩個(gè)功能,那所有適用的規(guī)則會(huì)同時(shí)生效——按最嚴(yán)格的那個(gè)來。也就是說,你只要選擇屏蔽 Training 爬蟲,Googlebot、Applebot、BingBot 這些混合爬蟲,統(tǒng)統(tǒng)會(huì)被一并屏蔽。
這刀砍的是「捆綁」——你想被搜索到,就得接受被 AI 訓(xùn)練。Cloudflare 說,這個(gè)捆綁不公平,必須拆開。
一組數(shù)據(jù)可以說明舊「社會(huì)契約」崩壞到了什么程度。Cloudflare 公布了各家 AI 公司的爬取與回流比:Google 大約是 14:1——每爬取 14 個(gè)頁面,回流 1 次點(diǎn)擊。OpenAI 是 1,700:1。Anthropic 是 73,000:1。
搜索引擎時(shí)代的交易是「我爬你的內(nèi)容,你得到流量」。在 AI 時(shí)代,這筆賬已經(jīng)算不過來了。
02
從「保安」到「收銀員」
如果 Cloudflare 只是幫網(wǎng)站主擋住 AI 爬蟲,那這件事的意義就止于「防御」。但 Cloudflare 顯然不滿足于只當(dāng)保安。
去年 7 月,Cloudflare 推出了「Pay Per Crawl」——按爬取次數(shù)向 AI 公司收費(fèi)。今年,它把這個(gè)模式升級(jí)為「Pay Per Use」。區(qū)別在于,不再是爬蟲每來一次你收一次錢,而是當(dāng)你的內(nèi)容在 AI 系統(tǒng)中真正產(chǎn)生了價(jià)值,被用于生成一個(gè)回答、出現(xiàn)在一個(gè) AI 搜索結(jié)果里,用戶才能收到錢。
從「按次收費(fèi)」到「按價(jià)值收費(fèi)」,這個(gè)轉(zhuǎn)變的野心不小。它意味著 Cloudflare 想建立的不是一道墻,而是一個(gè)市場。
目前的初始合作伙伴是兩家 AI 搜索公司 Ceramic.ai 和 You.com。當(dāng)出版商選擇加入后,他們的內(nèi)容出現(xiàn)在 Ceramic 的 AI 搜索結(jié)果中,或被 You.com 的 Agent 訪問時(shí),出版商會(huì)收到付款。大出版商們紛紛站臺(tái)——Condé Nast 的 CEO 說這是「游戲規(guī)則的改變」,Reddit 的聯(lián)合創(chuàng)始人說「整個(gè)生態(tài)系統(tǒng)都會(huì)受益」。
聽起來像是一個(gè)完美的故事。但我覺得有必要說一個(gè)不那么完美的細(xì)節(jié)。
今年 3 月,Cloudflare 自己發(fā)布了一個(gè)爬蟲 API。你給它一個(gè) URL,它能一次性抓取整個(gè)網(wǎng)站,返回 HTML、Markdown 或結(jié)構(gòu)化 JSON。這讓一些出版商相當(dāng)不安——那個(gè)一直幫我擋爬蟲的公司,怎么自己造了一個(gè)爬蟲?
更尷尬的是,有出版商嘗試屏蔽 Cloudflare 自己的爬蟲時(shí)發(fā)現(xiàn),設(shè)置不生效。雖然 Cloudflare 后來修復(fù)了這個(gè)問題,但互聯(lián)網(wǎng)上的評(píng)論已經(jīng)傳開了——「我們保護(hù)網(wǎng)站不被爬蟲抓取……除非是我們自己的爬蟲。」
Cloudflare 對(duì)此的解釋是,它的爬蟲是「合規(guī)爬蟲」,會(huì)尊重 robots.txt,會(huì)遵守自己的 AI Crawl Control 規(guī)則。如果站長選擇屏蔽 AI 爬蟲,Cloudflare 自己的爬蟲也會(huì)被擋在門外。用一位開發(fā)者的話說,這是一個(gè)「兩邊下注所以永遠(yuǎn)贏」的策略。
這就引出了一個(gè)根本性的問題:Cloudflare 到底是一個(gè)中立的基礎(chǔ)設(shè)施裁判,還是一個(gè)新型的中間商?
答案可能是后者。
它同時(shí)扮演著規(guī)則制定者(定義三類爬蟲)、規(guī)則執(zhí)行者(在基礎(chǔ)設(shè)施層攔截爬蟲)和市場參與者(運(yùn)營自己的爬蟲和內(nèi)容交易平臺(tái))三個(gè)角色。
這不是說它做的事情沒有價(jià)值——把 AI 爬蟲從「無序掠奪」拉入「明確分類、需要許可」的框架,確實(shí)是一個(gè)進(jìn)步。但把 Cloudflare 當(dāng)成內(nèi)容創(chuàng)作者的「救世主」,就太天真了。
它在構(gòu)建的,是一個(gè)以自己為樞紐的「AI 內(nèi)容稅收站」。
03
普通人能分到蛋糕嗎?
這可能是整件事里最讓人冷靜的部分。
Condé Nast、Dotdash Meredith、Reddit——站出來支持 Cloudflare 的,都是大型出版商和平臺(tái)。它們有內(nèi)容規(guī)模,有法務(wù)團(tuán)隊(duì),有談判籌碼。這些公司不需要 Cloudflare 也能跟 AI 公司簽許可協(xié)議——事實(shí)上,過去一年全球已經(jīng)簽了超過 50 份內(nèi)容許可大單。Cloudflare 對(duì)它們來說,是多了一個(gè)工具,不是唯一的出路。
但個(gè)人博主呢?一個(gè)在 WordPress 上寫技術(shù)教程的獨(dú)立開發(fā)者呢?一個(gè)用公眾號(hào)寫深度分析的自媒體人呢?
理論上,Cloudflare 的基礎(chǔ)設(shè)施,可以讓小內(nèi)容主無需逐一跟每家 AI 公司談判,就能設(shè)定權(quán)限和獲得補(bǔ)償。但「理論上」三個(gè)字是關(guān)鍵。Pay Per Use 到現(xiàn)在只有 Ceramic.ai 和 You.com 兩個(gè)合作伙伴,都是小玩家。OpenAI、Google、Anthropic 這些真正在大規(guī)模消耗內(nèi)容的公司沒有一個(gè)上桌。
而且有一個(gè)更現(xiàn)實(shí)的矛盾:對(duì)小創(chuàng)作者來說,曝光本身就是最稀缺的資源。屏蔽 AI 爬蟲可能意味著減少被發(fā)現(xiàn)的機(jī)會(huì)。大媒體屏蔽爬蟲,Google 搜索還是會(huì)收錄它們;小博客屏蔽爬蟲,可能就真的消失在互聯(lián)網(wǎng)的噪音里了。
有一組更讓人清醒的數(shù)據(jù)。
AI 聊天機(jī)器人帶來的引薦流量比傳統(tǒng)搜索少大約 96%。用戶在 AI 回答中點(diǎn)擊引用來源的概率,只有大約 1%。出版商在過去一年因?yàn)?AI 搜索功能損失了 20% 到 90% 不等的流量和收入。一項(xiàng)研究發(fā)現(xiàn),Google 的 AI Overviews 讓外鏈點(diǎn)擊量下降了大約 40%。
這意味著,即使 Pay Per Use 全面鋪開,付費(fèi)規(guī)模也可能遠(yuǎn)遠(yuǎn)不夠彌補(bǔ)出版商已經(jīng)失去的廣告收入。這不是一場變局,更像是一次止損——而且未必能止住。
Cloudflare 報(bào)告說,50% 以上的 AI 爬蟲流量花在重復(fù)抓取未更新的頁面上。解決這種低效確實(shí)有價(jià)值。但解決效率問題和讓創(chuàng)作者真正賺到錢,是兩件事。
04
「菩薩」也有自己的廟
Cloudflare 向來被廣大用戶稱贊為「賽博菩薩」,是因?yàn)樗_實(shí)在做一件有價(jià)值的事——把 AI 時(shí)代的數(shù)據(jù)掠奪從暗處拉到明處,逼 AI 公司說清楚「我要你的數(shù)據(jù)干什么」。在一個(gè) bot 流量已經(jīng)超過人類流量的互聯(lián)網(wǎng)上,有人愿意站出來喊一聲「規(guī)矩不能這么沒有」,這本身值得肯定。
但「菩薩」也有自己的廟。
Cloudflare 管理著全球大約 20% 的網(wǎng)絡(luò)流量,這個(gè)數(shù)字既大又不夠大。另外 80% 的網(wǎng)站不在它的保護(hù)范圍內(nèi)。AI 公司完全可以把數(shù)據(jù)采集的重心轉(zhuǎn)向非 Cloudflare 站點(diǎn)。
Google 和 Apple 的爬蟲已經(jīng)提供了形式上的選退工具,可能借此繞過 Cloudflare 的攔截。英國競爭與市場管理局(CMA)正在從監(jiān)管角度向 Google 施壓,要求它讓出版商能在不影響搜索排名的前提下退出 AI 訓(xùn)練。
一個(gè)基礎(chǔ)設(shè)施公司的政策,不會(huì)讓這場內(nèi)容權(quán)益的重新分配塵埃落定。
但它揭示了一個(gè)更深層的趨勢,互聯(lián)網(wǎng)的「收費(fèi)站」正在從搜索引擎轉(zhuǎn)移到基礎(chǔ)設(shè)施層。
過去二十年,Google 是那個(gè)站在路中間決定誰能被看見的人。現(xiàn)在 Cloudflare 想在更底層的位置攔一道——你要過路,先說清楚你是來干什么的,然后按規(guī)矩來。
收費(fèi)站變了。收費(fèi)的人,未必變了。
*頭圖來源:hitechnectar.com
本文為極客公園原創(chuàng)文章,轉(zhuǎn)載請聯(lián)系極客君微信 geekparkGO
極客一問
當(dāng) AI 消耗你的內(nèi)容卻不回饋流量,
你愿意被「保護(hù)」還是被「代理收費(fèi)」?
![]()
![]()
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.