← 所有文章

現在,助理才是真正的讀者

過去將近一年,我一直把自己的流量看錯了。我盯著真人訪客、搜尋點擊、瀏覽深度,把日誌裡那些機器人的紀錄當成該濾掉的雜訊。直到我真的把它們加總起來。在一個具代表性的日子裡,我的網站接待了約 301 位真人訪客,以及來自 AI 代理的約 19,800 次請求。這些代理並不是在抓取我的內容拿去訓練。佔比最大的單一來源,而且遙遙領先,是 ChatGPT 為了當下回答某個人的問題而即時抓取我的頁面。我真正的讀者早已悄悄不再造訪,他們改用助理來閱讀我;而那個助理讀我的次數,大約是它所服務的真人的六十六倍。 {.answer-block}

重點摘要

  • 在最近一個具代表性的日子,我的網站有約 301 位真人訪客與約 19,800 次 AI 代理請求。代理流量的 7 日平均約為每日 19,850 次,真人流量的 28 日平均為每日約 301 位,比例接近 66 比 1。1
  • 這些代理流量大多不是訓練爬蟲,而是使用者觸發的即時擷取:ChatGPT-User 每日約 13,100 次請求,Claude-User 約 2,300 次——這類代理抓取頁面,純粹是因為某個真人剛剛向助理問了問題。123
  • 各家廠商自己的文件把這條界線畫得很清楚。OpenAI 寫道:「ChatGPT-User 不會用於自動化地爬取網頁。」Anthropic 則說明,Claude-User 會在「個別使用者向 Claude 提問時」擷取頁面。Cloudflare 更把它正式歸類為獨立的 Agent 行為,與 Training、Search 分開。234
  • 相較之下,人人擔心的訓練爬蟲根本只是零頭:同一天 GPTBot 只有 55 次請求,ClaudeBot 212 次。123
  • 實務上的轉變是:您的內容愈來愈被當成「答案的原料」來消費。讀者是一位永遠不會落在您頁面上的真人,而真正閱讀您的,是那個在問題發生當下把您擷取出來的助理。這改變了您該量測什麼、該怎麼寫,也改變了「流量」二字的意義。

那個把一切重新定義的數字

這是一個個人網站:技術指南與隨筆,十種語系,每天幾百位真人訪客。體面,但談不上爆紅。好幾個月來,我的儀表板都在講一個整齊的故事,關於搜尋點擊與停留時間,而 AI 代理那幾列則被我擺在心裡標著「爬蟲,略過」的角落。

問題就出在那個標籤。當我終於把 Cloudflare 邊緣日誌拉進和真人分析同一個畫面時,兩者的比例根本不接近。真人:28 日平均每天約 301 位。AI 代理:7 日平均每天約 19,850 次請求,而我逐一拆解來源的那個代表日則是 19,785 次。1 兩段期間的數字都很穩定,所以這個比例不會因為我挑哪一段而改變:19,785 比 301 是 65.7 比 1,較平滑的 7 日平均則落在 65.9。就說六十六比一吧。

有個合理的質疑會立刻浮現,我想在它動搖其他論點之前先承認:這兩個單位並不對等。301 是不重複的真人訪客,19,800 則是代理的請求次數,而一次真人造訪本身也會產生好幾次頁面請求。所以這不是「讀者多了六十六倍」,而比較接近「助理請求我頁面的頻率,大約是真人前來閱讀頻率的六十六倍」。誠實的比較仍然指向同一個方向,因為有意思的並不是那個確切的倍數,而是這些代理請求究竟是什麼東西。

不是您擔心的那種爬蟲

預設的假設,包括我自己的,是一整面牆的 AI 代理流量代表訓練用爬蟲正把您的內容吸進下一代基礎模型。那是催生無數次 robots.txt 修改的恐懼,但我的日誌顯示的並不是這回事。

以下是同一個代表日,依 user-agent 拆解的結果:1

User-agent 請求數 這是什麼
ChatGPT-User 13,128 OpenAI,使用者觸發的即時擷取
Claude-User 2,274 Anthropic,使用者觸發的即時擷取
Bytespider 1,600 ByteDance,據報為訓練爬蟲
OAI-SearchBot 892 OpenAI,搜尋索引器
PerplexityBot 819 Perplexity,搜尋索引器5
Amazonbot 769 Amazon,索引用途(也可能用於訓練)
ClaudeBot 212 Anthropic,訓練爬蟲
GPTBot 55 OpenAI,訓練爬蟲
meta-externalagent 36 Meta,訓練爬蟲

請再看一次最上面兩列。ChatGPT-User 與 Claude-User 合計超過一萬五千次,佔了當天約兩萬次代理請求的絕大部分。兩者都不是訓練爬蟲,而這個區別並非我個人的詮釋,而是廠商用白話寫在文件裡的。

OpenAI 的機器人文件說,OpenAI 把 ChatGPT-User 用於「ChatGPT 與 Custom GPTs 中的某些使用者操作」,並說明「當使用者向 ChatGPT 或 CustomGPT 提問時,它可能會造訪某個網頁」,接著斬釘截鐵地寫著:「ChatGPT-User 不會用於自動化地爬取網頁」(原文:ChatGPT-User is not used for crawling the web in an automatic fashion)。2 大規模的訓練爬蟲是另一個獨立的代理 GPTBot,文件形容它抓取的是「可能用於訓練我們生成式 AI 基礎模型的內容」。2 在我的代表日裡,GPTBot 發出了五十五次請求,ChatGPT-User 則是一萬三千次。

Anthropic 畫的是同一條線。Claude-User「支援 Claude AI 的使用者。當個別使用者向 Claude 提問時,它可能會透過 Claude-User 代理存取網站」;而訓練爬蟲 ClaudeBot 則是「藉由蒐集可能有助於訓練的網頁內容,提升我們生成式 AI 模型的實用性與安全性」。3 形狀完全一樣:使用者觸發的代理遠遠壓過訓練爬蟲,2,274 比 212。

Cloudflare 擋在相當大一部分網路流量的前端,也沒有理由偏袒任何單一廠商,而它同樣把這個分野正式制度化。其已驗證機器人的分類法依行為把 AI 機器人分成不同類別:Agent,「代表真人造訪頁面、由使用者指揮的代理」;Search,「為了建立搜尋索引或 RAG 資料庫而爬取」;以及 Training,「為了訓練或微調模型而爬取」。4 真正的判別依據是「有沒有人在指揮」。訓練或搜尋機器人是自主爬行,為的是建立一份長期存在的資料集;Agent 的擷取則是每次請求觸發一次,由一次真人互動引發,只為即時回答一個特定問題。我的流量壓倒性地屬於第三種。

即時擷取實際上代表什麼

請靜下心想想它的運作機制,因為那會徹底改變您的心智模型。當 ChatGPT-User 打到我的頁面時,背後產生它的順序是這樣的:某個人打開助理,輸入一個問題,助理判斷我的頁面值得一讀才能回答,於是即時抓取該頁,取出所需的內容,組出一段回覆。那個人得到了答案。他們可能從頭到尾沒看過我的名字、我的版面、我其他的文章,也沒看過頁尾那一小段推薦我某個 App 的備註。

那就是一位讀者,只是一位我永遠見不到的讀者。助理是快遞,而我的分析工具從頭到尾只看見快遞的貨車——一天一萬三千趟——然後把它叫做雜訊。

這種顛倒,就是關於 AI 與內容的種種喧囂底下那個安靜的故事。訓練爬蟲的爭論談的是模型會不會在某個時間點把您的作品吃進權重裡一次。那個爭論很重要,但如果您想理解自己的即時讀者,它就是看錯了地方。即時讀者是透過 Agent 擷取抵達的,持續不斷,每一次都由此刻正在發生的真人互動所觸發。我日誌裡的每一次 ChatGPT-User 擷取,都能回溯到某個人向助理問了一件我的頁面能回答的事——即使單一問題可能觸發不只一次擷取,也有些擷取從未真正呈現給任何人。這個規模——一天一萬五千次擷取對上三百次真人造訪——說明我的內容真正觸及的人,大多都在助理的另一側。

這改變了量測網站的方式

一旦您接受助理是一群真實的讀者,您的儀表板上最重要的那個錶頭忽然就不見了。標準分析工具建立在「閱讀發生在您的頁面上」這個假設之上:工作階段、捲動深度、停留時間、藏在第一屏下方的轉換元素。當一個真人透過 Claude 讀您時,這些通通不會觸發。助理不捲動、不轉換,而且照定義每次造訪都是跳出。如果您只用頁面上的互動指標評斷內容,您成長最快的那群讀者在統計上是隱形的。

由此衍生三項調整,而這三項我都已經開始做。

第一,把 AI 代理的請求日誌當成讀者指標,而不是資安指標。我現在會像追蹤真人不重複訪客那樣,逐頁追蹤 ChatGPT-User 與 Claude-User 的請求量,因為那個數字是我手上最接近「助理有多常用這一頁去回答某個人」的替代指標。代理抓最多的頁面,未必是真人點最多的頁面,而這個落差,正是我原本一直丟掉的內容訊號。

第二,別再只為「在頁面上的那一刻」做最佳化。一篇寫給從搜尋落地、隨手掃讀的真人的頁面,和一篇寫給正在回答問題、需要乾淨擷取的助理的頁面,並不是同一回事。後者這份工作獎勵的是:靠近開頭、清楚且能獨立成立的答案,毫不含糊的主張,以及擷取器不必連同周邊裝飾一起搬走就能取用的結構。這正是我在每一篇文章開頭放一段直接答案區塊的原因。那個區塊既是給讀者的,也同樣是給快遞的。

第三,接受歸因會變難,改為量測它投下的影子。我看不見 Claude-User 擷取背後的那個真人。我能看見的是一個次級訊號:那些抵達我網站時已經帶著助理轉介來源的真人——那一小股讀完答案、想看原始出處、於是點進來的人。相對於擷取量,這只是涓涓細流,一天九位對上一萬五千次,但它是隱形讀者群露出的可見尖端;而它的走勢,才是「當一份好的答案原料,最終究竟會不會把真人送回源頭」這個問題的誠實記分板。

藏在底下的策略

有種誘惑,是把這一切讀成獨立網站的末日:助理把您的內容挖光、代替您作答、把真人留給自己。有時候確實就是這樣。但這個框架太扁平了,因為它忽略了「擷取」這件事實際上在篩選什麼。

助理之所以抓取您的頁面,是因為在問題發生的當下,它判定您的頁面是那個特定查詢最好的可用來源。那已經不是為某個關鍵字排名的舊搜尋遊戲,而是成為答案引擎在需要正確時會伸手去拿的那個東西。這裡的硬通貨不是反向連結,也不是關鍵字密度,而是在夠多人會問的問題上,能被驗證、也能被擷取地說對。準確、具體、時效新的頁面會被抓取;空洞、把既有說法重講一遍的商品化內容不會,因為模型早就掌握了商品化的那一部分,只有在需要它本身無法可靠內含的東西時才會向外伸手。

所以 Agent 流量創造出來的誘因,難得地和「做出真正好的頁面」是一致的。不是為排名演算法工程化的頁面,而是值得被擷取來回答一個真實問題的頁面。可量測的獎賞,已經從「有沒有真人落地並捲動」,移到「有沒有助理判定這是最好的來源,並把它讀給一個真人聽」。要我選,我寧願在第二個賽場上競爭。

我的立場

把助理當成您的主要讀者,因為就數字而言它們早就是了;並且為「擷取」而建,程度不亞於為「造訪」而建。落在您頁面上的真人,如今是少數派讀者,而且往往是助理答完之後,在乎到願意去把原始出處找出來的那一位。多數派讀者是助理本身,只要有真人的問題需要,它就即時把您擷取出來,而且從不碰您的分析數據。那不是一個需要封鎖的爬蟲問題,而是一條需要理解的通路——而且此刻,它是多數內容網站手上最大的一條。

未來幾年的網站,要用兩個數字來衡量,而不是一個。一個是您看得見的流量,也就是頁面上的真人;另一個是您只能推論的流量,也就是那些正在讀您、好去回答您永遠不會見到的真人的助理。我這邊的比例,大約是六十六比一,偏向我看不見的那群讀者。我猜您那邊的數字,也比您的儀表板告訴您的更接近這個比例——因為那幾列,就躺在我當初把自己那幾列丟著的同一個角落,標著雜訊。

關鍵要點

  • 把 AI 代理的請求算成讀者,而不是雜訊。 在我的網站上,它們大約以 66 比 1 壓過真人的頁面抵達次數,而且組成比倍數更重要。1
  • 代理流量大多是即時的、使用者觸發的擷取,不是訓練。 ChatGPT-User 與 Claude-User 抓取頁面,是因為某個真人剛剛問了助理某件事;廠商在文件裡寫明了這一點,Cloudflare 也把它歸類為獨立的 Agent 行為。234
  • 訓練爬蟲只佔很小一部分。 在使用者觸發的代理發出超過 15,000 次請求的那一天,GPTBot 與 ClaudeBot 合計還不到 300 次。123
  • 頁面內分析看不見您成長最快的讀者群。 助理不捲動、不轉換,所以互動指標會讓 Agent 這群讀者變成隱形;請改用逐頁的代理擷取量當作替代指標。
  • 為「被擷取」而寫。 開頭就給出清楚、能獨立成立的答案;具體、準確、保持時效。答案引擎會抓取它在問題當下判定為最佳來源的那一頁——這獎勵的是真的說對,而不是關鍵字最佳化。

常見問題

ChatGPT-User 和 GPTBot 有什麼差別?

GPTBot 是 OpenAI 的訓練爬蟲,蒐集的是「可能用於訓練」基礎模型的內容。ChatGPT-User 則是使用者觸發的代理,當有人向 ChatGPT 提問時才會去抓取頁面;OpenAI 明確表示它「不會用於自動化地爬取網頁」。2 在我的日誌裡,兩者相差好幾個數量級:ChatGPT-User 發出 13,128 次請求的那一天,GPTBot 只有 55 次。1

AI 助理真的在即時讀我的網站嗎?

如果您提供的內容能回答常見問題,答案幾乎肯定是「會」。ChatGPT-User、Claude-User、Perplexity-User 這類代理,會在真人向助理問了一件該頁能回答的事情時即時抓取頁面。23 它們既不同於訓練爬蟲,也不同於搜尋索引器;在我的網站上,它們是代理流量中最主要的形式。

這和 SEO 有什麼不同?

傳統 SEO 是為了在真人接著會點擊的搜尋結果頁上取得排名。答案引擎的擷取最佳化,則是為了成為助理會去抓取、閱讀並據以組出答案的那個來源——而且真人往往根本不會造訪。獎賞從排名訊號,轉向讓內容夠準確、夠具體、夠新,新到模型需要正確答案時會主動伸手取用您的頁面。

我該不該在 robots.txt 裡封鎖 AI 代理?

這是一個真實的選擇,但請依行為分別決定,不要一刀切。封鎖訓練爬蟲(GPTBot、ClaudeBot)影響的是您的內容會不會拿去訓練未來的模型。封鎖使用者觸發的代理(ChatGPT-User、Claude-User)影響的則是助理能不能即時用您的頁面回答真人——而對許多網站來說,那已經是最大的一群讀者。有一點值得知道:使用者觸發的代理在遵守 robots.txt 上的紀錄比訓練爬蟲差,所以 robots.txt 封鎖對訓練是比較明確的槓桿,對即時擷取則不然;在那裡,邊緣規則可能是更可靠的控制手段。Cloudflare 的分類法之所以把這些類別精確分開,正是為了讓您能區別對待。4

我要怎麼量測一群在自己網站上看不見的讀者?

您無法直接把一次即時擷取歸因到背後的真人,所以請改為量測兩件事:從邊緣日誌取得的逐頁 AI 代理請求量,當作助理使用每一頁頻率的替代指標;以及那一小股抵達時已由助理轉介的真人訪客,把它當作隱形讀者群投下的可見影子。

資料來源


  1. First-party analytics for blakecrosley.com, 2026-07-10 snapshot. Human visitors: 28-day average of ~301 unique humans/day. AI-agent requests: 7-day average of ~19,850/day from Cloudflare edge logs; the single-day source breakdown (ChatGPT-User 13,128; Claude-User 2,274; Bytespider 1,600; OAI-SearchBot 892; PerplexityBot 819; Amazonbot 769; ClaudeBot 212; GPTBot 55; meta-externalagent 36) is from the most recent complete day and sums to ~19,785, consistent with the 7-day average. Human figure is unique visitors; agent figure is requests, so the ~66:1 ratio compares agent request frequency to human arrival frequency, not reader counts. 

  2. OpenAI, “Bots” documentation, developers.openai.com/api/docs/bots. GPTBot: “used to crawl content that may be used in training our generative AI foundation models.” ChatGPT-User (OpenAI “uses ChatGPT-User” “for certain user actions in ChatGPT and Custom GPTs”): “When users ask ChatGPT or a CustomGPT a question, it may visit a web page,” and “ChatGPT-User is not used for crawling the web in an automatic fashion.” OAI-SearchBot: “used to surface websites in search results in ChatGPT’s search features.” Retrieved 2026-07-10. 

  3. Anthropic, “Does Anthropic crawl data from the web, and how can site owners block the crawler?”, support.claude.com/en/articles/8896518 (last updated April 7, 2026; retrieved 2026-07-10). Claude-User: “supports Claude AI users. When individuals ask questions to Claude, it may access websites using a Claude-User agent.” ClaudeBot: “helps enhance the utility and safety of our generative AI models by collecting web content that could potentially contribute to their training.” Claude-SearchBot: “navigates the web to improve search result quality for users.” 

  4. Cloudflare, “Verified bots” and AI-bot categories, developers.cloudflare.com/bots/concepts/bot/verified-bots/ and blog.cloudflare.com/ai-bots/. Behavior categories include Agent, “user-directed agents visiting a page on behalf of a human”; Search, “crawling to build search indexes or RAG databases”; and Training, “crawling to train or fine-tune models.” Retrieved 2026-07-10. 

  5. Perplexity, “PerplexityBot and Perplexity-User,” docs.perplexity.ai/guides/bots. PerplexityBot “is designed to surface and link websites in search results on Perplexity. It is not used to crawl content for AI foundation models.” Perplexity-User “supports user actions within Perplexity. When users ask Perplexity a question, it might visit a web page to help provide an accurate answer.” Retrieved 2026-07-10. 

相關文章

The Robots Are Taking Exams in My Search Console

First-party GSC data: 91% of 3.8M impressions fail a human-query filter. Exam questions, pasted errors, and agent sweeps…

10 分鐘閱讀

清理層才是真正的 AI 代理市場

Charlie Labs 從建構代理轉向清理代理留下的爛攤子。AI 代理市場正從生成轉向證明。清理才是耐久的那一層。

2 分鐘閱讀

Ralph 迴圈:我如何在夜間運行自主 AI 代理

我建構了一套自主代理系統,搭配停止鉤子、生成預算與檔案系統記憶體。以下是失敗經驗與真正能交付程式碼的方法。

3 分鐘閱讀