如果部落格流量突然多了一倍,先不要高興得太早。來的可能不是讀者,而是一直抓文章的程式。網站一樣得處理請求,內容也確實送出去了,但你可能等不到任何人點進來,更不用說留言或訂閱。
這讓我對 AI 爬蟲的感受有點矛盾。寫文章當然希望有人看到,如果 AI 搜尋能幫忙找到合適的讀者,我不會排斥。但如果文章被整篇抓走,答案也在別的地方看完了,自己的網站只剩增加的請求量,那個「曝光」好像就沒有想像中實在。
Cloudflare 在 2025 年 8 月把 AI Audit 更名為 AI Crawl Control 並正式推出,補上每個爬蟲的請求統計和趨勢。它讓網站管理者比較容易看出誰在抓、抓了多少、哪些被擋下。對我來說,先能看清楚,比一開始就選擇全部開放或全部封鎖更有用。
例如某個服務一週來抓了一千次,卻只帶來十次讀者造訪,這兩個數字就值得放在一起想。這是假設的例子,爬蟲請求也不能直接當成閱讀人數;還是得搭配網站自己的來源流量看,不能看到圖表往上就覺得成效很好。
連「不給抓」也分幾種#
在 robots.txt 寫不希望被抓取,仍然是在請對方遵守規則。AI Crawl Control 可以進一步對辨識出的爬蟲阻擋請求,至少不用完全期待對方自律。不過這只管得到經過 Cloudflare、又能被辨識的流量,不是按一下就從網路上隱形。
這次更新有個讓我停下來多看一下的地方:付費方案可以把阻擋回應設成 402 Payment Required,再附上授權聯絡方式。比起單純回 403 拒絕,它多表達了一層意思:內容不是不能用,但使用條件要先談。
只是回了 402,錢也不會自己進來。它可以傳達條件,不能保證對方願意談,更不等於收款和授權流程已經完成。這個差別不大,卻很容易在「網站終於能向 AI 收費」的想像裡被略過。
我現在比較想知道的,是自己的文章究竟被哪些服務反覆讀取,又有多少人因此找到這裡。如果真的帶來讀者,開放有開放的道理;如果只是被取用,也至少能知道自己正在提供什麼。連這些都看不到的時候,要談歡迎還是拒絕,其實都有點憑感覺。