過去兩年,AI 爬蟲成了網站運營者最頭疼的問題之一。大模型廠商不斷抓取網頁內容用於訓練,普通流量和惡意爬蟲混在一起,難以辨別。Anubis 這個開源專案,用一種相當詩意的說法來應對——給每一個傳入的 HTTP 請求「稱靈魂」。
專案由 TecharoHQ 開發,用 Go 語言編寫。倉庫介紹只有一句話,但 star 數已經超過 2.1 萬,可見這個問題有多普遍。
它到底解決什麼問題
網站日誌裡會出現大量非人類流量,它們不像普通使用者那樣瀏覽頁面,而是快速抓取文字、圖片,甚至繞過 robots.txt。Anubis 的思路是:在請求到達真實伺服器之前,先判斷它「夠不夠像真人」。如果請求被判定為 AI 爬蟲,就直接攔下來。
它的特點可以歸納為:
- 開源免費,程式碼完整託管在 GitHub,任何人可以審查、修改。
- Go 語言實現,部署產物是單一二進位制,資源佔用相對低。
- 活躍維護,倉庫有 871 次提交,還有 281 個 open issues 在討論邊界情況。
這類工具為什麼值得關注
AI 爬蟲問題不會消失,只會越來越普遍。對於內容創作者、獨立站長來說,流量和頻寬都是成本,被爬蟲白白消耗很浪費。Anubis 提供了一種輕量的防禦思路:把判斷前置,而不是等攻擊發生後再處理。
當然,官方公開的技術細節有限,比如具體用什麼特徵來識別 AI 爬蟲,目前沒有明確說明。想深入瞭解的話,只能直接讀原始碼。
使用前需要知道的事
Anubis 不是安裝即用的 SaaS,而是需要自己部署的服務。官方沒有提供託管版本,所有配置都通過環境變數或命令列引數完成。這意味著你要有一定的伺服器運維基礎。但正因為是開源專案,社羣裡已經有不少二次開發和部署教程。
另外,它攔截的是「疑似 AI 爬蟲」,這意味著誤傷正常使用者的可能性始終存在。部署前最好先小範圍測試,觀察對真實使用者訪問的影響,再逐步擴大範圍。
如果你也被異常爬蟲流量困擾,不妨把 Anubis 加入測試列表。先在小規模流量下跑一段時間,觀察它對正常請求的影響,再決定要不要全面啟用。










評論
暫無評論
成為第一個評論的人