过去两年,AI 爬虫成了网站运营者最头疼的问题之一。大模型厂商不断抓取网页内容用于训练,普通流量和恶意爬虫混在一起,难以辨别。Anubis 这个开源项目,用一种相当诗意的说法来应对——给每一个传入的 HTTP 请求“称灵魂”。
项目由 TecharoHQ 开发,用 Go 语言编写。仓库介绍只有一句话,但 star 数已经超过 2.1 万,可见这个问题有多普遍。
它到底解决什么问题
网站日志里会出现大量非人类流量,它们不像普通用户那样浏览页面,而是快速抓取文本、图片,甚至绕过 robots.txt。Anubis 的思路是:在请求到达真实服务器之前,先判断它“够不够像真人”。如果请求被判定为 AI 爬虫,就直接拦下来。
它的特点可以归纳为:
- 开源免费,代码完整托管在 GitHub,任何人可以审查、修改。
- Go 语言实现,部署产物是单一二进制,资源占用相对低。
- 活跃维护,仓库有 871 次提交,还有 281 个 open issues 在讨论边界情况。
这类工具为什么值得关注
AI 爬虫问题不会消失,只会越来越普遍。对于内容创作者、独立站长来说,流量和带宽都是成本,被爬虫白白消耗很浪费。Anubis 提供了一种轻量的防御思路:把判断前置,而不是等攻击发生后再处理。
当然,官方公开的技术细节有限,比如具体用什么特征来识别 AI 爬虫,目前没有明确说明。想深入了解的话,只能直接读源码。
使用前需要知道的事
Anubis 不是安装即用的 SaaS,而是需要自己部署的服务。官方没有提供托管版本,所有配置都通过环境变量或命令行参数完成。这意味着你要有一定的服务器运维基础。但正因为是开源项目,社区里已经有不少二次开发和部署教程。
另外,它拦截的是“疑似 AI 爬虫”,这意味着误伤正常用户的可能性始终存在。部署前最好先小范围测试,观察对真实用户访问的影响,再逐步扩大范围。
如果你也被异常爬虫流量困扰,不妨把 Anubis 加入测试列表。先在小规模流量下跑一段时间,观察它对正常请求的影响,再决定要不要全面启用。










评论
暂无评论
成为第一个评论的人