CriteriaBot

CriteriaBot用自然语言规则做内容评估

CriteriaBot 是一款可编程内容评估 API,用户用纯英文定义判定标准,即可对任意内容返回 true/false 结果。它结合传统机器学习和多 LLM 共识面板,支持内容审核、提示注入检测、品牌语气检查等场景,还能通过人工反馈个性化调整规则。适合社区运营、AI 应用开发者等。

paid
内容审核AI 分类器提示注入检测品牌语气检查自然语言规则内容安全API 工具文本分类可编程评估共识模型
收录日期
4.4 (0 评价数量)

登录后可为项目评分

CriteriaBot 是一个把“审核规则”变成“编程接口”的 AI 分类器。它不是给你一堆固定的垃圾邮件或仇恨言论标签,而是让你用自然语言写下判断标准,然后对任意文本返回每条标准的 true/false 结果。官方定位是“程序化内容评估”,听起来很工程师,但实际使用门槛比想象中低——因为整个交互都围绕 plain-English(纯英文)规则展开。

一套评价引擎,多种落地姿势

从网站展示的用例来看,CriteriaBot 更像是规则即服务。你写一条标准,比如“这段内容是否包含剧透?”,然后就可以对任何帖子、评论、邮件去跑。它列举了几类典型场景:

  • 内容审核:识别毒性、骚扰、不安全内容,还能叠加上你自己的社区规则,比如“禁止剧透”或“不讨论政治”
  • AI 防护:拦截提示注入(prompt injection)和不安全输出,给 LLM 应用增加一层可定制的护栏
  • 品牌语气检查:评估 AI 生成或人工写作是否符合既定的语气和风格指南
  • 合规与路由:检查内容是否符合监管或内部政策,或者按类型对消息、工单进行分流

另外还包括垃圾邮件识别、品牌公关监控、数据标注等。哪怕你只是想把几万条用户内容按“是否有价值”粗筛一遍,它也能承担这个脏活。对不同团队来说,它更像是一个可编程的判定层,而不是某种开箱即用的“审核模型”。

工作流:写规则、提交内容、拿判定

CriteriaBot 的官网给出了一条很清晰的链路:先写好规则(也可以从社区库复用),然后通过网站或 API 提交内容;系统会让一组 AI 模型对每条规则进行投票,形成加权共识;最后返回 true/false 判定。你还可以把自己的 API Key 接进来,构建一个自定义模型面板,针对你的场景调优。

比较特别的是它的个性化机制:你可以在已提交的内容上给出你自己的人工判定,系统会学习你的定义——不是你抄别人的标准,而是让模型适应你的判断。官方说通常只需要少量示例就能生效。

这种设计解决了一个实际问题:通用审核模型往往对垂直社区的“暗语”和“潜规则”不敏感。比如某个论坛的“讨论政治”边界,只有内部人才清楚。CriteriaBot 允许你在标准层面用自然语言描述,再通过反馈微调,这比维护一堆正则表达式或训练定制模型要灵活得多。

技术底子:传统 ML 和小型 LLM 的混合

根据官方描述,CriteriaBot 结合了传统机器学习方法与一组小型开源 LLM 的共识面板。这样做的好处是:既保留传统分类方法在精确度上的优势,又获得 LLM 的泛化能力。值得一提的是,模型还能访问 Wikipedia 和 Wolfram,因此在需要最新事实信息或数学计算的评估上也会更可靠。官方并未公开具体的模型清单或权重细节,但对于使用者来说,不需要关心内部实现——只要规则写得足够清楚,返回的结果就可以直接接入你的 pipeline。

怎么上手,以及谁适合用

上手成本主要花在“定义标准”上。你需要把心中的模糊概念拆成一条条可被机器判定的自然语言规则,比如“是否包含性骚扰言论”、“是否在兜售假货”。好消息是规则可以分组复用,还能从社区库借鉴别人写好的标准。API 示例也很直接,一个 POST 请求就能拿到判定结果,同步或异步处理都行。

如果你是内容平台的运营者、做 LLM 应用且有安全需求的开发者,或者在为客服消息做自动分类,CriteriaBot 值得一试。它的定位比普通审核 API 更“程序员友好”,但同时又没有放弃让非技术同事参与规则定义的可能性——毕竟写一句话规则,比写正则简单多了。

定价方面,官方没有在页面上给出具体价格,需要注册后获取 API Key。建议直接访问官网查看最新信息,或者先用自己的小批量内容测一测效果,再决定是否投入。

优缺点

优点

  • 用自然语言定义规则,无需训练样本
  • 多模型共识机制兼顾准确性与泛化
  • 支持人工反馈,逐步适应用户标准
  • 应用场景覆盖审核、防护、合规与标注

缺点

  • 官方公开的技术细节和性能数据有限
  • 复杂规则可能需要多次调整才能稳定

常见问题

CriteriaBot 免费吗?

官方未公开免费档或具体价格,需注册获取 API Key。建议访问官网查看最新定价,或先用小批量内容测试效果。

CriteriaBot 支持中文内容吗?

官方示例和文档以英文为主,但自然语言规则理论上可以用中文编写,具体支持程度建议直接尝试或咨询官方。

CriteriaBot 和普通内容审核 API 有什么区别?

它让你用自然语言自定义判定标准,并通过多个 AI 模型投票共识返回结果,还能根据你的反馈调整个性化定义,灵活性更高。

CriteriaBot 适合谁用?

适合内容平台运营者、社区管理员、LLM 应用开发者和需要做文本分类、路由或标注的团队。

探索更多

相似工具

DateGuard.ai

DateGuard.ai

DateGuard.ai 把自己比作约会领域的 Carfax: 见面之前先验证身份。核心是 AI 活体检测识破照骗和深度伪造,另外还有背景核查与语音分析。完整报告 $59 起,支持 Android 与 Web。

VideoVFY

VideoVFY

VideoVFY 是一个 AI 视频可靠性验证工具。粘贴 YouTube、TikTok 等平台的视频链接, 它会自动提取关键断言, 并与公开来源比对, 给出可靠性评分、修正建议和参考来源, 帮助你在转发前识别误导信息与假新闻。官方显示已完成近万次分析。

AI Sentinel

AI Sentinel

AI Sentinel 是 Lawwwing 推出的网站合规工具,自动检测并标注站内 AI 生成或编辑的图像与视频,以应对欧盟 AI 法案第 50 条透明度要求。无需开发者,支持 WordPress、Shopify 等主流 CMS,官方宣称检测准确率超 98.5%,安装仅需 2 分钟。

AuthentiScan Pro

AuthentiScan Pro

AuthentiScan Pro 是一款 AI 驱动的反诈检测工具,可同时分析 URL、文本和音频,识别虚假信息、AI 语音克隆与网络诈骗,并给出实时风险评分和通俗解释。无需账户、无需下载,打开网页就能用。目前处于 Beta 阶段,官方宣称免费,但算法细节尚未公开。

ContentGuard AI

ContentGuard AI 是一款免费网页写作分析工具,集成 AI 检测、查重、语法与可读性打分、多格式引用生成。

ModelVerify.ai

ModelVerify.ai

ModelVerify.ai 用于在你信任或付费之前,核验某个 LLM 接口或网关是否真正调用其宣称的模型。你提供密钥、基础地址与模型 ID,它会将实际行为与官方指纹比对,识别被偷换的模型、漂移与延迟问题。

开源项目

watermarks-remover: 剥离 AI 来源标记

watermarks-remover 是一个 Python 开源工具,能从 PNG、JPEG、SVG、PDF、DOCX、HTML、Markdown 等文件中移除 C2PA 与 AI 来源元数据,并提供 Unicode 文本清洗与统计重写功能。GitHub 上显示约 7.8k 星标,适合内容研究与反检测场景。

Humanizer:去除 AI 写作痕迹的开源技能

Humanizer 是一个开源代理技能,用于移除文本中常见的 AI 写作模式,使输出更接近人类写作。它以单个 Markdown 文件分发,支持 Claude 和 Cursor 等多种代理平台。该技能根据维基百科关于 AI 生成写作的指南,收录了33种典型模式,并分为内容、语言、风格和沟通等类别。它还提供最终审计和基于用户写作样本的语音校准功能。

Avoid AI Writing:审计并改写 AI 生成内容,提升自然度

Avoid AI Writing 是一个开源的 JavaScript 工具,用于审计和重写 AI 生成的内容,去除明显的机器痕迹。它可与 Claude Code、OpenClaw 等 AI 代理集成,帮助内容创作者产生更自然、更人性化的文章。项目采用 MIT 许可证,在 GitHub 上获得 2548 颗星(据 README)。

UQLM:检测大语言模型幻觉的不确定性量化工具

UQLM 是一个开源的 Python 包,旨在通过量化大语言模型的内在不确定性来检测其幻觉现象。它为对可靠性敏感的应用提供可测量的置信度评估,帮助开发者和研究者降低由 LLM 生成内容带来的风险。该工具提供了一种务实的方法来理解 LLM 何时可能编造信息,超越了简单的置信度分数,转向更稳健的不确定性量化框架。

Anubis: 给 HTTP 请求称重, 阻止 AI 爬虫

Anubis 是一个用 Go 语言编写的开源 HTTP 请求过滤中间件,通过评估请求特征来识别并阻止 AI 爬虫,保护网站内容和服务器资源。它在 GitHub 上已获得 2 万 star,适合被爬虫问题困扰的站点运营者。