CriteriaBot

CriteriaBot自然言語ルールで作る柔軟な内容評価API

CriteriaBot は自然言語で判定基準を定義できる内容評価 API。伝統的な ML と複数 LLM による合議制を組み合わせ、内容審査やプロンプトインジェクション対策、ブランド声のチェックなどに使える。個別フィードバックでルールの調整も可能。

paid
内容審査API自然言語ルールAI分類器プロンプトインジェクション検出テキスト分類ブランドトーン監査コミュニティ運営LLMセキュリティカスタマーサポート自動化合議制モデル
登録日
4.4 (0 レビュー数)

ログイン後に評価できます

世の中のコンテンツ審査 API の多くは、「スパムですか?」といった固定分類を返すだけ。CriteriaBot はそこをもう一歩進めて、審査の物差しそのものを自然言語で書けるようにした判定エンジンだ。

やり方はいたってシンプル。自分の言葉で「このテキストは暴言を含む」といったルールを定義し、API にテキストを渡す。すると結果が true/false で返ってくる。いわば「ルールをコード化しなくても、ルールをプログラムにできる」発想だ。

固定ラベルではなく、文章で基準を渡す

このアプローチの利点は、汎用モデルでは拾いきれない“その現場だけの基準”を扱える点にある。典型的な利用シーンは次の通り。

  • コミュニティ内容審査:ヘイトスピーチやスパムに加え、「ネタバレ禁止」「政治の話はお断り」といった自分たちのローカルルールを追加で評価
  • LLM の安全レイヤー:プロンプトインジェクションの検出や出力の不適切表現をブロックするカスタムガードレールとして利用
  • ブランドのトーン監査:AI 生成文や社外向け原稿が、定めたガイドラインに沿っているかを自動チェック
  • テキストの仕分け:カスタマーサポートのチケットや問い合わせをカテゴリ別に振り分ける

これ以外にも、広報モニタリングやデータの死活チェック的な使い方も見込める。特定の分類タグに縛られないので、チームごとの「これって問題ですよね?」を機械判定に置き換えやすい。

複数の AI に聞いて、多数決で決める設計

内部は従来型の機械学習モデルと、小型のオープンLLM群の合議制パネルを組み合わせた構造。Wikipedia や Wolfram にアクセスできるため、最新の事実確認や計算が必要な判定もサポートする。

個人的に面白いのは、ユーザーが「自分の判定」を返せる点だ。結果に違和感があれば人手で true/false を入れ直すだけで、モデル側がユーザーの基準を学習してくれる。特定コミュニティだけの暗黙のルール、たとえば「この掲示板での政治トークはここまで許容」みたいな曖昧な境界を、少しずつすり合わせられるのは実用的だ。

使いはじめの注意点と向いている人

ただし、動き出す前に少しだけ時間をかける必要がある。自然言語とはいえ、ルールの網の目をきちんと設計しないと、想定外の入力で不安定な判定が出る。少量のサンプルで試し、判定を繰り返し修正しながら育てていくのがおすすめだ。

その手間を差し引いても、毎回プロンプトを書くよりも再現性のある結果を得やすい。コミュニティ運営者、LLM アプリの開発者、カスタマーサポートの自動化を考えている人には、一度試す価値はある。料金は公式に公開されておらず、登録して API キーを取得する必要がある。まずは少ないデータ量で感触を確かめてみてほしい。

メリット・デメリット

メリット

  • 自然言語で判定基準を定義できるため、機械学習の知識が不要
  • 複数モデルの合議制で、単一LLMより安定した判定が期待できる
  • ユーザーのフィードバックで判定ルールを個別調整できる
  • 審査以外にもトーン監査や文章仕分けなど幅広く応用可能

デメリット

  • 技術詳細や性能データの公開情報がまだ少ない
  • 複雑なルールは、試行錯誤と調整にある程度の時間がかかる

よくある質問

CriteriaBot は無料で使えますか?

公式サイトには無料プランの記載がなく、登録して API キーを取得する方式です。料金が不明なため、少ないデータで試してから判断するのが良いでしょう。

日本語のコンテンツには対応していますか?

公式は英語を前提としたサービスですが、判定ルールを日本語で記述できる可能性があります。実際の対応状況は公式ドキュメントで確認するのが安全です。

通常のコンテンツ審査 API と何が違いますか?

固定カテゴリの代わりに、自然言語で判定基準を定義できる点です。更に複数モデルによる合議制とユーザーからのフィードバックで、コミュニティ固有のルールに合わせやすくなっています。

どんな人に向いていますか?

自社ルールでテキストを選別したいコミュニティ運営者、LLM の安全対策が欲しい開発者、サポートチケットの自動仕分けを考えているチームに向いています。

もっと見る

類似ツール

DateGuard.ai

DateGuard.ai

DateGuard.ai 把自己比作约会领域的 Carfax: 见面之前先验证身份。核心是 AI 活体检测识破照骗和深度伪造,另外还有背景核查与语音分析。完整报告 $59 起,支持 Android 与 Web。

VideoVFY

VideoVFY

VideoVFY 是一个 AI 视频可靠性验证工具。粘贴 YouTube、TikTok 等平台的视频链接, 它会自动提取关键断言, 并与公开来源比对, 给出可靠性评分、修正建议和参考来源, 帮助你在转发前识别误导信息与假新闻。官方显示已完成近万次分析。

AI Sentinel

AI Sentinel

AI SentinelはLawwwingが提供するサイト向けコンプライアンスツール。AI生成・編集された画像を自動検出し、EU AI法案第50条が求める表示をサイトに追加する。コーディング不要で約2分で導入可能、主要CMSに対応。

AuthentiScan Pro

AuthentiScan Pro

AuthentiScan Pro はURL・テキスト・音声を同時に分析するAI反詐検出ツール。リスクスコアと分かりやすい解説を表示し、アカウント不要で無料利用できる。ただしBeta版であり、精度やアルゴリズムは非公開。

ContentGuard AI

ContentGuard AI は、無料のウェブライティング分析ツールで、AI検出、重複チェック、文法・可読性スコア、複数形式の引用生成を統合しています。

ModelVerify.ai

ModelVerify.ai

ModelVerify.ai は、信頼する前や支払いを行う前に、LLM インターフェースやゲートウェイが本当に宣伝どおりのモデルを呼び出しているかを検証するためのツールです。キー、ベースURL、モデルIDを提供すると、実際の動作を公式フィンガープリントと照合し、すり替えられたモデル、ドリフト、遅延の問題を特定します。

オープンソース代替

watermarks-remover: AI由来マークを剥がす

AI生成物に付与されるC2PAなど由来メタデータを、PNG/JPEG/PDF/DOCX等から除去するPython製オープンソースツール。約7.8kスターを集める人気の背景と、実際の使い方・注意点を解説する。

Humanizer:AIライティングの痕跡を除去するオープンソーススキル

Humanizerは、テキストで一般的に見られるAIライティングパターンを除去し、出力を人間の執筆に近づけるためのオープンソースのエージェントスキルです。単一のMarkdownファイルとして配布され、ClaudeやCursorなど複数のエージェントプラットフォームをサポートします。このスキルは、WikipediaのAI生成文章に関するガイドラインに基づき、33の典型的なパターンを収録し、コンテンツ、言語、スタイル、コミュニケーションなどのカテゴリに分類しています。さらに、最終監査と、ユーザーのライティングサンプルに基づく語調キャリブレーション機能を提供します。

Avoid AI Writing:AI生成コンテンツを監査・書き換え、自然さを向上

Avoid AI Writingは、AI生成コンテンツを監査・書き換えして明らかな機械的痕跡を取り除く、オープンソースのJavaScriptツールです。Claude Code、OpenClawなどのAIエージェントと統合でき、コンテンツ制作者がより自然で人間らしい記事を生み出すのに役立ちます。プロジェクトはMITライセンスを採用しており、GitHubで2548スターを獲得しています(READMEによる)。

UQLM:大規模言語モデルのハルシネーションを検出する不確実性定量化ツール

UQLMは、大規模言語モデルの内在的な不確実性を定量化することで、そのハルシネーション現象を検出することを目的としたオープンソースのPythonパッケージです。信頼性に敏感なアプリケーションに対して測定可能な信頼度評価を提供し、開発者や研究者がLLM生成コンテンツによって生じるリスクを低減するのに役立ちます。このツールは、LLMがいつ情報を捏造する可能性があるかを理解するための実用的な方法を提供し、単純な信頼度スコアを超えて、より堅牢な不確実性定量化フレームワークへと移行します。

Anubis: HTTPリクエストを計量し、AIクローラーをブロック

AnubisはGo言語で書かれたオープンソースのHTTPリクエストフィルタリングミドルウェアで、リクエストの特徴を評価してAIクローラーを識別・ブロックし、ウェブサイトのコンテンツとサーバーリソースを保護します。GitHubでは20,000スターを獲得しており、クローラーに悩まされているサイト運営者に適しています。