LLM 路由不是新名词,但 Nadir 在“路由”前面加了一个关键步骤——验证。它的做法很直接:先让成本最低的模型回答,再由一个校准过的验证器给回复打分,分数不过关就自动升级到更强的模型。这相当于在每一条响应真正发给用户之前,先过一道质检。
官方介绍里,Nadir 把自己定位为 verifier-gated 路由器,而不是单纯按提示词难度来分流。它给出的数字也很敢说:60% 的成本削减,同时在 RouterBench 的留出集上保持 98% 的“始终使用 Opus”质量水平;在 RouterArena 公共榜上也排到了第 3 名。
“先便宜后验证”的逻辑
常见路由器的思路是预判:判断提示词难不难,再决定发给哪个模型。Nadir 的思路更像事后把关:先让便宜模型跑,用验证器判断结果是否达标。预判可能出错,而事后打分更接近真实质量。当然,验证器本身也会犯错,所以“校准”是这个方案的核心。
从公开信息看,官方没有展开验证器如何训练、如何校准。这点对技术选型的人来说是个需要自己评估的部分。
官方数字,先别急着全信
做技术选型时,厂商公布的数字只能作为参考。按照官方口径,以下数据都来自 Nadir 自己的宣传,尚未见到独立的第三方复测,实际效果会和你的请求分布、模型组合、验证器配置有很大关系。
- 成本降低约 60%(官方宣称)
- 在 RouterBench 留出提示集上保持 98% 的“始终使用 Opus”质量(官方宣称)
- RouterArena 公共排行榜第 3 位(截至采集时的官方信息)
- 接口 OpenAI 兼容,支持 BYOK,接入仅需两行改动
集成与适合谁
Nadir 提供的是 OpenAI 兼容接口,这意味着你不需要重写业务逻辑,只需把 base URL 和 API key 换掉。官方称集成只需要两行变更,BYOK 也允许团队直接带上自己的模型密钥。对于已经用过 OpenAI SDK 的团队,切换成本很低。
典型使用场景是请求量很大、但大部分请求并不复杂的业务:比如内容分类、信息抽取、客服话术生成。这些任务用顶级模型有点浪费,用太小的模型又怕质量不稳定,Nadir 的验证器会在中间兜底。如果你的团队几乎只跑复杂推理,或者调用量很小,这类路由器的收益就比较有限。
需要注意的限制
目前关于验证器如何训练、如何做质量校准,官方公开的技术细节不多。RouterBench 和 RouterArena 都是比较新的评测基准,榜单排名会变动。稳妥的做法是先拿自己的真实流量做小规模试点,对比成本和输出质量,再决定要不要全量切过去。
整体来看,Nadir 踩中了 LLM 优化工具的务实方向:不追求让每个回答都来自最强模型,而是用验证器保证质量底线。对想控制 AI 账单、又担心质量下滑的团队来说,这是一个值得放进评测清单的选项。











コメント
コメントはまだありません
最初のコメントを書きましょう