① 信号提取层
Information Theory Regime — 每提取一个信号, 路由不确定性降低
② 决策引擎
Boolean Algebra Regime — {AND, OR, NOT} 组合信号 → 路由策略
路由结果
模型池 — 3 个模型, 不同能力/成本
Qwen2.5-7B
通用聊天 | 快 · 便宜 · 本地
默认
DeepSeek-Coder-6.7B
代码生成 | 擅长编程 · 成本中等
代码
GPT-4o
复杂推理 | 最强 · 最贵 ($15/M tokens) · 云端
强力
效果数据 (NeurIPS 2025)
vs 所有请求发给同一个模型:
· MMLU-Pro 准确率 +10.2%
· 平均延迟 -47.1%
· Token 消耗 -48.5%
· 成本节约 ~45%
· MMLU-Pro 准确率 +10.2%
· 平均延迟 -47.1%
· Token 消耗 -48.5%
· 成本节约 ~45%
核心洞察: 简单问题用 7B 秒回, 复杂问题升级到 GPT-4o。
"在正确的时间、用正确的模型、以正确的成本"
"在正确的时间、用正确的模型、以正确的成本"