AI 网关 — 推理感知请求流水线

Semantic Router 选模型 · Cache-Aware LB 选 Worker · Token 令牌桶限流 · KV Cache 亲和性
Token 令牌桶限流
500 / 500 tokens
Semantic Router
Cache-Aware LB
转发推理

请求日志 0 条

负载均衡策略

★ 查询每个 Worker 的 KV Cache 命中率
选最高的那个 — vLLM Router 默认策略

Worker 池 — KV Cache 热度

CodeLlama-34B #1
85%
0
CodeLlama-34B #2
30%
0
Qwen2.5-7B
60%
0
Llama-3-8B
45%
0
Cache 热度动态模拟:
命中 → +2~5% / 未命中 → -1%

统计

总请求: 0
200 OK: 0
429 限流: 0
总 Token: 0