Temper 淬火路由器

Temper 是一个模型路由器。在 Agent 进入 ReAct 循环之前,根据任务复杂度选择模型推理档位。
定义
temper = 淬火。铁匠控制火候——不是所有任务都需要最强模型,刚好够用才是最好的火候。
背景
看了 Artificial Analysis Coding Agent Index 评测图后发现:同一个模型不同推理档位,成本差几倍,能力提升却越来越小。每条曲线都有拐点——再加钱提升微乎其微。
搜了 GitHub 上 LLM router 方向的项目(MTRouter、CSCR、RoBC),发现成熟方案极少。决定 V1 用纯规则——判断维度就是"这个任务需要模型自己想几步"。
架构
三段结构:复杂度预判(循环前判断一次)→ 降级机制(循环内兜底)→ 数据收集。
弃置原因
三个核心问题在实践中暴露:
第一,temper 假设能在对话开始前准确预判复杂度,但对话是动态的——聊着聊着方向会变,入口处的判断管不了后续走向。
第二,中途切换推理档位可能丢掉 prefix cache。DeepSeek 不同推理档位在后端可能是不同实例,cache 不互通。切换档位意味着已经积累的几千 token 前缀缓存全丢,重建成本可能超过省下来的推理费。
第三,日常用 minimal/low 就够了,temper 能优化的空间几乎为零——已经是底档,只能往上调不能往下降。
真正的降本杠杆在别处:减少重复 API 调用、审查前移减少迭代轮次、给 Codex 的需求写得更精确。这些比选模型档位省得多。
项目保留不删,等后续新思路。
