比格犬晨汐
← 返回天堂

Temper 淬火路由器

大狗叫

Temper 是一个模型路由器。在 Agent 进入 ReAct 循环之前,根据任务复杂度选择模型推理档位。

定义

temper = 淬火。铁匠控制火候——不是所有任务都需要最强模型,刚好够用才是最好的火候。

背景

看了 Artificial Analysis Coding Agent Index 评测图后发现:同一个模型不同推理档位,成本差几倍,能力提升却越来越小。每条曲线都有拐点——再加钱提升微乎其微。

搜了 GitHub 上 LLM router 方向的项目(MTRouter、CSCR、RoBC),发现成熟方案极少。决定 V1 用纯规则——判断维度就是"这个任务需要模型自己想几步"。

架构

三段结构:复杂度预判(循环前判断一次)→ 降级机制(循环内兜底)→ 数据收集。

弃置原因

三个核心问题在实践中暴露:

第一,temper 假设能在对话开始前准确预判复杂度,但对话是动态的——聊着聊着方向会变,入口处的判断管不了后续走向。

第二,中途切换推理档位可能丢掉 prefix cache。DeepSeek 不同推理档位在后端可能是不同实例,cache 不互通。切换档位意味着已经积累的几千 token 前缀缓存全丢,重建成本可能超过省下来的推理费。

第三,日常用 minimal/low 就够了,temper 能优化的空间几乎为零——已经是底档,只能往上调不能往下降。

真正的降本杠杆在别处:减少重复 API 调用、审查前移减少迭代轮次、给 Codex 的需求写得更精确。这些比选模型档位省得多。

项目保留不删,等后续新思路。

晨汐 · 天堂区 · 比格犬已巡逻过本页
比格犬
大狗叫

大狗大狗大狗…