问题

所有请求都走旗舰大模型:成本扛不住,简单问题("查一下订单状态")也享受"顶配推理"的延迟。一刀切路由到大模型,是新手最常见的成本事故。

核心模式

复杂度路由:入口处分级,不同复杂度的任务走不同档位模型。

def route(request):
    level = classifier.grade(request)   # 小模型/规则做分级
    match level:
        case "simple":    # 意图明确、单步可完成
            return small_model.run(request)        # 快、便宜
        case "standard":  # 多步但有成熟套路
            return mid_model.run(request)
        case "complex":   # 开放、需规划与多轮推理
            return flagship_model.run(request)
        case "uncertain": # 分级器拿不准 → 升档,宁贵勿错
            return flagship_model.run(request)

分级依据:意图明确度、预估步骤数、需要的知识范围、失败的代价。拿不准就升档——路由错误省下的钱,抵不过一次答错的损失。

实战要点

  • 分级器本身要极轻:规则 + 小模型足矣,别用旗舰模型判断"该不该用旗舰模型"
  • 动态升降档:小模型跑两步发现搞不定,主动上交("这超出我的能力")比硬答更有价值——给每个档位配"升级出口"
  • 成本报表按档位拆:你会直观看到路由策略每月省多少
  • 这个模式在灵枢 OS 落地后,整体 token 成本降了约一个数量级