问题

模型一次成型的输出质量有天花板:第一稿往往"能用但不精"。让人类逐条审校又不可规模化——质量与成本两头堵。

核心模式

生成-批评(Generator-Critic):生成与评审角色分离,批评者按明确标准挑刺,生成者按意见迭代。

draft = generator.run(task)

for round in range(MAX_ROUNDS):
    critique = critic.review(draft, criteria=RUBRIC)
    # 批评必须是结构化的、可执行的
    if not critique.issues:
        break
    draft = generator.revise(draft, critique.issues)

return draft

关键是 RUBRIC(评分细则):批评者不能泛泛地说"不够好",要按维度打分——准确性/完整性/风格/可执行性,每项给具体位置和改法。结构化批评是可迭代的,模糊批评只是情绪。

实战要点

  • 批评者用独立实例(最好不同模型或至少不同 system prompt):自评有系统性盲区
  • 迭代上限 2-3 轮:收益递减明显,第 3 轮后的改动常常只是"换个说法"
  • 不是所有输出都值得批评迭代:面向用户的关键产出(方案、代码、对外文案)用;内部中间产物不必
  • RUBRIC 要随业务沉淀:把人类审校时的真实意见回写成评分细则,批评者会越来越像你们团队的资深成员