本课目标

  • 理解预训练、SFT、RLHF 三个阶段各自做了什么
  • 理解"涌现能力"是什么,以及为什么它让人又兴奋又头疼
  • 搞懂幻觉的根源和实用的对抗策略

你一定遇到过这种情况:模型回答得头头是道,你差点就信了——直到发现它把 A 公司的事迹安在了 B 公司头上。这不是模型在"撒谎",是它在做一个它被训练要做的事:生成最像正确答案的东西。本讲帮你搞清楚,模型的"知识"从哪来、为什么它会编造、以及你能做些什么。

核心内容

预训练(Pre-training):喂书阶段

预训练的本质就一句话:让模型在海量文本上玩"预测下一个词"的游戏

比如给"中国的首都是",模型一开始瞎猜,错了就调整参数,猜对就强化。几千亿个 Token 之后,它内化了语言的模式、世界的知识、逻辑的规律——所有这些都以参数的形式"压缩"在模型里。

类比:就像一个小孩从出生开始就不停地读书,没人告诉他对错,只是让他猜下一页写什么。读到一定程度,他自然学会了语法、常识,甚至推理。预训练就是模型的"童年教育"。

微调(Fine-tuning):上岗培训

预训练完的模型"什么都懂一点",但不会跟人对话。微调就是上岗培训:

  • SFT(Supervised Fine-Tuning):给它看"好学生"的对话样本——问 A 答 A、问 B 答 B。让它学会遵循指令。
  • RLHF(Reinforcement Learning from Human Feedback):人对它的回答打分,哪个更好。模型学习"什么样的回答更像人喜欢的"。

预训练 = 读完大学。SFT = 岗前培训。RLHF = 老员工手把手带。

涌现能力(Emergence):量变引起质变

当模型参数超过某个阈值(通常是几十 B),一些没有专门训练过的能力会自动出现:多步推理、代码生成、上下文学习。

这是最让研究者兴奋也最头疼的现象。兴奋在于:扩大规模就能获得新能力。头疼在于:你不知道下一个涌现的是什么,也无法精确控制。

就像积木搭到一定高度,突然自己能站稳了——这不是你设计的,是尺度带来的"副作用"。

幻觉(Hallucination):模型最顽固的缺陷

幻觉不是 bug,是模型工作原理的必然产物。模型优化的目标是"生成最像正确答案的东西",而不是"生成正确的东西"。

工程上能做的事

  • 给材料而不是靠记忆:把事实作为上下文喂进去(RAG),让模型基于你给的材料回答,而不是"回忆"
  • 建立验证习惯:关键事实引用来源,不确定的标注置信度
  • 接受它的存在:设计系统时假设模型会出错,做好兜底

一个实用原则:不要让模型回答它"应该记住"的东西,让它回答你"刚刚告诉它"的东西。 前者依赖模型的记忆力(不可靠),后者依赖模型的阅读理解和推理(可靠得多)。

动手练习

找一条你最近看到的、看起来很有道理但你无法验证的 AI 回答。逐句标出:哪些是"模型肯定知道的"、哪些是"模型可能在编的"。然后想想,如果这个回答要交付给你的用户,你会加什么验证步骤?