本课目标

  • 理解 Token 是模型的"词汇单位",以及它为什么直接跟钱挂钩
  • 理解逐字生成(自回归)的工作方式
  • 用直觉而不是公式搞懂 Attention 在做什么
  • 理解上下文窗口及其工程影响

你对模型说"今天天气真好",它是怎么"听懂"的?答案是:它一个字都不认识。它只认识数字——每一个 Token 就是一个数字。本讲不讲数学公式,只讲你真正需要的那层理解。

核心内容

Token:模型的"最小阅读单位"

模型不认识"句子",它处理的是 Token 序列。一个中文汉字通常是 1-2 个 Token,一个英文单词可能是 1-3 个 Token("understand" 甚至被拆成 "under" + "stand")。

Token 直接决定三件事,全是工程要害

  1. 计费:API 按 Token 收费。你每次对话花多少钱,本质上就是 (输入 Token + 输出 Token) × 单价。
  2. 速度:生成 Token 的速度决定了你看到回复快慢。
  3. 天花板:上下文窗口以 Token 为单位,满了就塞不下了。

动手试:去 OpenAI Tokenizer 页面贴一段文字,看看实际消耗多少 Token。这个数字往往比你直觉估计的大——尤其是代码和结构化数据。

逐字输出:为什么模型一个字一个字往外蹦?

模型做的事可以粗暴概括为:给定前面所有 Token,预测下一个 Token → 采样一个 → 拼回去 → 继续预测

这不是 UI 效果,是模型的底层工作方式。理解了自回归,很多现象就通了:为什么让它先给结论再解释效果更好?因为"前面生成的内容"会参与后面的预测——你给了它更好的思考方向。为什么不能中途"跳过"?因为它真的只能一个一个来。

类比:就像你说话时,每说一个词,脑子里就在快速判断下一个词该说什么。只不过模型把每一步都变成了一个概率计算。

Attention:模型凭什么知道该看哪里?

当你读"他夸了小明,因为他乐于助人"时,要理解"他"指谁,你需要回头看前文。Attention 就是在做这件事:生成每个 Token 时,回头扫描前文里哪些词跟当前最相关,重点参考

不需要公式。想象你在开会,老板说了一句话,你脑子里快速回溯他五分钟前说过的话,找到最相关的那句,组合起来理解意图。Attention 就是这个"快速回溯 + 找相关 + 加权组合"的过程。

几十亿参数本质上是存储了语言中"什么跟什么相关"的统计规律。参数量越大,它能捕捉的关联越精细。

上下文窗口:模型的"工作记忆"

窗口有多大,它一次能"看到"多少内容。超出的部分对它而言不存在——不是"忘了",是根本没看到。

工程上的三个直接推论:

  • 长文档不能整本丢进去:需要切分检索(这是第五讲的 RAG)
  • 多轮对话会越来越贵越来越慢:历史全量重发
  • 关键指令放在开头或结尾:窗口中间位置容易被模型"忽略"(这叫"Lost in the Middle"效应,是 Attention 机制的数学特性,不是 bug)

2026 年的主流模型窗口 128K~2M Token 不等,能塞一整本《三体》。但能塞进去 ≠ 应该塞进去——越长的上下文推理越慢越贵。

动手练习

找一段 200 字的专业文本,用 Tokenizer 工具看看实际 Token 数。然后估算:如果这段文本在每次 API 调用时都要作为上下文传入,每天 100 次调用,一个月花多少钱?(按当前主流模型输出价格 ~¥2/百万 Token 估算)