☰
大模型是怎么工作的?从 Token 到下一个词的循环
2026/10/11 1:51:17 网站建设 项目流程

大模型是怎么工作的?从 Token 到下一个词的循环

视频版:【AI科普】两分钟看懂大模型原理

很多人第一次接触大模型时,会把它想象成一个巨大的数据库:问它问题,它就从里面“检索”出一段完整答案。实际上,语言大模型的核心任务只有一个——根据当前上下文,预测下一个 Token 的概率分布。整段回答,是由这个预测过程不断循环生成的。

一句话概括

大模型不是在数据库里搜索答案,而是在上下文中不断预测下一个 Token;预测结果被追加回上下文,再用于下一次预测。

1. 文本先被切成 Token

模型不能直接处理整句话,它需要先把文本切分成 Token。Token 不严格等于一个汉字或一个单词,可能是词、子词,甚至只是一个字符片段。每个 Token 都会被映射成词表中的一个整数 ID,例如“小猫”对应某个编号,“坐在”对应另一个编号。

这里要区分两件事:

  • Token 是模型处理的最小单位;
  • 数字 ID 只是词表索引,本身不包含语义。

2. Token 变成数字向量

得到 Token ID 后,模型会通过嵌入层把它变成高维向量。向量不是简单的编号,而是把词的语义、位置和上下文信息编码成可计算的数字表示。

例如,“小猫”和“猫”在向量空间中会更接近;而“猫”和“汽车”的距离通常更远。位置编码也会被加入,让模型知道每个 Token 在句子中的顺序。

3. Transformer 多层处理

嵌入向量进入 Transformer 后,会经过多层重复计算。每一层通常包含两部分:

  1. 注意力层:读取上下文,决定当前 Token 应该关注哪些位置;
  2. 前馈网络:对信息进行非线性加工,形成更丰富的表示。

层数越多,模型能组合和抽象的上下文关系越复杂。但层数并不等于“理解”,它仍然是在做高维数值变换和概率建模。

4. 注意力机制:让词读懂上下文

“它”到底指谁?“垫子”和“椅子”哪个更符合上下文?注意力机制会根据当前任务,为不同 Token 分配不同权重。

在“小猫坐在垫子上,因为……”这个例子里,模型会重点关联“小猫”“坐”“垫子”等 Token。注意力不是人工规则,而是通过训练学到的权重模式。

5. 预测下一个 Token

Transformer 的最后一层会输出一个覆盖整个词表的概率分布。给定上下文“小猫坐在……”,模型可能得到:

  • 垫子:68%
  • 椅子:18%
  • 窗台:9%
  • 其他:5%

模型会根据采样策略选出其中一个 Token。这个 Token 一旦被选中,就会被追加回上下文,成为下一轮预测的输入。

6. 自回归循环

大模型生成文字的过程是循环的:

上下文 ↓ 预测下一个 Token 的概率 ↓ 选择一个 Token ↓ 追加到上下文 ↓ 再次预测 ↓ 重复直到结束

所以它并不是一次写出整段答案,而是一次只生成一个 Token,再把结果放回去继续生成。理解这一点,就能理解很多现象:

  • 为什么会“越写越偏”:前面生成的内容会进入后续上下文;
  • 为什么同一问题可能得到不同答案:采样策略会带来随机性;
  • 为什么上下文长度重要:模型只能基于当前可见的上下文做预测;
  • 为什么会幻觉:模型追求的是概率合理,而不是事实检索。

7. 完整知识链

分词 → 向量化 → Transformer → 注意力 → 概率预测 → 循环生成

把这条链记住,你就不会再把它看成“一个会说话的数据库”,而会把它看成一个基于上下文、逐 Token 预测的自回归模型。

常见误解

误解一:模型在数据库里查答案

不是。它没有把整段答案预先存好;它是在上下文中逐步预测下一个 Token。

误解二:Token 就是字或词

不一定。Token 可能是字、词或子词,取决于分词器和词表设计。

误解三:概率高就代表事实正确

不一定。概率高只说明在当前参数和上下文下更“像”一个合理的下一个 Token,不代表真实世界一定如此。

学习建议

  1. 先理解“下一个 Token 预测”这个核心目标;
  2. 再理解 Token、向量、位置编码和注意力;
  3. 最后理解自回归生成、采样策略和上下文窗口。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询