LLM 基本概念
2026/9/24 11:57:08 网站建设 项目流程

一、什么是LLM

LLM(Large Language Model,大语言模型) 是一种基于海量文本数据训练的神经网络模型。

LLM 的核心任务,就是根据前面的内容,预测下一个词是什么。

输入:"我爱"LLM 计算下一个词的概率: 你 →30% 学习 →25% 吃 →15% 中国 →10%... 然后选一个(比如"学习"),拼上去 变成:"我爱学习"再预测下一个词: 编程 →20% 知识 →18%... 继续拼,直到生成完整句子

从而具备语言理解、生成、推理等能力。所有能力——翻译、写作、编程、推理——都是这个简单目标在大规模数据下的"副产品"。

特征说明
大规模参数量从数十亿到数万亿
通用性一个模型可处理多种任务,无需为每个任务单独训练
涌现能力规模达到一定程度后,出现小模型没有的能力(如推理、代码)
自回归逐token生成,每次基于前文预测下一个
预训练+微调先通用预训练,再针对任务适配

二、整体分层图

┌─────────────────────────────────────────────────────┐ │ 第6层:应用层 │ │ Chatbot / 知识助手 / Agent / API │ ├─────────────────────────────────────────────────────┤ │ 第5层:增强层 │ │ Prompt / RAG / Agent / 工具 / 记忆 │ ├─────────────────────────────────────────────────────┤ │ 第4层:推理层 │ │ 解码 / KV Cache / 量化 / 批处理 │ ├─────────────────────────────────────────────────────┤ │ 第3层:模型层 │ │ Transformer(分词→嵌入→注意力→FFN→输出) │ ├─────────────────────────────────────────────────────┤ │ 第2层:训练层 │ │ 预训练 → SFT → 对齐 → 微调 │ ├─────────────────────────────────────────────────────┤ │ 第1层:数据层 │ │ 训练数据 / 向量库 / 知识库 │ ├─────────────────────────────────────────────────────┤ │ 第0层:基础设施层 │ │ GPU / 分布式 / 推理引擎 / 监控 / 安全 │ └─────────────────────────────────────────────────────┘ 贯穿:评估与安全

一句话理解每层:

  • 第 0 层:地基(算力)
  • 第 1 层:燃料(数据)
  • 第 2 层:学习(训练)
  • 第 3 层:大脑(模型)
  • 第 4 层:加速(推理)
  • 第 5 层:外挂(增强)
  • 第 6 层:产品(应用)

第 0 层:基础设施层

支撑整个 LLM 系统运行的底层硬件和软件。就像盖楼需要地基,LLM 需要算力。

┌─────────────────────────────────────┐ │ 基础设施层 │ ├─────────────────────────────────────┤ │ 硬件 │ │ GPU/TPU 集群(算力核心) │ │ 高速网络(设备间通信) │ │ 存储(模型和数据) │ ├─────────────────────────────────────┤ │ 软件 │ │ 分布式训练框架 │ │ 推理引擎 │ │ 容器编排 │ ├─────────────────────────────────────┤ │ 运维 │ │ 监控 / 日志 / 安全 / 限流 │ └─────────────────────────────────────┘

作用

  • 提供算力(训练和推理都要)
  • 支撑分布式协同
  • 保证服务稳定和安全

第 1 层:数据层

LLM 的"燃料"。没有数据,模型什么也学不到。

┌─────────────────────────────────────┐ │ 数据层 │ ├─────────────────────────────────────┤ │ 训练数据(喂给模型学的) │ │ 网页 / 书籍 / 代码 / 论文 / 对话 │ ├─────────────────────────────────────┤ │ 运行时数据(模型工作时用的) │ │ 向量库 / 知识库 / 缓存 / 会话 │ ├─────────────────────────────────────┤ │ 数据处理 │ │ 清洗 / 去重 / 分词 / 嵌入 / 索引 │ └─────────────────────────────────────┘

作用

  • 训练时:提供学习材料
  • 推理时:提供外部知识(RAG 用)
  • 缓存:加速重复请求

第 2 层:训练层

把随机初始化的神经网络,变成能听懂人话的智能助手的过程。

┌─────────────────────────────────────┐ │ 训练层 │ ├─────────────────────────────────────┤ │ 阶段1:预训练 │ │ 数据:海量文本 │ │ 目标:预测下一个词 │ │ 结果:基础模型(有知识,不听话) │ ├─────────────────────────────────────┤ │ 阶段2:监督微调(SFT) │ │ 数据:指令-回答对 │ │ 目标:学会听话 │ │ 结果:指令模型(会听话,可能有害)│ ├─────────────────────────────────────┤ │ 阶段3:对齐(RLHF/DPO) │ │ 数据:人类偏好 │ │ 目标:符合人类价值观 │ │ 结果:对齐模型(有用、诚实、无害)│ ├─────────────────────────────────────┤ │ 可选:微调(LoRA 等) │ │ 适配特定领域,成本低 │ └─────────────────────────────────────┘

作用

  • 预训练:获得基础能力(语言、知识)
  • SFT:学会听指令
  • 对齐:学会做好人
  • 微调:适配特定领域

第 3 层:模型层(核心)

LLM 的"大脑",是 Transformer 架构的具体实现。所有智能都在这里产生。

┌─────────────────────────────────────────────┐ │ 模型层 │ ├─────────────────────────────────────────────┤ │ ① 输入处理 │ │ Tokenization(分词)→ 文本变 token │ │ Embedding(嵌入)→ token 变向量 │ │ Positional Encoding(位置编码)→ 加顺序 │ ├─────────────────────────────────────────────┤ │ ② Transformer Block × N(核心) │ │ ┌─────────────────────────────────┐ │ │ │ LayerNorm(归一化) │ │ │ │ ↓ │ │ │ │ Multi-Head Self-Attention │ │ │ │ (让每个词看其他词) │ │ │ │ ↓ │ │ │ │ Residual Add(残差相加) │ │ │ │ ↓ │ │ │ │ LayerNorm │ │ │ │ ↓ │ │ │ │ Feed-Forward Network │ │ │ │ (加工信息) │ │ │ │ ↓ │ │ │ │ Residual Add │ │ │ └─────────────────────────────────┘ │ ├─────────────────────────────────────────────┤ │ ③ 输出层 │ │ Linear → Softmax → 概率分布 │ └─────────────────────────────────────────────┘

作用

  • 理解输入:把文字变成模型能算的向量
  • 计算上下文:通过注意力理解词与词的关系
  • 加工信息:通过 FFN 提取特征
  • 预测下一个词:输出概率分布

第 4 层:推理层

模型训练好后,如何又快又省地生成输出。训练是一次性的,推理是天天用的。

┌─────────────────────────────────────┐ │ 推理层 │ ├─────────────────────────────────────┤ │ 解码策略(怎么选词) │ │ 贪心 / 束搜索 / 温度 / Top-k / Top-p│ ├─────────────────────────────────────┤ │ 加速技术(怎么更快) │ │ KV Cache / 量化 / 批处理 / 投机解码│ ├─────────────────────────────────────┤ │ 服务优化(怎么服务更多人) │ │ PagedAttention / 连续批处理 / 路由 │ └─────────────────────────────────────┘

作用

  • 控制输出质量:温度、Top-p 决定创意还是严谨
  • 加速推理:KV Cache、量化
  • 降低显存:量化、GQA
  • 提高吞吐:批处理、调度

第 5 层:增强层

弥补 LLM 的局限,扩展它的能力边界。这是应用落地最关键的一层。

┌─────────────────────────────────────┐ │ 增强层 │ ├─────────────────────────────────────┤ │ Prompt 工程(怎么问) │ │ 示例 / 思维链 / 角色设定 │ ├─────────────────────────────────────┤ │ RAG 检索增强(补知识) │ │ 查资料 → 塞进上下文 → 再回答 │ ├─────────────────────────────────────┤ │ Agent 编排(会做事) │ │ 规划 → 调工具 → 多步执行 │ ├─────────────────────────────────────┤ │ 记忆机制(记得住) │ │ 短期 / 长期记忆 │ ├─────────────────────────────────────┤ │ 工具调用(能动手) │ │ 调 API / 查数据库 / 执行代码 │ └─────────────────────────────────────┘

作用(对应解决 LLM 的局限)

  • LLM 局限 增强层方案
  • 幻觉 RAG 检索真实资料
  • 知识截止 RAG 补充最新信息
  • 无法做事 Agent + 工具调用
  • 多步任务 Agent 规划
  • 无记忆 记忆机制
  • 输出不可控 Prompt + 护栏

第 6 层:应用层

最终面向用户的产品和服务。用户看到的就是这一层。

┌─────────────────────────────────────┐ │ 应用层 │ ├─────────────────────────────────────┤ │ 对话类:Chatbot / 客服 / 角色扮演 │ │ 知识类:知识助手 / 文档问答 / 搜索 │ │ 创作类:写作 / 翻译 / 代码生成 │ │ 自动化:Agent / 工作流 / RPA │ │ 平台类:API 服务 / 模型市场 │ └─────────────────────────────────────┘

作用

  • 解决用户实际问题
  • 提供价值
  • 商业化

贯穿层:评估与安全

不单独成层,但贯穿所有层,保证系统可靠、安全、持续改进。

┌─────────────────────────────────────┐ │ 评估与安全(贯穿) │ ├─────────────────────────────────────┤ │ 评估:Benchmark / LLM-as-Judge / 人工│ │ 安全:内容过滤 / 越狱防御 / 隐私 │ │ 对齐:RLHF / DPO / 宪法 AI │ │ 可解释:注意力 / 探针 / 知识编辑 │ └─────────────────────────────────────┘

作用

  • 衡量效果好不好
  • 发现风险
  • 持续改进

四、LLM 分层协同

分层是逻辑划分,协同是运行时行为。不同场景调用不同层,复杂场景有循环和并行,但核心始终是 L3(模型)+ L4(推理),L5(增强)负责扩展能力,L1(数据)提供外部知识,L0(基础设施)全程支撑,L2(训练)只在训练时参与。

场景 1:简单问答(无 RAG、无工具)

典型:用户问"什么是 Java 的多态?"特点:最简流程,模型直接回答,不查外部资料。 用户提问 │ ▼ 【L6 应用层】接收请求 │ ▼ 【L5 增强层】Prompt 组装 │ (系统提示 + 用户问题) ▼ 【L3 模型层】LLM 前向计算 │ ← 依赖【L0 基础设施】 ▼ 【L4 推理层】解码生成 │ ← KV Cache、采样 ▼ 【L5 增强层】输出后处理(可选) │ ▼ 【L6 应用层】返回用户

场景 2:RAG 知识问答

典型:用户问"我们公司上季度的销售政策是什么?"特点:需要检索企业知识库,把资料塞进上下文再回答。 用户提问 │ ▼ 【L6 应用层】接收 │ ▼ 【L5 增强层】查询改写 │"上季度销售政策""2024Q4 销售政策 华东区"▼ 【L5 增强层】检索请求 │ ▼ 【L1 数据层】向量检索 │ 📦 向量库:语义召回 Top-K │ 📦 关键词:BM25 召回 │ ⚡ 混合检索 ▼ 【L5 增强层】重排序 │ Cross-Encoder 精排 ▼ 【L5 增强层】上下文组装 │ 拼接:系统提示 + 检索资料 + 用户问题 ▼ 【L3 模型层】LLM 生成 │ ← 基于真实资料,减少幻觉 ▼ 【L4 推理层】解码 │ ▼ 【L5 增强层】引用溯源 │ 标注答案来自哪段资料 ▼ 【L6 应用层】返回带引用的答案

场景 3:流式对话

典型:ChatGPT 逐字输出。 特点:边生成边返回,用户体验好。 用户提问 │ ▼ 【L6】接收 │ ▼ 【L5】Prompt 组装 │ ▼ 【L3】LLM 开始计算 │ ▼ 【L4】解码第1个 token │ ↓ 立即推送 ▼ 【L6】显示第1个字 │ ▼ 【L4】解码第2个 token │ ↓ 立即推送 ▼ 【L6】显示第2个字 │ ▼... 循环 ⟲... │ ▼ 【L4】遇到结束符 │ ▼ 【L6】输出完成

五、LLM 不能做什么

局限说明例子
幻觉会编造看似合理但错误的内容编造不存在的论文
知识截止训练数据有时间限制不知道昨天发生的事
上下文有限一次只能看有限长度超长文档看不完
数学弱概率模型不擅长精确计算大数乘法容易错
无法实时不能主动获取新信息需 RAG 或工具
可能有害对齐不完美被越狱后说错话
不确定不知道自己不知道不会说"我不确定"
谄媚倾向于迎合用户你说错它也附和

这些局限正是"增强层"要解决的问题。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询