理解生成式 AI 与大语言模型内部工作原理 — generative-ai-for-beginners 第 01 课技术指南
2026/9/7 23:20:07 网站建设 项目流程

理解生成式 AI 与大语言模型内部工作原理 — generative-ai-for-beginners 第 01 课技术指南

【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners

本文基于 generative-ai-for-beginners 课程仓库中 01-introduction-to-genai/README.md 课程文档撰写,完整覆盖生成式 AI 的技术演进脉络、大语言模型(LLM)的三大内部工作机制(分词、逐 token 预测、基于概率分布的采样),以及面向教育场景的 Prompt/Completion 四类典型用法。读完后你将能够:向他人解释 LLM 为什么"非确定性"、如何用温度参数控制输出随机性、如何为不同的任务目标设计 prompt,并知道在本课程 21 节体系中应如何继续深入。

1. 课程定位与学习场景:一个教育初创公司

本仓库是一个包含 21 节课的生成式 AI 入门课程(Generative AI for Beginners),每节课覆盖一个独立主题,分为讲解概念的 "Learn" 课和配套 Python/TypeScript 代码示例的 "Build" 课,见 课程总览 README。第 01 课属于 "Learn" 类型,其学习目标是:

  • 理解什么是生成式 AI,以及大语言模型是如何工作的;
  • 学会如何针对不同用例(尤其聚焦教育场景)利用 LLM。

课程全文以一个虚构的教育初创公司(后文简称 "our startup")为主线,其使命是:

在全球范围内改善学习机会的可及性,确保公平获取教育,并根据每个学习者的需求提供个性化学习体验。

这一业务场景贯穿全课程:学生拥有 24 小时在线的虚拟教师,教师可以使用创新工具评估学生并给予反馈。要达成这一目标,团队必须借助 LLM 这一现代最强大的工具之一。生成式 AI 之所以重要,在于它降低了 AI 的使用门槛——使用者只需一句自然语言文本,无需掌握 Java 或 SQL 等专门语言,即可让模型完成撰写报告、编写应用等任务。

本节的其余章节将依次回答三个核心问题:生成式 AI 是如何一步步走到今天的?LLM 的内部机制是什么?我们的初创公司能把 LLM 用在哪些具体任务上?

2. 生成式 AI 的技术演进史

尽管生成式 AI 模型的发布带来了巨大的 "hype",但这一技术实际上已经研发了几十年,最早的研究可追溯到 20 世纪 60 年代。课程将其演进划分为四个阶段:

2.1 关键词触发式聊天机器人:不可扩展的起点

最早的 AI 原型是打字式的聊天机器人:从一组专家处提取知识库并录入计算机,输入文本中出现的关键词会触发知识库中的预设答案。这种方法很快被证明无法规模化——知识库需要人工穷举,无法应对未见过的表达。

2.2 统计式方法:机器学习的转折

20 世纪 90 年代,统计学方法被引入文本分析,催生了机器学习(Machine Learning)算法:模型可以从数据中自行学习模式,而不需要显式编程。机器可以通过"文本—标签"配对进行训练,从而用预定义标签对未见过的输入文本进行分类——即识别消息意图。这一步让机器模拟了人类语言理解能力。

2.3 神经网络与现代虚拟助手

硬件算力的进步使能更大规模的数据和更复杂的计算,推动了神经网络(尤其是循环神经网络 RNN)等深度学习算法的发展。RNN 显著增强了自然语言处理能力,让文本的语义表示方式更有意义——同一个词在不同句子语境中的价值不同。这正是 21 世纪初诞生的虚拟助手所依赖的技术:它们擅长解读人类语言、识别需求并执行动作(如按预设脚本回答或调用第三方服务)。

2.4 当下:Transformer 与生成式 AI

生成式 AI 可以看作深度学习的一个子集,其关键突破是 Transformer 架构:

  • 突破 RNN 的长序列限制:Transformer 能够接收比 RNN 长得多的文本序列作为输入;
  • 基于注意力机制(attention):模型可以对输入分配不同权重,"更关注"信息最集中的位置,且不受其在序列中位置顺序的约束;
  • 广泛的任务适应性:大多数近期的生成式 AI 模型(即 LLM,因为它们处理文本输入输出)都基于该架构。这些模型在海量的无标注数据(书籍、文章、网站等多样来源)上训练,能够适应广泛的任务,并生成语法正确、具有一定"创造性"的文本。

这一突破不仅极大提升了机器"理解"输入文本的能力,更使其具备了用人类语言生成原创回应的能力——这就是"生成"二字的由来。

3. 大语言模型内部工作原理(以 GPT 系列为例)

课程以 OpenAI GPT(Generative Pre-trained Transformer)模型为例,拆解 LLM 的三个核心机制。理解这三点是掌握后续所有 prompt 工程课程(第 04 课、第 05 课)的基础。

3.1 Tokenizer:文本如何变成数字

LLM 接收文本输入、生成文本输出,但作为统计模型,它们对数字的运算远优于对文本序列的直接处理。因此所有输入在被核心模型使用前,都会先经过一个分词器(tokenizer):

  1. 一个token 是一小段文本,由可变的字符数组成;
  2. tokenizer 的核心任务是把输入切分为 token 数组;
  3. 每个 token 再被映射为一个token index(整数编码),代表原始文本片段的编号。

这一机制解释了为什么 API 调用普遍按 "token" 计费,也解释了为什么不同模型的上下文窗口(context window)大小不同——本质上就是模型一次能处理的 token 数上限。

3.2 逐 token 预测:扩展窗口式生成

给定 n 个 token 作为输入(最大 n 值因模型而异),模型预测1 个输出 token。该 token 随即被拼接到下一轮迭代的输入末尾,以"扩展窗口"的方式不断重复,从而让用户最终读到一个完整句子(或多句)而不是单个词。

这也解释了一个常见的用户体验现象:如果你曾用过 ChatGPT,可能会发现它偶尔看起来像是"停在了句子中间"——这正是因为模型在逐 token 地续写,每一步只产出一次 token。

3.3 概率分布与 temperature:非确定性的来源

输出 token 的选取遵循模型对"当前文本序列之后各候选 token 出现概率"的预测分布,该分布由训练过程决定。但模型并非总是选取概率最高的 token——选取过程中加入了一定程度的随机性,使模型以**非确定性(non-deterministic)**方式工作:相同输入不一定得到完全相同的输出。

  • 这种随机性是在模拟创造性思维的过程
  • 它可以通过名为 **temperature(温度)**的模型参数进行调节。

温度参数的实际意义是:温度越低,采样越趋近于"总是选最高概率 token",输出越稳定、越保守;温度越高,低概率 token 被选中的机会越大,输出越发散、更有创意。这一结论与课程知识检查题的标准答案一致(见 第 01 课知识检查)。

3.4 在本仓库中如何真正调用 LLM

当你在后续 "Build" 课中写代码调用模型时,本仓库提供了统一的客户端构造工具 shared/python/api_utils.py,它印证了上述机制的落地方式:

  • create_openai_client():优先读取环境变量OPENAI_API_KEY构造 OpenAI 客户端,缺失时抛出带明确提示的ValueError
  • create_azure_openai_client():读取AZURE_OPENAI_ENDPOINTAZURE_OPENAI_API_KEY,并自动把 base_url 组装为{endpoint}/openai/v1/,面向 Azure OpenAI 的 v1 端点,因此无需api_version参数;
  • make_safe_request():为 HTTP 请求注入超时(默认 30 秒)与重试(默认 3 次)逻辑。

配套的 shared/python/env_utils.py 提供get_required_env()validate_env_vars()get_env_with_default(),用于安全地读取和校验环境变量(例如模型名缺失时回退到默认值)。从源码结构看,这套工具是课程各 notebook 共用的基础设施,意味着任何课程的模型调用都遵循"环境变量配置密钥 → 构造客户端 → 发送 prompt"的一致模式。具体环境配置步骤(含本地与 Codespaces 两种方式)见 00-course-setup。

4. 初创公司如何用 LLM:Prompt 与 Completion 的四类用法

课程指出,LLM 的核心能力是"从自然语言文本输入出发,从零生成文本"。这里引入两个贯穿全课程的关键术语:

  • Prompt(提示词):发送给 LLM 的输入;
  • Completion(补全):LLM 的输出,该词源自模型的机制——生成下一个 token 以"补全"当前输入。

一个 prompt 可以包含以下形态,课程为每一类都给出了教育场景中的示例:

4.1 指令(Instruction)

指定你期望模型产生的输出类型,指令中有时还会内嵌示例或附加数据。典型应用:

  1. 摘要生成:对文章、书籍、产品评论等做摘要,并从非结构化数据中提取洞察;
  2. 创意构思与写作:设计文章、论文、作业等。

4.2 对话式提问(Question)

以与智能体(agent)对话的形式提出的问题,例如学生向 AI 助教提问某个知识点的解释。

4.3 待补全文本(Text to complete)

一段隐含"写作辅助"请求的文本片段,模型续写完成它——这直接呼应第 3.2 节的扩展窗口机制。

4.4 代码(Code)

一段代码加上"解释并为其写文档"的请求,或者一条注释请求生成完成特定任务的代码片段。

课程同时明确声明:以上示例相当简单,并非对 LLM 能力的穷尽展示,其目的是呈现生成式 AI 的潜力(在教育语境中尤为突出,但不限于此)。从本仓库的课程设计看,这些用法正是后续课程逐节展开的起点:第 04 课系统讲解 prompt 工程基础(含 Jupyter Notebook 沙箱练习),第 05 课讲解高级 prompt 技巧,第 06 课开始动手构建文本生成应用。

5. 重要局限:生成式 AI 并非"智能"

课程在这一节给出了一个必须内化的警告:生成式 AI 的输出并不完美,模型的"创造力"有时会反噬——输出可能是人类会解读为"对现实的歪曲"或具有冒犯性的词句组合。更具体地说:

  • 生成式 AI不具备(广义定义的)智能:它缺乏批判性推理、创造性推理与情商;
  • 不是确定性的:同一输入的输出会变化(见第 3.3 节);
  • 不可盲信:编造(fabrication)——错误的引用、内容与陈述——可能混入正确信息之中,并以极具说服力和自信的语气呈现。

课程的处理方式是:这些局限不会在本课展开,而是交由 第 03 课"负责任地使用生成式 AI" 系统讲解——包括公平性、包容性、可靠性/安全、安全与隐私、透明性与问责六大 Responsible AI 原则,以及幻觉(hallucinations)等危害的缓解策略。因此,"如何把 temperature、prompt 设计与评估手段组合起来控制输出质量"是第 04、05 课与第 03 课共同回答的命题。

6. 知识检查与课后练习

6.1 知识检查

关于大语言模型,下列哪项是正确的?

  1. 每次都会得到完全相同的回应;
  2. 它做什么都很完美,比如擅长加法、总能产出可运行代码;
  3. 即使使用相同的 prompt,回应也可能不同。它擅长为你提供某个东西(文本或代码)的第一稿,但需要你在此基础上改进。

答案:3。LLM 是非确定性的,输出会变化,但你可以通过 temperature 设置控制其变化幅度。也不应期望它"完美"完成任务——它的价值在于帮你完成"重活":给出一个好的初稿,然后由你逐步打磨。

6.2 课后练习(Assignment)

课程为本节布置的练习是:

  1. 进一步阅读生成式 AI 的相关资料;
  2. 找出一个"今天还没有生成式 AI、但你会希望加上"的领域;
  3. 思考影响差异:与"老方式"相比结果有何不同?你做了之前做不到的事,还是更快了?
  4. 写一份约 300 字的总结,描述你梦想中的 AI 初创公司,需包含 "Problem"(问题)、"How I would use AI"(我将如何使用 AI)、"Impact"(影响)等小标题,可选地加上商业计划。

这个练习把第 2 节的"教育初创公司"叙事交还给了读者本人——用本课学到的 prompt/completion 概念,为你的场景设计第一个真实 prompt。

7. 继续学习路径

读完本课后,建议按以下顺序推进,所有路径均在本仓库内:

下一步内容路径
第 02 课探索并对比不同 LLM 类型:如何为用例选择正确的模型、测试迭代与部署02-exploring-and-comparing-different-llms/README.md
第 03 课负责任地使用生成式 AI:幻觉、公平性等原则与缓解措施03-using-generative-ai-responsibly/README.md
第 04 课prompt 工程基础:tokenization、base LLM 与 instruction-tuned LLM 的核心概念及沙箱练习04-prompt-engineering-fundamentals/README.md
环境准备若要从 "Learn" 过渡到 "Build",先完成开发环境与 API 密钥配置00-course-setup/README.md

第 02 课将延续本课建立的术语体系(foundation model、LLM、多模态模型),帮助你理解"选型"决策:从文本生成、音频、图像到多模态,不同任务适合不同类型的模型,并按任务质量、延迟、上下文窗口、工具调用能力、安全行为、区域可用性与总成本来比较,而非仅看发布日期或价格。

要点回顾

  • 生成式 AI 的演进路径:关键词聊天机器人 → 统计式机器学习 → 神经网络/RNN 虚拟助手 → Transformer 驱动的 LLM;
  • LLM 三步内部机制:tokenizer 将文本编码为 token index → 逐 token 预测并以扩展窗口续写 → 从概率分布中采样,temperature 调节随机性
  • prompt 的四种基本形态(指令、对话提问、待补全文本、代码)覆盖摘要、创意写作、问答与代码生成等教育场景;
  • LLM 非确定性、不完美、不可盲信,编造内容会混入正确信息——质量与责任问题由第 03、04、05 课接力解决;
  • 本仓库后续课程与共享工具(shared/python/api_utils.py、shared/python/env_utils.py)为把上述概念落地为可运行的 Python/TypeScript 应用提供了统一基础设施。

【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询