1. 大模型 (Large Language Model, LLM)
定义:指参数量巨大(通常数十亿至万亿级别)、基于海量文本数据训练、能够理解和生成人类语言的人工智能模型。
核心特点:
- 规模效应:参数量越大,通常理解和生成能力越强。
- 涌现能力:当模型规模达到某个阈值后,会展现出训练数据中未明确编程的新能力(如推理、代码生成)。
- 通用性:一个模型可应用于多种下游任务(问答、摘要、翻译、创作等)。
代表模型:GPT系列、Claude、LLaMA、Gemini等。
2. 提示词工程 (Prompt Engineering)
定义:通过精心设计和优化输入给大模型的文本指令(提示词),以引导模型产生更准确、更符合预期的输出。
核心方法:
- 零样本提示:直接给出任务描述,不提供示例。
- 少样本提示:在任务描述中提供少量输入-输出示例。
- 思维链:要求模型“逐步思考”,展示推理过程,提升复杂问题解答的准确性。
- 角色扮演:为模型设定一个特定角色(如“资深软件架构师”),约束其回答风格和领域。
3. 智能体/代理 (Agent)
定义:一个能够感知环境、自主规划、调用工具并执行行动以实现特定目标的大模型应用系统。
核心组件:
- 规划模块:将复杂目标分解为可执行的子任务或步骤。
- 记忆模块:存储和检索过往的交互、知识或状态。
- 工具使用:能够调用外部API、函数、数据库或搜索引擎来获取信息或执行操作。
- 行动与反思:执行行动后,根据结果进行反思,调整后续策略。
典型架构:ReAct、AutoGPT、LangChain Agent。
4. 检索增强生成 (Retrieval-Augmented Generation, RAG)
定义:一种将外部知识检索与大模型生成能力相结合的技术范式。在回答用户问题时,先从知识库中检索相关文档片段,再将检索到的内容作为上下文提供给大模型,从而生成更准确、信息更实时、幻觉更少的答案。
核心流程:
- 索引:将文档切分、向量化,存入向量数据库。
- 检索:将用户问题向量化,从向量库中找出最相关的文本片段。
- 增强:将检索到的片段与原始问题组合,形成增强后的提示词。
- 生成:大模型基于增强后的提示词生成最终答案。
5. 微调 (Fine-Tuning)
定义:在预训练好的大模型基础上,使用特定领域或任务的数据集进行额外的有监督训练,使模型适应特定场景,提升在该场景下的性能。
主要方式:
- 全参数微调:更新模型的所有参数,效果最好,但成本最高。
- 参数高效微调:如LoRA、QLoRA,只训练少量新增的适配器参数,大幅降低计算和存储成本。
- 指令微调:使用指令-回答对数据进行训练,让模型更好地遵循人类指令。
6. 幻觉 (Hallucination)
定义:指大模型生成的内容看似合理、流畅,但事实上不符合现实或输入信息,即“一本正经地胡说八道”。
产生原因:模型基于概率生成文本,缺乏对真实世界的“理解”和事实核查机制。
缓解方法:RAG(提供真实依据)、提示词约束(要求注明信息来源)、模型对齐训练、后处理校验等。
7. 对齐 (Alignment)
定义:使人工智能系统的目标、价值观和行为与人类意图、伦理道德和社会规范保持一致的研究与实践。
核心目标:让AI系统变得有帮助、无害、诚实。
关键技术:
- 基于人类反馈的强化学习:通过人类对模型输出的偏好评分来训练模型。
- 宪法AI:让模型根据一套原则(宪法)进行自我批评和修正。
8. 上下文窗口 (Context Window)
定义:指大模型单次处理所能接受的输入文本(提示词+历史对话+生成内容)的最大长度(通常以Token数计)。
重要性:决定了模型能“记住”和参考多少上文信息,直接影响长文档处理、长对话和多轮任务规划的能力。
扩展技术:位置编码改进(如RoPE、ALiBi)、外推、压缩(如摘要关键信息)等。
9. Token
定义:大模型处理文本的基本单位。不是简单的单词或字符,而是通过分词器将文本切分成的子词片段。
特点:
- 中英文混合时,一个汉字通常对应1-2个Token,一个英文单词可能对应多个Token。
- 模型的理解、生成和计费通常都以Token数为基准。
10. 思维链 (Chain-of-Thought, CoT)
定义:一种提示技术,要求模型在给出最终答案前,先输出中间的推理步骤。这有助于提升模型在数学、逻辑推理等复杂任务上的表现。
变体:
- 零样本CoT:简单地在问题后加上“让我们一步步思考”。
- 少样本CoT:在提示词中提供包含推理步骤的示例。