一份术语表真正的价值,不在于它收了多少个词,而在于能不能让说不同语言、看不同文档的人,在同一件事上不出岔子。我带过几个从其他行业转过来做算法的同学,也帮人改过简历和论文,最常见的卡点从来不是模型跑不起来,而是术语对不上:简历上写"熟悉注意力机制",面试官追问 self-attention 和 cross-attention 的区别,答不上来;论文前半段写"注意力",后半段写"关注度",审稿人直接在意见里问这是不是一个东西;团队文档里 Agent 一会儿叫"代理"、一会儿叫"智能体",三个月后新同事翻文档完全接不上线。
所以我整理这份人工智能专业术语表(中英文对照)时,标准只有一个——能不能直接拿去用。它覆盖从机器学习基础概念到大模型、具身智能、边缘计算这些前沿方向的核心词汇,每一条都给出中英对照、一句话解释,以及我自己踩过或者见别人踩过的翻译坑。不管你是准备面试、写毕设、做课程作业、翻译文档,还是刚接手一个别人写的项目要读代码,都可以当成随手查的速查本;基础一般的读者也能顺着主干线看下去,把概念之间的关系理清楚。
1. 术语对不上,比不会调模型更耽误事
1.1 我见过的三类"术语事故"
第一类是检索失效。你想查"自注意力"的实现细节,中文搜出来的文章大多是二手转述,真正讲清楚的那几篇英文原文却因为你不知道它叫 self-attention,压根搜不到。术语的英文写法本身就是一把钥匙,中文译名只是标签,英文原名才是通行证。
第二类是沟通错位。Agent 这个词就非常典型:有的团队译成"代理",有的译成"智能体",还有的干脆保留英文。开会时一个人在说"我们的代理层",另一个人在理解成网络代理,讨论半小时才发现说的不是同一件事。类似的还有 Kernel(核函数 / 卷积核 / 操作系统内核)、Attention(注意力 / 关注度)、Bias(偏见 / 偏置),同一个英文词在不同上下文里对应完全不同的中文。
第三类是简历与论文失真。把"调参"写成 parameter tuning,面试官会默认你在调模型权重;而你想表达的其实是 hyperparameter tuning(超参数调优)。这两个词在英文里分得很清楚,写错了就是给自己挖坑。论文里把 fine-tuning 译成"精调"、"微调"、"微调训练"三种写法混用,审稿人第一反应就是作者对概念本身没吃透。
1.2 这份表的收录逻辑:高频、易混、有稳定译法
术语表最容易犯的错是"贪多"。我见过把维基百科上几百个词一股脑抄下来的表,结果真正高频的那三十个词反而埋在里面找不到。我的收录标准是三条:
- 高频:在论文、官方文档、面试、项目周报里反复出现的词优先。冷门词只在它容易和常见词混淆时才收。
- 易混:同一个中文对应多个英文,或者同一个英文对应多个中文的,必须单独标注上下文。这是术语表最该发力的地方。
- 有稳定译法:像 Grounding、Alignment 这类中文社区还没形成统一译法的词,我给你的是"当前最主流的说法 + 常见替代说法",而不是硬造一个译名。
提示:查术语时不要只记中文,一定要把英文原名一起记住。中文译名会随着社区习惯变化,英文原名基本是稳定的。
下面这张表是我从实际文档和面试里总结出来的"错译代价",你可以对照看看自己有没有中招。
| 常见写法 | 想表达的意思 | 问题所在 | 建议写法 |
|---|---|---|---|
| parameter tuning | 调超参数 | parameter 通常指模型权重,不是超参数 | hyperparameter tuning |
| 关注度机制 | 注意力机制 | 非主流译法,容易被当成另一个概念 | attention mechanism |
| 代理 | Agent | 与网络代理、代理模式冲突 | 智能体 / Agent |
| 精调 | Fine-tuning | 与微调混用,读者会困惑 | 微调 / Fine-tuning |
| 深度学习网络 | 神经网络 | 混淆了领域名和结构名 | neural network |
2. 主干线:从人工智能到深度学习的十二个基础锚点
2.1 AI、ML、DL、LLM 不是并列关系
这是最基础也最容易讲乱的一组。人工智能(Artificial Intelligence, AI)是最大的那个圈,指让机器表现出类似智能行为的所有努力;机器学习(Machine Learning, ML)是 AI 下面的一个分支,核心思路是不靠人写死规则,而是让模型从数据里学规律;深度学习(Deep Learning, DL)又是机器学习下面的分支,特点是用多层神经网络自动提取特征;大语言模型(Large Language Model, LLM)则是深度学习在自然语言方向上的一个具体产物。
| 中文 | 英文 | 一句话定义 |
|---|---|---|
| 人工智能 | Artificial Intelligence, AI | 让机器完成需要智能的任务的统称 |
| 机器学习 | Machine Learning, ML | 从数据中自动学习规律的方法体系 |
| 深度学习 | Deep Learning, DL | 用多层神经网络做表征学习的机器学习分支 |
| 神经网络 | Neural Network, NN | 由大量神经元节点分层连接构成的计算结构 |
| 大语言模型 | Large Language Model, LLM | 在海量文本上预训练、参数量很大的语言模型 |
| 生成式人工智能 | Generative AI, GenAI | 以生成新内容(文本、图像、音频)为目标的一类模型 |
理解这层包含关系有什么用?至少在写项目介绍时你不会说出"我们用深度学习做人工智能,又用机器学习做大模型"这种层级混乱的话。很多同学的毕设开题报告就是在这里失分的。
2.2 五种学习范式,别只会说"监督学习"
监督学习(Supervised Learning)用带标签的数据训练,比如给一堆图片标好是猫还是狗;无监督学习(Unsupervised Learning)没有标签,靠数据自身的结构做聚类、降维;半监督学习(Semi-supervised Learning)是少量有标签加大量无标签;自监督学习(Self-supervised Learning)是这几年最关键的范式转变,它从数据本身构造监督信号,比如把一句话中间挖掉一个词让模型去猜——大模型的预训练基本都建立在这上面;强化学习(Reinforcement Learning, RL)则通过与环境交互、根据奖励信号调整策略来学习。
这里有两个高频相关术语:奖励(Reward)和策略(Policy)。强化学习常被用在机器人控制、游戏对弈、以及大模型的对齐阶段。如果你看到 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习),它就是把人类偏好当作奖励信号的一种具体做法,这也是大模型能"听懂人话"的关键一步。
2.3 训练环节:参数、超参数、损失函数与梯度下降
这一组词在面试里几乎必问。参数(Parameters)是模型自己学出来的东西,比如权重矩阵里的每一个数值;超参数(Hyperparameters)是人手设定的东西,比如学习率、批大小、层数。这两者混用是新手最典型的失误。
损失函数(Loss Function)衡量模型预测和真实答案差多远,训练的目标就是把它降下来。梯度下降(Gradient Descent)是降低损失的主要手段:计算损失对参数的梯度,然后沿着梯度反方向挪一小步。学习率(Learning Rate)就是这一步的大小,太大会震荡,太小会慢得让人绝望。反向传播(Backpropagation)是高效计算这些梯度的算法,本质上是链式法则在计算图上的应用。
过拟合(Overfitting)指模型在训练集上表现很好、在新数据上拉胯;欠拟合(Underfitting)则相反,连训练集都学不好。缓解过拟合的常见手段包括正则化(Regularization)、Dropout、早停(Early Stopping)和增加数据量。术语表里这几个词放在一起看,比单独背要清楚得多。
2.4 数据侧的词汇,往往被忽略
做过项目的人都知道,真正花时间的部分在数据。数据集(Dataset)通常划分为训练集(Training Set)、验证集(Validation Set)、测试集(Test Set)。验证集用来调超参数和选模型,测试集只在最后评估一次。数据泄漏(Data Leakage)指的是测试集的信息以某种方式泄漏到了训练过程里,比如归一化时用了全量数据的均值——这种错误会让离线指标好看得离谱,上线后立刻打回原形。
其他必收的词包括特征(Feature)、标签(Label)、标注(Annotation / Labeling)、数据增强(Data Augmentation)、样本(Sample)、类别不平衡(Class Imbalance)、噪声(Noise)。标注一致性是数据质量的核心指标之一,后面讲 AI 训练师时会再展开。
3. 大模型高频术语:Token、嵌入、注意力与对齐
3.1 文本进模型的第一步:Token 与上下文窗口
模型看不懂文字,它只认数字。分词(Tokenization)就是把文本切成词元(Token)并映射成整数 ID 的过程,负责这件事的组件叫分词器(Tokenizer),它依赖的映射表叫词表(Vocabulary)。英文里一个 token 可能是半个单词,中文里常见的是按字或按常见词组切分。这件事直接影响你的成本估算:API 按 token 计费,上下文长度也按 token 算。
from transformers import AutoTokenizer tokenizer = AutoTokenizer.from_pretrained("bert-base-chinese") text = "人工智能术语表" print(tokenizer.tokenize(text)) # 输出类似: ['人', '工', '智', '能', '术', '语', '表'] print(tokenizer.encode(text)) # 输出对应的整数 ID 序列,模型真正吃进去的是这个上下文窗口(Context Window)指模型一次能处理的最大 token 数量。这个数字非常关键,因为超出部分会被截断或者需要额外的分块策略。
3.2 表征与注意力:理解 Transformer 的钥匙
嵌入(Embedding)是把离散符号(词、句子、图片)映射成稠密向量的过程,得到的向量叫词向量/嵌入向量(Embedding Vector)。向量的距离可以表达语义相似度,这是很多检索、聚类、推荐任务的基础。
注意力机制(Attention Mechanism)让模型在处理某个位置时,动态地参考其他位置的信息。分三个角色:查询(Query)、键(Key)、值(Value),通过计算查询和键的相似度得到权重,再对值加权求和。自注意力(Self-Attention)指查询、键、值都来自同一个序列;交叉注意力(Cross-Attention)指查询来自一个序列、键和值来自另一个序列,多模态模型里用它把图像信息和文本信息对齐。多头注意力(Multi-Head Attention)是并行做多组注意力,让模型从不同子空间捕捉不同的关系。
Transformer就是把注意力作为核心结构的模型架构,相比循环神经网络(RNN)它能并行计算、长距离依赖更好。相关词还有位置编码(Positional Encoding),因为注意力本身没有顺序概念,必须额外注入位置信息。
3.3 从预训练到微调:模型是怎么变得好用的
预训练(Pre-training)是在海量通用数据上先学一个基础模型,通常用自监督目标。微调(Fine-tuning)是在预训练模型基础上,用特定任务的数据继续训练。指令微调(Instruction Tuning)是用"指令-回答"格式的数据训练模型遵循指令。LoRA(Low-Rank Adaptation,低秩适配)是一种参数高效微调方法,只训练少量附加参数,显存占用小、切换任务方便,是目前个人开发者最常用的方案之一。
对齐(Alignment)指让模型的行为符合人类期望,RLHF 是主流做法之一。知识蒸馏(Knowledge Distillation)是用大模型(教师模型)指导小模型(学生模型)学习。量化(Quantization)是把权重从高精度压成低精度(比如从 FP16 到 INT8、INT4),换来更小的显存占用和更快的推理速度,代价是精度可能轻微下降。剪枝(Pruning)则是直接去掉不重要的连接或结构。
3.4 推理与应用侧:Prompt、RAG 与幻觉
提示(Prompt)是给模型的输入指令,提示工程(Prompt Engineering)是设计提示的方法论。零样本(Zero-shot)指不给示例直接问,少样本(Few-shot)指在提示里塞几个示例。思维链(Chain-of-Thought, CoT)是让模型分步推理的提示技巧,对数学和逻辑题效果明显。
检索增强生成(Retrieval-Augmented Generation, RAG)是先从外部知识库检索相关内容,再让模型基于检索结果生成答案,能显著降低胡编的概率。幻觉(Hallucination)指模型一本正经地生成不实内容,这是当前最需要警惕的问题。涌现能力(Emergent Ability)描述的是模型规模超过某个量级后突然出现的能力。缩放定律(Scaling Law)描述模型性能与参数量、数据量、算力之间的经验关系。混合专家(Mixture of Experts, MoE)是每次只激活部分参数的结构,用来在控制推理成本的同时扩大总参数量。智能体(Agent)则是让模型具备规划、调用工具、多步执行能力的一套系统。
4. 最容易翻车的三十组中英对照与误译纠正
4.1 一词多义:同一英文在不同语境下译法完全不同
这组词是术语表里最需要标注上下文的。单独把 Bias 译成"偏见"或者"偏置"都会错一半。
| 英文 | 语境一 | 语境二 | 判断依据 |
|---|---|---|---|
| Bias | 偏置(神经网络里的可学习常数项) | 偏见(数据或模型层面的系统性偏差) | 看是否与 weight 并列出现 |
| Kernel | 卷积核(CNN 里的滑动窗口) | 核函数(SVM 里的相似度函数) | 看模型类型 |
| Attention | 注意力(机制名) | 关注度(权重数值) | 看指的是结构还是数值 |
| Pooling | 池化(降采样操作) | 汇聚(多源信息融合) | 看是否在 CNN 语境 |
| Batch | 批次(一次送入的样本集合) | 批量(处理方式) | 看词性 |
| Agent | 智能体(AI 系统) | 代理(网络或设计模式) | 看上下文领域 |
| Token | 词元(文本切分单位) | 令牌(鉴权凭证) | 看是否在 NLP 语境 |
| Embedding | 嵌入(映射动作或结果) | 嵌入向量(具体的向量) | 看是否需要强调数值 |
4.2 中文社区还没定下译法的词
有一批词我建议中英并写,甚至直接用英文,因为中文译名尚未统一,硬译反而增加理解成本:
- Grounding:常见译法有"接地的""落地""锚定",说的是模型输出与真实世界或事实的对应程度。文档里最好写"事实接地(Grounding)"。
- Alignment:译"对齐"已经比较通用,但在强化学习语境里也指策略与目标的匹配,最好加一句限定。
- Hallucination:译"幻觉"通用,但注意它不带"模型有意欺骗"的含义,别写成"编造"。
- Prompt:译"提示"通用,但 Prompt Engineering 译"提示工程"比"指令工程"更常见。
- Fine-tuning:译"微调"最稳,不要用"精调""微调训练"混用。
- Scaling Law:译"缩放定律"与"规模定律"并存,论文里建议给出英文。
- Emergent:译"涌现",但要注意它描述的是现象,不是某种具体机制。
注意:写论文时,第一次出现某个术语,建议写成"中文(English, 缩写)"的格式,之后统一用缩写。这样既符合规范,也避免读者在不同译名之间来回猜。
4.3 工程与部署类:上线后才用得上的词
做模型和做产品中间隔着一段工程,这段里的术语也常被混淆。推理(Inference)指用训练好的模型做预测,和训练(Training)是两个阶段。吞吐量(Throughput)指单位时间能处理的请求数,延迟(Latency)指单个请求的响应时间,这两者经常互相牵制。显存(VRAM)是 GPU 上的内存,批大小(Batch Size)直接决定显存占用。边缘计算(Edge Computing)指把计算放到离数据源更近的设备上,比如把模型部署到开发板上做本地推理,好处是延迟低、数据不出本地;对应概念是云端推理(Cloud Inference)。
| 中文 | 英文 | 容易混淆的对象 |
|---|---|---|
| 推理 | Inference | 与"逻辑推理 Reasoning"不是一回事 |
| 吞吐量 | Throughput | 常与延迟一起权衡 |
| 显存 | VRAM | 与内存 RAM 区别清楚 |
| 量化 | Quantization | 与降采样无关 |
| 剪枝 | Pruning | 与数据清洗无关 |
| 边缘计算 | Edge Computing | 与分布式训练不同 |
5. 延伸圈层:具身智能、本体论这些新词该放在哪
5.1 具身智能与物理 AI
具身智能(Embodied AI)指的是让智能体拥有物理身体,能在真实环境里感知、决策、行动。它和纯文本模型的差别在于必须处理连续动作、真实物理约束和实时性。相关的核心术语包括世界模型(World Model),即模型对环境动态的内部建模;仿真到现实(Sim2Real),指在仿真环境训练、迁移到真实硬件;视觉-语言-动作模型(Vision-Language-Action, VLA),把看到的画面、听到的指令直接映射成动作。你如果听到"物理 AI(Physical AI)",它强调的是 AI 与物理世界交互这一面,和具身智能高度重叠。至于"除了物理 AI 还有别的 AI 吗",从术语角度说,这类说法都是应用侧的分类标签,不是模型架构层面的分类。
5.2 本体论与知识图谱:老词在新语境里复活
本体论(Ontology)在人工智能领域不是哲学概念,而是对某个领域概念、属性、关系的规范化描述。它和知识图谱(Knowledge Graph)密切相关:本体定义"有哪类东西、能有什么关系",知识图谱则是按这个框架填进去的具体事实。最基础的表示单位是三元组(Triple),形如"实体—关系—实体",比如"北京—是首都—中国"这种结构(这里只是形式示意)。
| 中文 | 英文 | 说明 |
|---|---|---|
| 本体论 | Ontology | 领域概念的规范化描述 |
| 知识图谱 | Knowledge Graph | 按本体组织的事实网络 |
| 三元组 | Triple | 头实体、关系、尾实体 |
| 实体 | Entity | 图谱中的节点 |
| 关系 | Relation | 节点之间的边 |
| 实体链接 | Entity Linking | 把文本中的提及对应到图谱节点 |
| 知识抽取 | Knowledge Extraction | 从非结构化文本提取结构化事实 |
做过 RAG 的人会发现,纯向量检索在涉及多跳关系的问题上效果有限,知识图谱正好补这一块,这也是近期"本体论 + 大模型"讨论变多的原因。
5.3 AI 训练师与数据质量:被低估的一环
人工智能训练师这个职业的核心工作包括数据采集、清洗、标注、质检、模型效果评估与反馈。里面有一批术语值得记住:标注一致性(Inter-Annotator Agreement)衡量不同标注者对同一批样本的判断是否一致,是数据质量的关键指标;数据质量评价通常看准确性、完整性、一致性、时效性和分布覆盖度;偏见(Bias)在这里指数据分布不均导致的模型表现差异,比如训练集中某类样本极少,模型对这类样本的识别率就会明显偏低。
数据集质量要求里有一条容易被忽略:标注规范(Annotation Guideline)必须先写清楚再开工,否则返工成本极高。我见过一个项目,标注规范里对"模糊样本"没定义,五个标注员给出五种处理方式,最后这批数据全部作废重标。
5.4 多模态与生成式方向
多模态(Multimodal)指模型同时处理文本、图像、音频等多种模态。扩散模型(Diffusion Model)是当前图像生成的主流架构,通过逐步去噪生成内容。文生图(Text-to-Image)、语音合成(Text-to-Speech, TTS)、语音识别(Automatic Speech Recognition, ASR)、数字人(Digital Human)都属于生成式人工智能的应用形态。AIGC(AI-Generated Content,人工智能生成内容)是这一整类应用的统称。
另外,大作业、导论、复习、学习路线这些词虽然出现在搜索里,但它们不是技术术语,而是学习场景。真正影响你复习效率的,是能不能把术语按"基础—模型—训练—推理—应用"分层整理,这比按字母表排序有用得多。
6. 术语表怎么用:三条能落地的整理方法
6.1 卡片法:术语 + 一句话 + 一个反例
我自己维护术语表的方式是卡片式,每条包含三部分:英文原名、一句话定义、一个反例或易混点。第三部分最重要,因为定义很容易背,混淆点才是你实际会出错的地方。举个例子:
- term: Hyperparameter zh: 超参数 definition: 训练前由人设定的配置项,不随训练更新 counter_example: 权重 weight 是参数不是超参数,别混 related: [Learning Rate, Batch Size, Early Stopping]用这种结构记,一个月能稳定积累两三百条,而且每条都带着"我为什么差点搞错"的信息,比单纯背定义牢固得多。我建议按主题分组而不是按字母排序,同一组词放在一起,概念之间的联系会自然浮现。
6.2 在代码和文档里建立中英映射习惯
读开源代码时,命名几乎全是英文。我的做法是:遇到不熟的变量名就记下来,然后对照中文文档确认它的标准译名。比如看到embeddings、attention_mask、logits、checkpoint,分别对应嵌入向量、注意力掩码、未归一化的预测分数、检查点。Logits这个词中文社区经常直接说 logits 不翻译,这也是可以接受的,硬译成"逻辑值"反而没人懂。
写团队文档时,建议在文档开头放一小节"术语约定",把中英对照列出来,后面全文统一用其中一种写法。这个小动作能省掉大量沟通成本,尤其是跨职能团队里产品和算法一起看文档的时候。
6.3 面试与论文里的中英取舍
面试时的原则是:名词说英文,解释用中文。说"我们用了 LoRA 做参数高效微调,主要是显存不够",比说"我们使用低秩适配进行参数高效微调"更自然,也更专业。面试官如果追问,你能用中文把原理讲清楚,就说明你真的理解,而不是背了译名。
论文写作的原则相反:第一次出现给全称和缩写,之后统一。中文期刊里,术语首次出现写成"注意力机制(Attention Mechanism)",后面统一用"注意力机制"或统一用缩写,不要来回换。我审过一篇稿子,同一个概念出现了"注意力""注意力机制""关注机制"三种写法,读起来非常累,这种情况审稿人通常会给"语言需润色"的意见。
如果是要用 AI 助手帮忙写论文,有一点必须提醒:术语和定义的准确性一定要自己过一遍。助手生成的术语解释看起来很流畅,但偶尔会把相近概念混在一起,比如把自监督学习和无监督学习当成一回事。把这些错误带进论文,比语法错误严重得多。用助手查陌生术语是可以的,但核心定义要以教材或原论文为准。
一份术语表放到最后,最值钱的从来不是那些冷门长词,而是那二三十个反复出现、看似简单、但每次都可能搞错的基础词。我把自己的术语表从最早的八十多条慢慢加到四百多条,最后发现真正反复翻看的,还是过拟合、超参数、自注意力、对齐这几个。如果你打算开始整理自己的版本,建议先别贪多,从今天这篇文章里的主干线开始,把每一条的中英对照和易混点写清楚,用起来比收藏一份"最全列表"有用得多。