从 NLP 到多模态:AI 如何理解与生成人类信息
2026/9/24 2:04:52 网站建设 项目流程

目录

1. NLP 是什么?

2. NLU 与 NLG:理解与生成的双引擎

3. NLU 常见任务

3.1 文本分类

3.2 情感分析

3.3 命名实体识别(NER)

3.4 语义相似度

4. NLG 常见任务

4.1 机器翻译

4.2 对话生成

4.3 文章摘要

5. 关键趋势:从任务专用到 LLM 统一

6. 语音处理:让机器听懂与说话

6.1 语音识别(ASR)

6.2 语音合成(TTS)

7. 多模态:AI 的下一站

7.1 文生图 / 视频 / 音频

7.2 视觉问答(VQA)

8. 总结

本文基于一份自然语言处理学习笔记整理,系统梳理 NLP、语音处理与多模态的核心概念、常见任务、典型应用和工程趋势。

1. NLP 是什么?

自然语言处理(Natural Language Processing, NLP)是人工智能领域中以自然语言文本(离散符号)为核心处理对象,研究如何建立人类语言形式与机器可计算语义之间可逆映射关系的学科。

它的目标不是简单地“处理字符串”,而是让计算机具备对语言符号进行形态分析、语义理解、逻辑推理及连贯生成的能力,从而消除人类自然语言的模糊性、歧义性与机器严格指令系统之间的鸿沟。

换句话说,NLP 要解决的是:人类说得含糊,机器却需要精确。


2. NLU 与 NLG:理解与生成的双引擎

NLP 通常可以分为两个核心方向:

方向全称目标重点例子
NLU自然语言理解让机器理解人类想表达的意思语义与意图判断“我想吃苹果”是指水果,还是指手机?
NLG自然语言生成根据数据或意图生成人类可读文本流畅度与准确性写新闻稿、写邮件回复、生成诗歌

NLU 负责“听懂”,NLG 负责“说人话”。两者共同构成 NLP 的基础能力。


3. NLU 常见任务

3.1 文本分类

文本分类是将一段不定长文本自动打上一个或多个预设类别标签。它是 NLP 最基础、最成熟的任务之一。

技术本质通常是:多分类或多标签问题

典型例子:

  • 主题分类:输入“中国乒乓球拿下奥运会大满贯” → 输出[体育]

  • 意图分类:输入“我想改一下收货地址” → 输出[修改订单]

  • 新闻打标:输入“央行宣布降低存款准备金率” → 输出[财经][政策]

3.2 情感分析

情感分析是文本分类的特殊子集,专门判断文本背后的主观情绪、观点或态度,通常输出极性或强度。

例子:

  • 细粒度情感:输入“酒店位置绝佳,但房间隔音差到离谱” → 输出位置[正向]隔音[负向]

  • 电商评价:输入“这手机电池太不耐用了” → 输出负向(Negative)

  • 社交媒体舆情:输入“XXX明星官宣结婚,祝福!” → 输出正向(Positive)情绪[喜悦]

3.3 命名实体识别(NER)

NER 从非结构化文本中识别出具有特定意义的实体指代,并将其归入预定义类别,如人名、地名、组织名、日期、专有名词等。它是信息抽取的基石。

例子:

输入:

马云在杭州创办了阿里巴巴,时间是1999年。

识别结果:

  • 马云:人名

  • 杭州:地名

  • 阿里巴巴:组织机构

  • 1999年:时间

3.4 语义相似度

语义相似度计算两段文本在含义层面的相近程度,而不是字面重复程度。它是搜索、问答和智能推荐的核心算法。

例子:

  • 句子 A:“如何给手机快速充电?”

  • 句子 B:“手机快充有哪些技巧?” → 相似度:0.95,语义一致

  • 句子 C:“今天手机电量消耗很快。” → 相似度:0.15,话题不同

难点在于:如果只看字面,“快充”和“充电”有重叠,但模型需要发现“技巧”和“消耗”语义完全不同。

可以借助 HanLP 分词与 NLP 演示工具进行体验:
https://hanlp.hankcs.com/demos/tok.html


4. NLG 常见任务

4.1 机器翻译

机器翻译将一种语言的文本自动翻译成另一种语言。

例子:

  • 输入(中文):“今天天气很好”

  • 输出(英文):“The weather is very nice today.”

4.2 对话生成

对话系统指构建能与人类进行多轮交互的聊天机器人。

例子:

  • 用户:“帮我查一下明天的天气。”

  • 系统:“您所在的城市是哪里?”

  • 用户:“上海。”

  • 系统:“明天上海晴转多云,22℃〜28℃。”

现在也可以借助豆包等工具创建漫画、PPT、小红书爆款文案等内容:
豆包 - 字节跳动旗下 AI 智能助手

4.3 文章摘要

文章摘要将长文本压缩成包含关键信息的短文本,主要分为:

  • 抽取式:直接从原文中摘取重要句子。

  • 生成式:重新组织语言生成新句子。

例子:输入一篇数千字新闻,输出摘要为:

5月6日,XX公司发布新款手机,配备最新AI芯片,起售价5999元。

如今大模型已经具备较强的文章摘要能力。例如使用 DeepSeek 时,可以输入提示词:

text

总结下这个博客的核心内容输出 https://claude.com/blog/common-workflow-patterns-for-ai-agents-and-when-to-use-them

总结结果通常能和原文核心内容保持较高一致性。

DeepSeek 地址:
DeepSeek


5. 关键趋势:从任务专用到 LLM 统一

过去,上述每个任务都需要单独训练一个小模型:文本分类一个模型、NER 一个模型、情感分析一个模型、摘要一个模型。

但现在,大语言模型(LLMs,如 GPT 系列、文心一言等)已经通过“预训练 + 微调 / 提示词”的方式,几乎能用同一个模型完成以上所有任务。

这意味着 NLP 工程范式正在发生变化:

  • 从“一个任务一个模型”走向“一个基座模型 + 多种提示/微调”

  • 从“标注数据驱动”走向“预训练知识 + 少样本/零样本”

  • 从“单点能力”走向“通用语言能力”


6. 语音处理:让机器听懂与说话

语音处理是一门涉及信号处理、计算机科学、语言学和人工智能的交叉学科,核心目标是让机器能够分析、理解、合成和处理人类语音信号。

6.1 语音识别(ASR)

ASR(Automatic Speech Recognition)即语音转文字,将人类语音中的词汇内容转换为计算机可读的文本或指令。目前系统通常基于 Whisper、Paraformer 等先进架构。

常见应用:

  • 智能音箱:小爱同学、Alexa

  • 会议纪要自动生成

  • 语音输入法

  • 无障碍辅助:为听障人士提供字幕

  • 车载语音控制

微信语音转文字就是典型的语音识别应用。

6.2 语音合成(TTS)

TTS(Text-to-Speech)即文字转语音,让计算机将文本转换为自然、流畅且富有表现力的语音。

目前 TTS 模型如 VITS、NaturalSpeech、ChatTTS 等,能够生成高度拟人、带有情感和韵律的语音,甚至支持少样本克隆——仅需几秒样本即可模仿特定人声。

讯飞推出的在线语音服务支持点击播放,把文字转换为声音,并且支持方言:
在线语音合成_文字转语音-讯飞开放平台


7. 多模态:AI 的下一站

“多模态”是人工智能领域的核心概念,指同时处理、理解或生成两种及以上不同类型数据的技术。人类认知天然就是多模态的:我们通过视觉、听觉、触觉等多种感官理解世界。

常见模态包括:

  • 视觉:图像、视频、图表、手势

  • 听觉:语音、音乐、环境声音

  • 文本:自然语言、符号、代码

  • 传感器数据:触觉、深度图、惯性测量单元数据、体温等

多模态 AI 主要解决三类问题:

  1. 理解与推理:从多种数据中提取含义。
    例如:给出图片和问题“图中穿红衣服的人在做什么?”,模型需要结合视觉和文本回答。

  2. 生成与创作:根据一种模态生成另一种模态。
    例如:文本生成图像、文本生成视频、图像生成文本、文本生成音乐。

  3. 对齐与检索:找到不同模态之间的对应关系。
    例如:用文字描述“一只在沙滩上的金毛犬”,从海量图片库中找出匹配图片。

7.1 文生图 / 视频 / 音频

图像生成的目标是:让计算机从随机噪声、文本描述、条件图像或其他模态输入中,自动创建出逼真、多样且符合要求的图像。

可以使用豆包输入提示词创建图片:
豆包 - 字节跳动旗下 AI 智能助手

相关技术还包括 Stable Diffusion、Midjourney、Sora 等。

7.2 视觉问答(VQA)

VQA 不仅仅是识别图像中的物体,而是要对整个场景进行语义层面的解析。它综合了感知、推理和知识,试图回答关于图像的高阶问题。

图像理解追求的是:让计算机像人一样,看懂图像中到底发生了什么,并能够用自然语言描述、推理或回答关于图像的问题。


8. 总结

从 NLP 到语音,再到多模态,AI 正在逐步获得理解与生成人类信息的能力:

  • NLP 是核心,研究语言形式与机器语义之间的映射。

  • NLU 与 NLG 是双引擎,分别负责理解与生成。

  • 文本分类、情感分析、NER、语义相似度、机器翻译、对话生成、文章摘要等是经典任务。

  • 大语言模型正在统一这些任务,改变传统“一任务一模型”的范式。

  • 语音处理让机器获得听觉能力,ASR 与 TTS 是两大核心。

  • 多模态让 AI 同时处理文本、图像、语音、视频和传感器数据,走向更接近人类的全感官智能。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询