FunASR 语音识别工具包如何 10 分钟装好:新手完整安装与配置指南
2026/9/7 7:12:15 网站建设 项目流程

FunASR 语音识别工具包如何 10 分钟装好:新手完整安装与配置指南

【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR

想在本地跑起来一个能语音识别、做说话人分离的开源工具箱?FunASR 就是为此设计的。它面向想快速搭建 ASR 环境的初学者和开发者,覆盖从环境配置到首次推理的完整路径。

🎯 项目速览:它到底能干什么

FunASR 是阿里巴巴达摩院开源的端到端语音识别工具包,定位介于学术研究和工业落地之间——既能训练模型,也能直接在生产环境提供推理服务。它不是单一模型,而是一整套「模型 + 流水线 + 服务」的组合。

核心能力:

  • 语音识别(ASR):基于非自回归的 Paraformer-large 等模型,把音频转成文字
  • 多任务识别:接入 Whisper-large-v3-turbo,支持多语言识别、翻译和语言识别
  • 语音理解:SenseVoice 等模型额外提供情感、音频事件等标签
  • 流水线组件:内置语音活动检测(VAD)、标点恢复、说话人验证与分离
  • 训练与推理一体:同一套代码完成模型训练、微调和线上推理

🧱 技术底座一览

装之前先搞清楚它由什么搭成,出了问题才知道往哪排查:

技术 / 依赖负责什么
Python 3.6+整个项目的运行语言
PyTorch主要深度学习框架,承载模型训练与推理
Paraformer-large非自回归端到端 ASR 主力模型
Whisper-large-v3-turbo多语言识别、翻译、语言识别
SenseVoice语音理解(识别 + 情感 + 事件)
pip / pip3Python 包管理,用于安装依赖
CUDA-capable GPU(可选)加速训练与推理

✅ 安装前环境自检

开工前先对照这张清单确认环境,能省掉后面大部分折腾:

前置条件要求是否必须
操作系统Linux 或 macOS必须
Python3.6 或更高版本必须
pip 或 pip3可正常安装 Python 包必须
git用于克隆仓库必须
NVIDIA GPU + CUDA支持 CUDA 的显卡可选(仅训练/加速推理需要)

在终端执行python3 --versionpip3 --version,两项都有正常输出才算通过自检。GPU 环境可选nvidia-smi确认驱动状态。

🛠️ 手把手安装

第 1 步:克隆项目仓库

把 FunASR 源码拉到本地。这一步做的事就是把整个代码库下载到你的工作目录:

git clone https://gitcode.com/GitHub_Trending/fun/FunASR.git cd FunASR

第 2 步:装系统级依赖

Python 包依赖一些系统库(编译工具、SSL、音频处理等),先按系统补上。

Ubuntu 系:

sudo apt-get update sudo apt-get install -y python3-pip python3-dev build-essential \ libssl-dev libffi-dev python3-setuptools libsox-fmt-mp3 sox

macOS:

brew install python libffi

这一步做的事是安装编译器和运行时库,后面 pip 编译本地扩展时会用到。

第 3 步:安装 Python 依赖

进入仓库目录,一次性装上所有 Python 包:

pip3 install -r requirements.txt

这一步做的事是按依赖清单批量安装 PyTorch 生态之外的配套库。如果网络较慢,可换用国内 PyPI 镜像源,以官方 README 为准。

第 4 步:配置环境(建议用虚拟环境)

把 FunASR 隔离在独立环境里,避免污染全局 Python:

conda create -n funasr python=3.8 conda activate funasr

这一步做的事是创建一个干净、可复现的运行环境(未装 conda 可直接跳过,用python3 -m venv也可以)。

第 5 步:拉取预训练模型

根据你要跑的任务,从 ModelScope 或 Hugging Face 下载对应 checkpoint。FunASR 首次推理时也会自动拉取所需模型,手动下载只是更可控。

🩺 安装验证与故障排查

先跑一个验证命令,确认包能正常导入执行:

python3 setup.py test

能跑通说明核心依赖装配无误。下面是新手最常踩的几个坑,按「现象 → 可能原因 → 解决」列出:

坑 1:pip: command not found

  • 现象:执行安装命令提示找不到 pip
  • 可能原因:系统只装了 pip3,或 Python 版本低于 3.6 导致工具链缺失
  • 解决:改用pip3,或用python3 -m pip install ...形式执行;必要时升级 Python

坑 2:macOS M1 上出现incompatible architecture (have x86_64, need arm64e)

  • 现象:安装 cffi 相关扩展时报架构不兼容
  • 可能原因:默认拉取了 Intel 架构的预编译包
  • 解决:卸载后按 arm64 强制重编:pip uninstall cffi pycparser,再ARCHFLAGS="-arch arm64" pip install cffi pycparser --compile --no-cache-dir

坑 3:装了 GPU 却提示 CUDA 不可用

  • 现象:推理报错No CUDA runtimetorch.cuda.is_available()为 False
  • 可能原因:安装的 PyTorch wheel 与本机 CUDA 驱动版本不匹配
  • 解决:按 PyTorch 官方版本对照表重装匹配的 CUDA wheel;急用时可先用device="cpu"跑通流程

坑 4:模型下载超时或中断

  • 现象:首次运行卡在模型下载
  • 可能原因:网络链路不稳定
  • 解决:手动从 ModelScope / Hugging Face 下载后放到本地路径指向,或切换网络重试,以官方 README 为准

🚀 第一次运行

装好后的最小可运行入口,参考 README_zh.md 中的快速开始示例:

from funasr import AutoModel model = AutoModel(model="iic/SenseVoiceSmall", device="cpu") result = model.generate(input="asr_example.wav") print(result)

预期表现:首次运行会自动下载 SenseVoiceSmall 模型,随后输出一段结构化转写文本,例如「欢迎大家来体验达摩院推出的语音识别模型」。能打印出转写结果,就说明从环境到模型链路全部打通。

⚙️ 版本与配置建议

  • 纯 CPU 机器:优先选轻量模型(如 SenseVoice 系列),FunASR 在 CPU 上也能达到不错的实时倍速,可先跑通再谈加速
  • 有 NVIDIA GPU:安装与驱动版本匹配的 PyTorch CUDA wheel,再把device参数改为cuda
  • 中国大陆网络环境:pip 与模型下载建议走镜像源,具体地址以官方 README 为准

📚 延伸阅读

  • 安装文档(中文)
  • 安装文档(英文)
  • Colab 快速体验
  • 核心源码目录

跑通第一次推理之后,你可以接着尝试换用 Paraformer 流式模型、接上标点与说话人分离流水线,或者把服务部署成 API 端点——这些都能基于今天搭好的环境直接展开。

【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询