FunASR 语音识别工具包如何 10 分钟装好:新手完整安装与配置指南
【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR
想在本地跑起来一个能语音识别、做说话人分离的开源工具箱?FunASR 就是为此设计的。它面向想快速搭建 ASR 环境的初学者和开发者,覆盖从环境配置到首次推理的完整路径。
🎯 项目速览:它到底能干什么
FunASR 是阿里巴巴达摩院开源的端到端语音识别工具包,定位介于学术研究和工业落地之间——既能训练模型,也能直接在生产环境提供推理服务。它不是单一模型,而是一整套「模型 + 流水线 + 服务」的组合。
核心能力:
- 语音识别(ASR):基于非自回归的 Paraformer-large 等模型,把音频转成文字
- 多任务识别:接入 Whisper-large-v3-turbo,支持多语言识别、翻译和语言识别
- 语音理解:SenseVoice 等模型额外提供情感、音频事件等标签
- 流水线组件:内置语音活动检测(VAD)、标点恢复、说话人验证与分离
- 训练与推理一体:同一套代码完成模型训练、微调和线上推理
🧱 技术底座一览
装之前先搞清楚它由什么搭成,出了问题才知道往哪排查:
| 技术 / 依赖 | 负责什么 |
|---|---|
| Python 3.6+ | 整个项目的运行语言 |
| PyTorch | 主要深度学习框架,承载模型训练与推理 |
| Paraformer-large | 非自回归端到端 ASR 主力模型 |
| Whisper-large-v3-turbo | 多语言识别、翻译、语言识别 |
| SenseVoice | 语音理解(识别 + 情感 + 事件) |
| pip / pip3 | Python 包管理,用于安装依赖 |
| CUDA-capable GPU(可选) | 加速训练与推理 |
✅ 安装前环境自检
开工前先对照这张清单确认环境,能省掉后面大部分折腾:
| 前置条件 | 要求 | 是否必须 |
|---|---|---|
| 操作系统 | Linux 或 macOS | 必须 |
| Python | 3.6 或更高版本 | 必须 |
| pip 或 pip3 | 可正常安装 Python 包 | 必须 |
| git | 用于克隆仓库 | 必须 |
| NVIDIA GPU + CUDA | 支持 CUDA 的显卡 | 可选(仅训练/加速推理需要) |
在终端执行python3 --version和pip3 --version,两项都有正常输出才算通过自检。GPU 环境可选nvidia-smi确认驱动状态。
🛠️ 手把手安装
第 1 步:克隆项目仓库
把 FunASR 源码拉到本地。这一步做的事就是把整个代码库下载到你的工作目录:
git clone https://gitcode.com/GitHub_Trending/fun/FunASR.git cd FunASR第 2 步:装系统级依赖
Python 包依赖一些系统库(编译工具、SSL、音频处理等),先按系统补上。
Ubuntu 系:
sudo apt-get update sudo apt-get install -y python3-pip python3-dev build-essential \ libssl-dev libffi-dev python3-setuptools libsox-fmt-mp3 soxmacOS:
brew install python libffi这一步做的事是安装编译器和运行时库,后面 pip 编译本地扩展时会用到。
第 3 步:安装 Python 依赖
进入仓库目录,一次性装上所有 Python 包:
pip3 install -r requirements.txt这一步做的事是按依赖清单批量安装 PyTorch 生态之外的配套库。如果网络较慢,可换用国内 PyPI 镜像源,以官方 README 为准。
第 4 步:配置环境(建议用虚拟环境)
把 FunASR 隔离在独立环境里,避免污染全局 Python:
conda create -n funasr python=3.8 conda activate funasr这一步做的事是创建一个干净、可复现的运行环境(未装 conda 可直接跳过,用python3 -m venv也可以)。
第 5 步:拉取预训练模型
根据你要跑的任务,从 ModelScope 或 Hugging Face 下载对应 checkpoint。FunASR 首次推理时也会自动拉取所需模型,手动下载只是更可控。
🩺 安装验证与故障排查
先跑一个验证命令,确认包能正常导入执行:
python3 setup.py test能跑通说明核心依赖装配无误。下面是新手最常踩的几个坑,按「现象 → 可能原因 → 解决」列出:
坑 1:pip: command not found
- 现象:执行安装命令提示找不到 pip
- 可能原因:系统只装了 pip3,或 Python 版本低于 3.6 导致工具链缺失
- 解决:改用
pip3,或用python3 -m pip install ...形式执行;必要时升级 Python
坑 2:macOS M1 上出现incompatible architecture (have x86_64, need arm64e)
- 现象:安装 cffi 相关扩展时报架构不兼容
- 可能原因:默认拉取了 Intel 架构的预编译包
- 解决:卸载后按 arm64 强制重编:
pip uninstall cffi pycparser,再ARCHFLAGS="-arch arm64" pip install cffi pycparser --compile --no-cache-dir
坑 3:装了 GPU 却提示 CUDA 不可用
- 现象:推理报错
No CUDA runtime或torch.cuda.is_available()为 False - 可能原因:安装的 PyTorch wheel 与本机 CUDA 驱动版本不匹配
- 解决:按 PyTorch 官方版本对照表重装匹配的 CUDA wheel;急用时可先用
device="cpu"跑通流程
坑 4:模型下载超时或中断
- 现象:首次运行卡在模型下载
- 可能原因:网络链路不稳定
- 解决:手动从 ModelScope / Hugging Face 下载后放到本地路径指向,或切换网络重试,以官方 README 为准
🚀 第一次运行
装好后的最小可运行入口,参考 README_zh.md 中的快速开始示例:
from funasr import AutoModel model = AutoModel(model="iic/SenseVoiceSmall", device="cpu") result = model.generate(input="asr_example.wav") print(result)预期表现:首次运行会自动下载 SenseVoiceSmall 模型,随后输出一段结构化转写文本,例如「欢迎大家来体验达摩院推出的语音识别模型」。能打印出转写结果,就说明从环境到模型链路全部打通。
⚙️ 版本与配置建议
- 纯 CPU 机器:优先选轻量模型(如 SenseVoice 系列),FunASR 在 CPU 上也能达到不错的实时倍速,可先跑通再谈加速
- 有 NVIDIA GPU:安装与驱动版本匹配的 PyTorch CUDA wheel,再把
device参数改为cuda - 中国大陆网络环境:pip 与模型下载建议走镜像源,具体地址以官方 README 为准
📚 延伸阅读
- 安装文档(中文)
- 安装文档(英文)
- Colab 快速体验
- 核心源码目录
跑通第一次推理之后,你可以接着尝试换用 Paraformer 流式模型、接上标点与说话人分离流水线,或者把服务部署成 API 端点——这些都能基于今天搭好的环境直接展开。
【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考