
FunASR 语音识别工具包如何 10 分钟装好新手完整安装与配置指南【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR想在本地跑起来一个能语音识别、做说话人分离的开源工具箱FunASR 就是为此设计的。它面向想快速搭建 ASR 环境的初学者和开发者覆盖从环境配置到首次推理的完整路径。 项目速览它到底能干什么FunASR 是阿里巴巴达摩院开源的端到端语音识别工具包定位介于学术研究和工业落地之间——既能训练模型也能直接在生产环境提供推理服务。它不是单一模型而是一整套「模型 流水线 服务」的组合。核心能力语音识别ASR基于非自回归的 Paraformer-large 等模型把音频转成文字多任务识别接入 Whisper-large-v3-turbo支持多语言识别、翻译和语言识别语音理解SenseVoice 等模型额外提供情感、音频事件等标签流水线组件内置语音活动检测VAD、标点恢复、说话人验证与分离训练与推理一体同一套代码完成模型训练、微调和线上推理 技术底座一览装之前先搞清楚它由什么搭成出了问题才知道往哪排查技术 / 依赖负责什么Python 3.6整个项目的运行语言PyTorch主要深度学习框架承载模型训练与推理Paraformer-large非自回归端到端 ASR 主力模型Whisper-large-v3-turbo多语言识别、翻译、语言识别SenseVoice语音理解识别 情感 事件pip / pip3Python 包管理用于安装依赖CUDA-capable GPU可选加速训练与推理✅ 安装前环境自检开工前先对照这张清单确认环境能省掉后面大部分折腾前置条件要求是否必须操作系统Linux 或 macOS必须Python3.6 或更高版本必须pip 或 pip3可正常安装 Python 包必须git用于克隆仓库必须NVIDIA GPU CUDA支持 CUDA 的显卡可选仅训练/加速推理需要在终端执行python3 --version和pip3 --version两项都有正常输出才算通过自检。GPU 环境可选nvidia-smi确认驱动状态。️ 手把手安装第 1 步克隆项目仓库把 FunASR 源码拉到本地。这一步做的事就是把整个代码库下载到你的工作目录git clone https://gitcode.com/GitHub_Trending/fun/FunASR.git cd FunASR第 2 步装系统级依赖Python 包依赖一些系统库编译工具、SSL、音频处理等先按系统补上。Ubuntu 系sudo apt-get update sudo apt-get install -y python3-pip python3-dev build-essential \ libssl-dev libffi-dev python3-setuptools libsox-fmt-mp3 soxmacOSbrew install python libffi这一步做的事是安装编译器和运行时库后面 pip 编译本地扩展时会用到。第 3 步安装 Python 依赖进入仓库目录一次性装上所有 Python 包pip3 install -r requirements.txt这一步做的事是按依赖清单批量安装 PyTorch 生态之外的配套库。如果网络较慢可换用国内 PyPI 镜像源以官方 README 为准。第 4 步配置环境建议用虚拟环境把 FunASR 隔离在独立环境里避免污染全局 Pythonconda create -n funasr python3.8 conda activate funasr这一步做的事是创建一个干净、可复现的运行环境未装 conda 可直接跳过用python3 -m venv也可以。第 5 步拉取预训练模型根据你要跑的任务从 ModelScope 或 Hugging Face 下载对应 checkpoint。FunASR 首次推理时也会自动拉取所需模型手动下载只是更可控。 安装验证与故障排查先跑一个验证命令确认包能正常导入执行python3 setup.py test能跑通说明核心依赖装配无误。下面是新手最常踩的几个坑按「现象 → 可能原因 → 解决」列出坑 1pip: command not found现象执行安装命令提示找不到 pip可能原因系统只装了 pip3或 Python 版本低于 3.6 导致工具链缺失解决改用pip3或用python3 -m pip install ...形式执行必要时升级 Python坑 2macOS M1 上出现incompatible architecture (have x86_64, need arm64e)现象安装 cffi 相关扩展时报架构不兼容可能原因默认拉取了 Intel 架构的预编译包解决卸载后按 arm64 强制重编pip uninstall cffi pycparser再ARCHFLAGS-arch arm64 pip install cffi pycparser --compile --no-cache-dir坑 3装了 GPU 却提示 CUDA 不可用现象推理报错No CUDA runtime或torch.cuda.is_available()为 False可能原因安装的 PyTorch wheel 与本机 CUDA 驱动版本不匹配解决按 PyTorch 官方版本对照表重装匹配的 CUDA wheel急用时可先用devicecpu跑通流程坑 4模型下载超时或中断现象首次运行卡在模型下载可能原因网络链路不稳定解决手动从 ModelScope / Hugging Face 下载后放到本地路径指向或切换网络重试以官方 README 为准 第一次运行装好后的最小可运行入口参考 README_zh.md 中的快速开始示例from funasr import AutoModel model AutoModel(modeliic/SenseVoiceSmall, devicecpu) result model.generate(inputasr_example.wav) print(result)预期表现首次运行会自动下载 SenseVoiceSmall 模型随后输出一段结构化转写文本例如「欢迎大家来体验达摩院推出的语音识别模型」。能打印出转写结果就说明从环境到模型链路全部打通。⚙️ 版本与配置建议纯 CPU 机器优先选轻量模型如 SenseVoice 系列FunASR 在 CPU 上也能达到不错的实时倍速可先跑通再谈加速有 NVIDIA GPU安装与驱动版本匹配的 PyTorch CUDA wheel再把device参数改为cuda中国大陆网络环境pip 与模型下载建议走镜像源具体地址以官方 README 为准 延伸阅读安装文档中文安装文档英文Colab 快速体验核心源码目录跑通第一次推理之后你可以接着尝试换用 Paraformer 流式模型、接上标点与说话人分离流水线或者把服务部署成 API 端点——这些都能基于今天搭好的环境直接展开。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考