Faster-Whisper 快速安装指南:从环境确认到第一次语音转录

发布时间:2026/9/5 22:24:00
Faster-Whisper 快速安装指南:从环境确认到第一次语音转录 Faster-Whisper 快速安装指南从环境确认到第一次语音转录【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperFaster-Whisper 是基于 CTranslate2 引擎的 OpenAI Whisper 语音转文本speech-to-text重实现精度相同而速度最高快约 4 倍、内存占用更低。本指南带你完成 CPU/GPU 路线选择、依赖安装并跑通第一次音频转录。快速判断这个工具适合你吗如果你需要在本机离线转录音频会议录音、播客、访谈又不想依赖在线 APIFaster-Whisper 是一个合适的选择。它支持从 tiny 到 large-v3/turbo 的多种 Whisper 模型规模可在 CPU 上直接运行有 NVIDIA GPU 时可获得数量级的速度提升。典型的适用任务包括批量字幕生成、带时间戳的转写输出、作为语音应用的后端引擎。 图片占位建议在此处摘要之后放一张 GPU 环境检查截图alt 文本“Faster-Whisper GPU 环境检查确认 CUDA 12 与 cuDNN 9 版本”覆盖关键词“Faster-Whisper GPU 环境检查”“CUDA 12”。仓库中暂无现成图片可后续补拍。选择运行路线CPU、GPU 还是 Docker先确认你的硬件再决定安装哪一套依赖。三条路线对比如下路线硬件条件额外依赖推荐模型 / 精度适合场景CPU多核 CPU8 核以上体验更好跑 large 级模型建议 16GB 内存仅 Python 3.9无需安装 FFmpeg音频解码由 PyAV 内置完成small / baseint8量化快速验证、无 GPU 的机器、短音频GPUNVIDIANVIDIA 显卡CUDA 12 cuBLAS cuDNN 9Python 3.9 及上述 NVIDIA 库large-v3 / turbofloat16或int8_float16大批量、长音频、追求实时率Docker同 GPU可选纯 CPU 容器官方 CUDA 镜像已内置 cuBLAS/cuDNN见 docker/同 GPU不想手动配置系统库时两条容易踩坑的事实先说清楚不需要装 FFmpeg。早期 Whisper 依赖系统 FFmpegFaster-Whisper 用 Python 库 PyAV 解码安装包自带。最新版的 CTranslate2 只支持 CUDA 12 cuDNN 9。你的环境如果是 CUDA 11/cuDNN 8 或 CUDA 12/cuDNN 8需要把 CTranslate2 固定到旧版本详见 README.md 的 GPU 一节。安装主线准备、安装、验证第一步准备 Python 环境用 3.9 及以上的 Python 建一个独立虚拟环境避免污染系统包python3 -m venv fw-env source fw-env/bin/activate python -m pip install -U pip成功信号python --version显示 3.9且提示符前出现环境名。第二步安装 faster-whisper常规安装Python 3.9 已就绪后执行pip install faster-whisper如果你想用开发版而不是 PyPI 稳定版也可以克隆仓库后本地安装git clone https://gitcode.com/GitHub_Trending/fa/faster-whisper pip install ./faster-whisperGPU 路线Linux额外需要安装 NVIDIA 运行库安装后在启动 Python之前设置库路径pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.* export LD_LIBRARY_PATH$(python3 -c import os,nvidia.cublas.lib as c,nvidia.cudnn.lib as d;print(os.path.dirname(c.__file__) : os.path.dirname(d.__file__)))提示Windows 用户可以从 NVIDIA 官方渠道获取 cuBLAS/cuDNN或将 dll 放入PATH目录用 Docker 则跳过此步。第三步验证导入python -c import faster_whisper; print(faster_whisper.__version__)成功信号打印出版本号无 ImportError。如果报缺少 cuBLAS/cuDNN 的链接错误说明 GPU 路线的库没装好或LD_LIBRARY_PATH未生效回到上一步检查。首次运行跑通一次最短转录准备一段 1~2 分钟的音频文件MP3/WAV/FLAC/OGG 均可。仓库自带的测试音频 tests/data/jfk.flac 也可以直接用克隆过仓库的话。新建first_run.pyfrom faster_whisper import WhisperModel model WhisperModel(tiny, devicecpu, compute_typeint8) segments, info model.transcribe(short_audio.mp3) print(f语言: {info.language}, 置信度: {info.language_probability:.2f}) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})运行前要知道两件事首次运行会自动从 Hugging Face Hub 下载 tiny 模型几十 MB 量级之后走本地缓存断网也能跑。segments是生成器只有遍历它时转录才真正开始执行。所以代码里必须有for循环或list(segments)否则脚本会“没有任何输出”地结束——这是新手最常见的困惑不是安装失败。成功信号控制台先打印检测到的语言再逐行输出带时间戳的文本内容能对上你听到的音频。配置与调优按需选择参数参数不少但新手阶段只碰下面这些就够用了你的目标做法预期效果GPU 显存不够建模型时compute_typeint8_float16GPU或int8CPU官方基准中 large-v2 显存从约 4.5GB 降到约 2.9GB精度基本不变大批量音频提速用BatchedInferencePipeline包装模型传batch_size8~16基准中 13 分钟音频从 1 分钟出头降到约 17 秒large-v2、batch8长音频跳过静音段transcribe(..., vad_filterTrue)批处理模式默认开启静音超过阈值的部分不参与解码速度明显提升平衡速度与精度调整beam_size1最快默认5更准数值越大越慢按精度需求选择输出词级时间戳transcribe(..., word_timestampsTrue)可拿到每个单词的起止时间适合字幕对齐CPU 上控制线程构造函数传cpu_threads或运行前设OMP_NUM_THREADS避免线程数与核数错配导致的降速所有模型与转录选项的完整列表直接看WhisperModel的源码文档字符串即可比外部资料更新更快。新手排障先按这三行式自查现象GPU 加载模型时报 cuBLAS/cuDNN 相关错误可能原因最新版 CTranslate2 只支持 CUDA 12 cuDNN 9你的环境是 CUDA 11 或 cuDNN 8。 处理方式升到 CUDA 12/cuDNN 9或按 README.md 的说明降级 CTranslate2CUDA 11/cuDNN 8 对应 3.24.0CUDA 12/cuDNN 8 对应 4.4.0。现象脚本跑完没有输出也不报错可能原因segments是生成器没有遍历就没有执行转录。 处理方式加for seg in segments:循环或segments list(segments)。现象首次运行卡在下载模型可能原因Hugging Face Hub 网络不畅。 处理方式确认网络或代理后重试模型已缓存后可设local_files_onlyTrue也可用download_root指定缓存目录。现象CPU 上跑大模型内存不足或极慢可能原因large 级模型在 CPU 上内存需求高16GB 起步。 处理方式改用 small/base 模型开int8量化或减少并发。现象转录出现重复、跑题的文字可能原因模型“顺着上文猜”导致的自回归漂移。 处理方式传condition_on_previous_textFalse配合指定language和必要的hotwords专有名词提示改善。下一步把结果用起来换更大的模型验证质量先确认 CPU 流程无误后把model_size换成small或 GPU 上的large-v3/turbo对比转录效果和耗时。体验批处理管线照 README.md 的 Batched Transcription 一节改造你的脚本长音频和多文件场景收益最大。需要自有模型时再学转换如果你微调过 Whisper 模型仓库提供了ct2-transformers-converter转换流程把 Transformers 格式权重转成 CTranslate2 格式后用本地路径加载即可。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考