
Buzz 语音转文字上手手册:离线转录、实时会议记录与字幕精修【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 语音转文字工具把 OpenAI Whisper 模型搬到你自己的电脑上运行,本地文件、录音、视频链接都能转成带时间戳的文本,适合做会议记录、播客字幕、采访整理的创作者和商务人员。它最大的优点是音频全程不上传、没有 API 费用,模型下载一次之后,断网也能继续转录。从零装好 Buzz 的三种路子操作步骤优先走官方安装包:Windows 和 macOS 去 SourceForge 下载对应安装包;Linux 用户用 flatpak 一行装完:flatpak install flathub io.github.chidiwilliams.Buzz用官方包省去了配环境的麻烦,首次打开就能直接进主界面。 2. 想要最新功能或者打算自己改代码,就克隆仓库:git clone https://gitcode.com/GitHub_Trending/buz/buzz仓库里带着 whisper.cpp 等子模块,准备一个 Python 3.12 环境,再按 README 配置依赖即可。 3. 嫌麻烦可以直接装 PyPI 包,前提是先装好 ffmpeg:pip install buzz-captions python -m buzz这种装法升级最方便,一条命令就能切回任意旧版本。容易踩的坑 Windows 安装包没有数字签名,弹出警告时点More info → Run anyway继续即可;走 PyPI 路线时确认 Python 是 3.12,版本不对模型库会直接报错。导入文件,拿到第一段带时间戳的文本操作步骤点主界面工具栏的图标(或按 CtrlO),在文件选择器里按住 Ctrl 多选几个音频/视频文件。一次导入多个文件可以共用同一组模型参数,不用逐个配置。在弹出的转录表单里确认三项:Task 选Transcribe(想翻译成英文就选Translate to English);Language 直接指定语种,别用自动检测——指定语种能明显减少 Whisper 识别错词;模型大小先用 base 试手。在 Export As 里勾选输出格式:只要纯文本就勾 TXT,做字幕勾 SRT 或 VTT,两种可以同时勾。点 Run,状态列变成 Completed 后双击该行,转录查看器打开,音频和带时间戳的文本左右对照,随时可以点回去听。关键参数点 Advanced 展开高级选项,在 Initial prompt 里预填容易听错的人名、产品名(比如OpenAI, Whisper),专有名词错拼率会降很多。Word-Level Timings 默认是关的;如果你后面打算重排字幕,导入时先把它勾上,转录结果里每个词都会单独成行,后续合并更自由。按速度和内存给模型做减法操作步骤打开 Edit → Preferences(或按 Ctrl,),切到 Models 标签页。模型组下拉框里优先选 Whisper.cpp——它同时支持 CPU 和 GPU 加速,是多数机器的最优默认;有 Nvidia 显卡时确认 CUDA 生效,其他显卡确认 Vulkan 生效。在模型大小列表里勾选要下载的型号,点 Download;不用的型号可以直接删掉腾空间。关键参数模型大小直接决定转录耗时和内存占用,常用五档:模型相对速度内存需求适合内容tiny最快约 1 GB长音频草稿、试听base快约 1 GB日常会议、口齿清楚的录音small中等约 2 GB播客、访谈medium慢约 5 GB正式交付的字幕large最慢约 10 GB高要求场景、翻译任务经验值:4 小时音频在中等 CPU 上,base 大约 20–40 分钟跑完,tiny 能压到 10 分钟左右;medium 以上建议留给 GPU 机器。 显存不够时,在 Whisper.cpp 里选量化版(如 q_5),精度损失很小,内存能省一半;离线机器可以提前把 .bin 模型文件拷到缓存目录,再用环境变量 BUZZ_MODEL_ROOT 指过去,启动时就不会尝试联网。配置一场会议录音的实时转录操作步骤按 CtrlR 打开录音窗口,选定麦克风和语言,点 Record。正式会议前先用同一套设置试录 2 分钟,确认电平正常、识别语种正确。点录音窗口的 Advanced settings,按机器性能选模式:Append below最省资源;机器富余再上Append and correct,它会回过头修正上一句的识别错误。调 Transcription step:建议从 5 秒起步,负载扛得住就保持,队列 Queue 持续上涨就加到 10–15 秒。这个步长决定延迟与 CPU 负载的平衡点。要投影到会场大屏,点 Presentation window,它只显示纯文本、字大无干扰,适合演讲场合。容易踩的坑⚠️ 默认 Whisper 后端做实时转录非常吃资源,务必改用 Whisper.cpp,并且从 tiny 或 base 起步。要录电脑里播放的声音(比如线上会议),装一个虚拟声卡(macOS 用 BlackHole、Windows 用 VB-Cable),把系统输出指到虚拟设备,再在 Buzz 里把它当麦克风选上,完整步骤见 docs/docs/usage/2_live_recording.md。转录之后:改字幕、认说话人、挂上插件操作步骤双击任务列表里的行进入查看器,直接点单元格改错字;播放到某一句,用 Ctrl← / Ctrl→ 微调片段开始时间,CtrlShift← / CtrlShift→ 调结束时间,改完自动保存。做字幕就点 Resize 按钮:填入单条字幕最大字数(中文建议 15–20 字、英文 40–42 字符),勾选 Split by punctuation,再把 Extend end time 设成 0.5–1 秒让字幕多停留一会儿。前提是转录时勾了 Word-Level Timings,否则只能按最大长度合并。多人对话点 Identify speakers,Buzz 会把连续句子自动归到同一说话人,你可以试听 10 秒片段,把Speaker 1改成真实姓名;勾选 Merge speaker sentences 后,同一说话人相邻的句子会并成一段。打开 Help → Plugins 管理插件:AI Summary 接 OpenAI 兼容接口自动写摘要,Export DOCX 直接出 Word 稿,Resize Transcript 自动重排字幕,DeepFilterNet 转录前去噪,Skip Already Transcribed 让重复导入的文件不再跑模型。拖拽调整执行顺序,点各插件旁的齿轮配参数。想要全自动,再打开 Preferences 的 Folder Watch:勾选 Enable folder watch,设好输入/输出目录,新文件一落进输入目录就自动转录,还可以勾 Delete processed files 转完即删原文件。关键参数导 TXT 时的段落切分由环境变量 BUZZ_PARAGRAPH_SPLIT_TIME 控制,默认 2000 毫秒,录音节奏快的场景降到 1000 更合适。输出文件名模板在 Preferences → General 里改,支持 {{ input_file_name }}、{{ model_size }}、{{ date_time }} 这些变量,归档命名一次配好,之后不用手动改名。 把Skip Already Transcribed Folder Watch AI Summary三个组合起来,就是一个无人值守的扔文件进目录→出文稿→出摘要流水线,日常整理采访素材很顺手。用命令行排队无人值守批量任务操作步骤一条 add 命令即可把任务排进队列:buzz add --task transcribe --model-type whispercpp --model-size base --srt 会议录音.mp3位置参数可以跟多个文件,等于一次性排一整批任务,跑完自动退出。 2. 常用开关:-l zh 指定语言,-p 加初始提示词防专名错听,--word-timestamps 出词级时间戳,--txt / --srt / --vtt 多选输出格式,--hide-gui 转完不弹主窗口。 3. 把这条命令接进脚本或定时任务,配合文件夹监控就是完整的批量流水线,完整参数表见 docs/docs/cli.md。⚠️ CLI 用到的模型如果没下过会自动尝试下载,断网环境请先在图形界面把模型备好;加了 --hide-gui 之后窗口被隐藏,进度只能靠输出日志确认。适用边界Buzz 的本地方案省掉了 API 成本,但 large 模型在纯 CPU 上转录长音频依然很慢,重度用户建议上 GPU 或者改用量化模型;它也不做会议决策总结(要摘要得接 AI Summary 插件),实时模式对机器性能比较敏感,低配电脑建议 tiny 起步。想再深入,可以从 buzz/plugins/ 目录里的示例插件下手,自己扩展转录流水线。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考