我要提问
ARTICLE DETAIL

资讯详情

前沿编程新知与开发实战干货的深度解读。

Buzz 本地音频转录工具:4 个任务从安装到批量转录

Buzz 本地音频转录工具:4 个任务从安装到批量转录 Buzz 本地音频转录工具4 个任务从安装到批量转录【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 Whisper 模型OpenAI 开源的语音转文字模型的本地音频转录工具在你的电脑上离线完成音频、视频的转录与翻译也支持麦克风实时录音。它的核心在于文件不离开本机不注册账号、不上传云端适合需要把会议录音、讲座、播客转成文字、又在意隐私的人。全文按四个递进任务展开任务一装好程序任务二拿到第一份转录结果任务三调准模型与语言任务四处理批量文件和常见卡点。任务一安装 Buzz官方提供四条路线macOS 的 .dmg、Windows 安装程序、Linux 的 FlatpakLinux 上的应用打包格式或 Snap以及 PyPI 源码安装。第一次使用按你的环境选一条即可。1. 选择安装路线macOS 和 Windows 用户从项目发布页下载 .dmg 或安装程序Windows 安装程序未签名出现安全警告时选择“仍然运行”。Linux 用户用 Flatpak 一条命令装完flatpak install flathub io.github.chidiwilliams.BuzzPyPI 路线需要先有 Python 3.12 和 ffmpeg开源音视频编解码器Buzz 靠它解码音频pip install buzz-captions python -m buzz2. 验证首次启动命令执行后主窗口打开是一张任务队列表。第一次转录时程序会按需下载模型并缓存所以首跑偏慢属正常后续转录直接复用本地模型。模型体积见任务三的表格。任务二转录第一个音频文件手里有了能跑的 Buzz接下来把一个音频文件变成文字。1. 导入音频文件打开 File 菜单选择“Import Media File”或按 CtrlOmacOS 为 CmdO也可以点工具栏的加号图标选入文件。它能打开的常见格式有MP3 WAV M4A FLAC OGG Opus MP4 MOV MKV AVI WebM解码交给底层 ffmpeg凡是 ffmpeg 能播放的文件 Buzz 就能导入YouTube 链接也能直接粘进来当任务处理。2. 选任务、语言和模型任务列里Transcribe 是输出原文语言Translate 是翻译成英文。语言建议明确指定而不是自动检测因为自动检测只看前几秒音频容易判错Buzz 目前覆盖 99 种语言。第一次用Tiny 模型足够点 Run 开始。所有推理都在本机进行音频不出设备断网也能转录不按分钟或调用次数计费。3. 打开转录结果状态变为 Completed 后双击该行进入结果视图每行有开始、结束时间戳和文本底部是播放器点任意一行就跳到对应位置。顶部菜单提供 Export、Translate、Resize字幕分段调整导出支持 TXT、SRT、VTT其中 SRT 和 VTT 是两种常见字幕格式默认导出 TXT。4. 边说边转可选还没有文件时也可以直接录点工具栏麦克风图标选好语言、模型和麦克风按 Record文字实时出。官方文档建议实时场景用 Whisper.cppWhisper 的 C 实现后端配小模型演讲时还能打开演示窗口把字幕投出去。任务三选模型选语言调准转录精度任务二跑通了流程这一步解决输出更准、更快的问题。1. 按场景匹配模型体积Whisper 各模型的下载体积首次转录按需下载如下模型下载体积适合Tiny约 73 MB快速验证Base约 139 MB日常会议Small约 462 MB速度与精度均衡Medium约 1.5 GB重要内容Large约 2.9 GB精度要求最高Large-V3-Turbo约 1.6 GBGPU 上更快带 .en 后缀的模型如 small.en只处理英文音频。转录速度取决于本机配置同一台机器上模型越大越慢。2. 选后端Buzz 有四个本地后端Whisper基于 PyTorch 深度学习框架NVIDIA 显卡可用 CUDA 加速、Whisper.cppVulkan 跨厂商图形接口加速多数独立核显都支持、Faster Whisper、Hugging Face模型托管平台。默认用 Whisper实时录音用 Whisper.cppPyPI 用户想开 GPU 加速需要另装 CUDA 版 PyTorch。后端代码都在 buzz/transcriber/ 目录一个后端一个文件读起来不费劲。3. 调语言与提示词音频里人名、术语多时在 Advanced 里把词填进 Initial prompt模型更倾向按你给的拼法输出减少专名错误。中英混合内容一般指定英文语言比自动检测效果好语言频繁切换的内容再考虑自动检测。4. 定制导出命名Preferences 的 General 页可以改导出目录和文件名模板占位符有 {{input_file_name}}、{{task}}、{{date_time}}、{{language}}批量导出的文件不会重名或含义不清。任务四批量处理与排障单文件没问题之后最后要处理一堆文件和偶尔的卡壳。1. 批量处理两条路。一是在导入对话框里一次选中多个文件它们进队列依次执行主界面表格对每一行显示 Queued、In Progress、Completed 状态。二是 Preferences 的 Folder Watch 页设一个监控目录新音频放进去自动进队列适合持续归档。2. 命令行脚本化同样的核心也暴露了 CLIbuzz add 接收文件与参数--srt、--txt 控制导出格式--hide-gui 可隐藏窗口跑无头任务buzz add --model-type whispercpp --model-size small --srt --txt interview.mp4把它写进脚本就是一条批处理本地转录流水线。3. 常见卡点太慢换小模型或改用 Whisper.cpp 后端并开 GPU 加速词级时间戳默认关闭需要时再开。文件导不进来先确认 ffmpeg 是否装好PyPI 路线必须再确认文件本身没损坏。内存紧张模型体积与内存占用基本成正比低配机器用 Tiny。实时录音有延迟换小模型、用 Whisper.cpp 后端、麦克风离嘴近一些。下一步建议想系统阅读从 docs/ 目录入手安装、文件导入、实时录音等使用文档都在那里想看懂转录如何执行逐个读 buzz/transcriber/ 里的后端实现主窗口和结果视图的界面代码在 buzz/widgets/ 目录。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表