
【免费下载链接】voxtral.cPure C inference of Mistral Voxtral Realtime 4B speech to text model项目地址https://gitcode.com/gh_mirrors/vo/voxtral.c点击查看免费下载voxtral.c是一个零依赖的纯 C 推理引擎可本地运行 Mistral 的 Voxtral Realtime 4B 语音识别模型speech-to-text。无需 Python 运行时、无需 CUDA 工具链通过几行 C API 调用你既可以做离线文件转写也能做低延迟的实时流式语音识别支持 Apple Silicon Metal GPU 加速。为什么选择 voxtral.c 语音识别引擎 特性说明零依赖纯 C 标准库无第三方框架可直接嵌入任意 C/C 项目Metal GPU 加速Apple Silicon 上自动使用 MPS 后端转录速度约 2.5 倍于实时流式 C APIvox_stream_t支持增量喂入音频、逐 token 取回文本内存友好BF16 权重以 mmap 方式映射加载近乎瞬时滚动 KV 缓存支持无限长音频多语言支持中、英、日、韩、法、德、西、葡等 13 种语言下面这个动图展示了它在终端中的流式转录效果音频经 ffmpeg 管道送入文字边听边出第一步下载模型并编译项目先获取项目源码并下载约 8.9GB 的模型权重git clone https://gitcode.com/gh_mirrors/vo/voxtral.c cd voxtral.c ./download_model.sh # 下载到 ./voxtral-model/然后按硬件选择后端编译参考 Makefilemake mps # Apple Silicon Metal GPU最快macOS 专用 make blas # Intel Mac / Linux OpenBLASLinux 上使用前先安装 OpenBLAS如sudo apt install libopenblas-dev。模型目录 voxtral-model/ 中会包含consolidated.safetensors、tekken.json分词器词表和params.json配置。第二步看懂核心 C API整个 API 定义在 voxtral.h实现位于 voxtral.c。构建应用只需认识下面这张接口表函数作用vox_load(model_dir)加载模型返回vox_ctx_t*上下文vox_free(ctx)释放模型资源vox_stream_init(ctx)创建流式识别会话vox_stream_t*vox_stream_feed(s, samples, n)喂入音频mono float3216kHz取值 [-1,1]内部自动跑 mel 频谱、编码器与解码器vox_stream_get(s, tokens, max)取回待输出的 token 字符串返回 0 表示取空vox_stream_flush(s)立即处理缓冲区中的音频流保持开启适合静音检测vox_stream_finish(s)标记音频结束处理剩余数据vox_stream_free(s)释放流式会话vox_transcribe(ctx, path)一行搞定转写 WAV 文件返回分配的字符串音频格式要求很简单单声道 float32、16kHz、[-1, 1]。如果你手头是 WAV 文件直接用 voxtral_audio.h 里的vox_load_wav()即可自动完成重采样与声道混合内存中的 WAV 字节流则可用vox_parse_wav_buffer()解析。第三步离线文件转写5 步完成最简单的场景读入 WAV、喂入音频、收集文本。#include voxtral.h #include voxtral_audio.h vox_ctx_t *ctx vox_load(voxtral-model); if (!ctx) return 1; int n_samples; float *samples vox_load_wav(audio.wav, n_samples); vox_stream_t *s vox_stream_init(ctx); vox_stream_feed(s, samples, n_samples); /* 喂入全部音频 */ vox_stream_finish(s); /* 标记结束冲刷尾部 */ const char *tokens[64]; int n; while ((n vox_stream_get(s, tokens, 64)) 0) for (int i 0; i n; i) printf(%s, tokens[i]); printf(\n); vox_stream_free(s); free(samples); vox_free(ctx); 如果完全不需要流式控制一行char *text vox_transcribe(ctx, audio.wav);就能拿到完整文本记得free(text)。第四步实时流式语音识别实时场景麦克风、网络流的关键模式是边喂音频、边取文本。vox_stream_t *s vox_stream_init(ctx); vox_stream_set_continuous(s, 1); /* 连续模式EOS/KV 溢出时自动重启 */ while (have_more_audio()) { float chunk[4096]; int n_read read_audio(chunk, 4096); /* 你的音频采集代码 */ vox_stream_feed(s, chunk, n_read); const char *tokens[16]; int n; while ((n vox_stream_get(s, tokens, 16)) 0) { for (int i 0; i n; i) fputs(tokens[i], stdout); fflush(stdout); } } vox_stream_finish(s); while ((n vox_stream_get(s, tokens, 16)) 0) for (int i 0; i n; i) fputs(tokens[i], stdout); vox_stream_free(s);两个实时场景的要点vox_stream_set_continuous(s, 1)开启后解码器在序列结束EOS、KV 缓存溢出或长时间输出非文本 token 时会自动重启。有限文件不需要无限长的直播/麦克风流必须开启否则 KV 缓存会无限增长。vox_stream_flush(s)检测到说话人停顿时调用立即吐出缓冲的转录文本而不用结束流。这是做静音断句的推荐姿势。第五步调优延迟与置信度 ⚡控制延迟/效率的权衡—— 用vox_set_processing_interval(s, seconds)设定编码器最小处理间隔对应 CLI 的-I参数默认 2.0 秒vox_set_processing_interval(s, 1.0); /* 更响应GPU 开销更高 */ vox_set_processing_interval(s, 3.0); /* 更省 GPU出字更慢 */实测建议实时流式用1.0–2.0 秒低于 0.5 秒会让大量 GPU 时间耗在每次调用的固定开销上。离线文件转写则无所谓。获取候选 token模型不确定时vox_stream_set_alt(s, 3, 0.5); /* 最多 3 个候选cutoff 0.5 */ const char *tokens[16 * 3]; while ((n vox_stream_get_alt(s, tokens, 16, 3)) 0) for (int i 0; i n; i) { printf(%s, tokens[i * 3]); /* 最佳 token */ for (int a 1; a 3 tokens[i * 3 a]; a) printf( [alt: %s], tokens[i * 3 a]); }调整转录延迟vox_set_delay(ctx, delay_ms)80–2400ms默认 480ms控制解码器相对音频的时间偏移数值越小出字越即时。常见问题与注意事项 ⚠️指针有效期vox_stream_get()返回的字符串指针有效直到vox_stream_free()需要保存请在之前复制。首段音频约需 3 秒解码器 prompt 需要 312 帧 mel约 3 秒音频才开始出字属正常现象。内存占用权重 8.9GBmmap 按需读取MPS 后端 GPU 权重缓存约 8.4GB解码器 KV 缓存上限约 1.8GB。音频必须 16kHz 单声道其他采样率请先用 ffmpeg 转换-ar 16000 -ac 1或用vox_load_wav自动重采样。一个 ctx 对应一个流vox_stream_init会重置编码器 KV 缓存多线程/多路音频请为每路创建独立上下文并做同步。关键文件速查voxtral.h全部公开 API 与模型常量定义voxtral.c流式管线、上下文管理核心实现voxtral_audio.hWAV 加载与 mel 频谱含增量 mel供流式使用voxtral_encoder.c / voxtral_decoder.c编码器32 层与 LLM 解码器26 层voxtral_mic_macos.cmacOS 麦克风采集示例main.cCLI 入口内含麦克风实时转写与 stdin 管道的完整参考用法MODEL.md模型架构与权重格式详解掌握以上 5 步你就可以把 Voxtral Realtime 4B 语音识别能力像普通 C 库一样嵌入自己的应用了 赞分享【免费下载链接】voxtral.cPure C inference of Mistral Voxtral Realtime 4B speech to text model项目地址https://gitcode.com/gh_mirrors/vo/voxtral.c点击查看免费下载相关推荐LoopmacOS 窗口管理工具一个触发键搞定分屏布局LoopmacOS 窗口管理工具一个触发键搞定分屏布局 Loop 是一款免费开源的 macOS 窗口管理工具。按住触发键再移动鼠标就能通过径向菜单把当前窗桌面应用40个免费练手项目面向求职的作品集完整挑选指南40个免费练手项目面向求职的作品集完整挑选指南 选练手项目多数人顺序反了先闷头写一个再硬塞进作品集面试被追问时讲不出重点。这份指南基于开源仓库 Git文档教程如何构建Vosk-api语音识别计费系统完整用量统计指南如何构建Vosk api语音识别计费系统完整用量统计指南 Vosk api是一款强大的开源离线语音识别工具包支持20多种语言和方言适用于多种编程语言可用人工智能语音创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考