尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
voxtral.c 输入模式全解:WAV 文件、ffmpeg 管道与麦克风 3 种用法完整清单
【免费下载链接】voxtral.cPure C inference of Mistral Voxtral Realtime 4B speech to text model项目地址https://gitcode.com/gh_mirrors/vo/voxtral.c点击查看免费下载voxtral.c是 MistralVoxtral Realtime 4B 语音转文字speech to text模型的纯 C 推理实现零外部依赖支持三种音频输入模式WAV 文件-i、ffmpeg 管道--stdin和麦克风实时采集--from-mic。本文用一张清单帮你快速搞懂每种模式怎么用、怎么选。输入模式命令行开关适用场景平台WAV 文件-i 文件.wav离线批量转写全平台stdin 管道--stdinMP3/OGG 等任意格式转码转写全平台麦克风--from-mic实时会议、口述转写仅 macOS三种方式互斥只能选其一参数解析见 main.c。快速上手3 步跑通语音转文字# 1. 获取代码 git clone https://gitcode.com/gh_mirrors/vo/voxtral.c cd voxtral.c # 2. 构建Apple Silicon 用 mpsIntel Mac/Linux 用 blas make mps # 或 make blas # 3. 下载模型约 8.9GB ./download_model.sh 完成后即可开始转写任意音频。模型权重以 mmap 方式加载几乎是瞬时的。模式一WAV 文件转录-i——最简单的离线用法./voxtral -d voxtral-model -i samples/test_speech.wav这是新手最友好的入口。要点只认 16-bit PCM 的 WAV但采样率不限——加载器 vox_load_wav() 会自动重采样到 16kHz立体声会自动混成单声道无需手动处理转写 token 逐词流式打印到 stdout计时信息默认输出到 stderr。常用调试开关./voxtral -d voxtral-model -i audio.wav --silent # 关闭 stderr 状态输出 ./voxtral -d voxtral-model -i audio.wav --debug # 逐层/逐块详细日志 ./voxtral -d voxtral-model -i audio.wav --alt 0.9 # 显示模型的备选 token 手里只有 OGG/MP3先用 ffmpeg 转一下即可ffmpeg -i input.ogg output.wav。项目自带两个示例samples/test_speech.wav 和 samples/jfk.wav可直接拿来验证安装是否成功。模式二ffmpeg 管道输入--stdin——通吃任意音频格式--stdin从标准输入读音频格式自动识别开头是 RIFF 头就按 WAV 解析否则按raw s16le 16kHz 单声道处理详见 main.c。配合 ffmpeg 可以边转码边转写这是整个项目最有威力的一点# 转写 MP3任何格式同理只要 ffmpeg 能解码 ffmpeg -i podcast.mp3 -f s16le -ar 16000 -ac 1 - 2/dev/null | \ ./voxtral -d voxtral-model --stdin # 直接管道 WAV自动识别 RIFF 头 cat recording.wav | ./voxtral -d voxtral-model --stdin试试仓库自带的 3 分钟经典演讲 samples/I_have_a_dream.oggffmpeg -i samples/I_have_a_dream.ogg -f s16le -ar 16000 -ac 1 - 2/dev/null | \ ./voxtral -d voxtral-model --stdin⚡ 进阶玩法——网络电台直播转写curl -sL http://stream.live.vc.bbcmedia.co.uk/bbc_world_service | \ ffmpeg -i pipe:0 -ar 16000 -ac 1 -f wav pipe:1 2/dev/null | \ ./voxtral -d voxtral-model --stdin注意通过 stdin 送 WAV 时必须严格是 16kHz 单声道 16-bit PCM否则会报WAV stdin streaming requires 16kHz mono——所以让 ffmpeg 统一转格式是最稳妥的做法。模式三麦克风实时转录--from-mic——macOS 专属./voxtral -d voxtral-model --from-mic # 默认 2 秒处理间隔 ./voxtral -d voxtral-model --from-mic -I 1.0 # 降低延迟 ./voxtral -d voxtral-model --from-mic --silent基于 macOS AudioQueue 服务实现源码见 voxtral_mic_macos.c。两个实用特性自动静音检测按 10ms 窗口计算 RMS 能量持续静音段会被跳过仅 600ms 内的短停顿保留保证词间自然只转写真正的人声节省大量 GPU 开销逻辑见 main.c追不上时自动跳过音频模型落后于实时会打印警告并丢弃缓冲避免延迟越滚越大按CtrlC干净退出。 想要实时字幕机体验加-I 1.0让文字更快跟上手速。关键参数 -I延迟与效率的权衡完整参考值-I 秒控制编码器处理累积音频的间隔是流式输入的核心参数取值效果适用场景0.5低延迟、响应快GPU 开销大实时字幕、口述1.0~2.0默认 2.0均衡实时流推荐的区间5.0高吞吐、批量合并编码离线管道、长音频官方基准60 秒音频用默认批量模式编码约 2.9 秒而-I 0.1要 15.8 秒慢 5.4 倍——每次编码器调用都有约 50ms 固定开销。离线文件转写时该参数无所谓因为音频一次性全部可用。辅助开关速查--monitor 让引擎状态看得见开关作用--silent只输出转写文本无 stderr 状态--debug逐层、逐块详细日志--alt 0.0-1.0模型不确定时内联显示备选词如[V\|Vo]ox[T\|tral]roll--monitor用 Unicode 符号实时显示引擎状态▶编码器处理、▪解码一批 token、✂/♻重启事件健康流式输出的样子是▶·▪▪▶▪▪▶▪▪若频繁出现▸、☠说明解码压力大。完整符号表见 README.md。三种输入方式怎么选已有 WAV 文件→-i最省事MP3/OGG/视频音轨/网络流→--stdin ffmpeg格式随便来️现场说话→--from-micmacOS带静音裁剪的实时转写。进阶C 流式 API 一行了解不想跑命令行voxtral.h 提供vox_stream_t流式 APIvox_stream_feed()喂入音频样本vox_stream_get()取回已生成的 token 字符串vox_stream_flush()可在说话停顿处强制吐出待转写文本而不结束流。离线、实时场景共用同一套接口一次封装即可集成进你自己的应用。写在最后voxtral.c 把音频进来、文字出去做成了三条清晰的路径文件、管道、麦克风。记住make→download_model.sh→ 三选一开关加上-I调延迟这套纯 C 语音转文字引擎就能在你的机器上跑起来——没有 Python 运行时没有 CUDA 工具链开箱即用。赞分享【免费下载链接】voxtral.cPure C inference of Mistral Voxtral Realtime 4B speech to text model项目地址https://gitcode.com/gh_mirrors/vo/voxtral.c点击查看免费下载相关推荐3行代码实现麦克风录音Unity麦克风输入全攻略3行代码实现麦克风录音Unity麦克风输入全攻略 你是否还在为Unity项目中的麦克风录音功能头疼遇到权限申请复杂、录音数据处理困难、跨平台兼容性问题本文游戏开发图形学PaddleSpeech 流式 ASR 服务客户端实战从 WAV 文件模拟到麦克风实时识别PaddleSpeech 流式 ASR 服务客户端实战从 WAV 文件模拟到麦克风实时识别 在 PaddleSpeech 的服务化部署体系中流式strea人工智能语音音频NLP媒体生成Awesome Public Datasets3步拿到免费公开数据集的电商数据分析实战指南Awesome Public Datasets3步拿到免费公开数据集的电商数据分析实战指南 想做电商分析找了半天数据要么收费、要么链接失效Awesome文档知识库数据集创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

FireRedTTS3音色设计(Voice Design)完全教程:一句话描述生成全新声音,无需参考音频

FireRedTTS3音色设计(Voice Design)完全教程:一句话描述生成全新声音,无需参考音频

【免费下载链接】FireRedTTS3 FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing 项目地址: https://gitcode.com/gh_mirrors/fi/FireRedTTS3 点击查看 免费下载 FireRedTTS3 是一款开源的多语…

📅 2026/10/11 17:21:47
YOLO目标检测实战:变压器漏油数据集VOC转YOLO与训练全流程

YOLO目标检测实战:变压器漏油数据集VOC转YOLO与训练全流程

简介:这份资源面向电力设备智能运维、工业视觉检测方向的研究者与算法工程师,提供了一套用于变压器漏油目标检测的标注数据集,可直接投入YOLO等检测模型的训练与验证。压缩包共676个文件,由338张jpg现场图片与338个xml标注文件一一…

📅 2026/10/11 17:16:47
PyQt5三维曲面图实战:从环境配置到交互式可视化

PyQt5三维曲面图实战:从环境配置到交互式可视化

简介:一套基于Python与PyQt5实现三维曲面图绘制的完整项目源码,面向具备Python基础、希望将GUI开发与三维科学可视化结合的开发者,适合快速搭建三维数据展示桌面工具。压缩包共36个文件,以4个Python脚本(入口与主逻辑&…

📅 2026/10/11 17:16:47
MORE NEWS

更多资讯

📰

自动侧推定位机构中的接近开关:让工件靠边更准确

自动侧推定位机构常用于装配前校正、检测前靠边、输送线转位和小型工件姿态调整。工件从输送线进入定位区后,通常需要由侧推板或气缸将其推向基准面。如果侧推距离不足,工件可能没有真正贴紧定位边;如果回位不完整,又会影响下一个…

📰

排序算法选择排序全解析:逻辑、稳定性、复杂度与工程取舍

讲个真实场景:我见过不少刚接触算法的同事,写出来的第一个排序代码,其实都是选择排序。倒不是因为他们背过这个算法,而是因为人天生就喜欢"从一堆东西里挑最小的,放到最前面"——这个动作太符合直觉了。但选…

📰

快照时间线分析:用历史快照还原目标网站的演变

快照时间线分析:用历史快照还原目标网站的演变 【免费下载链接】Legendary_OSINT A list of OSINT tools & resources for (fraud-)investigators, CTI-analysts, KYC, AML and more. 项目地址: https://gitcode.com/GitHub_Trending/le/Legendary_OSINT …

📰

一个软件工程大一新生的C语言学习感悟

我的C语言学习之路作为一名软件工程的大一新生,在这个暑假里开始学习C语言,我想分享一下我的感受。我之前接触计算机很少,但也会一点基本的操作。在得知我是软件工程专业时,我便询问了豆包关于这个专业相关的内容,于是…

📰

AI-For-Beginners 实战指南:基于 Hugging Face Transformers 的实验、文本生成与 Notebook 整理

教程人工智能机器学习深度学习 【免费下载链接】AI-For-Beginners 12 Weeks, 24 Lessons, AI for All! 项目地址: https://gitcode.com/GitHub_Trending/ai/AI-For-Beginners 点击查看 免费下载 本指南围绕课程《AI-For-Beginners》第 18 课的课后任务(…

📰

Spring Boot+Vue前后端分离旅游订票系统实战:从库存防超卖到订单状态机

上个季度我完整做了一个“旅游线路展示 在线订票”的前后端分离项目:Spring Boot 做后端接口,Vue 做前端页面,整个系统包含线路浏览、景点详情、日期团期选择、订单提交、支付状态回跳、后台线路维护这些核心环节。项目不大,但业…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬