最后更新:10/1/2026最后核验:2026-07-20
transcribe.cpp 是什么
transcribe.cpp 是一个基于 ggml 构建的跨平台本地 speech-to-text 推理库,适合希望在本机运行自动语音识别模型的开发者。相比完全依赖云端转录 API,它更强调本地部署、离线转写和可控的推理环境。该工具支持 16+ 个 ASR 模型系列、60+ 个模型变体、流式转写、批量转录,并提供 Metal、Vulkan、CUDA、TinyBLAS 等硬件加速选项。
核心功能
- 支持运行 16+ 个自动语音识别 ASR 模型系列和 60+ 个模型变体
- 同时支持实时流式转写和批量音频转录工作流
- 基于 ggml 进行本地推理,适合端侧 speech-to-text 语音识别处理
- 提供 Metal、Vulkan、CUDA 和 TinyBLAS 等多种硬件加速后端
- 支持经过数值验证和 WER 测试的 GGUF 模型构建
- 跨平台设计,便于将语音识别能力集成到本地应用中
最适合
正在开发本地语音转文字应用的开发者需要测试多个 ASR 模型系列和 GGUF 模型变体的团队希望实现流式转写、但不想完全依赖云端 API 的项目用于本地音频处理的批量转录流水线需要可配置推理后端的 AI 编程、音频处理和语音识别项目
定价
transcribe.cpp 目前标注为免费定价模式。用户仍应查看项目官网或代码仓库,确认最新许可证条款、模型可用性、安装配置要求,以及第三方依赖相关事项。
优缺点
优点
- 支持较丰富的 ASR 模型系列和模型变体
- 可以在本地运行语音转文字推理,便于控制数据和部署环境
- 同时提供流式转写和批量转录支持
- 针对不同硬件环境提供多种加速后端选择
- 使用据称经过数值验证和 WER 测试的 GGUF 模型构建
缺点
- 安装、配置和集成通常需要一定开发经验
- 并非面向普通用户的一站式云端转录服务或 no-code 网页应用
- 性能和识别准确率会受所选模型、硬件配置和音频质量影响
- 用户可能需要自行管理本地模型、依赖项和计算资源
替代工具
whisper.cpp
OpenAI Whisper 模型的热门本地推理实现,适合希望在设备端进行语音转文字的开发者。
OpenAI Whisper API
适合偏好 API 调用、而不想自行维护本地推理基础设施的云端 speech-to-text 方案。
Deepgram
云端语音识别平台,提供面向实时转写和批量转录场景的 API。
AssemblyAI
AI 音频 API 平台,通过托管端点提供语音转文字和音频智能分析能力。
Vosk
离线语音识别工具包,支持本地转写,并可嵌入到应用程序中。
常见问题
广告
详情
平台
macOSWindowsLinux
功能特性
- Run 16+ ASR model families and 60+ model variants
- Support both streaming and batch transcription
- Accelerate inference with Metal, Vulkan, CUDA, or TinyBLAS
- Use numerically verified, WER-tested GGUF model builds locally
支持语言
enzhmulti
已知限制
- It is a C/C++ library rather than a hosted transcription app, so integration and UI work remain with the developer
- Local builds require a platform toolchain and optional GPU dependencies such as Vulkan SDK or CUDA
- Model files are downloaded separately and audio may need conversion to 16 kHz mono WAV for the CLI path
- Supported model features vary by family, so it is not a universal drop-in replacement for every whisper.cpp flag







