← 返回笔记列表
第5期 · 开源项目

微软 VibeVoice|5万星 语音识别+长文本TTS 全家桶

开源项目语音第5期
#open-source#asr#tts#voice

微软 5 万星语音全家桶:一次吃 60 分钟长音频出结构化纪要,含 ASR / 长文本 TTS / Realtime 三件套,BitNet 版纯 CPU 可跑。

官方地址官网
开源协议MIT
价格开源免费
部署方式BitNet 版纯 CPU 可跑(轻薄本本地离线)
收录2026-08-25

Github 超 5 万星!微软开源转录神器 VibeVoice,如果你还在用 Whisper 做会议转写,值得试试这个语音全家桶。

核心竞争力

  • 长音频一次识别:VibeVoice-ASR 可以一次性吃下 60 分钟不间断音频,一口气完成转写、说话人区分、打上时间戳,直接输出『谁、几点、说了什么』的整套结构化纪要,不用二次拆分处理。传统方案长音频要切成一段一段,经常出现说话人错乱、上下文丢失。
  • 自定义热词库:把行业术语、人名、项目名称提前导入,识别准确率直接拉高一大截。
  • 低成本运行:新版 BitNet 版本纯 CPU 就可以跑,轻薄本不用显卡也能本地离线转写会议录音,数据完全不出电脑。

不只是语音转文字,是一整套语音方案

  1. ASR 语音识别:一小时长音频会议转录、区分发言人。
  2. 长文本 TTS:一次性生成最长 90 分钟音频,支持最多 4 个人对话音色互不串音,适合播客录制。
  3. Realtime 实时流式语音:0.5B 轻量模型,首段语音延迟 300 毫秒,AI Agent 边输出文字边发声,真正做到边想边说。

开源现状

  • MIT 协议完全开源免费,GitHub 仓库地址:microsoft/VibeVoice。
  • 做会议纪要、播客、AI 智能体语音交互,这个底座非常值得二次开发。
风险提示:语音克隆请征得当事人授权,禁止伪造音频。
📝 我的点评
继 MOSS-TTS 之后又一个语音工具,但 VibeVoice 更『狠』:5 万星、微软出品、一整套 ASR+TTS+Realtime。最大卖点是 60 分钟长音频一次转写还出结构化纪要(谁几点说了什么),直接戳中会议纪要这个高频痛点——Whisper 被迫切片的痛苦,它用『长上下文』解决了。BitNet 纯 CPU 可跑 + 数据不出电脑,对隐私敏感企业友好。Realtime 0.5B 300ms 延迟,是 AI Agent 语音交互的好底子。做产业带培训记录、客户沟通复盘、本地话术配音都能落。