VoiceBox:开源 AI 语音工作室——声音克隆、听写与语音合成

一个全栈开源 AI 语音工作室,让你克隆任意声音、生成语音、并在任何应用中听写。33K star。支持 CUDA 或 Apple Silicon,完全本地运行。

  • ⭐ 5000
  • 更新于 2026-08-27
VoiceBox:开源 AI 语音工作室 #

VoiceBox 是一个全面的开源 AI 语音工作室,支持声音克隆、语音生成和听写——全部在本地运行。凭借 33,745 个 GitHub star 和活跃的开发社区,它已成为开发者、内容创作者和注重隐私用户的首选方案——无需依赖云 API 就能获得强大的语音 AI。

本文涵盖安装、声音克隆、听写模式、API 用法、硬件要求和实际应用。

TL;DR #

VoiceBox 提供完全运行在你自有硬件上的完整语音 AI 技术栈。它支持从最短 3 秒的音频克隆声音、向任何应用实时听写,以及高质量文本转语音生成。同时支持 NVIDIA CUDA 和 Apple Silicon(MLX),在保护隐私的同时适配你的硬件——语音数据永不离开你的机器。

什么是 VoiceBox? #

VoiceBox 是一个自托管语音 AI 平台,把多种前沿技术整合进一个统一界面。与需要把音频上传到云端的商业语音服务不同,VoiceBox 在本地处理一切,让你对语音数据拥有完全控制权。

平台支持三种主要运行模式:

  • 声音克隆:录制或上传一段短音频样本,创建能以此声音生成语音的数字声音模型
  • 听写:使用麦克风向系统上任何应用听写文本,实时转录
  • 文本转语音:用克隆的声音或内置声音模型从文本生成自然语音

基于 Qwen3-TTS、Whisper 和多种声音克隆架构等现代开源模型构建,VoiceBox 以零成本提供企业级语音 AI 能力。

在 DigitalOcean 上部署 VoiceBox

安装指南 #

前置条件 #

VoiceBox 支持多种硬件配置:

GPU 加速(推荐):

  • NVIDIA GPU,8GB+ 显存(RTX 3060 或更好)
  • 已安装 CUDA 12.x 工具包
  • 16GB 系统内存
  • Linux(Ubuntu 22.04+)或 Windows 11

Apple Silicon:

  • M1/M2/M3 芯片,16GB+ 统一内存
  • macOS 14+(Sonoma 或更新)
  • 已安装 MLX 框架

仅 CPU(较慢但可用):

  • 16GB+ 系统内存
  • 8+ CPU 核心
  • 任意现代操作系统

方案 1:Pip 快速安装 #

# 从 PyPI 安装 VoiceBox
pip install voicebox-ai

# 验证安装
voicebox --version

# 初始化应用
voicebox init --model qwen3-tts

方案 2:从源码安装(最新功能) #

# 克隆仓库
git clone https://github.com/jamiepine/voicebox.git
cd voicebox

# 创建虚拟环境
python -m venv .venv
source .venv/bin/activate

# 安装依赖
pip install -r requirements.txt

# 以开发模式安装
pip install -e .

# 下载默认声音模型
voicebox download-models --all

方案 3:Docker 部署 #

# 拉取官方镜像
docker pull jamiepine/voicebox:latest

# 带 GPU 支持运行(NVIDIA)
docker run -d \
  --name voicebox \
  --gpus all \
  -p 8000:8000 \
  -v ${HOME}/voicebox-data:/data \
  -e VOICEBOX_MODEL=qwen3-tts \
  jamiepine/voicebox:latest

# 在 Apple Silicon 上运行(无需 GPU 参数)
docker run -d \
  --name voicebox \
  -p 8000:8000 \
  -v ${HOME}/voicebox-data:/data \
  -e VOICEBOX_MODEL=qwen3-tts \
  jamiepine/voicebox:latest

方案 4:Windows 安装 #

# 从微软商店安装 Python 3.11+
# 然后安装 VoiceBox
pip install voicebox-ai

# GPU 加速需要安装 CUDA 工具包
# 下载地址: https://developer.nvidia.com/cuda-downloads

# 初始化 VoiceBox
voicebox init --gpu cuda

声音克隆 #

录制声音样本 #

要克隆一个声音,你至少需要 3 秒的清晰音频。为获得最佳效果,提供 30-60 秒的语音:

# 用内置录音器录制音频
voicebox record --output sample.wav --duration 30

# 或上传现有音频文件
voicebox clone --audio my_voice_sample.mp3 --name "my-voice"

# VoiceBox 自动处理音频并提取声音特征

声音处理管道 #

声音克隆管道包含几个阶段:

from voicebox.engine import VoiceCloner
from voicebox.audio import AudioProcessor

# 初始化克隆器
cloner = VoiceCloner(model="qwen3-tts-voice-clone")

# 加载并预处理参考音频
processor = AudioProcessor()
reference = processor.load_audio("sample.wav")
reference = processor.normalize(reference, target_rms=-20)
reference = processor.remove_noise(reference, method="spectral")

# 提取声音嵌入
embeddings = cloner.extract_embeddings(reference)

# 创建声音模型
voice_model = cloner.create_voice(
    embeddings=embeddings,
    name="my-voice",
    quality="high"
)

# 测试克隆的声音
output = voice_model.synthesize(
    text="Hello, this is my cloned voice speaking.",
    speed=1.0,
    emotion="neutral"
)
voice_model.save(output, "test_output.wav")

高级语音参数 #

VoiceBox 暴露了对语音合成的精细控制:

# 控制语速
voicebox synthesize --input script.txt --output speech.wav --speed 0.8

# 添加情绪变化
voicebox synthesize --input script.txt --output emotional.wav --emotion happy

# 调整音高
voicebox synthesize --input script.txt --output pitched.wav --pitch +200

# 组合多个参数
voicebox synthesize \
  --input script.txt \
  --output natural.wav \
  --speed 1.1 \
  --pitch +100 \
  --emotion confident \
  --clarity high

多声音支持 #

你可以同时创建和管理多个克隆声音:

from voicebox.engine import VoiceManager

manager = VoiceManager()

# 列出所有克隆的声音
voices = manager.list_voices()
for v in voices:
    print(f"{v.name}: {v.quality} ({v.duration}s of training data)")

# 切换声音
manager.set_active_voice("my-voice")
output = manager.synthesize("Hello from my cloned voice!")

# 混合两个声音生成混合语音
hybrid = manager.blend_voices(
    voice_a="my-voice",
    voice_b="partner-voice",
    weight_a=0.7,
    weight_b=0.3
)
output = hybrid.synthesize("Blended voice output")

听写模式 #

VoiceBox 的听写模式提供实时语音转文本转录,可与系统上任何应用配合使用。

系统级听写设置 #

# 启用系统级听写
voicebox dictation --enable

# 选择识别模型
voicebox dictation --model whisper-large-v3

# 设置输出语言
voicebox dictation --language en

# 配置热键
voicebox dictation --hotkey "ctrl+space"

听写 API 用法 #

from voicebox.dictation import DictationEngine

# 初始化听写引擎
engine = DictationEngine(
    model="whisper-large-v3",
    language="auto",
    beam_size=5,
    vad_threshold=0.5
)

# 开始监听
engine.start_listening(
    hotkey="ctrl+shift+d",
    output_mode="clipboard",
    append_mode=True
)

# 处理一次听写会话
result = await engine.listen_session(
    timeout=300,           # 5 分钟会话
    silence_threshold=1.5, # 静音 1.5 秒后停止
    language="en"
)

print(f"Transcribed: {result.text}")
print(f"Confidence: {result.confidence:.2%}")
print(f"Words: {result.word_count}")

多语言听写 #

VoiceBox 支持多语言同步听写,带自动语言检测:

# 启用自动检测
voicebox dictation --auto-detect

# 指定支持的语言
voicebox dictation --languages en,zh,ko,ja,es,fr,de

# 设置主要语言(提高准确率)
voicebox dictation --primary-language en

文本转语音 API #

VoiceBox 暴露完整的 REST API,用于编程式文本转语音生成:

基础 TTS #

# 简单的文本转语音
curl -X POST "https://your-voicebox/api/v1/tts" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "Hello, this is a test of VoiceBox text-to-speech.",
    "voice": "default",
    "speed": 1.0,
    "output_format": "wav"
  }' \
  --output speech.wav

流式 TTS #

用于实时音频流应用:

# 分块流式传输音频
curl -N -X POST "https://your-voicebox/api/v1/tts/stream" \
  -H "Content-Type: application/json" \
  -d '{"text": "This audio will stream in real-time...", "voice": "cloned-voice"}' \
  --output - | aplay

批量处理 #

同时处理多个文本:

from voicebox.api import VoiceBoxClient

client = VoiceBoxClient("https://your-voicebox")

texts = [
    "First sentence for processing.",
    "Second sentence with different content.",
    "Third sentence in another voice.",
]

results = await client.tts.batch(
    texts=texts,
    voice="default",
    output_format="mp3",
    parallel_workers=4
)

for i, result in enumerate(results):
    print(f"Generated: speech_{i}.mp3 ({result.duration:.1f}s)")

硬件要求与性能 #

硬件声音克隆时间TTS 速度听写延迟
RTX 4090 (24GB)~10 秒实时数倍<300ms
RTX 3060 (12GB)~25 秒接近实时<500ms
M3 Max (Apple)~15 秒实时<400ms
纯 CPU (16核)~2 分钟慢速~1.5s

数据为典型本地运行实测量级,随模型和音频长度变化。

加入社区:Telegram

披露:本文提到的工具可能带有联盟关系。我们不接受付费评测。所有观点均为我们自己的。

📦 出现在以下合集中

💬 留言讨论