VoiceBox:开源 AI 语音工作室——声音克隆、听写与语音合成
一个全栈开源 AI 语音工作室,让你克隆任意声音、生成语音、并在任何应用中听写。33K star。支持 CUDA 或 Apple Silicon,完全本地运行。
- ⭐ 5000
- 更新于 2026-08-27
VoiceBox 是一个全面的开源 AI 语音工作室,支持声音克隆、语音生成和听写——全部在本地运行。凭借 33,745 个 GitHub star 和活跃的开发社区,它已成为开发者、内容创作者和注重隐私用户的首选方案——无需依赖云 API 就能获得强大的语音 AI。
本文涵盖安装、声音克隆、听写模式、API 用法、硬件要求和实际应用。
TL;DR #
VoiceBox 提供完全运行在你自有硬件上的完整语音 AI 技术栈。它支持从最短 3 秒的音频克隆声音、向任何应用实时听写,以及高质量文本转语音生成。同时支持 NVIDIA CUDA 和 Apple Silicon(MLX),在保护隐私的同时适配你的硬件——语音数据永不离开你的机器。
什么是 VoiceBox? #
VoiceBox 是一个自托管语音 AI 平台,把多种前沿技术整合进一个统一界面。与需要把音频上传到云端的商业语音服务不同,VoiceBox 在本地处理一切,让你对语音数据拥有完全控制权。
平台支持三种主要运行模式:
- 声音克隆:录制或上传一段短音频样本,创建能以此声音生成语音的数字声音模型
- 听写:使用麦克风向系统上任何应用听写文本,实时转录
- 文本转语音:用克隆的声音或内置声音模型从文本生成自然语音
基于 Qwen3-TTS、Whisper 和多种声音克隆架构等现代开源模型构建,VoiceBox 以零成本提供企业级语音 AI 能力。
在 DigitalOcean 上部署 VoiceBox安装指南 #
前置条件 #
VoiceBox 支持多种硬件配置:
GPU 加速(推荐):
- NVIDIA GPU,8GB+ 显存(RTX 3060 或更好)
- 已安装 CUDA 12.x 工具包
- 16GB 系统内存
- Linux(Ubuntu 22.04+)或 Windows 11
Apple Silicon:
- M1/M2/M3 芯片,16GB+ 统一内存
- macOS 14+(Sonoma 或更新)
- 已安装 MLX 框架
仅 CPU(较慢但可用):
- 16GB+ 系统内存
- 8+ CPU 核心
- 任意现代操作系统
方案 1:Pip 快速安装 #
# 从 PyPI 安装 VoiceBox
pip install voicebox-ai
# 验证安装
voicebox --version
# 初始化应用
voicebox init --model qwen3-tts
方案 2:从源码安装(最新功能) #
# 克隆仓库
git clone https://github.com/jamiepine/voicebox.git
cd voicebox
# 创建虚拟环境
python -m venv .venv
source .venv/bin/activate
# 安装依赖
pip install -r requirements.txt
# 以开发模式安装
pip install -e .
# 下载默认声音模型
voicebox download-models --all
方案 3:Docker 部署 #
# 拉取官方镜像
docker pull jamiepine/voicebox:latest
# 带 GPU 支持运行(NVIDIA)
docker run -d \
--name voicebox \
--gpus all \
-p 8000:8000 \
-v ${HOME}/voicebox-data:/data \
-e VOICEBOX_MODEL=qwen3-tts \
jamiepine/voicebox:latest
# 在 Apple Silicon 上运行(无需 GPU 参数)
docker run -d \
--name voicebox \
-p 8000:8000 \
-v ${HOME}/voicebox-data:/data \
-e VOICEBOX_MODEL=qwen3-tts \
jamiepine/voicebox:latest
方案 4:Windows 安装 #
# 从微软商店安装 Python 3.11+
# 然后安装 VoiceBox
pip install voicebox-ai
# GPU 加速需要安装 CUDA 工具包
# 下载地址: https://developer.nvidia.com/cuda-downloads
# 初始化 VoiceBox
voicebox init --gpu cuda
声音克隆 #
录制声音样本 #
要克隆一个声音,你至少需要 3 秒的清晰音频。为获得最佳效果,提供 30-60 秒的语音:
# 用内置录音器录制音频
voicebox record --output sample.wav --duration 30
# 或上传现有音频文件
voicebox clone --audio my_voice_sample.mp3 --name "my-voice"
# VoiceBox 自动处理音频并提取声音特征
声音处理管道 #
声音克隆管道包含几个阶段:
from voicebox.engine import VoiceCloner
from voicebox.audio import AudioProcessor
# 初始化克隆器
cloner = VoiceCloner(model="qwen3-tts-voice-clone")
# 加载并预处理参考音频
processor = AudioProcessor()
reference = processor.load_audio("sample.wav")
reference = processor.normalize(reference, target_rms=-20)
reference = processor.remove_noise(reference, method="spectral")
# 提取声音嵌入
embeddings = cloner.extract_embeddings(reference)
# 创建声音模型
voice_model = cloner.create_voice(
embeddings=embeddings,
name="my-voice",
quality="high"
)
# 测试克隆的声音
output = voice_model.synthesize(
text="Hello, this is my cloned voice speaking.",
speed=1.0,
emotion="neutral"
)
voice_model.save(output, "test_output.wav")
高级语音参数 #
VoiceBox 暴露了对语音合成的精细控制:
# 控制语速
voicebox synthesize --input script.txt --output speech.wav --speed 0.8
# 添加情绪变化
voicebox synthesize --input script.txt --output emotional.wav --emotion happy
# 调整音高
voicebox synthesize --input script.txt --output pitched.wav --pitch +200
# 组合多个参数
voicebox synthesize \
--input script.txt \
--output natural.wav \
--speed 1.1 \
--pitch +100 \
--emotion confident \
--clarity high
多声音支持 #
你可以同时创建和管理多个克隆声音:
from voicebox.engine import VoiceManager
manager = VoiceManager()
# 列出所有克隆的声音
voices = manager.list_voices()
for v in voices:
print(f"{v.name}: {v.quality} ({v.duration}s of training data)")
# 切换声音
manager.set_active_voice("my-voice")
output = manager.synthesize("Hello from my cloned voice!")
# 混合两个声音生成混合语音
hybrid = manager.blend_voices(
voice_a="my-voice",
voice_b="partner-voice",
weight_a=0.7,
weight_b=0.3
)
output = hybrid.synthesize("Blended voice output")
听写模式 #
VoiceBox 的听写模式提供实时语音转文本转录,可与系统上任何应用配合使用。
系统级听写设置 #
# 启用系统级听写
voicebox dictation --enable
# 选择识别模型
voicebox dictation --model whisper-large-v3
# 设置输出语言
voicebox dictation --language en
# 配置热键
voicebox dictation --hotkey "ctrl+space"
听写 API 用法 #
from voicebox.dictation import DictationEngine
# 初始化听写引擎
engine = DictationEngine(
model="whisper-large-v3",
language="auto",
beam_size=5,
vad_threshold=0.5
)
# 开始监听
engine.start_listening(
hotkey="ctrl+shift+d",
output_mode="clipboard",
append_mode=True
)
# 处理一次听写会话
result = await engine.listen_session(
timeout=300, # 5 分钟会话
silence_threshold=1.5, # 静音 1.5 秒后停止
language="en"
)
print(f"Transcribed: {result.text}")
print(f"Confidence: {result.confidence:.2%}")
print(f"Words: {result.word_count}")
多语言听写 #
VoiceBox 支持多语言同步听写,带自动语言检测:
# 启用自动检测
voicebox dictation --auto-detect
# 指定支持的语言
voicebox dictation --languages en,zh,ko,ja,es,fr,de
# 设置主要语言(提高准确率)
voicebox dictation --primary-language en
文本转语音 API #
VoiceBox 暴露完整的 REST API,用于编程式文本转语音生成:
基础 TTS #
# 简单的文本转语音
curl -X POST "https://your-voicebox/api/v1/tts" \
-H "Content-Type: application/json" \
-d '{
"text": "Hello, this is a test of VoiceBox text-to-speech.",
"voice": "default",
"speed": 1.0,
"output_format": "wav"
}' \
--output speech.wav
流式 TTS #
用于实时音频流应用:
# 分块流式传输音频
curl -N -X POST "https://your-voicebox/api/v1/tts/stream" \
-H "Content-Type: application/json" \
-d '{"text": "This audio will stream in real-time...", "voice": "cloned-voice"}' \
--output - | aplay
批量处理 #
同时处理多个文本:
from voicebox.api import VoiceBoxClient
client = VoiceBoxClient("https://your-voicebox")
texts = [
"First sentence for processing.",
"Second sentence with different content.",
"Third sentence in another voice.",
]
results = await client.tts.batch(
texts=texts,
voice="default",
output_format="mp3",
parallel_workers=4
)
for i, result in enumerate(results):
print(f"Generated: speech_{i}.mp3 ({result.duration:.1f}s)")
硬件要求与性能 #
| 硬件 | 声音克隆时间 | TTS 速度 | 听写延迟 |
|---|---|---|---|
| RTX 4090 (24GB) | ~10 秒 | 实时数倍 | <300ms |
| RTX 3060 (12GB) | ~25 秒 | 接近实时 | <500ms |
| M3 Max (Apple) | ~15 秒 | 实时 | <400ms |
| 纯 CPU (16核) | ~2 分钟 | 慢速 | ~1.5s |
数据为典型本地运行实测量级,随模型和音频长度变化。
加入社区:Telegram
披露:本文提到的工具可能带有联盟关系。我们不接受付费评测。所有观点均为我们自己的。
💬 留言讨论