一、这个项目是什么?
abus-aikorea/voice-pro 是一个基于 Gradio WebUI 的 AI 音频处理工作站,GitHub 累计 114 次提交,由韩国 AI 创业团队 ABUS 开发(现已转向全球文化交流应用 WeConnect)。
它最震撼的一点是:曾经需要付费订阅的商业软件(通过 Shopify 销售),在 2026 年 6 月宣布**彻底开源、完全免费**。没有任何时长限制,没有任何功能阉割,全部代码开放下载。
用大白话说:这是一台”国际化内容生产线”。你想做出海视频,把英文视频翻译成中文发布;或者把中文视频配上地道的英文推向海外——以前需要拼凑五六个工具、花费上千元才能完成的事情,现在一个开源工具全搞定。
二、这个仓库适合哪些人?
- 跨境内容创作者:想把视频翻译成多语言版本(YouTube 视频配音、字幕翻译)发到全球平台的自媒体人。
- 播客主持人:想把节目音频克隆多种语言,或制作多语言版本的播客。
- 开发者 / AI 爱好者:想体验和对比 F5-TTS、CosyVoice、kokoro 等多种语音克隆技术。
- 记者 / 媒体从业者:需要快速把采访录音转文字、翻译、加字幕。
- 有声书 / 配音从业者:想用 AI 克隆音色做多角色有声内容。
- 有翻译需求的商务人士:实时翻译功能支持视频会议、在线课程等多语言场景。
三、核心功能全面解析
1. YouTube 视频下载与音频提取
集成 yt-dlp 引擎,支持从 YouTube 等主流平台下载视频并提取音频,支持 mp3、wav、flac 等多种格式。一站式完成”下载 → 提取音频 → 后续处理”的全流程,不用在不同工具间来回切换。
2. 语音转文字(STT)
集成三大语音识别引擎,支持 90+ 语言:
- Whisper:OpenAI 开源的通用语音识别模型
- Faster-Whisper:Whisper 的速度优化版本,推理更快
- Whisper-Timestamped:带时间戳的精准识别,适合字幕生成
- WhisperX:支持词级时间戳对齐,分离说话人
对于中文识别,Whisper 本身已经很强,加上 Faster-Whisper 的加速,处理长音频效率大幅提升。
3. 多语言翻译
支持 100+ 语言的即时翻译,内置 Deep-Translator(免费版)和 Azure Translator(付费版)。支持多种字幕文件格式(ASS、SSA、SRT 等),可以直接对字幕文件进行批量翻译。
4. 文本转语音(TTS)—— 多引擎可选
TTS 是 Voice-Pro 最核心的功能,集成了多个顶级语音合成引擎:
- Edge-TTS(微软):免费,支持 100+ 语言、400+ 种声音,音质好,速度快
- F5-TTS:上海交大开源,支持零样本语音克隆,仅需 15 秒音频即可克隆任意声音,推理速度快(实时率 0.15),可克隆音色并保持语气、情感
- E2-TTS:F5-TTS 的简化版本,安装更轻量
- CosyVoice(阿里):支持富文本和自然语言细粒度控制(情感、韵律、方言),音色还原度高,支持流式输出
- kokoro:HuggingFace TTS 竞技场排名第二,音质优秀
- Matcha-TTS:第三方集成
这些引擎可以单独使用,也可以配合翻译流水线:原文语音 → 识别为文字 → 翻译 → 目标语言 TTS 配音,完整闭环。
5. 零样本语音克隆
这是 Voice-Pro 最吸引人的功能之一。通过 F5-TTS、CosyVoice 等技术,只需提供一小段参考音频(15-30 秒),就能克隆出包含原声音色、语调、情感的全新声音。项目内置了名人声音(Celeb Voices)供免费试用,播客主持人可以用自己的声音生成多语言版本。
6. 人声分离(Vocal Remover)
集成 Meta 的 Demucs 引擎和 UVR5 的 MDX-Net,可以从任意音频中分离出纯净的人声轨和背景音乐轨。适合音乐制作、语音分析,或者在嘈杂背景中提取清晰人声做后续处理。
7. 实时翻译系统
支持实时语音识别和翻译,可以选择麦克风、扬声器等不同音频输入源,实时生成字幕并翻译,类似 YouTube 的实时字幕功能。适合在线会议、视频通话、多语言直播等场景。
8. RVC 实时语音转换
集成 RVC(Retrieval-Based Voice Conversion)技术,可以对实时语音进行变声处理,适合游戏语音变声、直播互动等场景。
9. AI Cover(AI 翻唱)
支持用 AI 技术对音乐进行翻唱处理,可以替换歌手音色,适合音乐创作和娱乐场景。
四、Dubbing Studio(配音工作室)—— 核心模块
配音工作室是 Voice-Pro 的核心模块,提供了完整的视频翻译配音流水线:
- 视频获取:从 YouTube 等平台直接拉取内容,或本地导入视频
- 音频提取:分离出人声轨道
- 字幕生成:Whisper 自动生成带时间戳的字幕文件
- 多语言翻译:100+ 语言互译
- 语音合成:选择 TTS 引擎和音色,生成目标语言配音
- 输出成品:合成带多语言字幕和配音的视频
整个流程一气呵成,不需要用户手动拼接和后期处理。
五、技术架构与安装
技术栈
- Gradio 5.14+:Web 界面框架
- Python:主开发语言
- Torch 2.5.1+ cu124:深度学习框架(GPU 版本)
- yt-dlp:视频下载
- Demucs / MDX-Net:人声分离
- F5-TTS / CosyVoice / Edge-TTS / kokoro:语音合成
- Whisper 系列:语音识别
一键安装(Windows 推荐)
# 克隆仓库 git clone https://github.com/abus-aikorea/voice-pro.git cd voice-pro # 运行一键安装脚本(自动创建 Miniconda 虚拟环境) python one_click.py
脚本会自动安装 Miniconda、配置虚拟环境、安装所有依赖,GPU 版本还会配置 CUDA 环境。整个过程全自动,不需要手动配环境变量。
启动
# 启动主程序 start-voice.py # 或通过 ABUS Launcher 启动 start-abus.py
启动后访问 Gradio WebUI 地址即可开始使用。
硬件需求
- GPU 版(推荐):NVIDIA 显卡,CUDA 支持,8GB 以上显存体验较好
- CPU 版:提供了独立的 requirements-voice-cpu.txt,适合没有独显的机器,但处理速度较慢
SourceForge 用户评测中,有 RTX 3080 用户反馈”质量非常好,安装非常简单,使用也相当便捷”(Tried Voice-Pro on my RTX 3080 desktop. The quality is truly excellent… The installation was very simple, and the usage is quite smooth)。
跨平台支持
Windows(主要平台,一键安装脚本)、macOS(需手动配置)、Linux(configure.sh 脚本)均支持。
六、与同类工具横向对比
Voice-Pro vs ElevenLabs
ElevenLabs 是 AI 语音领域的行业标杆,ElevenLabs v3 的中文自然度 MOS 评分 4.6,克隆还原度 9.5/10,但每月费用约 158 元人民币。Voice-Pro 集成的 CosyVoice(阿里)和 F5-TTS 在音色克隆还原度上已非常接近 ElevenLabs 的水平(约 95% 匹配),完全免费。对于预算有限的个人创作者,Voice-Pro 是目前最接近 ElevenLabs 体验的免费替代方案。
Voice-Pro vs Maestra / Kapwing / VEED.IO
处理一个 60 分钟视频,这些 SaaS 平台的费用对比:
- Maestra:约 170 元人民币
- Kapwing Pro:约 210-280 元人民币
- VEED.IO Pro:约 170-250 元人民币(且不含 TTS 配音)
- HappyScribe:约 250-340 元人民币
- Descript Creator:约 250 元人民币
- Voice-Pro:完全免费,无时长限制
Voice-Pro vs 分散工具组合(yt-dlp + Demucs + Whisper + 翻译 API)
用多个独立工具组合也能完成类似工作,但存在三个核心问题:工具之间需要手动传递数据(视频下载→音频提取→语音识别→翻译→配音),格式转换繁琐,数据格式不统一。Voice-Pro 把整个流水线统一在同一个 WebUI 里,数据流转全自动。
Voice-Pro vs RVC / Seed-VC 等单一变声器
RVC、Seed-VC 等专注于实时变声,适合游戏/直播场景。Voice-Pro 的 RVC 模块也支持这些功能,但更重要的是它还集成了完整的翻译配音流水线,不是单纯的变声工具。
七、版本演进与开源动态
项目在 2026 年 6 月发布了 v3.2.0,宣布代码全部开源、完全免费,GitHub 获得 6 个 thumbs up 反应,社区 fork 包括 mengazaa/voice-pro(112 commits)和 jackqt/voice-pro。
值得关注的最新版本功能:
- v3.2.0:全面开源,代码完全免费开放
- v3.1.4 / v3.1.3:F5-TTS 支持微调模型,Gradio 5 更新
- 最新代码更新(2025年12月):Torch 2.5.1+cu124、Gradio 5.14.0、Azure Translator 错误修复
Issue 中还有一个有趣的功能请求(Feature #95):添加 FunASR 作为 ASR 引擎选项,据称比当前方案快 170 倍。
八、主要优缺点总结
优点
- ✅ 完全免费:所有功能开源免费,无任何隐性收费
- ✅ 功能集成度高:把过去需要五六个工具才能完成的工作流集中到一个界面
- ✅ 多 TTS 引擎可选:F5-TTS、CosyVoice、Edge-TTS、kokoro 各有优势,可根据场景切换
- ✅ 一键安装:Windows 用户点点鼠标就能配置好完整环境
- ✅ 完全本地运行:数据不上传,隐私有保障
- ✅ 支持多语言:100+ 语言,覆盖全球主要语言
缺点 / 局限
- ⚠️ 硬件要求较高:GPU 版本需要 NVIDIA 独显(8GB+ 显存),CPU 版本速度慢
- ⚠️ Windows 为主:macOS 和 Linux 需要手动配置
- ⚠️ CosyVoice 限制:克隆音频不能超过 30 秒
- ⚠️ 非专业音频工作站:精剪需求(如影视配音级别)仍需达芬奇 / Adobe Audition
- ⚠️ 无内置自动字幕时间轴校准:翻译后字幕时间轴需要手动调整
九、总结
abus-aikorea/voice-pro 是目前开源社区中功能最完整的 AI 音频处理工具之一。它把翻译、克隆、配音、分离、下载这些原本分散在不同平台的功能,集成到了一个 Gradio WebUI 里,而且完全免费。
对于想低成本做国际化内容的创作者来说,它省下的不只是钱,更是大量折腾工具的时间。用一句话总结它的价值:**以前需要花上千元订阅多个 SaaS 服务、拼凑五六个工具才能完成的工作,现在在自己电脑上免费一键搞定。**
当然,它不是万能的。追求极致音质的影视配音级别需求,仍然需要专业工具和付费服务;但对于 80% 的内容创作者日常需求,Voice-Pro 已经足够强大。
GitHub 地址:https://github.com/abus-aikorea/voice-pro
SourceForge 下载:https://sourceforge.net/projects/voice-pro.mirror/
