自媒体出海的终极神器,语音翻译、AI克隆、人声分离、YouTube下载全打包

自媒体出海的终极神器,语音翻译、AI克隆、人声分离、YouTube下载全打包最新版

官方版无广告10

更新日期:2026年7月20日分类标签: 语言:中文平台:没限制

0 人已下载 手机查看

一、这个项目是什么?

abus-aikorea/voice-pro 是一个基于 Gradio WebUI 的 AI 音频处理工作站,GitHub 累计 114 次提交,由韩国 AI 创业团队 ABUS 开发(现已转向全球文化交流应用 WeConnect)。

它最震撼的一点是:曾经需要付费订阅的商业软件(通过 Shopify 销售),在 2026 年 6 月宣布**彻底开源、完全免费**。没有任何时长限制,没有任何功能阉割,全部代码开放下载。

用大白话说:这是一台”国际化内容生产线”。你想做出海视频,把英文视频翻译成中文发布;或者把中文视频配上地道的英文推向海外——以前需要拼凑五六个工具、花费上千元才能完成的事情,现在一个开源工具全搞定。

二、这个仓库适合哪些人?

  • 跨境内容创作者:想把视频翻译成多语言版本(YouTube 视频配音、字幕翻译)发到全球平台的自媒体人。
  • 播客主持人:想把节目音频克隆多种语言,或制作多语言版本的播客。
  • 开发者 / AI 爱好者:想体验和对比 F5-TTS、CosyVoice、kokoro 等多种语音克隆技术。
  • 记者 / 媒体从业者:需要快速把采访录音转文字、翻译、加字幕。
  • 有声书 / 配音从业者:想用 AI 克隆音色做多角色有声内容。
  • 有翻译需求的商务人士:实时翻译功能支持视频会议、在线课程等多语言场景。

三、核心功能全面解析

1. YouTube 视频下载与音频提取

集成 yt-dlp 引擎,支持从 YouTube 等主流平台下载视频并提取音频,支持 mp3、wav、flac 等多种格式。一站式完成”下载 → 提取音频 → 后续处理”的全流程,不用在不同工具间来回切换。

2. 语音转文字(STT)

集成三大语音识别引擎,支持 90+ 语言:

  • Whisper:OpenAI 开源的通用语音识别模型
  • Faster-Whisper:Whisper 的速度优化版本,推理更快
  • Whisper-Timestamped:带时间戳的精准识别,适合字幕生成
  • WhisperX:支持词级时间戳对齐,分离说话人

对于中文识别,Whisper 本身已经很强,加上 Faster-Whisper 的加速,处理长音频效率大幅提升。

3. 多语言翻译

支持 100+ 语言的即时翻译,内置 Deep-Translator(免费版)和 Azure Translator(付费版)。支持多种字幕文件格式(ASS、SSA、SRT 等),可以直接对字幕文件进行批量翻译。

4. 文本转语音(TTS)—— 多引擎可选

TTS 是 Voice-Pro 最核心的功能,集成了多个顶级语音合成引擎:

  • Edge-TTS(微软):免费,支持 100+ 语言、400+ 种声音,音质好,速度快
  • F5-TTS:上海交大开源,支持零样本语音克隆,仅需 15 秒音频即可克隆任意声音,推理速度快(实时率 0.15),可克隆音色并保持语气、情感
  • E2-TTS:F5-TTS 的简化版本,安装更轻量
  • CosyVoice(阿里):支持富文本和自然语言细粒度控制(情感、韵律、方言),音色还原度高,支持流式输出
  • kokoro:HuggingFace TTS 竞技场排名第二,音质优秀
  • Matcha-TTS:第三方集成

这些引擎可以单独使用,也可以配合翻译流水线:原文语音 → 识别为文字 → 翻译 → 目标语言 TTS 配音,完整闭环。

5. 零样本语音克隆

这是 Voice-Pro 最吸引人的功能之一。通过 F5-TTS、CosyVoice 等技术,只需提供一小段参考音频(15-30 秒),就能克隆出包含原声音色、语调、情感的全新声音。项目内置了名人声音(Celeb Voices)供免费试用,播客主持人可以用自己的声音生成多语言版本。

6. 人声分离(Vocal Remover)

集成 Meta 的 Demucs 引擎和 UVR5 的 MDX-Net,可以从任意音频中分离出纯净的人声轨和背景音乐轨。适合音乐制作、语音分析,或者在嘈杂背景中提取清晰人声做后续处理。

7. 实时翻译系统

支持实时语音识别和翻译,可以选择麦克风、扬声器等不同音频输入源,实时生成字幕并翻译,类似 YouTube 的实时字幕功能。适合在线会议、视频通话、多语言直播等场景。

8. RVC 实时语音转换

集成 RVC(Retrieval-Based Voice Conversion)技术,可以对实时语音进行变声处理,适合游戏语音变声、直播互动等场景。

9. AI Cover(AI 翻唱)

支持用 AI 技术对音乐进行翻唱处理,可以替换歌手音色,适合音乐创作和娱乐场景。

四、Dubbing Studio(配音工作室)—— 核心模块

配音工作室是 Voice-Pro 的核心模块,提供了完整的视频翻译配音流水线:

  1. 视频获取:从 YouTube 等平台直接拉取内容,或本地导入视频
  2. 音频提取:分离出人声轨道
  3. 字幕生成:Whisper 自动生成带时间戳的字幕文件
  4. 多语言翻译:100+ 语言互译
  5. 语音合成:选择 TTS 引擎和音色,生成目标语言配音
  6. 输出成品:合成带多语言字幕和配音的视频

整个流程一气呵成,不需要用户手动拼接和后期处理。

五、技术架构与安装

技术栈

  • Gradio 5.14+:Web 界面框架
  • Python:主开发语言
  • Torch 2.5.1+ cu124:深度学习框架(GPU 版本)
  • yt-dlp:视频下载
  • Demucs / MDX-Net:人声分离
  • F5-TTS / CosyVoice / Edge-TTS / kokoro:语音合成
  • Whisper 系列:语音识别

一键安装(Windows 推荐)

# 克隆仓库
git clone https://github.com/abus-aikorea/voice-pro.git
cd voice-pro

# 运行一键安装脚本(自动创建 Miniconda 虚拟环境)
python one_click.py

脚本会自动安装 Miniconda、配置虚拟环境、安装所有依赖,GPU 版本还会配置 CUDA 环境。整个过程全自动,不需要手动配环境变量。

启动

# 启动主程序
start-voice.py

# 或通过 ABUS Launcher 启动
start-abus.py

启动后访问 Gradio WebUI 地址即可开始使用。

硬件需求

  • GPU 版(推荐):NVIDIA 显卡,CUDA 支持,8GB 以上显存体验较好
  • CPU 版:提供了独立的 requirements-voice-cpu.txt,适合没有独显的机器,但处理速度较慢

SourceForge 用户评测中,有 RTX 3080 用户反馈”质量非常好,安装非常简单,使用也相当便捷”(Tried Voice-Pro on my RTX 3080 desktop. The quality is truly excellent… The installation was very simple, and the usage is quite smooth)。

跨平台支持

Windows(主要平台,一键安装脚本)、macOS(需手动配置)、Linux(configure.sh 脚本)均支持。

六、与同类工具横向对比

Voice-Pro vs ElevenLabs

ElevenLabs 是 AI 语音领域的行业标杆,ElevenLabs v3 的中文自然度 MOS 评分 4.6,克隆还原度 9.5/10,但每月费用约 158 元人民币。Voice-Pro 集成的 CosyVoice(阿里)和 F5-TTS 在音色克隆还原度上已非常接近 ElevenLabs 的水平(约 95% 匹配),完全免费。对于预算有限的个人创作者,Voice-Pro 是目前最接近 ElevenLabs 体验的免费替代方案。

Voice-Pro vs Maestra / Kapwing / VEED.IO

处理一个 60 分钟视频,这些 SaaS 平台的费用对比:

  • Maestra:约 170 元人民币
  • Kapwing Pro:约 210-280 元人民币
  • VEED.IO Pro:约 170-250 元人民币(且不含 TTS 配音)
  • HappyScribe:约 250-340 元人民币
  • Descript Creator:约 250 元人民币
  • Voice-Pro:完全免费,无时长限制

Voice-Pro vs 分散工具组合(yt-dlp + Demucs + Whisper + 翻译 API)

用多个独立工具组合也能完成类似工作,但存在三个核心问题:工具之间需要手动传递数据(视频下载→音频提取→语音识别→翻译→配音),格式转换繁琐,数据格式不统一。Voice-Pro 把整个流水线统一在同一个 WebUI 里,数据流转全自动。

Voice-Pro vs RVC / Seed-VC 等单一变声器

RVC、Seed-VC 等专注于实时变声,适合游戏/直播场景。Voice-Pro 的 RVC 模块也支持这些功能,但更重要的是它还集成了完整的翻译配音流水线,不是单纯的变声工具。

七、版本演进与开源动态

项目在 2026 年 6 月发布了 v3.2.0,宣布代码全部开源、完全免费,GitHub 获得 6 个 thumbs up 反应,社区 fork 包括 mengazaa/voice-pro(112 commits)和 jackqt/voice-pro。

值得关注的最新版本功能:

  • v3.2.0:全面开源,代码完全免费开放
  • v3.1.4 / v3.1.3:F5-TTS 支持微调模型,Gradio 5 更新
  • 最新代码更新(2025年12月):Torch 2.5.1+cu124、Gradio 5.14.0、Azure Translator 错误修复

Issue 中还有一个有趣的功能请求(Feature #95):添加 FunASR 作为 ASR 引擎选项,据称比当前方案快 170 倍。

八、主要优缺点总结

优点

  • 完全免费:所有功能开源免费,无任何隐性收费
  • 功能集成度高:把过去需要五六个工具才能完成的工作流集中到一个界面
  • 多 TTS 引擎可选:F5-TTS、CosyVoice、Edge-TTS、kokoro 各有优势,可根据场景切换
  • 一键安装:Windows 用户点点鼠标就能配置好完整环境
  • 完全本地运行:数据不上传,隐私有保障
  • 支持多语言:100+ 语言,覆盖全球主要语言

缺点 / 局限

  • ⚠️ 硬件要求较高:GPU 版本需要 NVIDIA 独显(8GB+ 显存),CPU 版本速度慢
  • ⚠️ Windows 为主:macOS 和 Linux 需要手动配置
  • ⚠️ CosyVoice 限制:克隆音频不能超过 30 秒
  • ⚠️ 非专业音频工作站:精剪需求(如影视配音级别)仍需达芬奇 / Adobe Audition
  • ⚠️ 无内置自动字幕时间轴校准:翻译后字幕时间轴需要手动调整

九、总结

abus-aikorea/voice-pro 是目前开源社区中功能最完整的 AI 音频处理工具之一。它把翻译、克隆、配音、分离、下载这些原本分散在不同平台的功能,集成到了一个 Gradio WebUI 里,而且完全免费。

对于想低成本做国际化内容的创作者来说,它省下的不只是钱,更是大量折腾工具的时间。用一句话总结它的价值:**以前需要花上千元订阅多个 SaaS 服务、拼凑五六个工具才能完成的工作,现在在自己电脑上免费一键搞定。**

当然,它不是万能的。追求极致音质的影视配音级别需求,仍然需要专业工具和付费服务;但对于 80% 的内容创作者日常需求,Voice-Pro 已经足够强大。

GitHub 地址:https://github.com/abus-aikorea/voice-pro

SourceForge 下载:https://sourceforge.net/projects/voice-pro.mirror/

相关软件

暂无评论

暂无评论...