你是否曾为给YouTube视频配中文字幕而反复听写?是否想把一段外语播客瞬间转成带情感的中文语音?又或者,想用自己的声音“朗读”别人写的文案,却苦于没有专业TTS或录音设备?Voice-Pro 正是为此而生——它不是一个简单的文字转语音工具,而是一个开箱即用、全中文界面友好的AI语音处理工作站,把原本需要多个软件+技术门槛才能完成的音频任务,浓缩进一个浏览器页面里。
核心功能
- 多引擎智能语音合成(TTS):内置 Edge-TTS(微软免费引擎)、kokoro(日韩语表现优异)、E2-TTS 与 F5-TTS(支持零样本音色克隆),可生成自然、带语调、多语种(中/英/日/韩/法/西等)的高质量语音,效果媲美商业服务如ElevenLabs,且完全本地运行、隐私可控。
- 高精度语音识别与时间轴字幕生成:基于 Faster-Whisper + Whisper-Timestamped 深度优化,支持中英文混合识别,自动生成带精确时间戳的SRT/ASS字幕,准确率远超普通在线工具,特别适合播客整理、课程笔记和短视频二创。
- 零样本声音克隆(Zero-shot Voice Cloning):仅需30秒干净人声录音,即可复刻你的音色、语气甚至呼吸感,用于配音、有声书、AI助手语音等场景——无需训练模型、不上传隐私音频,全程离线处理,安全可靠。
- 端到端视频语音处理流水线:从YouTube链接一键下载→人声分离(Demucs/M DX-Net)→语音转文字→多语言翻译(支持中↔英/日/韩等)→目标语言TTS配音→自动对齐音画,真正实现“输入链接,输出双语配音版视频”。
- 专业级音频预处理与后处理:集成人声增强、噪音抑制、伴奏分离、Karaoke歌词同步、音频格式批量转换等功能,让创作者专注内容,而非折腾音频工程。
- Gradio中文WebUI,开箱即用:无需写代码、不碰命令行,所有功能通过直观网页界面操作;支持Windows一键安装包(含CUDA加速版),显卡用户可获得3倍以上处理速度提升。
适合哪些人用

Voice-Pro 不是给极客看的玩具,而是为真实创作场景打造的生产力工具:自媒体UP主可快速生成多语种口播视频;语言学习者与教师能自动生成带双语字幕的听力材料;有声书制作者与播客主可低成本实现个性化配音与后期;跨境电商运营轻松将产品视频本地化为小语种版本;甚至视障朋友的辅助工具开发者也能基于其API构建无障碍阅读应用。只要你需要“让文字开口说话”或“听懂声音背后的意思”,它就是你的语音瑞士军刀。
快速上手
Windows 用户推荐直接下载官方发布的 免安装绿色版(含Python+CUDA环境):访问 GitHub Release 页面 → 找到最新版(如 v4.0.0)→ 下载 voice-pro-win-cuda.zip → 解压后双击 launch.bat 即可启动本地Web界面(地址默认为 http://127.0.0.1:7860)。首次运行会自动下载所需模型(约2–4GB,建议保持网络畅通)。Mac/Linux 用户可通过 pip 安装:pip install voice-pro 后运行 voice-pro 命令启动。所有操作均有中文提示,关键步骤配有GIF动图指引,10分钟内即可完成首个YouTube视频的中文字幕+配音全流程。
项目信息
abus-aikorea/voice-pro
GitHub
Gradio WebUI for creators and developers, featuring key TTS (Edge-TTS, kokoro) and zero-shot Voice Cloning (E2 & F5-TTS, CosyVoice), with Whisper audi
11.8k
今日 +58 stars today
Stars
1.7k
Forks
Python
GPL-3.0
编程语言:Python|GitHub Star 数:11,793|开源协议:GPL-3.0(保障自由使用与修改权利,商用需注意合规)|GitHub 项目地址
如果你厌倦了在十几个网站和软件间复制粘贴、担心数据泄露、又被高昂的TTS订阅费劝退——Voice-Pro 就是你等待已久的那款「真正属于中文创作者的AI语音操作系统」。




