你是否厌倦了冷冰冰的语音助手界面?当 Zoom 会议、语音笔记或 AI 对话响起时,有没有想过——如果声音能配上一个会呼吸、会眨眼、会随语调微微点头的虚拟形象,体验会不会更自然、更沉浸?Persona 正是为此而生:它不是语音识别工具,也不是 TTS 合成器,而是一个轻量、隐私优先的桌面虚拟角色引擎,专为“已有语音流”的场景注入视觉生命力。
它不录音、不联网、不上传音频,也不生成语音——而是实时监听你正在播放的语音(比如会议软件输出、AI 助手朗读、播客播放),并驱动一个 VRM 格式的 3D 虚拟角色同步做出表情、口型与肢体反应。你的声音在哪响,Persona 就在哪“现身”,像一位安静陪伴在侧的数字伙伴。
核心功能
- 跨平台实时语音驱动:支持 Windows(WASAPI 进程环回)、macOS(Core Audio 进程音频捕获,需 macOS 14.2+)、Linux(PipeWire 流捕获),无需麦克风权限,只监听系统播放端。
- 零隐私风险设计:全程本地运行,不采集麦克风、不保存音频片段、不传输任何数据到网络,连语音内容本身都不做转录或分析。
- VRM 角色自由导入:开箱即用空角色库,支持用户自行导入符合标准的 .vrm 模型(如 Vroid Studio 或 Unity 导出的角色),真正实现“我的声音,我的形象”。
- 深度应用集成:自动识别并绑定主流语音应用进程(如 Zoom、Microsoft Teams、Edge/Chrome 的 WebRTC 通话、ElevenLabs 播放器等),无需手动配置音频源。
- 低资源占用桌面常驻:基于 Electron + WebGPU 渲染,对硬件加速图形有要求但内存友好,可最小化至托盘长期运行,不干扰主工作流。
- 一键式设置引导:首次启动自动打开设置面板,提供清晰的 VRM 导入指引、权限提示(如 macOS 录音权限)和平台特异性依赖说明(如 Linux 需 pw-dump/pw-record)。
适合哪些人用
Persona 特别适合三类中文用户:远程办公族——让线上会议中的语音反馈可视化,提升沟通临场感;AI 工具深度使用者——为 LLM 语音助手(如 Whisper+LLM 本地方案、ChatTTS 等)添加可信、个性化的视觉载体;Vtuber 或虚拟偶像创作者——快速搭建轻量级本地直播辅助角色,配合 OBS 实现“语音驱动+实时渲染”闭环,无需复杂动捕设备。
快速上手
下载安装包最省心:访问 GitHub Releases 页面,按系统选择对应版本(Windows NSIS 安装器 / macOS DMG / Linux AppImage 或 DEB)。首次运行会弹出设置窗口,点击“导入角色”选择本地 .vrm 文件即可启动。若需从源码运行,请确保已安装 Node.js 24+ 和 npm,执行 npm install && npm run dev(注意:Linux 用户需提前确认 pw-dump 和 pw-record 已加入 PATH;Windows 需 Win10 20348+;macOS 首次启动会请求一次“屏幕录制”权限——实为系统音频捕获所需,安全可控)。
项目信息
xikhar/persona
GitHub
Bringing real-time voice to life.
JavaScript 开发|GitHub Star 数:679|开源协议:NOASSERTION(作者暂未明确声明,但代码完全开放,建议商用前联系确认)|GitHub 项目地址
如果你希望语音交互不再只是“听到”,而是真正“看见”和“感受”——Persona 是目前中文生态中最干净、最专注、也最尊重用户隐私的实时虚拟角色落地方案。


