TranslaMic:让 Mac 把翻译后的声音直接送进会议软件
远程会议里有一种很实际的需求:我用自己熟悉的语言讲话,对方能不能直接从会议软件里听到另一种语言?
字幕可以帮助理解,但它仍然要求参会者一直盯着屏幕。如果能把语音识别、翻译和语音合成串在一起,再把合成后的译文送进会议软件的麦克风输入,沟通方式就会自然很多。
这就是我开发 TranslaMic(译麦) 的原因。
项目已经开源,并发布了第一个可安装版本:
TranslaMic 能做什么
TranslaMic 是一款面向 Apple Silicon Mac 的开源实时语音翻译工具。它可以监听 Mac 麦克风,也可以监听指定应用的声音,然后依次完成:
- 使用 Apple Speech 把输入音频识别为文字。
- 使用 Apple Translation 生成目标语言译文。
- 使用 macOS 系统语音或本地 Qwen3-TTS 合成译文语音。
- 通过 Core Audio 虚拟驱动,把语音提供给其他应用作为麦克风输入。
安装后,腾讯会议、Zoom、Microsoft Teams 等软件会看到一个名为 TranslaMic Virtual Microphone 的输入设备。把会议软件的麦克风切换到它,对方听到的就是 TranslaMic 合成后的目标语言语音,而不是原始麦克风声音。
除了虚拟麦克风,TranslaMic 还保留了双语字幕、悬浮字幕、字幕记录和术语表。人名、产品名和专业词汇可以加入术语表,减少会议中因为专有名词造成的理解偏差。
为什么尽量使用 macOS 自带能力
开发这个工具时,我希望默认方案尽可能简单、可靠,也尽量减少额外的云端依赖。因此主要流程使用 macOS 自带的能力:
- Apple Speech 负责语音识别;
- Apple Translation 负责文本翻译;
- AVSpeechSynthesizer 负责低延迟语音合成;
- Core Audio 驱动负责把声音暴露为虚拟麦克风。
这种设计不需要注册 TranslaMic 账号,也没有项目方运营的云端后台、分析或遥测。部分 Apple 语言资源可能需要由系统下载,但日常处理尽可能留在 Mac 上完成。
两种语音引擎
目前 TranslaMic 提供两种语音引擎。
macOS 系统语音
系统语音启动快、延迟相对较低,不需要额外下载模型,是实时会议的推荐选择。应用只展示正常人声音色,并按照语言去重,避免系统里的特效音色和重复项目干扰选择。
Qwen3-TTS 0.6B
Qwen3-TTS 的声音更自然,当前提供九个正常人声音色,模型在本机通过 Apple Silicon 和 MLX 运行。首次使用需要下载大约 2.5 GB 的模型与运行环境。
不过必须坦率说明:当前 Qwen3-TTS 的延迟仍然较高。
我们尝试过流式输出,但实际语音的完整性和可理解性不够稳定,因此目前恢复为整句生成模式。也就是说,它需要先把整句话生成完成,再播放到扬声器或虚拟麦克风。这个过程通常需要数秒,不适合节奏紧凑的实时会议。
所以现阶段的建议很明确:
- 实时会议优先使用 macOS 系统语音;
- Qwen3-TTS 作为自然音色的实验性选项;
- 后续继续评估其他开源模型、量化模型和更低延迟的语音生成方案。
如何安装和使用
当前版本只支持 macOS 26+ 和 Apple Silicon,不支持 Intel Mac,也不计划发布到 Mac App Store。
使用步骤如下:
- 从 GitHub Releases 下载
translamic-x.y.z.pkg。 - 安装后重启 Mac,让 Core Audio 加载虚拟麦克风驱动。
- 启动 TranslaMic,授予麦克风、语音识别,以及屏幕与系统音频录制等必要权限。
- 选择输入源、输入语言和翻译目标语言。
- 打开“朗读翻译结果到虚拟麦克风”,选择语音引擎和音色。
- 在会议软件中,把麦克风切换为 TranslaMic Virtual Microphone。
- 点击 TranslaMic 的“开始”,然后正常讲话。
设置页面提供测试文本和“测试虚拟麦克风”按钮。测试声音会直接从 Mac 当前扬声器播放,适合在会议前确认目标语言、发音和音色。
不要把 TranslaMic 自己监听的输入源设置为 TranslaMic Virtual Microphone,否则可能形成音频循环,或者得不到有效输入。会议中也建议佩戴耳机,避免扬声器声音重新进入实体麦克风。
关于未签名版本
TranslaMic 0.1.6 仍然是早期开发版,安装包尚未使用 Developer ID 签名,也没有经过 Apple 公证。应用和驱动使用的是不需要开发者账号的 ad-hoc 签名。
这意味着 macOS 可能会阻止安装或首次启动。请只从可信的项目 Release 页面下载安装,并在确认被阻止的应用确实是 TranslaMic 后,再到“系统设置 → 隐私与安全性”中允许打开。正式发布前,我会继续评估 Developer ID 签名和公证。
语音识别、翻译和语音合成都可能出现错误。医疗、法律、安全指令等高风险内容,不应该只依赖实时翻译结果。
感谢原作者
TranslaMic 基于 Frank Li(franklioxygen) 创建并开源的 v2s 继续开发。
v2s 为项目提供了实时语音识别、翻译、双语字幕、悬浮字幕和字幕记录等重要基础。TranslaMic 在此基础上增加了虚拟麦克风、目标语言语音输出、语音引擎选择等能力。非常感谢 Frank Li 和 v2s 社区贡献者的开放工作,没有这些扎实的基础,就不会有 TranslaMic。
虚拟音频驱动还参考并改编了 Apple 的 Audio Server Driver 示例;Qwen3-TTS、MLX-Audio、uv 以及相关第三方项目的许可说明,都可以在仓库中查看。
接下来准备做什么
0.1.6 还是一个 MVP,接下来重点会放在:
- 继续验证腾讯会议、Zoom、Teams 等会议软件的兼容性;
- 降低从说话结束到目标语言发音之间的整体延迟;
- 对比不同开源 TTS 和量化模型的速度、音质与内存占用;
- 改善长句队列、错误恢复和会议中的连续使用体验;
- 在准备正式发布时加入 Developer ID 签名与 Apple 公证。
如果你也有跨语言会议、直播或远程协作场景,欢迎下载体验、提交 Issue,或者直接参与开发。这个项目仍处于很早期的阶段,真实使用反馈会直接影响后续方案选择。