TranslaMic:让 Mac 把翻译后的声音直接送进会议软件

远程会议里有一种很实际的需求:我用自己熟悉的语言讲话,对方能不能直接从会议软件里听到另一种语言?

字幕可以帮助理解,但它仍然要求参会者一直盯着屏幕。如果能把语音识别、翻译和语音合成串在一起,再把合成后的译文送进会议软件的麦克风输入,沟通方式就会自然很多。

这就是我开发 TranslaMic(译麦) 的原因。

项目已经开源,并发布了第一个可安装版本:

TranslaMic 能做什么

TranslaMic 是一款面向 Apple Silicon Mac 的开源实时语音翻译工具。它可以监听 Mac 麦克风,也可以监听指定应用的声音,然后依次完成:

  1. 使用 Apple Speech 把输入音频识别为文字。
  2. 使用 Apple Translation 生成目标语言译文。
  3. 使用 macOS 系统语音或本地 Qwen3-TTS 合成译文语音。
  4. 通过 Core Audio 虚拟驱动,把语音提供给其他应用作为麦克风输入。

安装后,腾讯会议、Zoom、Microsoft Teams 等软件会看到一个名为 TranslaMic Virtual Microphone 的输入设备。把会议软件的麦克风切换到它,对方听到的就是 TranslaMic 合成后的目标语言语音,而不是原始麦克风声音。

除了虚拟麦克风,TranslaMic 还保留了双语字幕、悬浮字幕、字幕记录和术语表。人名、产品名和专业词汇可以加入术语表,减少会议中因为专有名词造成的理解偏差。

为什么尽量使用 macOS 自带能力

开发这个工具时,我希望默认方案尽可能简单、可靠,也尽量减少额外的云端依赖。因此主要流程使用 macOS 自带的能力:

  • Apple Speech 负责语音识别;
  • Apple Translation 负责文本翻译;
  • AVSpeechSynthesizer 负责低延迟语音合成;
  • Core Audio 驱动负责把声音暴露为虚拟麦克风。

这种设计不需要注册 TranslaMic 账号,也没有项目方运营的云端后台、分析或遥测。部分 Apple 语言资源可能需要由系统下载,但日常处理尽可能留在 Mac 上完成。

两种语音引擎

目前 TranslaMic 提供两种语音引擎。

macOS 系统语音

系统语音启动快、延迟相对较低,不需要额外下载模型,是实时会议的推荐选择。应用只展示正常人声音色,并按照语言去重,避免系统里的特效音色和重复项目干扰选择。

Qwen3-TTS 0.6B

Qwen3-TTS 的声音更自然,当前提供九个正常人声音色,模型在本机通过 Apple Silicon 和 MLX 运行。首次使用需要下载大约 2.5 GB 的模型与运行环境。

不过必须坦率说明:当前 Qwen3-TTS 的延迟仍然较高。

我们尝试过流式输出,但实际语音的完整性和可理解性不够稳定,因此目前恢复为整句生成模式。也就是说,它需要先把整句话生成完成,再播放到扬声器或虚拟麦克风。这个过程通常需要数秒,不适合节奏紧凑的实时会议。

所以现阶段的建议很明确:

  • 实时会议优先使用 macOS 系统语音;
  • Qwen3-TTS 作为自然音色的实验性选项;
  • 后续继续评估其他开源模型、量化模型和更低延迟的语音生成方案。

如何安装和使用

当前版本只支持 macOS 26+ 和 Apple Silicon,不支持 Intel Mac,也不计划发布到 Mac App Store。

使用步骤如下:

  1. 从 GitHub Releases 下载 translamic-x.y.z.pkg。
  2. 安装后重启 Mac,让 Core Audio 加载虚拟麦克风驱动。
  3. 启动 TranslaMic,授予麦克风、语音识别,以及屏幕与系统音频录制等必要权限。
  4. 选择输入源、输入语言和翻译目标语言。
  5. 打开“朗读翻译结果到虚拟麦克风”,选择语音引擎和音色。
  6. 在会议软件中,把麦克风切换为 TranslaMic Virtual Microphone。
  7. 点击 TranslaMic 的“开始”,然后正常讲话。

设置页面提供测试文本和“测试虚拟麦克风”按钮。测试声音会直接从 Mac 当前扬声器播放,适合在会议前确认目标语言、发音和音色。

不要把 TranslaMic 自己监听的输入源设置为 TranslaMic Virtual Microphone,否则可能形成音频循环,或者得不到有效输入。会议中也建议佩戴耳机,避免扬声器声音重新进入实体麦克风。

关于未签名版本

TranslaMic 0.1.6 仍然是早期开发版,安装包尚未使用 Developer ID 签名,也没有经过 Apple 公证。应用和驱动使用的是不需要开发者账号的 ad-hoc 签名。

这意味着 macOS 可能会阻止安装或首次启动。请只从可信的项目 Release 页面下载安装,并在确认被阻止的应用确实是 TranslaMic 后,再到“系统设置 → 隐私与安全性”中允许打开。正式发布前,我会继续评估 Developer ID 签名和公证。

语音识别、翻译和语音合成都可能出现错误。医疗、法律、安全指令等高风险内容,不应该只依赖实时翻译结果。

感谢原作者

TranslaMic 基于 Frank Li(franklioxygen) 创建并开源的 v2s 继续开发。

v2s 为项目提供了实时语音识别、翻译、双语字幕、悬浮字幕和字幕记录等重要基础。TranslaMic 在此基础上增加了虚拟麦克风、目标语言语音输出、语音引擎选择等能力。非常感谢 Frank Li 和 v2s 社区贡献者的开放工作,没有这些扎实的基础,就不会有 TranslaMic。

虚拟音频驱动还参考并改编了 Apple 的 Audio Server Driver 示例;Qwen3-TTS、MLX-Audio、uv 以及相关第三方项目的许可说明,都可以在仓库中查看。

接下来准备做什么

0.1.6 还是一个 MVP,接下来重点会放在:

  • 继续验证腾讯会议、Zoom、Teams 等会议软件的兼容性;
  • 降低从说话结束到目标语言发音之间的整体延迟;
  • 对比不同开源 TTS 和量化模型的速度、音质与内存占用;
  • 改善长句队列、错误恢复和会议中的连续使用体验;
  • 在准备正式发布时加入 Developer ID 签名与 Apple 公证。

如果你也有跨语言会议、直播或远程协作场景,欢迎下载体验、提交 Issue,或者直接参与开发。这个项目仍处于很早期的阶段,真实使用反馈会直接影响后续方案选择。


TranslaMic:让 Mac 把翻译后的声音直接送进会议软件
https://www.techeek.cn/introducing-translamic/
作者
大橙子
发布于
2026年8月13日
许可协议