phuc-nt/my-translator

GitHub: phuc-nt/my-translator

一款无需服务器的跨平台实时语音翻译桌面应用,支持多种云端与本地引擎,在悬浮窗中即时显示翻译结果并可选语音播报。

Stars: 1226 | Forks: 391

My Translator — Real-time Speech Translation

Latest Release Built with Tauri macOS Windows License Stars

**My Translator** 是一款基于 Tauri 构建的实时语音翻译桌面应用。它直接从您的系统或麦克风捕获音频,将其转录,并在极简的悬浮窗中显示翻译结果——全程无需中转服务器参与。 ### ⬇️ 我应该下载哪个版本? 从 [最新发布版本](https://github.com/phuc-nt/my-translator/releases/latest) 中获取对应的文件: | 您的设备 | 文件 | |---|---| | **Mac Apple Silicon** (M1/M2/M3/M4) | `MyTranslator__aarch64.dmg` | | **Mac Intel** (2020 年及更早) | `MyTranslator__x64.dmg` | | **Windows** | `MyTranslator__x64-setup.exe` | ## 工作原理 ``` ┌── ☁️ Soniox (text) ──┐ System Audio / Mic → 16kHz PCM ─────┼── ⚡ OpenAI Realtime (text+🔊) ─┼─→ Overlay UI ├── 🌏 Qwen LiveTranslate Flash (text only) │ └── 🖥️ Local MLX (text, offline) ─┘ ↓ (optional, text engines) TTS (Edge / Google / ElevenLabs) → 🔊 ``` 四种翻译引擎,根据您的通话需求进行选择: | 功能 | 详情 | |---------|--------| | **引擎** | ☁️ Soniox · ⚡ OpenAI Realtime · 🌏 Qwen LiveTranslate Flash · 🖥️ Local MLX | | **延迟** | ~2 秒 (Soniox / OpenAI) · ~4 秒 (Qwen) · ~10 秒 (Local) | | **语言** | 70+ 源语言 → 任意目标语言 (Soniox),13 种目标语言 (OpenAI),60+ 源语言及目标语言 (Qwen),JA/EN/ZH/KO → VI/EN (Local) | | **成本** | ~$0.12/小时 (Soniox) · ~$4/小时 (OpenAI,包含语音) · 免费预览 (Qwen,仅文本) · 免费 (Local) | | **TTS** | Soniox / Local 模式提供 3 个服务商 (免费的 Edge、Google、ElevenLabs) — OpenAI 传输其原生语音(默认关闭),Qwen 仅限文本 | | **平台** | macOS (ARM + Intel) · Windows · Local 模式 = 仅限 Apple Silicon | | **签名** | ✅ macOS 已签名并公证 | | **自动更新** | ✅ 内置支持,可在“设置”中检查并安装 | ## 功能特性 ### 📖 双面板视图 两种显示模式: - **单面板**(默认) — 仅显示翻译文本,简洁且专注 - **双面板** — 源文本 | 翻译文本 并排显示,每个面板独立滚动 通过面板按钮切换(悬停时显示在右下角)。 ### 🔄 智能滚动 仅当您处于底部时才自动滚动。向上滚动以阅读旧内容时,不会被强行拉回底部。 ### 🔤 快捷字体大小 A- / A+ 悬浮控制(悬停时显示在右下角)。字体大小最大可调至 140px — 非常适合用于演示。 ### 🔄 双向翻译 同时翻译两种语言之间的对话 — 非常适合双语会议。 - **单向**:源语言 → 目标语言(例如:日语 → 越南语) - **双向**:语言 A ↔ 语言 B(例如:越南语 ↔ 日语) — 应用会自动检测当前发言者,并将其翻译为另一种语言 **视频通话设置** (Zoom, Google Meet, MS Teams): 1. 音频源:**两者**(系统 + 麦克风) 2. 翻译类型:**双向** 3. 设置语言 A 和语言 B ### 🎙️ TTS 语音播报 在单向模式下朗读翻译结果 — 提供 3 个服务商: | | Edge TTS ⭐ | Google Chirp 3 HD | ElevenLabs | |-|-------------|-------------------|------------| | **成本** | 免费 | 每月免费 100 万字符 | ~$5/月+ | | **质量** | ★★★★☆ 神经网络语音 | ★★★★★ 接近真人 | ★★★★★ 高级 | | **越南语** | ✅ 2 种声音 | ✅ 6 种声音 | ✅ 支持 | | **配置** | 无需配置 | Google Cloud API key | API key | | **语速控制** | ✅ | ✅ 0.5x–2.0x | ❌ | TTS 默认处于**关闭状态** — 可通过 TTS 按钮或 `⌘ T` 进行切换。 ### 📖 自定义翻译术语 定义特定领域的词汇应如何翻译: ``` Original sin = Tội nguyên tổ Christ = Kitô Pneumonia = Viêm phổi ``` 在“设置” → “翻译” → “翻译术语”中添加术语。非常适合用于宗教、医疗或技术类内容。 ### ⚡ OpenAI Realtime 模式 通过 OpenAI 的 `gpt-realtime-translate`(计划于 2026 年 5 月正式发布)实现单次调用的流式翻译。通过一个 WebSocket 返回**翻译文本和翻译后的语音音频** — 无需单独的 TTS 步骤,降低了端到端延迟,输出也更地道。权衡之处:**约 $4/小时**,费用由您自己的 OpenAI 账户承担。支持 13 种目标语言:en, es, pt, fr, de, it, ru, hi, id, vi, ja, ko, zh。 当选择 OpenAI Realtime 时,双向模式和自定义 TTS 开关将不可用(因为音频为原生处理)。 ### 🌏 Qwen LiveTranslate Flash 模式 Alibaba DashScope 的 `qwen3-livetranslate-flash-realtime` — 在 Qwen 的**免费预览层**上传输**翻译文本**(无原生语音),并提供与移动端应用一致的 **60 种语言选择器**。服务器端的 VAD 负责处理语音活动检测,因此它支持麦克风 / 系统音频 / 两者混合。仅限显示翻译结果(无源文本转录面板;因为该模型不暴露 ASR)。可从 [阿里云百炼](https://bailian.console.alibabacloud.com) 获取密钥(仅限新加坡区域 — 其他区域会请求不同的 endpoint 并失败)。 必须显式选择源语言(此引擎禁用了自动检测功能 — 当源语言设为“auto”时,Live Flash 在处理真实的麦克风输入时会卡住)。当选择 Qwen 时,双向模式和自定义 TTS 开关也会被禁用。 ### 🖥️ Local 模式(仅限 Apple Silicon) 使用 MLX + Whisper + Gemma 的实验性离线模式 — 100% 在设备端运行。支持 JA/EN/ZH/KO → VI/EN。 ## 隐私 **您的音频永远不会触及我们的服务器 — 因为我们根本没有服务器。** - 应用**直接**连接到您配置的 API — 没有中继,没有中间人 - **API key 归您所有** — 存储在本地,绝不外传 - **无账号、无遥测、无数据分析** — 零跟踪 - 转录内容每次会话会以 `.md` 文件的形式保存在本地 ## 技术栈 - **[Tauri 2](https://tauri.app/)** — Rust 后端 + WebView 前端 - **[ScreenCaptureKit](https://developer.apple.com/documentation/screencapturekit)** — macOS 系统音频 - **[WASAPI](https://learn.microsoft.com/en-us/windows/win32/coreaudio/wasapi)** — Windows 系统音频 - **[cpal](https://github.com/RustAudio/cpal)** — 跨平台麦克风 - **[Soniox](https://soniox.com)** — 实时 STT + 翻译 - **[OpenAI Realtime Translate](https://platform.openai.com/docs/guides/realtime)** — `gpt-realtime-translate`(文本 + 原生语音) - **[MLX](https://github.com/ml-explore/mlx)** — 用于离线模式的设备端 Whisper + Gemma - **[Piper](https://github.com/rhasspy/piper) 通过 [sherpa-onnx](https://github.com/k2-fsa/sherpa-onnx)** — 本地离线神经网络 TTS(设备端运行,无需网络) - **[Edge TTS](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/index-text-to-speech)** — 免费的神经网络 TTS(默认) - **[Google Cloud TTS](https://cloud.google.com/text-to-speech)** — Chirp 3 HD(接近真人音质) - **[ElevenLabs](https://elevenlabs.io)** — 高级 TTS ## 从源码构建 ``` git clone https://github.com/phuc-nt/my-translator.git cd my-translator npm install npm run tauri build ``` 环境要求:Rust (stable),Node.js 18+,macOS 13+ 或 Windows 10+。 ## Star 历史 Star History Chart ## 许可证 MIT
标签:MITM代理, Tauri, 可视化界面, 实时语音翻译, 文字转语音, 桌面应用, 语音识别