在 Linux 上做語音聽寫,以前一直是個尷尬的選項。那些打磨得好的商業 app(Wispr Flow、superwhisper、Typeless)都上 macOS、Windows 和手機,卻完全跳過 Linux。但這個缺口已經悄悄補上了。現在 Linux 上有不錯的原生選擇,有免費開源的,也有幾個商業的。你只要分得清誰是誰。
這是一份 2026 年「在 Linux 上真的能用什麼」的誠實地圖。先把話講在前面:Meander 是我們自己的產品。 但下面的對手我們都公正列出,優點、缺點、適合誰,一個都沒藏。這裡沒有單一的「最好」,看你最在意什麼。我們一個一個工具看,並排比較,最後給一個誠實的推薦。
懶人包
- 裝了就能用、有 AI 潤稿和真翻譯: Meander。原生 Linux app,有免費方案。(我們的產品)
- 最好的免費、純本地、開源: Handy。打磨得好、MIT、完全離線。
- 開源、本地或雲端都行、有同步: OpenWhispr。MIT,最接近商業工作流的開源做法。
- 最完整的純離線圖形介面: Speech Note(Flathub)。
- 極簡 / 自己組: nerd-dictation、whisper.cpp。
這些在 Linux 上還是用不了
先說不在這份清單上的:大家通常是從這些雲端 app 過來的,但它們在 Linux 上還是跑不了。
- Wispr Flow:macOS、Windows、iOS、Android。沒有 Linux。(我們的比較)
- superwhisper:macOS、Windows、iOS。沒有 Linux 也沒有 Android。(我們的比較)
- Typeless:macOS、Windows、iOS、Android、網頁版。沒有 Linux。(我們的比較)
如果你是從其中一個過來的,下面這些都真的能在 Linux 上跑。
1. Meander:裝了就能用,有 AI 潤稿和翻譯
適合: 想要五分鐘就上手、有 AI 潤稿、有翻譯、手機上也能用同一套工具,而且不想自己管模型或 API key 的人。
Meander 提供原生 Linux 安裝檔(.deb 和 .AppImage),把 Linux 當一等公民。按住快捷鍵、講話、放開。它會轉錄、順掉文法和贅字,把乾淨的文字貼到游標所在的地方。終端機、編輯器、瀏覽器,任何你能打字的地方都行。
- ✅ 按住說話 → 轉錄 → AI 潤稿 → 貼到游標,不用設定 API key
- ✅ 翻譯模式: 講一種語言、輸出另一種。針對中文、日文、韓文特別調校
- ✅ 同一個帳號在 Windows 上、也能當 完整的 Android 鍵盤。設定和紀錄三邊同步
- ✅ 有免費方案可以先試
- ✅ 在雲端跑: 連長音檔都快,而且不佔你的 CPU、GPU、RAM(那些留給 ComfyUI、build、遊戲,或你其他要跑的東西)
- ➖ 雲端為主:需要連線。音訊即時處理,不會儲存
取捨: 如果你的硬條件是完全離線,Meander 不是那種。可以試下面的 Handy 或 Speech Note。反過來說,那些跑在你自己機器上、會吃你的資源(下面細講)。
2. Handy:最好的免費、純本地選擇
適合: 想要打磨得好、私密、離線、零成本、又不用帳號的聽寫的人。
Handy 用的點子跟商業工具一樣(按快捷鍵、講話、文字進任何輸入框),但全部都在你自己的機器上跑。它做得很扎實(GitHub 24k+ 星)、開源(MIT)、有原生 Linux 版。轉錄用 Whisper(可 GPU 加速)或 Parakeet V3(CPU、自動偵測語言)。
- ✅ 免費、開源(MIT)、完全離線。 你的音訊不會離開機器
- ✅ 原生 Linux、macOS、Windows。打磨得好、更新很勤
- ✅ Whisper + Parakeet 引擎:轉錄 99+ 種語言(講什麼語言、就出什麼語言的文字)
- ➖ AI 潤稿要自備 API key(OpenAI/Anthropic)或自架 Ollama。例外是 macOS,可以用裝置端的 Apple Intelligence
- ➖ 只有桌面版。 沒有 Android,也沒有跨裝置帳號或同步
- ➖ 沒有內建翻譯。你可以透過 LLM 後處理(自備 key 加自訂 prompt)翻成其他語言,但沒有 Meander 那種裝了就能用的翻譯模式。原生的 Whisper 翻譯只能輸出英文
取捨: 想要私密又免費,先試這個。想要零設定的 AI 潤稿、Android 鍵盤,或語言之間的翻譯,那就是商業 app 上場的時候。
Handy(github.com/cjpais/Handy)
3. OpenWhispr:開源、本地或雲端、有同步
適合: 想要一個能完全本地或在雲端跑、又帶點商業工具便利性的開源 app 的人。
OpenWhispr 模糊了離線工具和付費工具之間的界線。你可以在本地跑 Whisper(Tiny 到 Turbo,75 MB–1.6 GB)、不用連網,或用雲端模型加自己的 API key。它還加了 AI 潤稿(「幫我整理一下」、「草擬一封 email」)、100+ 種語言的自動偵測轉錄,以及在付費方案上的多桌面同步。
- ✅ 免費、開源(MIT)。 本地處理無限量、完全離線
- ✅ 本地或雲端,你選。原生 Linux、macOS、Windows
- ✅ AI 潤稿和助理式指令。付費方案有跨裝置同步
- ✅ 還能做會議轉錄: 自動偵測 Zoom/Teams/FaceTime,在裝置端做講者分離
- ➖ 免費的雲端額度有上限(約每週 2000 字)。本地不限量
- ➖ 只有桌面版。 沒有 Android
- ➖ 是多語言轉錄,但不能在語言之間做翻譯輸出
取捨: 最接近商業工作流的開源選擇。如果你不介意自備 key 或自己管本地模型,它很強。
4. Speech Note:最完整的純離線圖形介面
適合: 想要免費、離線、開源、有像樣的圖形介面、引擎選擇又多的聽寫的人。
Speech Note 是一個免費、開源(MPL-2.0)的 Linux app,能做語音轉文字、文字轉語音、還有翻譯,全部離線。沒有任何東西離開你的機器。它支援多種引擎(whisper.cpp、Faster Whisper、Vosk、Coqui 等),可下載 100+ 種語言的模型,還能透過全域快捷鍵把辨識出的文字打進任何使用中的視窗。
- ✅ 免費、開源,在 Flathub 上(也有 AUR / openSUSE)
- ✅ 完全離線。 隱私是架構決定的
- ✅ 多引擎多模型、100+ 種語言,還有離線翻譯
- ➖ 模型要你自己下載和管理。準確度看你選哪個
- ➖ 純轉錄。不會幫你 AI 潤掉贅字或文法
取捨: 比商業 app 多很多旋鈕。這對你是優點還是缺點,看你是哪種人。
5. nerd-dictation:極簡、可改
適合: 喜歡一個自己讀得懂、改得動、能寫腳本的工具的命令列使用者。
nerd-dictation 是一個單一的 Python 腳本(GPL-3.0),建在離線的 VOSK 引擎上。沒有常駐程式、沒有介面:你把「開始」和「結束」綁到快捷鍵,它就把你講的打出來。文字處理是一個 Python 設定檔,所以你想怎麼改輸出都行。透過輸入模擬工具,在 X11 和 Wayland 上都能用。
- ✅ 免費、開源、完全離線
- ✅ 小巧、手動觸發的設計。背景不會有東西在跑
- ✅ 輸出的後處理是你自己的 Python,想怎麼客製都行
- ➖ 要自己組:VOSK 模型、音訊工具、
xdotool/ydotool、快捷鍵 - ➖ VOSK 的準確度落後現代 Whisper 等級的模型
6. whisper.cpp:自己動手做
適合: 想要最高離線準確度、又不介意自己搭整條管線的人。
whisper.cpp 不是一個聽寫 app。它是 OpenAI Whisper 的一個高效能 C/C++ 移植版,上面很多工具都建在它之上。Linux 使用者用一個收音腳本加一個輸入模擬器,把它接進聽寫流程。準確度是離線能拿到的最好的。其他全靠你自己。
- ✅ 離線的準確度天花板,免費、開源
- ➖ 沒有 app、沒有快捷鍵、沒有介面。全部你自己搭
它們怎麼比
真正把這些工具分出來的,是兩件事。一是你要自己管多少: 是裝了就能用的 app,還是要自己接模型和 API key。二是工作在哪裡發生。
完全離線的工具把你的音訊留在自己機器上,但代價是你的機器在扛。本地的語音轉文字、一道 LLM 潤稿,還有(如果你要它念回來)TTS,全都要 RAM 和 GPU。一個 LLM 加一個像樣的語音模型,很容易就要 6 GB 以上,光是好的 TTS 也要好幾 G。它們一跑,就跟你想拿那張 GPU 去做的其他事搶資源:ComfyUI、訓練模型、build、遊戲。而且除非你降到很小的模型(那會犧牲準確度),否則比雲端慢,長音檔尤其明顯。
雲端工具(像 Meander)做的是相反的取捨:你的機器不被佔、長音檔轉得快,而且你用大型高準確度模型加 LLM 潤稿,卻不花你自己一個 byte 的 VRAM。代價是要連線。沒有哪一邊「比較好」。選你比較願意付的那種代價。(而且只有 Meander 連你的手機都一起算進來。)
| Meander | OpenWhispr | Handy | Speech Note | |
|---|---|---|---|---|
| 原生 Linux | ||||
| 完全離線(私密) | 雲端¹ | 本地模式 | ||
| 不佔用你的 CPU/GPU/RAM | 雲端 | 只在雲端模式 | 會佔 | 會佔 |
| 長音檔快 | 看模型/硬體 | 看模型/硬體 | 看模型/硬體 | |
| AI 潤稿、免設定 | 內建 | ⚠️ 自備 key² | ⚠️ 自備 key³ | 純文字 |
| 多語轉錄(講 X → 出 X 文字) | 100+ | 99+ | 100+ | |
| 翻譯成另一種語言(講 X → 出 Y) | 內建、零設定、中日韓調校 | ⚠️ 靠自己的 LLM | ⚠️ 靠自己的 LLM⁵ | 離線、需分步 |
| 一個帳號跨 Linux + Windows | 付費方案 | 各機獨立 | ||
| Android(完整鍵盤 / IME) | ||||
| 設定和紀錄跨裝置同步 | 含 Android | 付費、桌面 | ||
| 內建 AI 助理 | ||||
| 免費 | 免費方案 | 免費方案⁴ | 完全免費 | |
| 開源 | MIT | MIT | MPL-2.0 |
¹ Meander 即時串流處理音訊,不會儲存錄音。 ² OpenWhispr 的本地模型離線跑、不用 key;雲端模型用你自己的 API key。 ³ Handy 用你自己的 OpenAI/Anthropic key 或自架 Ollama。在 macOS 上可以用裝置端的 Apple Intelligence,免 key。 ⁴ OpenWhispr 的免費方案本地不限量;雲端額度有上限(約每週 2000 字)。 ⁵ Handy 要翻成其他語言只能透過它的 LLM 後處理: 自備 API key(或本地 Ollama / Mac 的 Apple Intelligence)加一個你自己寫的 prompt。它沒有內建的翻成指定語言的模式,原生的 Whisper 翻譯只能輸出英文。(OpenWhispr 的 LLM 那條路也一樣。)
功能、平台、定價都會變,請以各專案官網的最新資訊為準。
誠實的推薦。 這裡真的有選擇,沒有單一贏家。如果隱私和零成本是你的底線,而且你不介意花自己的 CPU、GPU、RAM,那就走離線。Handy 是最好的起手,想要更多引擎和離線翻譯就選 Speech Note,想要介於本地和雲端之間就選 OpenWhispr。
但對多數人來說,另一條路更簡單。全部在本地跑,等於你的機器在扛:那些 RAM 和 GPU 你八成想拿去做別的,而且只要超過一句話就會變慢。讓雲端來做就跳過這一切。你拿到速度、機器不被佔、而且沒有東西要設定。這就是 Meander 的賭注:連長音檔都快,內建 AI 潤稿和真正的翻譯,Windows 和 Android 上還是同一個帳號。有免費方案,你可以先試試合不合用再決定付不付費。