語音打字
概述
選擇本地轉錄引擎或作業系統的內建聽寫服務。可用性取決於您的平台以及安裝的可選引擎。
語音轉文字有什麼作用
只要 Kaiju Hub AI 提供麥克風操作,語音轉文字就會將您所說的內容轉換為可編輯的文字。使用它來聽寫代理提示、繼續 Kaiju 語音對話以及無需打字即可輸入較長的指令。 Whisper 和 Parakeet 等本機引擎會在您的機器上保存轉錄;平台聽寫使用 Windows 或 macOS 提供的語音服務。
可用服務
耳語
具有可選模型大小和硬體加速功能的本地 OpenAI Whisper 轉錄。
NVIDIA 鸚鵡
使用選購的 Parakeet 引擎進行快速本地語音辨識。
瘋狂快速的耳語
針對支援的 GPU 配置的最佳化 Whisper 路徑。
Windows 語音輸入
使用 Windows 聽寫和設定的系統熱鍵。
蘋果聽寫
使用內建的 macOS 聽寫服務。
耳語
Whisper 設定
設定 OpenAI Whisper 的本機語音轉文字轉錄。Whisper 完全在您的電腦上執行,提供離線、私密的語音輸入。直接從此標籤下載、安裝和移除模型。
可用模型
Tiny
3900 萬參數,約 75 MB 下載,約 10 倍即時速度,需要 1 GB VRAM。
Base
7400 萬參數,約 145 MB 下載,約 7 倍即時速度,需要 1 GB VRAM。
Small
2.44 億參數,約 465 MB 下載,約 4 倍即時速度,需要 2 GB VRAM。
Medium
7.69 億參數,約 1.5 GB 下載,約 2 倍即時速度,需要 5 GB VRAM。
Large
15.5 億參數,約 3 GB 下載,1 倍即時速度,需要 10 GB VRAM。
Turbo
8.09 億參數,約 1.6 GB 下載,約 8 倍即時速度,需要 6 GB VRAM。
我應該選擇哪種 Whisper 型號?
從 Small 開始,以實現速度、記憶體使用和轉錄品質的實際平衡。當硬體有限時向下移動,或當精度和 GPU 效能更重要時選擇 Medium、Large 或 Turbo。
Tiny
喚醒詞檢測、快速命令以及在最低記憶體系統上的測試。
Base
在普通硬體上進行簡短的筆記、提示和一般聽寫。
Small
座席提示和較長聽寫的平衡日常選擇。
Medium
當您可以犧牲額外的處理時間和記憶體時,請注重準確性的轉錄。
Large
適用於至少 10 GB 可用 VRAM 的系統的最高精度本機選項。
Turbo
在具有至少 6 GB 可用 VRAM 的支援 GPU 上快速、高品質轉錄。
安裝狀態
設定頁面顯示必要依賴項的安裝狀態:
長尾小鸚鵡和瘋狂的快速耳語
可選的快速發動機
這些引擎是單獨下載的,因此預設安裝較小。設定畫面顯示每個引擎的安裝和硬體狀態。
透過即時本機轉錄,在說話時即可看到文字出現。Insanely Fast Whisper 已針對現代 NVIDIA GPU 最佳化,同時也提供 Whisper、Parakeet、雲端和平台語音選項。
NVIDIA 鸚鵡
高速本地語音轉文字引擎。在選擇之前,請從「語音輸入」設定中安裝其可選運行時。
瘋狂快速的耳語
旨在相容 GPU 系統的加速 Whisper 實作。使用前安裝可選引擎。
透過 Kaiju Voice 選擇一個絕不會默默地開始大量下載。首先在「設定」中安裝;然後,助理可以驗證可用性並切換服務。
平台語音
Windows 語音輸入
設定 Windows 語音輸入以進行語音轉文字轉錄。此服務使用 Windows 10 及更新版本內建的 Azure Speech Services。需要網路連線。按照設定指示在 Windows 設定中啟用語音辨識。
系統需求
Windows 10 或更新版本,且在系統設定中已啟用語音辨識。
快捷鍵
預設觸發快捷鍵:Ctrl+Shift+W。可依您的偏好設定。
測試觸發
測試按鈕以驗證語音輸入是否正確搭配您的麥克風運作。
Apple 聽寫
設定 Apple 聽寫以在 macOS 上進行語音轉文字轉錄。這是 macOS 的原生功能,除了在系統設定中啟用聽寫外,無需額外設定。
系統需求
macOS 且已在系統設定 > 鍵盤中啟用聽寫。
快捷鍵
預設觸發快捷鍵:Ctrl+Shift+D。可依您的偏好設定。
測試觸發
測試按鈕以驗證聽寫是否正確搭配您的麥克風運作。
文字轉語音與人工智慧語音
本地語音模型
AI Brain 透過選定的已安裝模型進行對話。更改模型會在載入新模型之前卸載先前的模型,並且語音清單會過濾為與該模型相容的語音。
心82M
輕量、快速的本地語音,具有廣泛的內建語音選擇。
話匣子渦輪
低延遲表達性語音並支援語音克隆。
話匣子
用於表達本地合成和克隆的完整 Chatterbox 模型。
OmniVoice 0.6B
緊湊的多語言本地文本轉語音。
輸出TTS 1.0 1B
具有自己的兼容語音集的本地語音生成。
Qwen3-TTS 1.7B
更大規模的多語言和富有表現力的本地綜合。
魚語S2 Pro
高品質本地語音以及受支援的參考語音工作流程。
語速可設定為 0.5 倍至 2 倍。語音克隆僅出現在支援它的型號上;使用您擁有或有權使用的音訊。
雲端提供者目錄
設定目錄還包括 OpenAI、ElevenLabs、Cartesia、Smallest AI、Fish Audio、Speechmatics、Amazon Polly、Google Cloud Text-to Speech 和 Microsoft Azure 的配置。可用性取決於提供者配置和您提供的憑證。
API 憑證保留在「設定」中,且不包含在 Kaiju Voice 的語音或結構化設定摘要中。
