Kaiju Hub AI

語音打字

Kaiju Hub 設定中的語音輸入服務選擇

概述

選擇本地轉錄引擎或作業系統的內建聽寫服務。可用性取決於您的平台以及安裝的可選引擎。

語音轉文字有什麼作用

只要 Kaiju Hub AI 提供麥克風操作,語音轉文字就會將您所說的內容轉換為可編輯的文字。使用它來聽寫代理提示、繼續 Kaiju 語音對話以及無需打字即可輸入較長的指令。 Whisper 和 Parakeet 等本機引擎會在您的機器上保存轉錄;平台聽寫使用 Windows 或 macOS 提供的語音服務。

可用服務

耳語

具有可選模型大小和硬體加速功能的本地 OpenAI Whisper 轉錄。

NVIDIA 鸚鵡

使用選購的 Parakeet 引擎進行快速本地語音辨識。

瘋狂快速的耳語

針對支援的 GPU 配置的最佳化 Whisper 路徑。

Windows 語音輸入

使用 Windows 聽寫和設定的系統熱鍵。

蘋果聽寫

使用內建的 macOS 聽寫服務。

耳語

Whisper — 具有轉錄引擎選擇和安裝狀態的本地語音到文本

Whisper 設定

設定 OpenAI Whisper 的本機語音轉文字轉錄。Whisper 完全在您的電腦上執行,提供離線、私密的語音輸入。直接從此標籤下載、安裝和移除模型。

可用模型

Tiny

3900 萬參數,約 75 MB 下載,約 10 倍即時速度,需要 1 GB VRAM。

Base

7400 萬參數,約 145 MB 下載,約 7 倍即時速度,需要 1 GB VRAM。

Small

2.44 億參數,約 465 MB 下載,約 4 倍即時速度,需要 2 GB VRAM。

Medium

7.69 億參數,約 1.5 GB 下載,約 2 倍即時速度,需要 5 GB VRAM。

Large

15.5 億參數,約 3 GB 下載,1 倍即時速度,需要 10 GB VRAM。

Turbo

8.09 億參數,約 1.6 GB 下載,約 8 倍即時速度,需要 6 GB VRAM。

我應該選擇哪種 Whisper 型號?

從 Small 開始,以實現速度、記憶體使用和轉錄品質的實際平衡。當硬體有限時向下移動,或當精度和 GPU 效能更重要時選擇 Medium、Large 或 Turbo。

Tiny

喚醒詞檢測、快速命令以及在最低記憶體系統上的測試。

Base

在普通硬體上進行簡短的筆記、提示和一般聽寫。

Small

座席提示和較長聽寫的平衡日常選擇。

Medium

當您可以犧牲額外的處理時間和記憶體時,請注重準確性的轉錄。

Large

適用於至少 10 GB 可用 VRAM 的系統的最高精度本機選項。

Turbo

在具有至少 6 GB 可用 VRAM 的支援 GPU 上快速、高品質轉錄。

安裝狀態

設定頁面顯示必要依賴項的安裝狀態:

耳語
FFmpeg
CUDA
UV (Python env)

長尾小鸚鵡和瘋狂的快速耳語

可選的快速發動機

這些引擎是單獨下載的,因此預設安裝較小。設定畫面顯示每個引擎的安裝和硬體狀態。

透過即時本機轉錄,在說話時即可看到文字出現。Insanely Fast Whisper 已針對現代 NVIDIA GPU 最佳化,同時也提供 Whisper、Parakeet、雲端和平台語音選項。

NVIDIA 鸚鵡

高速本地語音轉文字引擎。在選擇之前,請從「語音輸入」設定中安裝其可選運行時。

瘋狂快速的耳語

旨在相容 GPU 系統的加速 Whisper 實作。使用前安裝可選引擎。

透過 Kaiju Voice 選擇一個絕不會默默地開始大量下載。首先在「設定」中安裝;然後,助理可以驗證可用性並切換服務。

平台語音

Windows Voice Typing — keyboard shortcut configuration and system setup

Windows 語音輸入

設定 Windows 語音輸入以進行語音轉文字轉錄。此服務使用 Windows 10 及更新版本內建的 Azure Speech Services。需要網路連線。按照設定指示在 Windows 設定中啟用語音辨識。

系統需求

Windows 10 或更新版本,且在系統設定中已啟用語音辨識。

快捷鍵

預設觸發快捷鍵:Ctrl+Shift+W。可依您的偏好設定。

測試觸發

測試按鈕以驗證語音輸入是否正確搭配您的麥克風運作。

Apple 聽寫

設定 Apple 聽寫以在 macOS 上進行語音轉文字轉錄。這是 macOS 的原生功能,除了在系統設定中啟用聽寫外,無需額外設定。

系統需求

macOS 且已在系統設定 > 鍵盤中啟用聽寫。

快捷鍵

預設觸發快捷鍵:Ctrl+Shift+D。可依您的偏好設定。

測試觸發

測試按鈕以驗證聽寫是否正確搭配您的麥克風運作。

文字轉語音與人工智慧語音

本地語音模型

AI Brain 透過選定的已安裝模型進行對話。更改模型會在載入新模型之前卸載先前的模型,並且語音清單會過濾為與該模型相容的語音。

心82M

輕量、快速的本地語音,具有廣泛的內建語音選擇。

話匣子渦輪

低延遲表達性語音並支援語音克隆。

話匣子

用於表達本地合成和克隆的完整 Chatterbox 模型。

OmniVoice 0.6B

緊湊的多語言本地文本轉語音。

輸出TTS 1.0 1B

具有自己的兼容語音集的本地語音生成。

Qwen3-TTS 1.7B

更大規模的多語言和富有表現力的本地綜合。

魚語S2 Pro

高品質本地語音以及受支援的參考語音工作流程。

語速可設定為 0.5 倍至 2 倍。語音克隆僅出現在支援它的型號上;使用您擁有或有權使用的音訊。

雲端提供者目錄

設定目錄還包括 OpenAI、ElevenLabs、Cartesia、Smallest AI、Fish Audio、Speechmatics、Amazon Polly、Google Cloud Text-to Speech 和 Microsoft Azure 的配置。可用性取決於提供者配置和您提供的憑證。

API 憑證保留在「設定」中,且不包含在 Kaiju Voice 的語音或結構化設定摘要中。

Kaiju Hub AI 中顯示的所有第三方標誌、商標和品牌名稱均為其各自所有者的財產。它們的使用僅用於識別目的,並不意味著認可、贊助或隸屬關係。