Kaiju Hub AI

音声入力

Kaiju Hub 設定での音声入力サービスの選択

概要

ローカルの文字起こしエンジンまたはオペレーティング システムの組み込みディクテーション サービスを選択します。利用できるかどうかは、プラットフォームとインストールされているオプションのエンジンによって異なります。

音声からテキストへの変換の機能

Speech to Text は、Kaiju Hub AI がマイク アクションを提供する場所であればどこでも、ユーザーの発言を編集可能なテキストに変換します。これを使用して、エージェントのプロンプトを口述したり、Kaiju Voice での会話を継続したり、入力せずに長い指示を入力したりできます。 Whisper や Parakeet などのローカル エンジンは、マシン上で文字起こしを維持します。プラットフォームのディクテーションは、Windows または macOS が提供する音声サービスを使用します。

利用できるサービス

ささやき

選択可能なモデル サイズとハードウェア アクセラレーションを備えたローカル OpenAI Whisper トランスクリプション。

NVIDIA インコ

オプションの Parakeet エンジンを使用した高速ローカル音声認識。

めちゃくちゃ速いささやき

サポートされている GPU 構成向けに最適化された Whisper パス。

Windows の音声入力

Windows ディクテーションと設定されたシステム ホットキーを使用します。

Apple ディクテーション

組み込みの macOS ディクテーション サービスを使用します。

ささやき

Whisper — 文字起こしエンジンの選択とインストールステータスを備えたローカル音声テキスト変換

Whisper設定

ローカル音声テキスト変換のためのOpenAI Whisper設定を構成します。Whisperはマシン上で完全に実行され、オフラインでプライベートな音声入力を提供します。このタブからモデルを直接ダウンロード、インストール、削除できます。

利用可能なモデル

Tiny

39M parameters, ~75 MB download, ~10x realtime speed, requires 1 GB VRAM.

Base

74M parameters, ~145 MB download, ~7x realtime speed, requires 1 GB VRAM.

Small

244M parameters, ~465 MB download, ~4x realtime speed, requires 2 GB VRAM.

Medium

769M parameters, ~1.5 GB download, ~2x realtime speed, requires 5 GB VRAM.

Large

1550M parameters, ~3 GB download, 1x realtime speed, requires 10 GB VRAM.

Turbo

809M parameters, ~1.6 GB download, ~8x realtime speed, requires 6 GB VRAM.

どのウィスパーモデルを選択すればよいですか?

速度、メモリ使用量、転写品質の実用的なバランスを得るには、Small から始めてください。ハードウェアが制限されている場合は下に移動し、精度と GPU パフォーマンスがより重要な場合は Medium、Large、または Turbo を選択します。

Tiny

ウェイクワード検出、クイック コマンド、およびメモリが最も少ないシステムでのテスト。

Base

控えめなハードウェアでの短いメモ、プロンプト、および一般的なディクテーション。

Small

エージェントのプロンプトと長時間のディクテーションのためのバランスの取れた毎日の選択肢。

Medium

余分な処理時間とメモリを犠牲にして、精度を重視した転写を行います。

Large

少なくとも 10 GB の利用可能な VRAM を備えたシステム向けの最高精度のローカル オプション。

Turbo

少なくとも 6 GB の利用可能な VRAM を備えたサポートされている GPU での高速で高品質のトランスクリプション。

インストールステータス

設定ページには必要な依存関係のインストールステータスが表示されます:

ささやき
FFmpeg
CUDA
UV (Python env)

インコとめちゃくちゃ速いささやき

オプションの高速エンジン

これらのエンジンは個別にダウンロードされるため、デフォルトのインストールは小規模のままです。設定画面には、各エンジンのインストールとハードウェアのステータスが表示されます。

ライブのローカル文字起こしで、話すそばから単語が表示されます。Insanely Fast Whisper は最新の NVIDIA GPU 向けに最適化されており、Whisper、Parakeet、クラウド、プラットフォームの音声オプションも利用できます。

NVIDIA インコ

高速ローカル音声テキスト変換エンジン。オプションのランタイムを選択する前に、音声入力設定からインストールしてください。

めちゃくちゃ速いささやき

互換性のある GPU システムを対象とした、高速化された Whisper 実装。オプションのエンジンを取り付けてご使用ください。

Kaiju Voice を通じていずれかを選択しても、大規模なダウンロードがサイレントに開始されることはありません。まず設定でインストールしてください。その後、アシスタントは可用性を確認してサービスを切り替えることができます。

プラットフォーム音声

Windows Voice Typing — keyboard shortcut configuration and system setup

Windows音声入力

音声テキスト変換のためのWindows音声入力を設定します。このサービスはWindows 10以降に内蔵のAzure Speech Servicesを使用します。インターネット接続が必要です。Windowsの設定で音声認識を有効にするセットアップ手順に従ってください。

システム要件

システム設定で音声認識が有効なWindows 10以降。

ホットキー

デフォルトのトリガーホットキー:Ctrl+Shift+W。お好みに設定可能。

トリガーテスト

マイクで音声入力が正しく動作しているか確認するテストボタン。

Apple Dictation

macOSでの音声テキスト変換のためのApple Dictationを設定します。これはmacOSのネイティブ機能で、システム設定でディクテーションを有効にする以外の追加セットアップは不要です。

システム要件

システム設定 > キーボードでディクテーションが有効なmacOS。

ホットキー

デフォルトのトリガーホットキー:Ctrl+Shift+D。お好みに設定可能。

トリガーテスト

マイクでディクテーションが正しく動作しているか確認するテストボタン。

テキスト読み上げと AI 音声

ローカル音声モデル

AI Brain は、選択されたインストール済みモデルを通して話します。モデルを変更すると、新しいモデルをロードする前に以前のモデルがアンロードされ、ボイス リストはそのモデルと互換性のあるボイスにフィルタリングされます。

こころ82M

幅広い組み込み音声選択を備えた、軽量で高速なローカル音声。

チャターボックスターボ

低遅延の表現力豊かなスピーチとサポートされた音声クローン。

おしゃべり箱

表現力豊かなローカル合成とクローン作成のための完全な Chatterbox モデル。

オムニボイス 0.6B

コンパクトな多言語ローカルテキスト読み上げ。

アウトTTS 1.0 1B

独自の互換性のある音声セットを使用したローカル音声生成。

Qwen3-TTS 1.7B

より大規模な多言語で表現力豊かなローカル合成。

フィッシュスピーチ S2 プロ

サポートされている参照音声ワークフローによる高品質のローカル音声。

発話速度は0.5倍速から2倍速まで設定できます。音声クローン作成は、それをサポートするモデルでのみ表示されます。あなたが所有する、または使用許可を得ているオーディオを使用してください。

クラウドプロバイダーカタログ

設定カタログには、OpenAI、イレブンラボ、Cartesia、Smallest AI、Fish Audio、Speechmatics、Amazon Polly、Google Cloud Text-to-Speech、および Microsoft Azure の構成も含まれています。可用性は、プロバイダーの構成と指定した資格情報によって異なります。

API 認証情報は設定に残り、Kaiju Voice の音声または構造化された設定概要から除外されます。

Kaiju Hub AIに表示されるサードパーティのロゴ、商標、ブランド名はそれぞれの所有者に帰属します。識別目的のみに使用され、推奨、後援、提携を意味するものではありません。