Kaiju Hub AI

Pisanie głosowe

Wybór usługi pisania głosowego w ustawieniach Kaiju Hub

Przegląd

Wybierz lokalny silnik transkrypcji lub wbudowaną usługę dyktowania systemu operacyjnego. Dostępność zależy od platformy i zainstalowanych opcjonalnych silników.

Co robi zamiana mowy na tekst

Zamiana mowy na tekst zamienia Twoją wypowiedź w edytowalny tekst wszędzie tam, gdzie Kaiju Hub AI oferuje działanie mikrofonu. Używaj go do dyktowania poleceń agenta, kontynuowania rozmowy głosowej Kaiju i wprowadzania dłuższych instrukcji bez pisania. Lokalne silniki, takie jak Whisper i Parakeet, przechowują transkrypcję na Twoim komputerze; dyktowanie na platformie korzysta z usługi mowy udostępnianej przez system Windows lub macOS.

Dostępne usługi

Szeptać

Lokalna transkrypcja OpenAI Whisper z możliwością wyboru rozmiaru modelu i akceleracją sprzętową.

NVIDIA Parakeet

Szybkie lokalne rozpoznawanie mowy za pomocą opcjonalnego silnika Parakeet.

Szalenie szybki szept

Zoptymalizowana ścieżka Whisper dla obsługiwanych konfiguracji GPU.

Pisanie głosowe w systemie Windows

Używa dyktowania systemu Windows i skonfigurowanego skrótu systemowego.

Dyktando Apple

Korzysta z wbudowanej usługi dyktowania w systemie macOS.

Szeptać

Szept — lokalna zamiana mowy na tekst z wyborem silnika transkrypcji i stanem instalacji

Ustawienia Whisper

Skonfiguruj ustawienia OpenAI Whisper do lokalnej transkrypcji mowy na tekst. Whisper działa całkowicie na Twoim komputerze do prywatnego, offline wprowadzania głosowego. Pobieraj, instaluj i usuwaj modele bezpośrednio z tej zakładki.

Dostępne modele

Tiny

39M parametrów, ~75 MB do pobrania, ~10x prędkość w czasie rzeczywistym, wymaga 1 GB VRAM.

Base

74M parametrów, ~145 MB do pobrania, ~7x prędkość w czasie rzeczywistym, wymaga 1 GB VRAM.

Small

244M parametrów, ~465 MB do pobrania, ~4x prędkość w czasie rzeczywistym, wymaga 2 GB VRAM.

Medium

769M parametrów, ~1,5 GB do pobrania, ~2x prędkość w czasie rzeczywistym, wymaga 5 GB VRAM.

Large

1550M parametrów, ~3 GB do pobrania, 1x prędkość w czasie rzeczywistym, wymaga 10 GB VRAM.

Turbo

809M parametrów, ~1,6 GB do pobrania, ~8x prędkość w czasie rzeczywistym, wymaga 6 GB VRAM.

Który model Whisper wybrać?

Zacznij od wersji Small, aby uzyskać praktyczną równowagę między szybkością, wykorzystaniem pamięci i jakością transkrypcji. Przejdź w dół, jeśli sprzęt jest ograniczony, lub wybierz Medium, Large lub Turbo, gdy liczy się dokładność i wydajność procesora graficznego.

Tiny

Wykrywanie słów budzących, szybkie polecenia i testowanie na systemach z najmniejszą pamięcią.

Base

Krótkie notatki, podpowiedzi i ogólne dyktando na skromnym sprzęcie.

Small

Zrównoważony wybór na co dzień w przypadku podpowiedzi dla agentów i dłuższego dyktowania.

Medium

Transkrypcja zorientowana na dokładność, gdy możesz zamienić dodatkowy czas przetwarzania i pamięć.

Large

Opcja lokalna o najwyższej dokładności dla systemów z co najmniej 10 GB dostępnej pamięci VRAM.

Turbo

Szybka transkrypcja wysokiej jakości na obsługiwanym procesorze graficznym z co najmniej 6 GB dostępnej pamięci VRAM.

Status instalacji

Strona ustawień pokazuje status instalacji wymaganych zależności:

Szeptać
FFmpeg
CUDA
UV (Python env)

Papuga i szalenie szybki szept

Opcjonalne szybkie silniki

Silniki te można pobrać osobno, więc domyślna instalacja pozostaje niewielka. Ekran ustawień pokazuje instalację i stan sprzętu dla każdego silnika.

Obserwuj pojawiające się słowa podczas mówienia dzięki lokalnej transkrypcji na żywo. Insanely Fast Whisper jest zoptymalizowany pod kątem nowoczesnych procesorów graficznych NVIDIA; dostępne są również Whisper, Parakeet oraz opcje mowy w chmurze i systemie.

NVIDIA Parakeet

Szybki lokalny silnik zamiany mowy na tekst. Zainstaluj opcjonalne środowisko wykonawcze w ustawieniach pisania głosowego przed jego wybraniem.

Szalenie szybki szept

Przyspieszona implementacja Whisper przeznaczona dla kompatybilnych systemów GPU. Przed użyciem zainstaluj opcjonalny silnik.

Wybranie jednego za pomocą Kaiju Voice nigdy nie rozpoczyna cichego pobierania dużego pliku. Najpierw zainstaluj go w Ustawieniach; asystent może następnie sprawdzić dostępność i zmienić usługę.

Głos platformy

Windows Voice Typing — keyboard shortcut configuration and system setup

Pisanie głosowe Windows

Skonfiguruj Pisanie głosowe Windows do transkrypcji mowy na tekst. Ta usługa używa Azure Speech Services wbudowanych w Windows 10 i nowsze. Wymagane jest połączenie z internetem. Postępuj zgodnie z instrukcjami konfiguracji, aby włączyć rozpoznawanie mowy w Ustawieniach Windows.

Wymagania systemowe

Windows 10 lub nowszy z włączonym rozpoznawaniem mowy w ustawieniach systemowych.

Skrót klawiszowy

Domyślny skrót: Ctrl+Shift+W. Możliwość konfiguracji według preferencji.

Testowanie wyzwalania

Przycisk testowy do weryfikacji, czy pisanie głosowe działa poprawnie z Twoim mikrofonem.

Dyktowanie Apple

Skonfiguruj Dyktowanie Apple do transkrypcji mowy na tekst w macOS. Jest to natywna funkcja macOS, nie wymagająca dodatkowej konfiguracji poza włączeniem dyktowania w Ustawieniach systemowych.

Wymagania systemowe

macOS z włączonym Dyktowaniem w Ustawienia systemowe > Klawiatura.

Skrót klawiszowy

Domyślny skrót: Ctrl+Shift+D. Możliwość konfiguracji według preferencji.

Testowanie wyzwalania

Przycisk testowy do weryfikacji, czy dyktowanie działa poprawnie z Twoim mikrofonem.

Tekst na mowę i głosy AI

Lokalne modele głosu

AI Brain przemawia poprzez wybrany zainstalowany model. Zmiana modelu powoduje usunięcie poprzedniego modelu przed załadowaniem nowego, a lista głosów jest filtrowana w kierunku głosów zgodnych z tym modelem.

Kokoro 82M

Lekka, szybka mowa lokalna z szerokim wbudowanym wyborem głosu.

Gaduła Turbo

Mowa ekspresyjna o niskim opóźnieniu i obsługiwane klonowanie głosu.

Gaduła

Pełny model Chatterbox do ekspresyjnej syntezy lokalnej i klonowania.

OmniVoice 0.6B

Kompaktowy, wielojęzyczny, lokalny syntezator mowy.

OuteTTS 1.0 1B

Lokalne generowanie mowy z własnym, kompatybilnym zestawem głosów.

Qwen3-TTS 1.7B

Większa wielojęzyczna i wyrazista synteza lokalna.

Mowa Ryby S2 Pro

Wysokiej jakości mowa lokalna z obsługiwanymi przepływami pracy z głosem referencyjnym.

Szybkość mowy można ustawić w zakresie od 0,5× do 2×. Klonowanie głosu pojawia się tylko w przypadku modeli, które je obsługują; wykorzystaj dźwięk, którego jesteś właścicielem lub na którego użycie masz pozwolenie.

Katalog dostawców usług w chmurze

Katalog ustawień obejmuje także konfigurację OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech i Microsoft Azure. Dostępność zależy od konfiguracji dostawcy i podanych poświadczeń.

Poświadczenia API pozostają w Ustawieniach i są wykluczone z mówionych lub uporządkowanych podsumowań ustawień Kaiju Voice.

Wszystkie logo, znaki towarowe i nazwy marek stron trzecich wyświetlane w Kaiju Hub AI są własnością ich odpowiednich właścicieli. Ich użycie służy wyłącznie celom identyfikacyjnym i nie oznacza poparcia, sponsorowania ani przynależności.