Pisanie głosowe
Przegląd
Wybierz lokalny silnik transkrypcji lub wbudowaną usługę dyktowania systemu operacyjnego. Dostępność zależy od platformy i zainstalowanych opcjonalnych silników.
Co robi zamiana mowy na tekst
Zamiana mowy na tekst zamienia Twoją wypowiedź w edytowalny tekst wszędzie tam, gdzie Kaiju Hub AI oferuje działanie mikrofonu. Używaj go do dyktowania poleceń agenta, kontynuowania rozmowy głosowej Kaiju i wprowadzania dłuższych instrukcji bez pisania. Lokalne silniki, takie jak Whisper i Parakeet, przechowują transkrypcję na Twoim komputerze; dyktowanie na platformie korzysta z usługi mowy udostępnianej przez system Windows lub macOS.
Dostępne usługi
Szeptać
Lokalna transkrypcja OpenAI Whisper z możliwością wyboru rozmiaru modelu i akceleracją sprzętową.
NVIDIA Parakeet
Szybkie lokalne rozpoznawanie mowy za pomocą opcjonalnego silnika Parakeet.
Szalenie szybki szept
Zoptymalizowana ścieżka Whisper dla obsługiwanych konfiguracji GPU.
Pisanie głosowe w systemie Windows
Używa dyktowania systemu Windows i skonfigurowanego skrótu systemowego.
Dyktando Apple
Korzysta z wbudowanej usługi dyktowania w systemie macOS.
Szeptać
Ustawienia Whisper
Skonfiguruj ustawienia OpenAI Whisper do lokalnej transkrypcji mowy na tekst. Whisper działa całkowicie na Twoim komputerze do prywatnego, offline wprowadzania głosowego. Pobieraj, instaluj i usuwaj modele bezpośrednio z tej zakładki.
Dostępne modele
Tiny
39M parametrów, ~75 MB do pobrania, ~10x prędkość w czasie rzeczywistym, wymaga 1 GB VRAM.
Base
74M parametrów, ~145 MB do pobrania, ~7x prędkość w czasie rzeczywistym, wymaga 1 GB VRAM.
Small
244M parametrów, ~465 MB do pobrania, ~4x prędkość w czasie rzeczywistym, wymaga 2 GB VRAM.
Medium
769M parametrów, ~1,5 GB do pobrania, ~2x prędkość w czasie rzeczywistym, wymaga 5 GB VRAM.
Large
1550M parametrów, ~3 GB do pobrania, 1x prędkość w czasie rzeczywistym, wymaga 10 GB VRAM.
Turbo
809M parametrów, ~1,6 GB do pobrania, ~8x prędkość w czasie rzeczywistym, wymaga 6 GB VRAM.
Który model Whisper wybrać?
Zacznij od wersji Small, aby uzyskać praktyczną równowagę między szybkością, wykorzystaniem pamięci i jakością transkrypcji. Przejdź w dół, jeśli sprzęt jest ograniczony, lub wybierz Medium, Large lub Turbo, gdy liczy się dokładność i wydajność procesora graficznego.
Tiny
Wykrywanie słów budzących, szybkie polecenia i testowanie na systemach z najmniejszą pamięcią.
Base
Krótkie notatki, podpowiedzi i ogólne dyktando na skromnym sprzęcie.
Small
Zrównoważony wybór na co dzień w przypadku podpowiedzi dla agentów i dłuższego dyktowania.
Medium
Transkrypcja zorientowana na dokładność, gdy możesz zamienić dodatkowy czas przetwarzania i pamięć.
Large
Opcja lokalna o najwyższej dokładności dla systemów z co najmniej 10 GB dostępnej pamięci VRAM.
Turbo
Szybka transkrypcja wysokiej jakości na obsługiwanym procesorze graficznym z co najmniej 6 GB dostępnej pamięci VRAM.
Status instalacji
Strona ustawień pokazuje status instalacji wymaganych zależności:
Papuga i szalenie szybki szept
Opcjonalne szybkie silniki
Silniki te można pobrać osobno, więc domyślna instalacja pozostaje niewielka. Ekran ustawień pokazuje instalację i stan sprzętu dla każdego silnika.
Obserwuj pojawiające się słowa podczas mówienia dzięki lokalnej transkrypcji na żywo. Insanely Fast Whisper jest zoptymalizowany pod kątem nowoczesnych procesorów graficznych NVIDIA; dostępne są również Whisper, Parakeet oraz opcje mowy w chmurze i systemie.
NVIDIA Parakeet
Szybki lokalny silnik zamiany mowy na tekst. Zainstaluj opcjonalne środowisko wykonawcze w ustawieniach pisania głosowego przed jego wybraniem.
Szalenie szybki szept
Przyspieszona implementacja Whisper przeznaczona dla kompatybilnych systemów GPU. Przed użyciem zainstaluj opcjonalny silnik.
Wybranie jednego za pomocą Kaiju Voice nigdy nie rozpoczyna cichego pobierania dużego pliku. Najpierw zainstaluj go w Ustawieniach; asystent może następnie sprawdzić dostępność i zmienić usługę.
Głos platformy
Pisanie głosowe Windows
Skonfiguruj Pisanie głosowe Windows do transkrypcji mowy na tekst. Ta usługa używa Azure Speech Services wbudowanych w Windows 10 i nowsze. Wymagane jest połączenie z internetem. Postępuj zgodnie z instrukcjami konfiguracji, aby włączyć rozpoznawanie mowy w Ustawieniach Windows.
Wymagania systemowe
Windows 10 lub nowszy z włączonym rozpoznawaniem mowy w ustawieniach systemowych.
Skrót klawiszowy
Domyślny skrót: Ctrl+Shift+W. Możliwość konfiguracji według preferencji.
Testowanie wyzwalania
Przycisk testowy do weryfikacji, czy pisanie głosowe działa poprawnie z Twoim mikrofonem.
Dyktowanie Apple
Skonfiguruj Dyktowanie Apple do transkrypcji mowy na tekst w macOS. Jest to natywna funkcja macOS, nie wymagająca dodatkowej konfiguracji poza włączeniem dyktowania w Ustawieniach systemowych.
Wymagania systemowe
macOS z włączonym Dyktowaniem w Ustawienia systemowe > Klawiatura.
Skrót klawiszowy
Domyślny skrót: Ctrl+Shift+D. Możliwość konfiguracji według preferencji.
Testowanie wyzwalania
Przycisk testowy do weryfikacji, czy dyktowanie działa poprawnie z Twoim mikrofonem.
Tekst na mowę i głosy AI
Lokalne modele głosu
AI Brain przemawia poprzez wybrany zainstalowany model. Zmiana modelu powoduje usunięcie poprzedniego modelu przed załadowaniem nowego, a lista głosów jest filtrowana w kierunku głosów zgodnych z tym modelem.
Kokoro 82M
Lekka, szybka mowa lokalna z szerokim wbudowanym wyborem głosu.
Gaduła Turbo
Mowa ekspresyjna o niskim opóźnieniu i obsługiwane klonowanie głosu.
Gaduła
Pełny model Chatterbox do ekspresyjnej syntezy lokalnej i klonowania.
OmniVoice 0.6B
Kompaktowy, wielojęzyczny, lokalny syntezator mowy.
OuteTTS 1.0 1B
Lokalne generowanie mowy z własnym, kompatybilnym zestawem głosów.
Qwen3-TTS 1.7B
Większa wielojęzyczna i wyrazista synteza lokalna.
Mowa Ryby S2 Pro
Wysokiej jakości mowa lokalna z obsługiwanymi przepływami pracy z głosem referencyjnym.
Szybkość mowy można ustawić w zakresie od 0,5× do 2×. Klonowanie głosu pojawia się tylko w przypadku modeli, które je obsługują; wykorzystaj dźwięk, którego jesteś właścicielem lub na którego użycie masz pozwolenie.
Katalog dostawców usług w chmurze
Katalog ustawień obejmuje także konfigurację OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech i Microsoft Azure. Dostępność zależy od konfiguracji dostawcy i podanych poświadczeń.
Poświadczenia API pozostają w Ustawieniach i są wykluczone z mówionych lub uporządkowanych podsumowań ustawień Kaiju Voice.
