Hlasové zadávání
Přehled
Vyberte místní přepisovací modul nebo službu diktování vestavěnou ve vašem operačním systému. Dostupnost závisí na vaší platformě a na tom, které volitelné motory jsou nainstalovány.
Co dělá převod řeči na text
Převod řeči na text změní to, co říkáte, na upravitelný text, kdykoli Kaiju Hub AI nabízí mikrofonní akci. Použijte jej k diktování výzev agentů, pokračování v konverzaci Kaiju Voice a zadávání delších pokynů bez psaní. Místní nástroje jako Whisper a Parakeet uchovávají přepis na vašem počítači; diktování platformy využívá hlasovou službu poskytovanou Windows nebo macOS.
Dostupné služby
Šeptej
Lokální přepis OpenAI Whisper s volitelnou velikostí modelu a hardwarovou akcelerací.
NVIDIA Parakeet
Rychlé místní rozpoznávání řeči pomocí volitelného enginu Parakeet.
Šíleně rychlý šepot
Optimalizovaná cesta Whisper pro podporované konfigurace GPU.
Hlasové zadávání Windows
Používá diktování Windows a nakonfigurovanou systémovou klávesovou zkratku.
Diktování Apple
Používá vestavěnou službu diktování macOS.
Šeptej
Šeptej
Stav instalace
Nastavení Whisperu
Malý
39 milionů parametrů, ~75 MB ke stažení, ~10x rychlejší než v reálném čase, vyžaduje 1 GB VRAM.
Základní nastavení
74 milionů parametrů, ~145 MB ke stažení, ~7x rychlejší než v reálném čase, vyžaduje 1 GB VRAM.
Malý
244 milionů parametrů, ~465 MB ke stažení, ~4x rychlejší než v reálném čase, vyžaduje 2 GB VRAM.
Střední
769 milionů parametrů, ~1,5 GB ke stažení, ~2x rychlejší než v reálném čase, vyžaduje 5 GB VRAM.
Velký
1550M parametrů, ~3 GB ke stažení, 1x rychlost v reálném čase, vyžaduje 10 GB VRAM.
Turbo
809M parametrů, ~1,6 GB ke stažení, ~8x rychlost v reálném čase, vyžaduje 6 GB VRAM.
Který model Whisper bych si měl vybrat?
Začněte s Small pro praktickou rovnováhu mezi rychlostí, využitím paměti a kvalitou přepisu. Přejděte dolů, když je hardware omezený, nebo zvolte Medium, Large nebo Turbo, když na přesnosti a výkonu GPU záleží více.
Malý
Detekce probuzení, rychlé příkazy a testování na systémech s nejnižší pamětí.
Základní nastavení
Krátké poznámky, výzvy a obecné diktáty na skromném hardwaru.
Malý
Vyvážená každodenní volba pro výzvy agentů a delší diktování.
Střední
Transkripce zaměřená na přesnost, kdy můžete vyměnit čas zpracování a paměť navíc.
Velký
Nejpřesnější místní možnost pro systémy s alespoň 10 GB dostupné paměti VRAM.
Turbo
Rychlý a vysoce kvalitní přepis na podporovaném GPU s alespoň 6 GB dostupné paměti VRAM.
Dostupné modely
Stránka nastavení zobrazuje stav instalace požadovaných závislostí:
Andulka a šíleně rychlý šepot
Volitelné rychlé motory
Tyto motory jsou samostatné stahování, takže výchozí instalace zůstává malá. Obrazovka nastavení zobrazuje instalaci a stav hardwaru pro každý motor.
Sledujte, jak se slova zobrazují během řeči díky živému místnímu přepisu. Insanely Fast Whisper je optimalizován pro moderní GPU NVIDIA; k dispozici jsou také Whisper, Parakeet a cloudové i systémové možnosti rozpoznávání řeči.
NVIDIA Parakeet
Vysokorychlostní místní převodník řeči na text. Před výběrem nainstalujte jeho volitelný runtime z nastavení Hlasového zadávání.
Šíleně rychlý šepot
Zrychlená implementace Whisper určená pro kompatibilní systémy GPU. Před použitím nainstalujte volitelný motor.
Výběr přes Kaiju Voice nikdy nezahájí velké stahování tiše. Nejprve jej nainstalujte v Nastavení; asistent pak může ověřit dostupnost a přepnout služby.
Platformní hlas
Hlasové psaní ve Windows
Platforma
Systémové požadavky
Požadavky na systém
Klávesová zkratka
Klávesová zkratka
Testovací spouštěč
Otestovat spouštěč
Diktační služba Apple
Nakonfigurujte rozpoznávání hlasu ve Windows pro rozpoznávání řeči na text. Tato služba používá Azure Speech Services, které jsou součástí Windows 10 a novějších. Vyžaduje připojení k internetu. Postupujte podle pokynů pro nastavení a povolte rozpoznávání řeči v nastavení systému Windows.
Systémové požadavky
Tlačítko pro testování, které ověří, zda rozpoznávání hlasu správně funguje s vaším mikrofonem.
Klávesová zkratka
macOS s povoleným rozpoznáváním řeči v Nastavení systému > Klávesnice.
Testovací spouštěč
Výchozí klávesová zkratka: Ctrl+Shift+D. Lze ji konfigurovat podle vašich preferencí.
Převod textu na řeč a hlasy AI
Místní hlasové modely
AI Brain mluví prostřednictvím vybraného nainstalovaného modelu. Změna modelů uvolní předchozí model před načtením nového a seznam hlasů je filtrován na hlasy kompatibilní s tímto modelem.
Kokoro 82M
Lehká, rychlá místní řeč s širokým vestavěným výběrem hlasu.
Chatterbox Turbo
Expresivní řeč s nízkou latencí a podporované klonování hlasu.
Chatterbox
Úplný model Chatterbox pro expresivní lokální syntézu a klonování.
OmniVoice 0,6B
Kompaktní vícejazyčný místní převod textu na řeč.
OuteTTS 1.0 1B
Lokální generování řeči s vlastní kompatibilní hlasovou sadou.
Qwen3-TTS 1.7B
Větší vícejazyčná a expresivní lokální syntéza.
Fish Speech S2 Pro
Vysoce kvalitní místní řeč s podporovanými pracovními postupy referenčního hlasu.
Rychlost řeči lze nastavit od 0,5× do 2×. Hlasové klonování se zobrazí pouze u modelů, které jej podporují; používat zvuk, který vlastníte nebo máte oprávnění k použití.
Katalog poskytovatelů cloudu
Katalog nastavení také obsahuje konfiguraci pro OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech a Microsoft Azure. Dostupnost závisí na konfiguraci poskytovatele a přihlašovacích údajích, které dodáte.
Přihlašovací údaje API zůstávají v Nastavení a jsou vyloučeny z mluvených nebo strukturovaných souhrnů nastavení Kaiju Voice.
