Kaiju Hub AI

Hlasové zadávání

Výběr služby hlasového psaní v nastavení Kaiju Hub

Přehled

Vyberte místní přepisovací modul nebo službu diktování vestavěnou ve vašem operačním systému. Dostupnost závisí na vaší platformě a na tom, které volitelné motory jsou nainstalovány.

Co dělá převod řeči na text

Převod řeči na text změní to, co říkáte, na upravitelný text, kdykoli Kaiju Hub AI nabízí mikrofonní akci. Použijte jej k diktování výzev agentů, pokračování v konverzaci Kaiju Voice a zadávání delších pokynů bez psaní. Místní nástroje jako Whisper a Parakeet uchovávají přepis na vašem počítači; diktování platformy využívá hlasovou službu poskytovanou Windows nebo macOS.

Dostupné služby

Šeptej

Lokální přepis OpenAI Whisper s volitelnou velikostí modelu a hardwarovou akcelerací.

NVIDIA Parakeet

Rychlé místní rozpoznávání řeči pomocí volitelného enginu Parakeet.

Šíleně rychlý šepot

Optimalizovaná cesta Whisper pro podporované konfigurace GPU.

Hlasové zadávání Windows

Používá diktování Windows a nakonfigurovanou systémovou klávesovou zkratku.

Diktování Apple

Používá vestavěnou službu diktování macOS.

Šeptej

Whisper — místní převod řeči na text s výběrem přepisovacího jádra a stavem instalace

Šeptej

Stav instalace

Nastavení Whisperu

Malý

39 milionů parametrů, ~75 MB ke stažení, ~10x rychlejší než v reálném čase, vyžaduje 1 GB VRAM.

Základní nastavení

74 milionů parametrů, ~145 MB ke stažení, ~7x rychlejší než v reálném čase, vyžaduje 1 GB VRAM.

Malý

244 milionů parametrů, ~465 MB ke stažení, ~4x rychlejší než v reálném čase, vyžaduje 2 GB VRAM.

Střední

769 milionů parametrů, ~1,5 GB ke stažení, ~2x rychlejší než v reálném čase, vyžaduje 5 GB VRAM.

Velký

1550M parametrů, ~3 GB ke stažení, 1x rychlost v reálném čase, vyžaduje 10 GB VRAM.

Turbo

809M parametrů, ~1,6 GB ke stažení, ~8x rychlost v reálném čase, vyžaduje 6 GB VRAM.

Který model Whisper bych si měl vybrat?

Začněte s Small pro praktickou rovnováhu mezi rychlostí, využitím paměti a kvalitou přepisu. Přejděte dolů, když je hardware omezený, nebo zvolte Medium, Large nebo Turbo, když na přesnosti a výkonu GPU záleží více.

Malý

Detekce probuzení, rychlé příkazy a testování na systémech s nejnižší pamětí.

Základní nastavení

Krátké poznámky, výzvy a obecné diktáty na skromném hardwaru.

Malý

Vyvážená každodenní volba pro výzvy agentů a delší diktování.

Střední

Transkripce zaměřená na přesnost, kdy můžete vyměnit čas zpracování a paměť navíc.

Velký

Nejpřesnější místní možnost pro systémy s alespoň 10 GB dostupné paměti VRAM.

Turbo

Rychlý a vysoce kvalitní přepis na podporovaném GPU s alespoň 6 GB dostupné paměti VRAM.

Dostupné modely

Stránka nastavení zobrazuje stav instalace požadovaných závislostí:

Šeptej
FFmpeg
CUDA
UV (Python env)

Andulka a šíleně rychlý šepot

Volitelné rychlé motory

Tyto motory jsou samostatné stahování, takže výchozí instalace zůstává malá. Obrazovka nastavení zobrazuje instalaci a stav hardwaru pro každý motor.

Sledujte, jak se slova zobrazují během řeči díky živému místnímu přepisu. Insanely Fast Whisper je optimalizován pro moderní GPU NVIDIA; k dispozici jsou také Whisper, Parakeet a cloudové i systémové možnosti rozpoznávání řeči.

NVIDIA Parakeet

Vysokorychlostní místní převodník řeči na text. Před výběrem nainstalujte jeho volitelný runtime z nastavení Hlasového zadávání.

Šíleně rychlý šepot

Zrychlená implementace Whisper určená pro kompatibilní systémy GPU. Před použitím nainstalujte volitelný motor.

Výběr přes Kaiju Voice nikdy nezahájí velké stahování tiše. Nejprve jej nainstalujte v Nastavení; asistent pak může ověřit dostupnost a přepnout služby.

Platformní hlas

Windows Voice Typing — keyboard shortcut configuration and system setup

Hlasové psaní ve Windows

Platforma

Systémové požadavky

Požadavky na systém

Klávesová zkratka

Klávesová zkratka

Testovací spouštěč

Otestovat spouštěč

Diktační služba Apple

Nakonfigurujte rozpoznávání hlasu ve Windows pro rozpoznávání řeči na text. Tato služba používá Azure Speech Services, které jsou součástí Windows 10 a novějších. Vyžaduje připojení k internetu. Postupujte podle pokynů pro nastavení a povolte rozpoznávání řeči v nastavení systému Windows.

Systémové požadavky

Tlačítko pro testování, které ověří, zda rozpoznávání hlasu správně funguje s vaším mikrofonem.

Klávesová zkratka

macOS s povoleným rozpoznáváním řeči v Nastavení systému > Klávesnice.

Testovací spouštěč

Výchozí klávesová zkratka: Ctrl+Shift+D. Lze ji konfigurovat podle vašich preferencí.

Převod textu na řeč a hlasy AI

Místní hlasové modely

AI Brain mluví prostřednictvím vybraného nainstalovaného modelu. Změna modelů uvolní předchozí model před načtením nového a seznam hlasů je filtrován na hlasy kompatibilní s tímto modelem.

Kokoro 82M

Lehká, rychlá místní řeč s širokým vestavěným výběrem hlasu.

Chatterbox Turbo

Expresivní řeč s nízkou latencí a podporované klonování hlasu.

Chatterbox

Úplný model Chatterbox pro expresivní lokální syntézu a klonování.

OmniVoice 0,6B

Kompaktní vícejazyčný místní převod textu na řeč.

OuteTTS 1.0 1B

Lokální generování řeči s vlastní kompatibilní hlasovou sadou.

Qwen3-TTS 1.7B

Větší vícejazyčná a expresivní lokální syntéza.

Fish Speech S2 Pro

Vysoce kvalitní místní řeč s podporovanými pracovními postupy referenčního hlasu.

Rychlost řeči lze nastavit od 0,5× do 2×. Hlasové klonování se zobrazí pouze u modelů, které jej podporují; používat zvuk, který vlastníte nebo máte oprávnění k použití.

Katalog poskytovatelů cloudu

Katalog nastavení také obsahuje konfiguraci pro OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech a Microsoft Azure. Dostupnost závisí na konfiguraci poskytovatele a přihlašovacích údajích, které dodáte.

Přihlašovací údaje API zůstávají v Nastavení a jsou vyloučeny z mluvených nebo strukturovaných souhrnů nastavení Kaiju Voice.

Všechna loga, ochranné známky a názvy značek třetích stran zobrazené v Kaiju Hub AI jsou vlastnictvím příslušných vlastníků. Jejich použití slouží výhradně k identifikaci a neznamená schválení, sponzorství ani přidružení.