Kaiju Hub AI

Hanggépelés

Hanggépelési szolgáltatás kiválasztása a Kaiju Hub beállításaiban

Áttekintés

Válasszon helyi átírási motort vagy operációs rendszere beépített diktálási szolgáltatását. A rendelkezésre állás a platformtól és a telepített opcionális motoroktól függ.

Amit a beszéd szöveggé alakít

A beszéd szöveggé változtatja a mondottakat szerkeszthető szöveggé, ahol a Kaiju Hub AI mikrofonműveletet kínál. Használja ügynöki utasítások diktálására, a Kaiju Voice beszélgetés folytatására, és hosszabb utasítások beírására gépelés nélkül. A helyi motorok, mint például a Whisper és a Parakeet, megtartják az átírást a gépen; A platformdiktálás a Windows vagy a macOS által biztosított beszédszolgáltatást használja.

Elérhető szolgáltatások

Suttogni

Helyi OpenAI Whisper átírás választható modellmérettel és hardveres gyorsítással.

NVIDIA papagáj

Gyors helyi beszédfelismerés az opcionális Parakeet motor segítségével.

Őrülten gyors suttogás

Optimalizált Whisper útvonal a támogatott GPU-konfigurációkhoz.

Windows hanggépelés

Windows diktálást és a konfigurált rendszer gyorsbillentyűjét használja.

Apple-diktálás

A beépített macOS diktálási szolgáltatást használja.

Suttogni

Whisper – helyi beszéd-szövegké alakítás az átírási motor kiválasztásával és telepítési állapotával

Whisper beállítások

Konfigurálja az OpenAI Whisper beállításait a helyi hang-szöveg átalakításhoz. A Whisper teljes mértékben a gépen fut az offline, privát hangbemenethez. Töltse le, telepítse és távolítsa el a modelleket közvetlenül erről a lapról.

Elérhető modellek

Apró

39M paraméter, ~75 MB letöltés, ~10x valós idejű sebesség, 1 GB VRAM szükséges.

Alap

74M paraméter, ~145 MB letöltés, ~7x valós idejű sebesség, 1 GB VRAM szükséges.

Kicsi

244M paraméter, ~465 MB letöltés, ~4x valós idejű sebesség, 2 GB VRAM szükséges.

Közepes

769M paraméter, ~1,5 GB letöltés, ~2x valós idejű sebesség, 5 GB VRAM szükséges.

Nagy

1550M paraméter, ~3 GB letöltés, 1x valós idejű sebesség, 10 GB VRAM szükséges.

Turbo

809M paraméter, ~1,6 GB letöltés, ~8x valós idejű sebesség, 6 GB VRAM szükséges.

Melyik Whisper modellt válasszam?

Kezdje a Small modellel a sebesség, a memóriahasználat és az átírási minőség praktikus egyensúlyához. Ha a hardver korlátozott, lépjen lefelé, vagy válassza a Medium, Large vagy Turbo modellt, ha a pontosság és a GPU teljesítménye fontosabb.

Apró

Ébresztőszó-érzékelés, gyors parancsok és tesztelés a legkisebb memóriájú rendszereken.

Alap

Rövid megjegyzések, utasítások és általános diktálás szerény hardveren.

Kicsi

Kiegyensúlyozott mindennapi választás ügynöki felszólításhoz és hosszabb diktáláshoz.

Közepes

Pontosságra összpontosító átírás, ha extra feldolgozási időt és memóriát vásárolhat.

Nagy

A legnagyobb pontosságú helyi lehetőség legalább 10 GB rendelkezésre álló VRAM-mal rendelkező rendszerek számára.

Turbo

Gyors, kiváló minőségű átírás támogatott GPU-n, legalább 6 GB rendelkezésre álló VRAM-mal.

Telepítési állapot

A beállítások oldala megjeleníti a szükséges függőségek telepítési állapotát:

Suttogni
FFmpeg
CUDA
UV (Python env)

Papagáj és őrülten gyors suttogás

Választható gyors motorok

Ezek a motorok különálló letöltések, így az alapértelmezett telepítés kicsi marad. A beállítások képernyőn az egyes motorok telepítési és hardverállapota látható.

Élő, helyi átírással beszéd közben azonnal láthatja a szavakat. Az Insanely Fast Whisper modern NVIDIA GPU-kra optimalizált, emellett Whisper, Parakeet, felhőalapú és platformszintű beszédbeviteli lehetőségek is elérhetők.

NVIDIA papagáj

Nagy sebességű helyi beszéd-szöveg motor. Telepítse az opcionális futtatókörnyezetét a Hanggépelés beállításai közül, mielőtt kiválasztaná.

Őrülten gyors suttogás

Egy gyorsított Whisper-megvalósítás kompatibilis GPU-rendszerekhez. Használat előtt szerelje be az opcionális motort.

Ha kiválaszt egyet a Kaiju Voice segítségével, soha nem indul el csendben egy nagy letöltés. Először telepítse a Beállításokba; az asszisztens ezután ellenőrizheti az elérhetőséget és válthat szolgáltatást.

Platform hang

Windows Voice Typing — keyboard shortcut configuration and system setup

Windows Hangbeviteli

Konfigurálja a Windows Hangbevitelt a hang-szöveg átalakításhoz. Ez a szolgáltatás az Azure Speech Services-t használja, amely a Windows 10 és újabb verziókban található. Internetkapcsolat szükséges. Kövesse az utasításokat a hangfelismerés engedélyezéséhez a Windows beállításokban.

Rendszerkövetelmények

Windows 10 vagy újabb, engedélyezett hangfelismeréssel a rendszerbeállításokban.

Gyorsbillentyű

Alapértelmezett gyorsbillentyű: Ctrl+Shift+W. Testreszabható az Ön preferenciái szerint.

Gyorsbillentyű tesztelése

Teszt gomb a hangbeviteli funkció helyes működésének ellenőrzéséhez a mikrofonnal.

Apple Diktálás

Konfigurálja az Apple Diktálást a hang-szöveg átalakításhoz a macOS-en. Ez egy natív macOS funkció, amelyhez nincs szükség további beállításra, csak engedélyezze a diktálást a Rendszerbeállításokban.

Rendszerkövetelmények

macOS, engedélyezett diktálással a Rendszerbeállítások > Billentyűzet menüben.

Gyorsbillentyű

Alapértelmezett gyorsbillentyű: Ctrl+Shift+D. Testreszabható az Ön preferenciái szerint.

Gyorsbillentyű tesztelése

Teszt gomb a diktálási funkció helyes működésének ellenőrzéséhez a mikrofonnal.

Text to Speech és AI Voices

Helyi hangmodellek

Az AI Brain a kiválasztott telepített modellen keresztül beszél. A modellváltáskor az új modell betöltése előtt kiürül az előző modell, és a hanglistát a rendszer az adott modellel kompatibilis hangokra szűri.

Kokoro 82M

Könnyű, gyors helyi beszéd széles beépített hangválasztással.

Chatterbox Turbo

Alacsony késleltetésű kifejező beszéd és támogatott hangklónozás.

Chatterbox

A teljes Chatterbox modell kifejező helyi szintézishez és klónozáshoz.

OmniVoice 0.6B

Kompakt többnyelvű helyi szövegfelolvasó.

OuteTTS 1.0 1B

Helyi beszédgenerálás saját kompatibilis hangkészlettel.

Qwen3-TTS 1.7B

Nagyobb többnyelvű és kifejező helyi szintézis.

Fish Speech S2 Pro

Kiváló minőségű helyi beszéd támogatott referencia-hang munkafolyamatokkal.

A beszédsebesség 0,5× és 2× között állítható be. A hangklónozás csak azoknál a modelleknél jelenik meg, amelyek támogatják; használjon hangot, amely a saját tulajdonában van, vagy engedélye van a használatára.

Felhőszolgáltató katalógus

A beállításkatalógus tartalmazza az OpenAI, az ElevenLabs, a Cartesia, a Smallest AI, a Fish Audio, a Speechmatics, az Amazon Polly, a Google Cloud Text-to-Speech és a Microsoft Azure konfigurációját is. Az elérhetőség a szolgáltató konfigurációjától és a megadott hitelesítő adatoktól függ.

Az API hitelesítő adatai a Beállítások között maradnak, és nem szerepelnek a Kaiju Voice hangos vagy strukturált beállításainak összefoglalóiban.

A Kaiju Hub AI-ban megjelenített összes harmadik fél logó, védjegy és márkanév a megfelelő tulajdonosok tulajdona. Használatuk kizárólag azonosítási célokat szolgál és nem jelent jóváhagyást, szponzorálást vagy társulást.