Kaiju Hub AI

Tastarea vocală

Selectarea serviciului de tastare vocală în setările Kaiju Hub

Prezentare generală

Alegeți un motor de transcriere local sau serviciul de dictare încorporat în sistemul dvs. de operare. Disponibilitatea depinde de platforma dvs. și de ce motoare opționale sunt instalate.

Ce face speech-to-text

Speech to text transformă ceea ce spui în text editabil oriunde Kaiju Hub AI oferă o acțiune de microfon. Folosiți-l pentru a dicta solicitările agentului, pentru a continua o conversație Kaiju Voice și pentru a introduce instrucțiuni mai lungi fără a tasta. Motoarele locale precum Whisper și Parakeet păstrează transcrierea pe mașina dvs.; Dictarea platformei folosește serviciul de vorbire oferit de Windows sau macOS.

Servicii disponibile

șoptește

Transcriere locală OpenAI Whisper cu dimensiunea modelului selectabilă și accelerare hardware.

NVIDIA Parakeet

Recunoaștere rapidă locală a vorbirii folosind motorul Parakeet opțional.

Şoaptă nebuneşte de rapidă

O cale Whisper optimizată pentru configurațiile GPU acceptate.

Tastare vocală Windows

Utilizează dictarea Windows și tasta rapidă de sistem configurată.

Dictarea Apple

Utilizează serviciul de dictare macOS încorporat.

șoptește

Whisper — conversie vocală locală în text cu selecția motorului de transcriere și starea instalării

Setări Whisper

Configurați setările OpenAI Whisper pentru transcrierea locală de la voce la text. Whisper rulează complet pe computerul dvs. pentru intrare vocală offline, privată. Descărcați, instalați și eliminați modele direct din această filă.

Modele disponibile

Foarte mic

39 de milioane de parametri, aproximativ 75 MB descărcați, aproximativ 10x viteza în timp real, necesită 1 GB VRAM.

Basic

74 de milioane de parametri, aproximativ 145 MB descărcați, aproximativ 7x viteza în timp real, necesită 1 GB VRAM.

Mic

244 de milioane de parametri, aproximativ 465 MB descărcați, aproximativ 4x viteza în timp real, necesită 2 GB VRAM.

Mediu

769 de milioane de parametri, aproximativ 1,5 GB descărcați, aproximativ 2x viteza în timp real, necesită 5 GB VRAM.

Mare

1550 de milioane de parametri, aproximativ 3 GB descărcați, 1x viteza în timp real, necesită 10 GB VRAM.

Turbo

809 de milioane de parametri, aproximativ 1,6 GB descărcați, aproximativ 8x viteza în timp real, necesită 6 GB VRAM.

Ce model Whisper ar trebui să aleg?

Începeți cu Small pentru un echilibru practic între viteză, utilizarea memoriei și calitatea transcripției. Deplasați-vă în jos când hardware-ul este limitat sau alegeți Medium, Large sau Turbo când precizia și performanța GPU contează mai mult.

Foarte mic

Detectarea cuvintelor de trezire, comenzi rapide și testare pe sistemele cu cea mai mică memorie.

Basic

Note scurte, solicitări și dictare generală pe hardware modest.

Mic

O alegere de zi cu zi echilibrată pentru solicitările agenților și dictarea mai lungă.

Mediu

Transcriere concentrată pe precizie atunci când puteți tranzacționa timp suplimentar de procesare și memorie.

Mare

Opțiunea locală cu cea mai mare precizie pentru sistemele cu cel puțin 10 GB de VRAM disponibilă.

Turbo

Transcriere rapidă și de înaltă calitate pe un GPU compatibil cu cel puțin 6 GB de VRAM disponibilă.

Stare de instalare

Pagina de setări afișează starea instalării dependențelor necesare:

șoptește
FFmpeg
CUDA
UV (Python env)

Perus și șoaptă nebunește de rapidă

Motoare rapide optionale

Aceste motoare sunt descărcări separate, astfel încât instalarea implicită rămâne mică. Ecranul de setări arată instalarea și starea hardware-ului pentru fiecare motor.

Vedeți cuvintele apărând în timp ce vorbiți, cu transcriere locală în direct. Insanely Fast Whisper este optimizat pentru GPU-uri NVIDIA moderne; sunt disponibile și Whisper, Parakeet, precum și opțiuni vocale în cloud și ale platformei.

NVIDIA Parakeet

Un motor local de conversie vocală în text de mare viteză. Instalați durata de funcționare opțională din setările de tastare vocală înainte de a o selecta.

Şoaptă nebuneşte de rapidă

O implementare accelerată Whisper destinată sistemelor GPU compatibile. Instalați motorul opțional înainte de utilizare.

Selectarea unuia prin Kaiju Voice nu începe niciodată o descărcare mare în tăcere. Instalați-l mai întâi în Setări; asistentul poate verifica apoi disponibilitatea și poate schimba serviciile.

Voce platformă

Windows Voice Typing — keyboard shortcut configuration and system setup

Introducere vocală Windows

Configurați Introducerea vocală Windows pentru transcrierea de la voce la text. Acest serviciu utilizează Serviciile de vorbire Azure încorporate în Windows 10 și versiunile ulterioare. Este necesară o conexiune la internet. Urmați instrucțiunile de configurare pentru a activa recunoașterea vocală în Setările Windows.

Cerințe de sistem

Windows 10 sau o versiune ulterioară, cu recunoașterea vocală activată în setările sistemului.

Scurtătură

Scurtătura implicită: Ctrl+Shift+W. Configurabilă după preferințele dvs.

Testați declanșatorul

Butonul de testare pentru a verifica dacă introducerea vocală funcționează corect cu microfonul dvs.

Dictare Apple

Configurați Dictarea Apple pentru transcrierea de la voce la text pe macOS. Acesta este un serviciu nativ macOS, fără a fi necesară nicio configurare suplimentară, în afară de activarea dictării în Setările sistemului.

Cerințe de sistem

macOS cu Dictare activată în Setările sistemului > Tastatură.

Scurtătură

Scurtătura implicită: Ctrl+Shift+D. Configurabilă după preferințele dvs.

Testați declanșatorul

Butonul de testare pentru a verifica dacă dictarea funcționează corect cu microfonul dvs.

Text to Speech și voci AI

Modele locale de voce

AI Brain vorbește prin modelul instalat selectat. Schimbarea modelelor descarcă modelul anterior înainte de încărcarea celui nou, iar lista de voci este filtrată la voci compatibile cu modelul respectiv.

Kokoro 82M

Vorbire locală ușoară și rapidă, cu o selecție largă de voce încorporată.

Chatterbox Turbo

Vorbire expresivă cu latență scăzută și clonarea vocii acceptată.

Chatterbox

Modelul complet Chatterbox pentru sinteza locală expresivă și clonarea.

OmniVoice 0.6B

Text-to-speech local compact multilingv.

OuteTTS 1.0 1B

Generare locală de vorbire cu propriul set de voce compatibil.

Qwen3-TTS 1.7B

Sinteză locală multilingvă și expresivă mai mare.

Fish Speech S2 Pro

Vorbire locală de înaltă calitate, cu fluxuri de lucru acceptate pentru voce de referință.

Viteza vorbirii poate fi setată de la 0,5× la 2×. Clonarea vocii apare doar pentru modelele care o suportă; utilizați sunetul pe care îl dețineți sau aveți permisiunea de a utiliza.

Catalogul furnizorilor de cloud

Catalogul de setări include și configurații pentru OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech și Microsoft Azure. Disponibilitatea depinde de configurația furnizorului și de acreditările pe care le furnizați.

Acreditările API rămân în Setări și sunt excluse din rezumatele setărilor vorbite sau structurate ale Kaiju Voice.

Toate logo-urile, marcile inregistrate si numele de brand terte afisate pe Kaiju Hub AI sunt proprietatea detinatorilor respectivi. Utilizarea lor este exclusiv in scopuri de identificare si nu implica sustinere, sponsorizare sau afiliere.