Tastarea vocală
Prezentare generală
Alegeți un motor de transcriere local sau serviciul de dictare încorporat în sistemul dvs. de operare. Disponibilitatea depinde de platforma dvs. și de ce motoare opționale sunt instalate.
Ce face speech-to-text
Speech to text transformă ceea ce spui în text editabil oriunde Kaiju Hub AI oferă o acțiune de microfon. Folosiți-l pentru a dicta solicitările agentului, pentru a continua o conversație Kaiju Voice și pentru a introduce instrucțiuni mai lungi fără a tasta. Motoarele locale precum Whisper și Parakeet păstrează transcrierea pe mașina dvs.; Dictarea platformei folosește serviciul de vorbire oferit de Windows sau macOS.
Servicii disponibile
șoptește
Transcriere locală OpenAI Whisper cu dimensiunea modelului selectabilă și accelerare hardware.
NVIDIA Parakeet
Recunoaștere rapidă locală a vorbirii folosind motorul Parakeet opțional.
Şoaptă nebuneşte de rapidă
O cale Whisper optimizată pentru configurațiile GPU acceptate.
Tastare vocală Windows
Utilizează dictarea Windows și tasta rapidă de sistem configurată.
Dictarea Apple
Utilizează serviciul de dictare macOS încorporat.
șoptește
Setări Whisper
Configurați setările OpenAI Whisper pentru transcrierea locală de la voce la text. Whisper rulează complet pe computerul dvs. pentru intrare vocală offline, privată. Descărcați, instalați și eliminați modele direct din această filă.
Modele disponibile
Foarte mic
39 de milioane de parametri, aproximativ 75 MB descărcați, aproximativ 10x viteza în timp real, necesită 1 GB VRAM.
Basic
74 de milioane de parametri, aproximativ 145 MB descărcați, aproximativ 7x viteza în timp real, necesită 1 GB VRAM.
Mic
244 de milioane de parametri, aproximativ 465 MB descărcați, aproximativ 4x viteza în timp real, necesită 2 GB VRAM.
Mediu
769 de milioane de parametri, aproximativ 1,5 GB descărcați, aproximativ 2x viteza în timp real, necesită 5 GB VRAM.
Mare
1550 de milioane de parametri, aproximativ 3 GB descărcați, 1x viteza în timp real, necesită 10 GB VRAM.
Turbo
809 de milioane de parametri, aproximativ 1,6 GB descărcați, aproximativ 8x viteza în timp real, necesită 6 GB VRAM.
Ce model Whisper ar trebui să aleg?
Începeți cu Small pentru un echilibru practic între viteză, utilizarea memoriei și calitatea transcripției. Deplasați-vă în jos când hardware-ul este limitat sau alegeți Medium, Large sau Turbo când precizia și performanța GPU contează mai mult.
Foarte mic
Detectarea cuvintelor de trezire, comenzi rapide și testare pe sistemele cu cea mai mică memorie.
Basic
Note scurte, solicitări și dictare generală pe hardware modest.
Mic
O alegere de zi cu zi echilibrată pentru solicitările agenților și dictarea mai lungă.
Mediu
Transcriere concentrată pe precizie atunci când puteți tranzacționa timp suplimentar de procesare și memorie.
Mare
Opțiunea locală cu cea mai mare precizie pentru sistemele cu cel puțin 10 GB de VRAM disponibilă.
Turbo
Transcriere rapidă și de înaltă calitate pe un GPU compatibil cu cel puțin 6 GB de VRAM disponibilă.
Stare de instalare
Pagina de setări afișează starea instalării dependențelor necesare:
Perus și șoaptă nebunește de rapidă
Motoare rapide optionale
Aceste motoare sunt descărcări separate, astfel încât instalarea implicită rămâne mică. Ecranul de setări arată instalarea și starea hardware-ului pentru fiecare motor.
Vedeți cuvintele apărând în timp ce vorbiți, cu transcriere locală în direct. Insanely Fast Whisper este optimizat pentru GPU-uri NVIDIA moderne; sunt disponibile și Whisper, Parakeet, precum și opțiuni vocale în cloud și ale platformei.
NVIDIA Parakeet
Un motor local de conversie vocală în text de mare viteză. Instalați durata de funcționare opțională din setările de tastare vocală înainte de a o selecta.
Şoaptă nebuneşte de rapidă
O implementare accelerată Whisper destinată sistemelor GPU compatibile. Instalați motorul opțional înainte de utilizare.
Selectarea unuia prin Kaiju Voice nu începe niciodată o descărcare mare în tăcere. Instalați-l mai întâi în Setări; asistentul poate verifica apoi disponibilitatea și poate schimba serviciile.
Voce platformă
Introducere vocală Windows
Configurați Introducerea vocală Windows pentru transcrierea de la voce la text. Acest serviciu utilizează Serviciile de vorbire Azure încorporate în Windows 10 și versiunile ulterioare. Este necesară o conexiune la internet. Urmați instrucțiunile de configurare pentru a activa recunoașterea vocală în Setările Windows.
Cerințe de sistem
Windows 10 sau o versiune ulterioară, cu recunoașterea vocală activată în setările sistemului.
Scurtătură
Scurtătura implicită: Ctrl+Shift+W. Configurabilă după preferințele dvs.
Testați declanșatorul
Butonul de testare pentru a verifica dacă introducerea vocală funcționează corect cu microfonul dvs.
Dictare Apple
Configurați Dictarea Apple pentru transcrierea de la voce la text pe macOS. Acesta este un serviciu nativ macOS, fără a fi necesară nicio configurare suplimentară, în afară de activarea dictării în Setările sistemului.
Cerințe de sistem
macOS cu Dictare activată în Setările sistemului > Tastatură.
Scurtătură
Scurtătura implicită: Ctrl+Shift+D. Configurabilă după preferințele dvs.
Testați declanșatorul
Butonul de testare pentru a verifica dacă dictarea funcționează corect cu microfonul dvs.
Text to Speech și voci AI
Modele locale de voce
AI Brain vorbește prin modelul instalat selectat. Schimbarea modelelor descarcă modelul anterior înainte de încărcarea celui nou, iar lista de voci este filtrată la voci compatibile cu modelul respectiv.
Kokoro 82M
Vorbire locală ușoară și rapidă, cu o selecție largă de voce încorporată.
Chatterbox Turbo
Vorbire expresivă cu latență scăzută și clonarea vocii acceptată.
Chatterbox
Modelul complet Chatterbox pentru sinteza locală expresivă și clonarea.
OmniVoice 0.6B
Text-to-speech local compact multilingv.
OuteTTS 1.0 1B
Generare locală de vorbire cu propriul set de voce compatibil.
Qwen3-TTS 1.7B
Sinteză locală multilingvă și expresivă mai mare.
Fish Speech S2 Pro
Vorbire locală de înaltă calitate, cu fluxuri de lucru acceptate pentru voce de referință.
Viteza vorbirii poate fi setată de la 0,5× la 2×. Clonarea vocii apare doar pentru modelele care o suportă; utilizați sunetul pe care îl dețineți sau aveți permisiunea de a utiliza.
Catalogul furnizorilor de cloud
Catalogul de setări include și configurații pentru OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech și Microsoft Azure. Disponibilitatea depinde de configurația furnizorului și de acreditările pe care le furnizați.
Acreditările API rămân în Setări și sunt excluse din rezumatele setărilor vorbite sau structurate ale Kaiju Voice.
