Mecanografia per veu
Visió general
Trieu un motor de transcripció local o el servei de dictat integrat del vostre sistema operatiu. La disponibilitat depèn de la vostra plataforma i dels motors opcionals instal·lats.
Què fa la parla a text
La veu a text converteix el que dius en text editable allà on Kaiju Hub AI ofereix una acció de micròfon. Utilitzeu-lo per dictar instruccions de l'agent, continuar una conversa de Kaiju Voice i introduir instruccions més llargues sense escriure. Els motors locals com Whisper i Parakeet mantenen la transcripció a la vostra màquina; El dictat de la plataforma utilitza el servei de veu proporcionat per Windows o macOS.
Serveis disponibles
xiuxiuejar
Transcripció local OpenAI Whisper amb mida de model seleccionable i acceleració de maquinari.
NVIDIA Perico
Reconeixement local ràpid de la veu mitjançant el motor opcional Parakeet.
Xiuxiueig increïblement ràpid
Una ruta de Whisper optimitzada per a configuracions de GPU compatibles.
Escriptura de veu de Windows
Utilitza el dictat de Windows i la tecla d'accés ràpid del sistema configurat.
Dictat d'Apple
Utilitza el servei de dictat de macOS integrat.
xiuxiuejar
Configuració de Whisper
Configura la configuració d'OpenAI Whisper per a la transcripció de veu a text local. Whisper s'executa completament a la teva màquina per a l'entrada de veu privada i fora de línia. Descarrega, instal·la i suprimeix els models directament des d'aquesta pestanya.
Models disponibles
Petit
39 milions de paràmetres, ~75 MB de descàrrega, ~10x de velocitat en temps real, requereix 1 GB de VRAM.
Bàsic
74 milions de paràmetres, ~145 MB de descàrrega, ~7x de velocitat en temps real, requereix 1 GB de VRAM.
Petit
244 milions de paràmetres, ~465 MB de descàrrega, ~4x de velocitat en temps real, requereix 2 GB de VRAM.
Mitjà
769 milions de paràmetres, ~1,5 GB de descàrrega, ~2x de velocitat en temps real, requereix 5 GB de VRAM.
Gran
1550 milions de paràmetres, ~3 GB de descàrrega, 1x de velocitat en temps real, requereix 10 GB de VRAM.
Turbo
809 milions de paràmetres, ~1,6 GB de descàrrega, ~8x de velocitat en temps real, requereix 6 GB de VRAM.
Quin model de Whisper he de triar?
Comenceu amb Small per obtenir un equilibri pràctic de velocitat, ús de memòria i qualitat de transcripció. Desplaceu-vos cap avall quan el maquinari sigui limitat o trieu Medium, Large o Turbo quan la precisió i el rendiment de la GPU siguin més importants.
Petit
Detecció de paraules d'activació, ordres ràpides i proves als sistemes amb menys memòria.
Bàsic
Notes breus, indicacions i dictat general sobre maquinari modest.
Petit
Una opció diària equilibrada per a indicacions de l'agent i dictats més llargs.
Mitjà
Transcripció centrada en la precisió quan podeu intercanviar temps de processament i memòria addicionals.
Gran
L'opció local de més precisió per a sistemes amb almenys 10 GB de VRAM disponible.
Turbo
Transcripció ràpida i d'alta qualitat en una GPU compatible amb almenys 6 GB de VRAM disponible.
Estat de la instal·lació
La pàgina de configuració mostra l'estat de la instal·lació de les dependències necessàries:
Periquito i xiuxiueig insòment ràpid
Motors ràpids opcionals
Aquests motors són descàrregues separades, de manera que la instal·lació predeterminada es manté petita. La pantalla de configuració mostra l'estat de la instal·lació i del maquinari per a cada motor.
Vegeu com apareixen les paraules mentre parleu amb la transcripció local en directe. Insanely Fast Whisper està optimitzat per a GPU NVIDIA modernes, i també hi ha disponibles Whisper, Parakeet i opcions de veu al núvol i de la plataforma.
NVIDIA Perico
Un motor local de veu a text d'alta velocitat. Instal·leu el seu temps d'execució opcional des de la configuració d'Escriptura de veu abans de seleccionar-lo.
Xiuxiueig increïblement ràpid
Una implementació accelerada de Whisper pensada per a sistemes GPU compatibles. Instal·leu el motor opcional abans d'utilitzar-lo.
Si seleccioneu-ne un mitjançant Kaiju Voice, mai no s'inicia una descàrrega gran en silenci. Instal·leu-lo primer a Configuració; L'assistent pot verificar la disponibilitat i canviar de servei.
Veu de la plataforma
Escriptura de veu de Windows
Configura l'escriptura de veu de Windows per a la transcripció de veu a text. Aquest servei utilitza els serveis de veu d'Azure integrats a Windows 10 i versions posteriors. Cal que hi hagi connexió a Internet. Segueix les instruccions de configuració per habilitar el reconeixement de veu a la configuració de Windows.
Requisits del sistema
Windows 10 o posterior amb el reconeixement de veu habilitat a la configuració del sistema.
Tecla de dret
Tecla de dret per defecte: Ctrl+Maj+W. Es pot configurar segons les teves preferències.
Prova de la tecla de dret
Botó de prova per verificar que l'escriptura de veu funciona correctament amb el teu micròfon.
Dictat d'Apple
Configura el dictat d'Apple per a la transcripció de veu a text a macOS. Aquest és un servei natiu de macOS que no requereix cap configuració addicional més enllà d'habilitar el dictat a la configuració del sistema.
Requisits del sistema
macOS amb el dictat habilitat a la configuració del sistema > teclat.
Tecla de dret
Tecla de dret per defecte: Ctrl+Maj+D. Es pot configurar segons les teves preferències.
Prova de la tecla de dret
Botó de prova per verificar que el dictat funciona correctament amb el teu micròfon.
Text a veu i veus d'IA
Models de veu locals
AI Brain parla a través del model instal·lat seleccionat. El canvi de model descarrega el model anterior abans de carregar-ne el nou i la llista de veus es filtra a veus compatibles amb aquest model.
Kokoro 82M
Veu local lleugera i ràpida amb una àmplia selecció de veu integrada.
Chatterbox Turbo
Discurs expressiu de baixa latència i clonació de veu compatible.
Chatterbox
El model complet de Chatterbox per a la síntesi local expressiva i la clonació.
OmniVoice 0.6B
Text a veu local multilingüe compacte.
OuteTTS 1.0 1B
Generació de veu local amb el seu propi conjunt de veu compatible.
Qwen3-TTS 1.7B
Síntesi local multilingüe i expressiva més gran.
Fish Speech S2 Pro
Veu local d'alta qualitat amb fluxos de treball de veu de referència compatibles.
La velocitat de la parla es pot configurar de 0,5× a 2×. La clonació de veu només apareix per als models que l'admeten; utilitzeu l'àudio que teniu o teniu permís per utilitzar-lo.
Catàleg de proveïdors de núvol
El catàleg de configuració també inclou la configuració per a OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech i Microsoft Azure. La disponibilitat depèn de la configuració del proveïdor i de les credencials que proporcioneu.
Les credencials de l'API romanen a Configuració i s'exclouen dels resums de configuració parlats o estructurats de Kaiju Voice.
