Kaiju Hub AI

Mecanografia per veu

Selecció del servei d'escriptura de veu a la configuració de Kaiju Hub

Visió general

Trieu un motor de transcripció local o el servei de dictat integrat del vostre sistema operatiu. La disponibilitat depèn de la vostra plataforma i dels motors opcionals instal·lats.

Què fa la parla a text

La veu a text converteix el que dius en text editable allà on Kaiju Hub AI ofereix una acció de micròfon. Utilitzeu-lo per dictar instruccions de l'agent, continuar una conversa de Kaiju Voice i introduir instruccions més llargues sense escriure. Els motors locals com Whisper i Parakeet mantenen la transcripció a la vostra màquina; El dictat de la plataforma utilitza el servei de veu proporcionat per Windows o macOS.

Serveis disponibles

xiuxiuejar

Transcripció local OpenAI Whisper amb mida de model seleccionable i acceleració de maquinari.

NVIDIA Perico

Reconeixement local ràpid de la veu mitjançant el motor opcional Parakeet.

Xiuxiueig increïblement ràpid

Una ruta de Whisper optimitzada per a configuracions de GPU compatibles.

Escriptura de veu de Windows

Utilitza el dictat de Windows i la tecla d'accés ràpid del sistema configurat.

Dictat d'Apple

Utilitza el servei de dictat de macOS integrat.

xiuxiuejar

Xiuxiueig: veu local a text amb selecció del motor de transcripció i estat d'instal·lació

Configuració de Whisper

Configura la configuració d'OpenAI Whisper per a la transcripció de veu a text local. Whisper s'executa completament a la teva màquina per a l'entrada de veu privada i fora de línia. Descarrega, instal·la i suprimeix els models directament des d'aquesta pestanya.

Models disponibles

Petit

39 milions de paràmetres, ~75 MB de descàrrega, ~10x de velocitat en temps real, requereix 1 GB de VRAM.

Bàsic

74 milions de paràmetres, ~145 MB de descàrrega, ~7x de velocitat en temps real, requereix 1 GB de VRAM.

Petit

244 milions de paràmetres, ~465 MB de descàrrega, ~4x de velocitat en temps real, requereix 2 GB de VRAM.

Mitjà

769 milions de paràmetres, ~1,5 GB de descàrrega, ~2x de velocitat en temps real, requereix 5 GB de VRAM.

Gran

1550 milions de paràmetres, ~3 GB de descàrrega, 1x de velocitat en temps real, requereix 10 GB de VRAM.

Turbo

809 milions de paràmetres, ~1,6 GB de descàrrega, ~8x de velocitat en temps real, requereix 6 GB de VRAM.

Quin model de Whisper he de triar?

Comenceu amb Small per obtenir un equilibri pràctic de velocitat, ús de memòria i qualitat de transcripció. Desplaceu-vos cap avall quan el maquinari sigui limitat o trieu Medium, Large o Turbo quan la precisió i el rendiment de la GPU siguin més importants.

Petit

Detecció de paraules d'activació, ordres ràpides i proves als sistemes amb menys memòria.

Bàsic

Notes breus, indicacions i dictat general sobre maquinari modest.

Petit

Una opció diària equilibrada per a indicacions de l'agent i dictats més llargs.

Mitjà

Transcripció centrada en la precisió quan podeu intercanviar temps de processament i memòria addicionals.

Gran

L'opció local de més precisió per a sistemes amb almenys 10 GB de VRAM disponible.

Turbo

Transcripció ràpida i d'alta qualitat en una GPU compatible amb almenys 6 GB de VRAM disponible.

Estat de la instal·lació

La pàgina de configuració mostra l'estat de la instal·lació de les dependències necessàries:

xiuxiuejar
FFmpeg
CUDA
UV (Python env)

Periquito i xiuxiueig insòment ràpid

Motors ràpids opcionals

Aquests motors són descàrregues separades, de manera que la instal·lació predeterminada es manté petita. La pantalla de configuració mostra l'estat de la instal·lació i del maquinari per a cada motor.

Vegeu com apareixen les paraules mentre parleu amb la transcripció local en directe. Insanely Fast Whisper està optimitzat per a GPU NVIDIA modernes, i també hi ha disponibles Whisper, Parakeet i opcions de veu al núvol i de la plataforma.

NVIDIA Perico

Un motor local de veu a text d'alta velocitat. Instal·leu el seu temps d'execució opcional des de la configuració d'Escriptura de veu abans de seleccionar-lo.

Xiuxiueig increïblement ràpid

Una implementació accelerada de Whisper pensada per a sistemes GPU compatibles. Instal·leu el motor opcional abans d'utilitzar-lo.

Si seleccioneu-ne un mitjançant Kaiju Voice, mai no s'inicia una descàrrega gran en silenci. Instal·leu-lo primer a Configuració; L'assistent pot verificar la disponibilitat i canviar de servei.

Veu de la plataforma

Windows Voice Typing — keyboard shortcut configuration and system setup

Escriptura de veu de Windows

Configura l'escriptura de veu de Windows per a la transcripció de veu a text. Aquest servei utilitza els serveis de veu d'Azure integrats a Windows 10 i versions posteriors. Cal que hi hagi connexió a Internet. Segueix les instruccions de configuració per habilitar el reconeixement de veu a la configuració de Windows.

Requisits del sistema

Windows 10 o posterior amb el reconeixement de veu habilitat a la configuració del sistema.

Tecla de dret

Tecla de dret per defecte: Ctrl+Maj+W. Es pot configurar segons les teves preferències.

Prova de la tecla de dret

Botó de prova per verificar que l'escriptura de veu funciona correctament amb el teu micròfon.

Dictat d'Apple

Configura el dictat d'Apple per a la transcripció de veu a text a macOS. Aquest és un servei natiu de macOS que no requereix cap configuració addicional més enllà d'habilitar el dictat a la configuració del sistema.

Requisits del sistema

macOS amb el dictat habilitat a la configuració del sistema > teclat.

Tecla de dret

Tecla de dret per defecte: Ctrl+Maj+D. Es pot configurar segons les teves preferències.

Prova de la tecla de dret

Botó de prova per verificar que el dictat funciona correctament amb el teu micròfon.

Text a veu i veus d'IA

Models de veu locals

AI Brain parla a través del model instal·lat seleccionat. El canvi de model descarrega el model anterior abans de carregar-ne el nou i la llista de veus es filtra a veus compatibles amb aquest model.

Kokoro 82M

Veu local lleugera i ràpida amb una àmplia selecció de veu integrada.

Chatterbox Turbo

Discurs expressiu de baixa latència i clonació de veu compatible.

Chatterbox

El model complet de Chatterbox per a la síntesi local expressiva i la clonació.

OmniVoice 0.6B

Text a veu local multilingüe compacte.

OuteTTS 1.0 1B

Generació de veu local amb el seu propi conjunt de veu compatible.

Qwen3-TTS 1.7B

Síntesi local multilingüe i expressiva més gran.

Fish Speech S2 Pro

Veu local d'alta qualitat amb fluxos de treball de veu de referència compatibles.

La velocitat de la parla es pot configurar de 0,5× a 2×. La clonació de veu només apareix per als models que l'admeten; utilitzeu l'àudio que teniu o teniu permís per utilitzar-lo.

Catàleg de proveïdors de núvol

El catàleg de configuració també inclou la configuració per a OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech i Microsoft Azure. La disponibilitat depèn de la configuració del proveïdor i de les credencials que proporcioneu.

Les credencials de l'API romanen a Configuració i s'exclouen dels resums de configuració parlats o estructurats de Kaiju Voice.

Tots els logotips, marques comercials i noms de marques de tercers mostrats a Kaiju Hub AI són propietat dels seus respectius propietaris. El seu ús és únicament amb fins d'identificació i no implica recolzament, patrocini ni afiliació.