Escritura por voz
Descripción general
Elija un motor de transcripción local o el servicio de dictado integrado de su sistema operativo. La disponibilidad depende de su plataforma y de los motores opcionales instalados.
¿Qué hace la conversión de voz a texto?
La voz a texto convierte lo que dices en texto editable siempre que Kaiju Hub AI ofrezca una acción de micrófono. Úselo para dictar indicaciones para los agentes, continuar una conversación de Kaiju Voice e ingresar instrucciones más largas sin escribir. Los motores locales como Whisper y Parakeet mantienen la transcripción en su máquina; El dictado de la plataforma utiliza el servicio de voz proporcionado por Windows o macOS.
Servicios disponibles
susurro
Transcripción local OpenAI Whisper con tamaño de modelo seleccionable y aceleración de hardware.
Periquito NVIDIA
Reconocimiento de voz local rápido utilizando el motor Parakeet opcional.
Susurro increíblemente rápido
Una ruta Whisper optimizada para configuraciones de GPU compatibles.
Escritura por voz en Windows
Utiliza el dictado de Windows y la tecla de acceso rápido del sistema configurada.
Dictado de manzana
Utiliza el servicio de dictado integrado de macOS.
susurro
Configuración de Whisper
Configura los ajustes de OpenAI Whisper para la transcripción local de voz a texto. Whisper se ejecuta completamente en tu máquina para entrada de voz sin conexión y privada. Descarga, instala y elimina modelos directamente desde esta pestaña.
Modelos disponibles
Tiny
39M parámetros, ~75 MB de descarga, velocidad ~10x en tiempo real, requiere 1 GB de VRAM.
Base
74M parámetros, ~145 MB de descarga, velocidad ~7x en tiempo real, requiere 1 GB de VRAM.
Small
244M parámetros, ~465 MB de descarga, velocidad ~4x en tiempo real, requiere 2 GB de VRAM.
Medium
769M parámetros, ~1.5 GB de descarga, velocidad ~2x en tiempo real, requiere 5 GB de VRAM.
Large
1550M parámetros, ~3 GB de descarga, velocidad 1x en tiempo real, requiere 10 GB de VRAM.
Turbo
809M parámetros, ~1.6 GB de descarga, velocidad ~8x en tiempo real, requiere 6 GB de VRAM.
¿Qué modelo de Whisper debo elegir?
Comience con Small para lograr un equilibrio práctico entre velocidad, uso de memoria y calidad de transcripción. Baje cuando el hardware sea limitado o elija Medium, Large o Turbo cuando la precisión y el rendimiento de la GPU sean más importantes.
Tiny
Detección de palabras de activación, comandos rápidos y pruebas en los sistemas con menor memoria.
Base
Notas breves, indicaciones y dictados generales en hardware modesto.
Small
Una opción diaria equilibrada para indicaciones de agentes y dictados más largos.
Medium
Transcripción centrada en la precisión cuando se puede intercambiar tiempo de procesamiento y memoria adicionales.
Large
La opción local de mayor precisión para sistemas con al menos 10 GB de VRAM disponible.
Turbo
Transcripción rápida y de alta calidad en una GPU compatible con al menos 6 GB de VRAM disponible.
Estado de instalación
La página de configuración muestra el estado de instalación de las dependencias requeridas:
Periquito y susurro increíblemente rápido
Motores rápidos opcionales
Estos motores son descargas independientes, por lo que la instalación predeterminada sigue siendo pequeña. La pantalla de configuración muestra el estado de instalación y hardware de cada motor.
Vea aparecer las palabras mientras habla con la transcripción local en directo. Insanely Fast Whisper está optimizado para GPU NVIDIA modernas; también dispone de Whisper, Parakeet y opciones de voz en la nube y de la plataforma.
Periquito NVIDIA
Un motor local de conversión de voz a texto de alta velocidad. Instale su tiempo de ejecución opcional desde la configuración de Escritura por voz antes de seleccionarlo.
Susurro increíblemente rápido
Una implementación acelerada de Whisper destinada a sistemas GPU compatibles. Instale el motor opcional antes de usarlo.
Seleccionar uno a través de Kaiju Voice nunca inicia una descarga grande de forma silenciosa. Instálelo primero en Configuración; el asistente puede luego verificar la disponibilidad y cambiar de servicio.
Voz de plataforma
Dictado por voz de Windows
Configura el dictado por voz de Windows para la transcripción de voz a texto. Este servicio usa Azure Speech Services integrado en Windows 10 y versiones posteriores. Se requiere conexión a internet. Sigue las instrucciones de configuración para habilitar el reconocimiento de voz en la Configuración de Windows.
Requisitos del sistema
Windows 10 o posterior con reconocimiento de voz habilitado en la configuración del sistema.
Tecla de acceso rápido
Tecla de acceso rápido predeterminada: Ctrl+Shift+W. Configurable según tu preferencia.
Prueba de activación
Botón de prueba para verificar que el dictado por voz funciona correctamente con tu micrófono.
Dictado de Apple
Configura el dictado de Apple para la transcripción de voz a texto en macOS. Esta es una función nativa de macOS que no requiere configuración adicional más allá de habilitar el dictado en Ajustes del Sistema.
Requisitos del sistema
macOS con Dictado habilitado en Ajustes del Sistema > Teclado.
Tecla de acceso rápido
Tecla de acceso rápido predeterminada: Ctrl+Shift+D. Configurable según tu preferencia.
Prueba de activación
Botón de prueba para verificar que el dictado funciona correctamente con tu micrófono.
Texto a voz y voces de IA
Modelos de voz locales
AI Brain habla a través del modelo instalado seleccionado. Al cambiar de modelo, se descarga el modelo anterior antes de cargar el nuevo, y la lista de voces se filtra a voces compatibles con ese modelo.
Kokoro 82M
Voz local ligera y rápida con una amplia selección de voz integrada.
Chatterbox Turbo
Habla expresiva de baja latencia y clonación de voz compatible.
charlatán
El modelo completo de Chatterbox para síntesis y clonación local expresiva.
OmniVoice 0.6B
Texto a voz local multilingüe compacto.
OuteTTS 1.0 1B
Generación de voz local con su propio conjunto de voces compatible.
Qwen3-TTS 1.7B
Síntesis local más amplia, multilingüe y expresiva.
Discurso de pez S2 Pro
Voz local de alta calidad con flujos de trabajo de voz de referencia compatibles.
La velocidad del habla se puede configurar entre 0,5× y 2×. La clonación de voz aparece sólo para los modelos que la admiten; Utilice audio de su propiedad o que tenga permiso para utilizar.
Catálogo de proveedores de nube
El catálogo de configuración también incluye configuración para OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech y Microsoft Azure. La disponibilidad depende de la configuración del proveedor y de las credenciales que proporcione.
Las credenciales de API permanecen en Configuración y se excluyen de los resúmenes de configuración estructurados o hablados de Kaiju Voice.
