Kaiju Hub AI

Escritura por voz

Selección del servicio de escritura por voz en la configuración de Kaiju Hub

Descripción general

Elija un motor de transcripción local o el servicio de dictado integrado de su sistema operativo. La disponibilidad depende de su plataforma y de los motores opcionales instalados.

¿Qué hace la conversión de voz a texto?

La voz a texto convierte lo que dices en texto editable siempre que Kaiju Hub AI ofrezca una acción de micrófono. Úselo para dictar indicaciones para los agentes, continuar una conversación de Kaiju Voice e ingresar instrucciones más largas sin escribir. Los motores locales como Whisper y Parakeet mantienen la transcripción en su máquina; El dictado de la plataforma utiliza el servicio de voz proporcionado por Windows o macOS.

Servicios disponibles

susurro

Transcripción local OpenAI Whisper con tamaño de modelo seleccionable y aceleración de hardware.

Periquito NVIDIA

Reconocimiento de voz local rápido utilizando el motor Parakeet opcional.

Susurro increíblemente rápido

Una ruta Whisper optimizada para configuraciones de GPU compatibles.

Escritura por voz en Windows

Utiliza el dictado de Windows y la tecla de acceso rápido del sistema configurada.

Dictado de manzana

Utiliza el servicio de dictado integrado de macOS.

susurro

Whisper: conversión de voz a texto local con selección de motor de transcripción y estado de instalación

Configuración de Whisper

Configura los ajustes de OpenAI Whisper para la transcripción local de voz a texto. Whisper se ejecuta completamente en tu máquina para entrada de voz sin conexión y privada. Descarga, instala y elimina modelos directamente desde esta pestaña.

Modelos disponibles

Tiny

39M parámetros, ~75 MB de descarga, velocidad ~10x en tiempo real, requiere 1 GB de VRAM.

Base

74M parámetros, ~145 MB de descarga, velocidad ~7x en tiempo real, requiere 1 GB de VRAM.

Small

244M parámetros, ~465 MB de descarga, velocidad ~4x en tiempo real, requiere 2 GB de VRAM.

Medium

769M parámetros, ~1.5 GB de descarga, velocidad ~2x en tiempo real, requiere 5 GB de VRAM.

Large

1550M parámetros, ~3 GB de descarga, velocidad 1x en tiempo real, requiere 10 GB de VRAM.

Turbo

809M parámetros, ~1.6 GB de descarga, velocidad ~8x en tiempo real, requiere 6 GB de VRAM.

¿Qué modelo de Whisper debo elegir?

Comience con Small para lograr un equilibrio práctico entre velocidad, uso de memoria y calidad de transcripción. Baje cuando el hardware sea limitado o elija Medium, Large o Turbo cuando la precisión y el rendimiento de la GPU sean más importantes.

Tiny

Detección de palabras de activación, comandos rápidos y pruebas en los sistemas con menor memoria.

Base

Notas breves, indicaciones y dictados generales en hardware modesto.

Small

Una opción diaria equilibrada para indicaciones de agentes y dictados más largos.

Medium

Transcripción centrada en la precisión cuando se puede intercambiar tiempo de procesamiento y memoria adicionales.

Large

La opción local de mayor precisión para sistemas con al menos 10 GB de VRAM disponible.

Turbo

Transcripción rápida y de alta calidad en una GPU compatible con al menos 6 GB de VRAM disponible.

Estado de instalación

La página de configuración muestra el estado de instalación de las dependencias requeridas:

susurro
FFmpeg
CUDA
UV (Python env)

Periquito y susurro increíblemente rápido

Motores rápidos opcionales

Estos motores son descargas independientes, por lo que la instalación predeterminada sigue siendo pequeña. La pantalla de configuración muestra el estado de instalación y hardware de cada motor.

Vea aparecer las palabras mientras habla con la transcripción local en directo. Insanely Fast Whisper está optimizado para GPU NVIDIA modernas; también dispone de Whisper, Parakeet y opciones de voz en la nube y de la plataforma.

Periquito NVIDIA

Un motor local de conversión de voz a texto de alta velocidad. Instale su tiempo de ejecución opcional desde la configuración de Escritura por voz antes de seleccionarlo.

Susurro increíblemente rápido

Una implementación acelerada de Whisper destinada a sistemas GPU compatibles. Instale el motor opcional antes de usarlo.

Seleccionar uno a través de Kaiju Voice nunca inicia una descarga grande de forma silenciosa. Instálelo primero en Configuración; el asistente puede luego verificar la disponibilidad y cambiar de servicio.

Voz de plataforma

Windows Voice Typing — keyboard shortcut configuration and system setup

Dictado por voz de Windows

Configura el dictado por voz de Windows para la transcripción de voz a texto. Este servicio usa Azure Speech Services integrado en Windows 10 y versiones posteriores. Se requiere conexión a internet. Sigue las instrucciones de configuración para habilitar el reconocimiento de voz en la Configuración de Windows.

Requisitos del sistema

Windows 10 o posterior con reconocimiento de voz habilitado en la configuración del sistema.

Tecla de acceso rápido

Tecla de acceso rápido predeterminada: Ctrl+Shift+W. Configurable según tu preferencia.

Prueba de activación

Botón de prueba para verificar que el dictado por voz funciona correctamente con tu micrófono.

Dictado de Apple

Configura el dictado de Apple para la transcripción de voz a texto en macOS. Esta es una función nativa de macOS que no requiere configuración adicional más allá de habilitar el dictado en Ajustes del Sistema.

Requisitos del sistema

macOS con Dictado habilitado en Ajustes del Sistema > Teclado.

Tecla de acceso rápido

Tecla de acceso rápido predeterminada: Ctrl+Shift+D. Configurable según tu preferencia.

Prueba de activación

Botón de prueba para verificar que el dictado funciona correctamente con tu micrófono.

Texto a voz y voces de IA

Modelos de voz locales

AI Brain habla a través del modelo instalado seleccionado. Al cambiar de modelo, se descarga el modelo anterior antes de cargar el nuevo, y la lista de voces se filtra a voces compatibles con ese modelo.

Kokoro 82M

Voz local ligera y rápida con una amplia selección de voz integrada.

Chatterbox Turbo

Habla expresiva de baja latencia y clonación de voz compatible.

charlatán

El modelo completo de Chatterbox para síntesis y clonación local expresiva.

OmniVoice 0.6B

Texto a voz local multilingüe compacto.

OuteTTS 1.0 1B

Generación de voz local con su propio conjunto de voces compatible.

Qwen3-TTS 1.7B

Síntesis local más amplia, multilingüe y expresiva.

Discurso de pez S2 Pro

Voz local de alta calidad con flujos de trabajo de voz de referencia compatibles.

La velocidad del habla se puede configurar entre 0,5× y 2×. La clonación de voz aparece sólo para los modelos que la admiten; Utilice audio de su propiedad o que tenga permiso para utilizar.

Catálogo de proveedores de nube

El catálogo de configuración también incluye configuración para OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech y Microsoft Azure. La disponibilidad depende de la configuración del proveedor y de las credenciales que proporcione.

Las credenciales de API permanecen en Configuración y se excluyen de los resúmenes de configuración estructurados o hablados de Kaiju Voice.

Todos los logotipos, marcas comerciales y nombres de marcas de terceros mostrados en Kaiju Hub AI son propiedad de sus respectivos dueños. Su uso es únicamente con fines de identificación y no implica respaldo, patrocinio ni afiliación.