Kaiju Hub AI

Digitação por voz

Seleção do serviço de digitação por voz nas configurações do Kaiju Hub

Visão geral

Escolha um mecanismo de transcrição local ou o serviço de ditado integrado do seu sistema operacional. A disponibilidade depende da sua plataforma e dos mecanismos opcionais instalados.

O que a fala para texto faz

A fala em texto transforma o que você diz em texto editável sempre que o Kaiju Hub AI oferece uma ação de microfone. Use-o para ditar instruções ao agente, continuar uma conversa do Kaiju Voice e inserir instruções mais longas sem digitar. Mecanismos locais como Whisper e Parakeet mantêm a transcrição em sua máquina; o ditado da plataforma usa o serviço de fala fornecido pelo Windows ou macOS.

Serviços disponíveis

Sussurro

Transcrição local OpenAI Whisper com tamanho de modelo selecionável e aceleração de hardware.

Periquito NVIDIA

Reconhecimento rápido de fala local usando o mecanismo Parakeet opcional.

Sussurro incrivelmente rápido

Um caminho Whisper otimizado para configurações de GPU suportadas.

Digitação por voz do Windows

Usa o ditado do Windows e a tecla de atalho do sistema configurada.

Ditado da Apple

Usa o serviço integrado de ditado do macOS.

Sussurro

Whisper – conversão local de fala em texto com seleção de mecanismo de transcrição e status de instalação

Configurações do Whisper

Configure as configurações do OpenAI Whisper para transcrição local de fala para texto. O Whisper é executado inteiramente na sua máquina para entrada de voz offline e privada. Baixe, instale e remova modelos diretamente desta aba.

Modelos disponíveis

Tiny

39M parameters, ~75 MB download, ~10x realtime speed, requires 1 GB VRAM.

Base

74M parameters, ~145 MB download, ~7x realtime speed, requires 1 GB VRAM.

Small

244M parameters, ~465 MB download, ~4x realtime speed, requires 2 GB VRAM.

Medium

769M parameters, ~1.5 GB download, ~2x realtime speed, requires 5 GB VRAM.

Large

1550M parameters, ~3 GB download, 1x realtime speed, requires 10 GB VRAM.

Turbo

809M parameters, ~1.6 GB download, ~8x realtime speed, requires 6 GB VRAM.

Qual modelo Whisper devo escolher?

Comece com Small para obter um equilíbrio prático entre velocidade, uso de memória e qualidade de transcrição. Desça quando o hardware for limitado ou escolha Medium, Large ou Turbo quando a precisão e o desempenho da GPU forem mais importantes.

Tiny

Detecção de wake-word, comandos rápidos e testes nos sistemas com menos memória.

Base

Notas curtas, instruções e ditados gerais sobre hardware modesto.

Small

Uma escolha diária equilibrada para solicitações do agente e ditados mais longos.

Medium

Transcrição focada na precisão quando você pode negociar tempo de processamento e memória extras.

Large

A opção local de maior precisão para sistemas com pelo menos 10 GB de VRAM disponível.

Turbo

Transcrição rápida e de alta qualidade em uma GPU compatível com pelo menos 6 GB de VRAM disponível.

Status de instalação

A página de configurações mostra o status de instalação das dependências necessárias:

Sussurro
FFmpeg
CUDA
UV (Python env)

Periquito e sussurro incrivelmente rápido

Motores rápidos opcionais

Esses mecanismos são downloads separados, portanto a instalação padrão permanece pequena. A tela de configurações mostra o status de instalação e hardware de cada mecanismo.

Veja as palavras aparecerem enquanto fala com transcrição local ao vivo. O Insanely Fast Whisper é otimizado para GPUs NVIDIA modernas; Whisper, Parakeet e opções de voz na nuvem e da plataforma também estão disponíveis.

Periquito NVIDIA

Um mecanismo local de fala para texto de alta velocidade. Instale seu tempo de execução opcional nas configurações de digitação por voz antes de selecioná-lo.

Sussurro incrivelmente rápido

Uma implementação acelerada do Whisper destinada a sistemas GPU compatíveis. Instale o motor opcional antes de usar.

Selecionar um através do Kaiju Voice nunca inicia um download grande silenciosamente. Instale-o primeiro em Configurações; o assistente pode então verificar a disponibilidade e trocar de serviço.

Voz da plataforma

Windows Voice Typing — keyboard shortcut configuration and system setup

Digitação por voz do Windows

Configure a Digitação por Voz do Windows para transcrição de fala para texto. Este serviço usa os Serviços de Fala Azure integrados ao Windows 10 e posteriores. Uma conexão com a internet é necessária. Siga as instruções de configuração para habilitar o reconhecimento de fala nas Configurações do Windows.

Requisitos do sistema

Windows 10 ou posterior com reconhecimento de fala habilitado nas configurações do sistema.

Tecla de atalho

Tecla de atalho padrão: Ctrl+Shift+W. Configurável conforme sua preferência.

Teste de acionamento

Botão de teste para verificar se a digitação por voz está funcionando corretamente com seu microfone.

Ditado da Apple

Configure o Ditado da Apple para transcrição de fala para texto no macOS. Este é um recurso nativo do macOS sem necessidade de configuração adicional além de habilitar o ditado nas Configurações do Sistema.

Requisitos do sistema

macOS com Ditado habilitado em Configurações do Sistema > Teclado.

Tecla de atalho

Tecla de atalho padrão: Ctrl+Shift+D. Configurável conforme sua preferência.

Teste de acionamento

Botão de teste para verificar se o ditado está funcionando corretamente com seu microfone.

Texto para fala e vozes de IA

Modelos de voz locais

AI Brain fala através do modelo instalado selecionado. A alteração dos modelos descarrega o modelo anterior antes de carregar o novo, e a lista de vozes é filtrada para vozes compatíveis com esse modelo.

Kokoro 82M

Fala local leve e rápida com ampla seleção de voz integrada.

Chatterbox Turbo

Fala expressiva de baixa latência e clonagem de voz suportada.

Tagarela

O modelo Chatterbox completo para síntese e clonagem local expressiva.

OmniVoice 0.6B

Conversão de texto para fala local multilíngue compacta.

OuteTTS 1.0 1B

Geração de fala local com seu próprio conjunto de voz compatível.

Qwen3-TTS 1.7B

Maior síntese local multilíngue e expressiva.

Fala de peixe S2 Pro

Fala local de alta qualidade com fluxos de trabalho de voz de referência suportados.

A velocidade da fala pode ser definida de 0,5× a 2×. A clonagem de voz aparece apenas para modelos que a suportam; use áudio de sua propriedade ou que tenha permissão para usar.

Catálogo de provedores de nuvem

O catálogo de configurações também inclui configurações para OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech e Microsoft Azure. A disponibilidade depende da configuração do provedor e das credenciais fornecidas.

As credenciais da API permanecem nas configurações e são excluídas dos resumos de configurações faladas ou estruturadas do Kaiju Voice.

Todos os logotipos, marcas comerciais e nomes de marcas de terceiros exibidos no Kaiju Hub AI são propriedade de seus respectivos donos. Seu uso é exclusivamente para fins de identificação e não implica endosso, patrocínio ou afiliação.