Digitação por voz
Visão geral
Escolha um mecanismo de transcrição local ou o serviço de ditado integrado do seu sistema operacional. A disponibilidade depende da sua plataforma e dos mecanismos opcionais instalados.
O que a fala para texto faz
A fala em texto transforma o que você diz em texto editável sempre que o Kaiju Hub AI oferece uma ação de microfone. Use-o para ditar instruções ao agente, continuar uma conversa do Kaiju Voice e inserir instruções mais longas sem digitar. Mecanismos locais como Whisper e Parakeet mantêm a transcrição em sua máquina; o ditado da plataforma usa o serviço de fala fornecido pelo Windows ou macOS.
Serviços disponíveis
Sussurro
Transcrição local OpenAI Whisper com tamanho de modelo selecionável e aceleração de hardware.
Periquito NVIDIA
Reconhecimento rápido de fala local usando o mecanismo Parakeet opcional.
Sussurro incrivelmente rápido
Um caminho Whisper otimizado para configurações de GPU suportadas.
Digitação por voz do Windows
Usa o ditado do Windows e a tecla de atalho do sistema configurada.
Ditado da Apple
Usa o serviço integrado de ditado do macOS.
Sussurro
Configurações do Whisper
Configure as configurações do OpenAI Whisper para transcrição local de fala para texto. O Whisper é executado inteiramente na sua máquina para entrada de voz offline e privada. Baixe, instale e remova modelos diretamente desta aba.
Modelos disponíveis
Tiny
39M parameters, ~75 MB download, ~10x realtime speed, requires 1 GB VRAM.
Base
74M parameters, ~145 MB download, ~7x realtime speed, requires 1 GB VRAM.
Small
244M parameters, ~465 MB download, ~4x realtime speed, requires 2 GB VRAM.
Medium
769M parameters, ~1.5 GB download, ~2x realtime speed, requires 5 GB VRAM.
Large
1550M parameters, ~3 GB download, 1x realtime speed, requires 10 GB VRAM.
Turbo
809M parameters, ~1.6 GB download, ~8x realtime speed, requires 6 GB VRAM.
Qual modelo Whisper devo escolher?
Comece com Small para obter um equilíbrio prático entre velocidade, uso de memória e qualidade de transcrição. Desça quando o hardware for limitado ou escolha Medium, Large ou Turbo quando a precisão e o desempenho da GPU forem mais importantes.
Tiny
Detecção de wake-word, comandos rápidos e testes nos sistemas com menos memória.
Base
Notas curtas, instruções e ditados gerais sobre hardware modesto.
Small
Uma escolha diária equilibrada para solicitações do agente e ditados mais longos.
Medium
Transcrição focada na precisão quando você pode negociar tempo de processamento e memória extras.
Large
A opção local de maior precisão para sistemas com pelo menos 10 GB de VRAM disponível.
Turbo
Transcrição rápida e de alta qualidade em uma GPU compatível com pelo menos 6 GB de VRAM disponível.
Status de instalação
A página de configurações mostra o status de instalação das dependências necessárias:
Periquito e sussurro incrivelmente rápido
Motores rápidos opcionais
Esses mecanismos são downloads separados, portanto a instalação padrão permanece pequena. A tela de configurações mostra o status de instalação e hardware de cada mecanismo.
Veja as palavras aparecerem enquanto fala com transcrição local ao vivo. O Insanely Fast Whisper é otimizado para GPUs NVIDIA modernas; Whisper, Parakeet e opções de voz na nuvem e da plataforma também estão disponíveis.
Periquito NVIDIA
Um mecanismo local de fala para texto de alta velocidade. Instale seu tempo de execução opcional nas configurações de digitação por voz antes de selecioná-lo.
Sussurro incrivelmente rápido
Uma implementação acelerada do Whisper destinada a sistemas GPU compatíveis. Instale o motor opcional antes de usar.
Selecionar um através do Kaiju Voice nunca inicia um download grande silenciosamente. Instale-o primeiro em Configurações; o assistente pode então verificar a disponibilidade e trocar de serviço.
Voz da plataforma
Digitação por voz do Windows
Configure a Digitação por Voz do Windows para transcrição de fala para texto. Este serviço usa os Serviços de Fala Azure integrados ao Windows 10 e posteriores. Uma conexão com a internet é necessária. Siga as instruções de configuração para habilitar o reconhecimento de fala nas Configurações do Windows.
Requisitos do sistema
Windows 10 ou posterior com reconhecimento de fala habilitado nas configurações do sistema.
Tecla de atalho
Tecla de atalho padrão: Ctrl+Shift+W. Configurável conforme sua preferência.
Teste de acionamento
Botão de teste para verificar se a digitação por voz está funcionando corretamente com seu microfone.
Ditado da Apple
Configure o Ditado da Apple para transcrição de fala para texto no macOS. Este é um recurso nativo do macOS sem necessidade de configuração adicional além de habilitar o ditado nas Configurações do Sistema.
Requisitos do sistema
macOS com Ditado habilitado em Configurações do Sistema > Teclado.
Tecla de atalho
Tecla de atalho padrão: Ctrl+Shift+D. Configurável conforme sua preferência.
Teste de acionamento
Botão de teste para verificar se o ditado está funcionando corretamente com seu microfone.
Texto para fala e vozes de IA
Modelos de voz locais
AI Brain fala através do modelo instalado selecionado. A alteração dos modelos descarrega o modelo anterior antes de carregar o novo, e a lista de vozes é filtrada para vozes compatíveis com esse modelo.
Kokoro 82M
Fala local leve e rápida com ampla seleção de voz integrada.
Chatterbox Turbo
Fala expressiva de baixa latência e clonagem de voz suportada.
Tagarela
O modelo Chatterbox completo para síntese e clonagem local expressiva.
OmniVoice 0.6B
Conversão de texto para fala local multilíngue compacta.
OuteTTS 1.0 1B
Geração de fala local com seu próprio conjunto de voz compatível.
Qwen3-TTS 1.7B
Maior síntese local multilíngue e expressiva.
Fala de peixe S2 Pro
Fala local de alta qualidade com fluxos de trabalho de voz de referência suportados.
A velocidade da fala pode ser definida de 0,5× a 2×. A clonagem de voz aparece apenas para modelos que a suportam; use áudio de sua propriedade ou que tenha permissão para usar.
Catálogo de provedores de nuvem
O catálogo de configurações também inclui configurações para OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech e Microsoft Azure. A disponibilidade depende da configuração do provedor e das credenciais fornecidas.
As credenciais da API permanecem nas configurações e são excluídas dos resumos de configurações faladas ou estruturadas do Kaiju Voice.
