Digitazione vocale
Panoramica
Scegli un motore di trascrizione locale o il servizio di dettatura integrato nel tuo sistema operativo. La disponibilità dipende dalla piattaforma e dai motori opzionali installati.
Cosa fa la sintesi vocale
La sintesi vocale trasforma ciò che dici in testo modificabile ovunque Kaiju Hub AI offra un'azione del microfono. Usalo per dettare le istruzioni dell'agente, continuare una conversazione Kaiju Voice e inserire istruzioni più lunghe senza digitare. I motori locali come Whisper e Parakeet mantengono la trascrizione sul tuo computer; la dettatura della piattaforma utilizza il servizio vocale fornito da Windows o macOS.
Servizi disponibili
Sussurrare
Trascrizione locale OpenAI Whisper con dimensioni del modello selezionabili e accelerazione hardware.
Parrocchetto NVIDIA
Riconoscimento vocale locale veloce utilizzando il motore Parakeet opzionale.
Sussurro follemente veloce
Un percorso Whisper ottimizzato per le configurazioni GPU supportate.
Digitazione vocale di Windows
Utilizza la dettatura di Windows e il tasto di scelta rapida del sistema configurato.
Dettatura di mele
Utilizza il servizio di dettatura integrato in macOS.
Sussurrare
Impostazioni Whisper
Configura le impostazioni di OpenAI Whisper per la trascrizione locale da voce a testo. Whisper funziona interamente sul tuo computer per l'input vocale offline e privato. Scarica, installa e rimuovi modelli direttamente da questa scheda.
Modelli disponibili
Tiny
39M parameters, ~75 MB download, ~10x realtime speed, requires 1 GB VRAM.
Base
74M parameters, ~145 MB download, ~7x realtime speed, requires 1 GB VRAM.
Small
244M parameters, ~465 MB download, ~4x realtime speed, requires 2 GB VRAM.
Medium
769M parameters, ~1.5 GB download, ~2x realtime speed, requires 5 GB VRAM.
Large
1550M parameters, ~3 GB download, 1x realtime speed, requires 10 GB VRAM.
Turbo
809M parameters, ~1.6 GB download, ~8x realtime speed, requires 6 GB VRAM.
Quale modello Whisper dovrei scegliere?
Inizia con Small per un equilibrio pratico tra velocità, utilizzo della memoria e qualità della trascrizione. Scendi verso il basso quando l'hardware è limitato oppure scegli Medium, Large o Turbo quando la precisione e le prestazioni della GPU contano di più.
Tiny
Rilevamento delle parole di attivazione, comandi rapidi e test sui sistemi con memoria minima.
Base
Brevi note, suggerimenti e dettature generali su hardware modesto.
Small
Una scelta quotidiana equilibrata per i suggerimenti degli agenti e la dettatura più lunga.
Medium
Trascrizione mirata alla precisione quando puoi scambiare tempo di elaborazione e memoria aggiuntivi.
Large
L'opzione locale con la massima precisione per i sistemi con almeno 10 GB di VRAM disponibile.
Turbo
Trascrizione veloce e di alta qualità su una GPU supportata con almeno 6 GB di VRAM disponibile.
Stato installazione
La pagina delle impostazioni mostra lo stato di installazione delle dipendenze necessarie:
Parrocchetto e Sussurro follemente veloce
Motori veloci opzionali
Questi motori sono download separati, quindi l'installazione predefinita rimane piccola. La schermata delle impostazioni mostra l'installazione e lo stato dell'hardware per ciascun motore.
Guarda le parole apparire mentre parli con la trascrizione locale in tempo reale. Insanely Fast Whisper è ottimizzato per le GPU NVIDIA moderne; sono disponibili anche Whisper, Parakeet e opzioni vocali cloud e di piattaforma.
Parrocchetto NVIDIA
Un motore di sintesi vocale locale ad alta velocità. Installa il suo runtime opzionale dalle impostazioni di digitazione vocale prima di selezionarlo.
Sussurro follemente veloce
Un'implementazione Whisper accelerata destinata ai sistemi GPU compatibili. Installare il motore opzionale prima dell'uso.
Selezionarne uno tramite Kaiju Voice non avvia mai un download di grandi dimensioni in modo silenzioso. Installalo prima in Impostazioni; l'assistente può quindi verificare la disponibilità e cambiare servizio.
Voce piattaforma
Digitazione vocale Windows
Configura la digitazione vocale di Windows per la trascrizione da voce a testo. Questo servizio usa Azure Speech Services integrato in Windows 10 e versioni successive. E necessaria una connessione internet. Segui le istruzioni di configurazione per abilitare il riconoscimento vocale nelle Impostazioni di Windows.
Requisiti di sistema
Windows 10 o successivo con riconoscimento vocale abilitato nelle impostazioni di sistema.
Tasto rapido
Tasto rapido predefinito: Ctrl+Shift+W. Configurabile a tua preferenza.
Test
Pulsante di test per verificare che la digitazione vocale funzioni correttamente con il tuo microfono.
Apple Dictation
Configura Apple Dictation per la trascrizione da voce a testo su macOS. Questa e una funzionalita nativa di macOS senza configurazione aggiuntiva necessaria oltre all'abilitazione della dettatura nelle Impostazioni di Sistema.
Requisiti di sistema
macOS con Dettatura abilitata in Impostazioni di Sistema > Tastiera.
Tasto rapido
Tasto rapido predefinito: Ctrl+Shift+D. Configurabile a tua preferenza.
Test
Pulsante di test per verificare che la dettatura funzioni correttamente con il tuo microfono.
Sintesi vocale e voci AI
Modelli vocali locali
AI Brain parla attraverso il modello installato selezionato. La modifica dei modelli scarica il modello precedente prima di caricare quello nuovo e l'elenco delle voci viene filtrato in base alle voci compatibili con quel modello.
Kokoro 82M
Discorso locale leggero e veloce con un'ampia selezione vocale integrata.
Chatterbox Turbo
Discorso espressivo a bassa latenza e clonazione vocale supportata.
Chiacchierone
Il modello Chatterbox completo per la sintesi e la clonazione locale espressiva.
OmniVoice 0.6B
Sintesi vocale locale multilingue compatta.
OuteTTS 1.0 1B
Generazione vocale locale con il proprio set vocale compatibile.
Qwen3-TTS 1.7B
Sintesi locale multilingue ed espressiva più ampia.
Discorso dei pesci S2 Pro
Discorso locale di alta qualità con flussi di lavoro con voce di riferimento supportati.
La velocità della voce può essere impostata da 0,5× a 2×. La clonazione vocale appare solo per i modelli che la supportano; utilizzare l'audio di tua proprietà o che sei autorizzato a utilizzare.
Catalogo del fornitore di servizi cloud
Il catalogo delle impostazioni include anche la configurazione per OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech e Microsoft Azure. La disponibilità dipende dalla configurazione del provider e dalle credenziali fornite.
Le credenziali API rimangono nelle Impostazioni e sono escluse dai riepiloghi parlati o strutturati delle impostazioni di Kaiju Voice.
