Kaiju Hub AI

Digitazione vocale

Selezione del servizio di digitazione vocale nelle impostazioni di Kaiju Hub

Panoramica

Scegli un motore di trascrizione locale o il servizio di dettatura integrato nel tuo sistema operativo. La disponibilità dipende dalla piattaforma e dai motori opzionali installati.

Cosa fa la sintesi vocale

La sintesi vocale trasforma ciò che dici in testo modificabile ovunque Kaiju Hub AI offra un'azione del microfono. Usalo per dettare le istruzioni dell'agente, continuare una conversazione Kaiju Voice e inserire istruzioni più lunghe senza digitare. I motori locali come Whisper e Parakeet mantengono la trascrizione sul tuo computer; la dettatura della piattaforma utilizza il servizio vocale fornito da Windows o macOS.

Servizi disponibili

Sussurrare

Trascrizione locale OpenAI Whisper con dimensioni del modello selezionabili e accelerazione hardware.

Parrocchetto NVIDIA

Riconoscimento vocale locale veloce utilizzando il motore Parakeet opzionale.

Sussurro follemente veloce

Un percorso Whisper ottimizzato per le configurazioni GPU supportate.

Digitazione vocale di Windows

Utilizza la dettatura di Windows e il tasto di scelta rapida del sistema configurato.

Dettatura di mele

Utilizza il servizio di dettatura integrato in macOS.

Sussurrare

Whisper: sintesi vocale locale con selezione del motore di trascrizione e stato di installazione

Impostazioni Whisper

Configura le impostazioni di OpenAI Whisper per la trascrizione locale da voce a testo. Whisper funziona interamente sul tuo computer per l'input vocale offline e privato. Scarica, installa e rimuovi modelli direttamente da questa scheda.

Modelli disponibili

Tiny

39M parameters, ~75 MB download, ~10x realtime speed, requires 1 GB VRAM.

Base

74M parameters, ~145 MB download, ~7x realtime speed, requires 1 GB VRAM.

Small

244M parameters, ~465 MB download, ~4x realtime speed, requires 2 GB VRAM.

Medium

769M parameters, ~1.5 GB download, ~2x realtime speed, requires 5 GB VRAM.

Large

1550M parameters, ~3 GB download, 1x realtime speed, requires 10 GB VRAM.

Turbo

809M parameters, ~1.6 GB download, ~8x realtime speed, requires 6 GB VRAM.

Quale modello Whisper dovrei scegliere?

Inizia con Small per un equilibrio pratico tra velocità, utilizzo della memoria e qualità della trascrizione. Scendi verso il basso quando l'hardware è limitato oppure scegli Medium, Large o Turbo quando la precisione e le prestazioni della GPU contano di più.

Tiny

Rilevamento delle parole di attivazione, comandi rapidi e test sui sistemi con memoria minima.

Base

Brevi note, suggerimenti e dettature generali su hardware modesto.

Small

Una scelta quotidiana equilibrata per i suggerimenti degli agenti e la dettatura più lunga.

Medium

Trascrizione mirata alla precisione quando puoi scambiare tempo di elaborazione e memoria aggiuntivi.

Large

L'opzione locale con la massima precisione per i sistemi con almeno 10 GB di VRAM disponibile.

Turbo

Trascrizione veloce e di alta qualità su una GPU supportata con almeno 6 GB di VRAM disponibile.

Stato installazione

La pagina delle impostazioni mostra lo stato di installazione delle dipendenze necessarie:

Sussurrare
FFmpeg
CUDA
UV (Python env)

Parrocchetto e Sussurro follemente veloce

Motori veloci opzionali

Questi motori sono download separati, quindi l'installazione predefinita rimane piccola. La schermata delle impostazioni mostra l'installazione e lo stato dell'hardware per ciascun motore.

Guarda le parole apparire mentre parli con la trascrizione locale in tempo reale. Insanely Fast Whisper è ottimizzato per le GPU NVIDIA moderne; sono disponibili anche Whisper, Parakeet e opzioni vocali cloud e di piattaforma.

Parrocchetto NVIDIA

Un motore di sintesi vocale locale ad alta velocità. Installa il suo runtime opzionale dalle impostazioni di digitazione vocale prima di selezionarlo.

Sussurro follemente veloce

Un'implementazione Whisper accelerata destinata ai sistemi GPU compatibili. Installare il motore opzionale prima dell'uso.

Selezionarne uno tramite Kaiju Voice non avvia mai un download di grandi dimensioni in modo silenzioso. Installalo prima in Impostazioni; l'assistente può quindi verificare la disponibilità e cambiare servizio.

Voce piattaforma

Windows Voice Typing — keyboard shortcut configuration and system setup

Digitazione vocale Windows

Configura la digitazione vocale di Windows per la trascrizione da voce a testo. Questo servizio usa Azure Speech Services integrato in Windows 10 e versioni successive. E necessaria una connessione internet. Segui le istruzioni di configurazione per abilitare il riconoscimento vocale nelle Impostazioni di Windows.

Requisiti di sistema

Windows 10 o successivo con riconoscimento vocale abilitato nelle impostazioni di sistema.

Tasto rapido

Tasto rapido predefinito: Ctrl+Shift+W. Configurabile a tua preferenza.

Test

Pulsante di test per verificare che la digitazione vocale funzioni correttamente con il tuo microfono.

Apple Dictation

Configura Apple Dictation per la trascrizione da voce a testo su macOS. Questa e una funzionalita nativa di macOS senza configurazione aggiuntiva necessaria oltre all'abilitazione della dettatura nelle Impostazioni di Sistema.

Requisiti di sistema

macOS con Dettatura abilitata in Impostazioni di Sistema > Tastiera.

Tasto rapido

Tasto rapido predefinito: Ctrl+Shift+D. Configurabile a tua preferenza.

Test

Pulsante di test per verificare che la dettatura funzioni correttamente con il tuo microfono.

Sintesi vocale e voci AI

Modelli vocali locali

AI Brain parla attraverso il modello installato selezionato. La modifica dei modelli scarica il modello precedente prima di caricare quello nuovo e l'elenco delle voci viene filtrato in base alle voci compatibili con quel modello.

Kokoro 82M

Discorso locale leggero e veloce con un'ampia selezione vocale integrata.

Chatterbox Turbo

Discorso espressivo a bassa latenza e clonazione vocale supportata.

Chiacchierone

Il modello Chatterbox completo per la sintesi e la clonazione locale espressiva.

OmniVoice 0.6B

Sintesi vocale locale multilingue compatta.

OuteTTS 1.0 1B

Generazione vocale locale con il proprio set vocale compatibile.

Qwen3-TTS 1.7B

Sintesi locale multilingue ed espressiva più ampia.

Discorso dei pesci S2 Pro

Discorso locale di alta qualità con flussi di lavoro con voce di riferimento supportati.

La velocità della voce può essere impostata da 0,5× a 2×. La clonazione vocale appare solo per i modelli che la supportano; utilizzare l'audio di tua proprietà o che sei autorizzato a utilizzare.

Catalogo del fornitore di servizi cloud

Il catalogo delle impostazioni include anche la configurazione per OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech e Microsoft Azure. La disponibilità dipende dalla configurazione del provider e dalle credenziali fornite.

Le credenziali API rimangono nelle Impostazioni e sono escluse dai riepiloghi parlati o strutturati delle impostazioni di Kaiju Voice.

Tutti i loghi, marchi e nomi di marchi di terze parti visualizzati in Kaiju Hub AI sono di proprietà dei rispettivi proprietari. Il loro utilizzo è esclusivamente a scopo identificativo e non implica approvazione, sponsorizzazione o affiliazione.