Saisie vocale
Aperçu
Choisissez un moteur de transcription local ou le service de dictée intégré à votre système d'exploitation. La disponibilité dépend de votre plate-forme et des moteurs en option installés.
À quoi sert la synthèse vocale
La parole en texte transforme ce que vous dites en texte modifiable partout où Kaiju Hub AI propose une action de microphone. Utilisez-le pour dicter les invites des agents, poursuivre une conversation Kaiju Voice et saisir des instructions plus longues sans taper. Les moteurs locaux tels que Whisper et Parakeet conservent la transcription sur votre machine ; La dictée de la plateforme utilise le service vocal fourni par Windows ou macOS.
Services disponibles
Chuchoter
Transcription locale OpenAI Whisper avec taille de modèle sélectionnable et accélération matérielle.
Perruche NVIDIA
Reconnaissance vocale locale rapide à l'aide du moteur Parakeet en option.
Chuchotement incroyablement rapide
Un chemin Whisper optimisé pour les configurations GPU prises en charge.
Saisie vocale Windows
Utilise la dictée Windows et le raccourci clavier système configuré.
Dictée Apple
Utilise le service de dictée macOS intégré.
Chuchoter
Paramètres Whisper
Configurez les paramètres OpenAI Whisper pour la transcription locale parole-en-texte. Whisper fonctionne entièrement sur votre machine pour une entrée vocale hors ligne et privée. Téléchargez, installez et supprimez des modèles directement depuis cet onglet.
Modèles disponibles
Tiny
39M paramètres, téléchargement ~75 Mo, vitesse ~10x temps réel, nécessite 1 Go de VRAM.
Base
74M paramètres, téléchargement ~145 Mo, vitesse ~7x temps réel, nécessite 1 Go de VRAM.
Small
244M paramètres, téléchargement ~465 Mo, vitesse ~4x temps réel, nécessite 2 Go de VRAM.
Medium
769M paramètres, téléchargement ~1,5 Go, vitesse ~2x temps réel, nécessite 5 Go de VRAM.
Large
1550M paramètres, téléchargement ~3 Go, vitesse 1x temps réel, nécessite 10 Go de VRAM.
Turbo
809M paramètres, téléchargement ~1,6 Go, vitesse ~8x temps réel, nécessite 6 Go de VRAM.
Quel modèle Whisper dois-je choisir ?
Commencez par Small pour un équilibre pratique entre vitesse, utilisation de la mémoire et qualité de transcription. Descendez lorsque le matériel est limité, ou choisissez Medium, Large ou Turbo lorsque la précision et les performances du GPU sont plus importantes.
Tiny
Détection de mots d'éveil, commandes rapides et tests sur les systèmes à mémoire la plus faible.
Base
Notes courtes, invites et dictées générales sur du matériel modeste.
Small
Un choix quotidien équilibré pour les invites des agents et les dictées plus longues.
Medium
Transcription axée sur la précision lorsque vous pouvez échanger du temps de traitement et de la mémoire supplémentaires.
Large
L'option locale de la plus haute précision pour les systèmes disposant d'au moins 10 Go de VRAM disponible.
Turbo
Transcription rapide et de haute qualité sur un GPU pris en charge avec au moins 6 Go de VRAM disponible.
Statut d'installation
La page des paramètres affiche le statut d'installation des dépendances requises :
Perruche et murmure incroyablement rapide
Moteurs rapides en option
Ces moteurs sont des téléchargements distincts, donc l'installation par défaut reste petite. L'écran des paramètres affiche l'installation et l'état du matériel pour chaque moteur.
Voyez les mots apparaître à mesure que vous parlez grâce à la transcription locale en direct. Insanely Fast Whisper est optimisé pour les GPU NVIDIA modernes ; Whisper, Parakeet et les options vocales du cloud et de la plateforme restent également disponibles.
Perruche NVIDIA
Un moteur de synthèse vocale local à grande vitesse. Installez son runtime facultatif à partir des paramètres de saisie vocale avant de le sélectionner.
Chuchotement incroyablement rapide
Une implémentation accélérée de Whisper destinée aux systèmes GPU compatibles. Installez le moteur en option avant utilisation.
En sélectionner un via Kaiju Voice ne démarre jamais un téléchargement volumineux en silence. Installez-le d'abord dans Paramètres ; l'assistant peut alors vérifier la disponibilité et changer de service.
Voix de la plateforme
Saisie vocale Windows
Configurez la Saisie vocale Windows pour la transcription parole-en-texte. Ce service utilise les services Azure Speech intégrés à Windows 10 et versions ultérieures. Une connexion Internet est requise. Suivez les instructions de configuration pour activer la reconnaissance vocale dans les Paramètres Windows.
Configuration système requise
Windows 10 ou version ultérieure avec la reconnaissance vocale activée dans les paramètres système.
Raccourci clavier
Raccourci de déclenchement par défaut : Ctrl+Maj+W. Configurable selon vos préférences.
Test de déclenchement
Bouton de test pour vérifier que la saisie vocale fonctionne correctement avec votre microphone.
Dictée Apple
Configurez la Dictée Apple pour la transcription parole-en-texte sur macOS. C'est une fonctionnalité native de macOS sans configuration supplémentaire requise au-delà de l'activation de la dictée dans les Réglages système.
Configuration système requise
macOS avec la Dictée activée dans Réglages système > Clavier.
Raccourci clavier
Raccourci de déclenchement par défaut : Ctrl+Maj+D. Configurable selon vos préférences.
Test de déclenchement
Bouton de test pour vérifier que la dictée fonctionne correctement avec votre microphone.
Synthèse vocale et voix IA
Modèles vocaux locaux
AI Brain parle à travers le modèle installé sélectionné. Changer de modèle décharge le modèle précédent avant de charger le nouveau, et la liste des voix est filtrée pour les voix compatibles avec ce modèle.
Kokoro 82M
Discours local léger et rapide avec une large sélection de voix intégrée.
Chatterbox Turbo
Discours expressif à faible latence et clonage vocal pris en charge.
Chatterbox
Le modèle Chatterbox complet pour la synthèse locale expressive et le clonage.
OmniVoice 0.6B
Synthèse vocale locale multilingue compacte.
SortieTTS 1.0 1B
Génération vocale locale avec son propre ensemble vocal compatible.
Qwen3-TTS 1.7B
Synthèse locale multilingue et expressive plus large.
Discours de poisson S2 Pro
Discours local de haute qualité avec flux de travail de voix de référence pris en charge.
La vitesse de parole peut être réglée de 0,5× à 2×. Le clonage vocal apparaît uniquement pour les modèles qui le prennent en charge ; utilisez l'audio que vous possédez ou que vous avez la permission d'utiliser.
Catalogue des fournisseurs de cloud
Le catalogue de paramètres comprend également la configuration pour OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech et Microsoft Azure. La disponibilité dépend de la configuration du fournisseur et des informations d'identification que vous fournissez.
Les informations d'identification de l'API restent dans les paramètres et sont exclues des résumés des paramètres vocaux ou structurés de Kaiju Voice.
