Kaiju Hub AI

Saisie vocale

Sélection du service de saisie vocale dans les paramètres du Kaiju Hub

Aperçu

Choisissez un moteur de transcription local ou le service de dictée intégré à votre système d'exploitation. La disponibilité dépend de votre plate-forme et des moteurs en option installés.

À quoi sert la synthèse vocale

La parole en texte transforme ce que vous dites en texte modifiable partout où Kaiju Hub AI propose une action de microphone. Utilisez-le pour dicter les invites des agents, poursuivre une conversation Kaiju Voice et saisir des instructions plus longues sans taper. Les moteurs locaux tels que Whisper et Parakeet conservent la transcription sur votre machine ; La dictée de la plateforme utilise le service vocal fourni par Windows ou macOS.

Services disponibles

Chuchoter

Transcription locale OpenAI Whisper avec taille de modèle sélectionnable et accélération matérielle.

Perruche NVIDIA

Reconnaissance vocale locale rapide à l'aide du moteur Parakeet en option.

Chuchotement incroyablement rapide

Un chemin Whisper optimisé pour les configurations GPU prises en charge.

Saisie vocale Windows

Utilise la dictée Windows et le raccourci clavier système configuré.

Dictée Apple

Utilise le service de dictée macOS intégré.

Chuchoter

Whisper : synthèse vocale locale avec sélection du moteur de transcription et état de l'installation

Paramètres Whisper

Configurez les paramètres OpenAI Whisper pour la transcription locale parole-en-texte. Whisper fonctionne entièrement sur votre machine pour une entrée vocale hors ligne et privée. Téléchargez, installez et supprimez des modèles directement depuis cet onglet.

Modèles disponibles

Tiny

39M paramètres, téléchargement ~75 Mo, vitesse ~10x temps réel, nécessite 1 Go de VRAM.

Base

74M paramètres, téléchargement ~145 Mo, vitesse ~7x temps réel, nécessite 1 Go de VRAM.

Small

244M paramètres, téléchargement ~465 Mo, vitesse ~4x temps réel, nécessite 2 Go de VRAM.

Medium

769M paramètres, téléchargement ~1,5 Go, vitesse ~2x temps réel, nécessite 5 Go de VRAM.

Large

1550M paramètres, téléchargement ~3 Go, vitesse 1x temps réel, nécessite 10 Go de VRAM.

Turbo

809M paramètres, téléchargement ~1,6 Go, vitesse ~8x temps réel, nécessite 6 Go de VRAM.

Quel modèle Whisper dois-je choisir ?

Commencez par Small pour un équilibre pratique entre vitesse, utilisation de la mémoire et qualité de transcription. Descendez lorsque le matériel est limité, ou choisissez Medium, Large ou Turbo lorsque la précision et les performances du GPU sont plus importantes.

Tiny

Détection de mots d'éveil, commandes rapides et tests sur les systèmes à mémoire la plus faible.

Base

Notes courtes, invites et dictées générales sur du matériel modeste.

Small

Un choix quotidien équilibré pour les invites des agents et les dictées plus longues.

Medium

Transcription axée sur la précision lorsque vous pouvez échanger du temps de traitement et de la mémoire supplémentaires.

Large

L'option locale de la plus haute précision pour les systèmes disposant d'au moins 10 Go de VRAM disponible.

Turbo

Transcription rapide et de haute qualité sur un GPU pris en charge avec au moins 6 Go de VRAM disponible.

Statut d'installation

La page des paramètres affiche le statut d'installation des dépendances requises :

Chuchoter
FFmpeg
CUDA
UV (Python env)

Perruche et murmure incroyablement rapide

Moteurs rapides en option

Ces moteurs sont des téléchargements distincts, donc l'installation par défaut reste petite. L'écran des paramètres affiche l'installation et l'état du matériel pour chaque moteur.

Voyez les mots apparaître à mesure que vous parlez grâce à la transcription locale en direct. Insanely Fast Whisper est optimisé pour les GPU NVIDIA modernes ; Whisper, Parakeet et les options vocales du cloud et de la plateforme restent également disponibles.

Perruche NVIDIA

Un moteur de synthèse vocale local à grande vitesse. Installez son runtime facultatif à partir des paramètres de saisie vocale avant de le sélectionner.

Chuchotement incroyablement rapide

Une implémentation accélérée de Whisper destinée aux systèmes GPU compatibles. Installez le moteur en option avant utilisation.

En sélectionner un via Kaiju Voice ne démarre jamais un téléchargement volumineux en silence. Installez-le d'abord dans Paramètres ; l'assistant peut alors vérifier la disponibilité et changer de service.

Voix de la plateforme

Windows Voice Typing — keyboard shortcut configuration and system setup

Saisie vocale Windows

Configurez la Saisie vocale Windows pour la transcription parole-en-texte. Ce service utilise les services Azure Speech intégrés à Windows 10 et versions ultérieures. Une connexion Internet est requise. Suivez les instructions de configuration pour activer la reconnaissance vocale dans les Paramètres Windows.

Configuration système requise

Windows 10 ou version ultérieure avec la reconnaissance vocale activée dans les paramètres système.

Raccourci clavier

Raccourci de déclenchement par défaut : Ctrl+Maj+W. Configurable selon vos préférences.

Test de déclenchement

Bouton de test pour vérifier que la saisie vocale fonctionne correctement avec votre microphone.

Dictée Apple

Configurez la Dictée Apple pour la transcription parole-en-texte sur macOS. C'est une fonctionnalité native de macOS sans configuration supplémentaire requise au-delà de l'activation de la dictée dans les Réglages système.

Configuration système requise

macOS avec la Dictée activée dans Réglages système > Clavier.

Raccourci clavier

Raccourci de déclenchement par défaut : Ctrl+Maj+D. Configurable selon vos préférences.

Test de déclenchement

Bouton de test pour vérifier que la dictée fonctionne correctement avec votre microphone.

Synthèse vocale et voix IA

Modèles vocaux locaux

AI Brain parle à travers le modèle installé sélectionné. Changer de modèle décharge le modèle précédent avant de charger le nouveau, et la liste des voix est filtrée pour les voix compatibles avec ce modèle.

Kokoro 82M

Discours local léger et rapide avec une large sélection de voix intégrée.

Chatterbox Turbo

Discours expressif à faible latence et clonage vocal pris en charge.

Chatterbox

Le modèle Chatterbox complet pour la synthèse locale expressive et le clonage.

OmniVoice 0.6B

Synthèse vocale locale multilingue compacte.

SortieTTS 1.0 1B

Génération vocale locale avec son propre ensemble vocal compatible.

Qwen3-TTS 1.7B

Synthèse locale multilingue et expressive plus large.

Discours de poisson S2 Pro

Discours local de haute qualité avec flux de travail de voix de référence pris en charge.

La vitesse de parole peut être réglée de 0,5× à 2×. Le clonage vocal apparaît uniquement pour les modèles qui le prennent en charge ; utilisez l'audio que vous possédez ou que vous avez la permission d'utiliser.

Catalogue des fournisseurs de cloud

Le catalogue de paramètres comprend également la configuration pour OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech et Microsoft Azure. La disponibilité dépend de la configuration du fournisseur et des informations d'identification que vous fournissez.

Les informations d'identification de l'API restent dans les paramètres et sont exclues des résumés des paramètres vocaux ou structurés de Kaiju Voice.

Tous les logos, marques déposées et noms de marques de tiers affichés dans Kaiju Hub AI sont la propriété de leurs propriétaires respectifs. Leur utilisation est uniquement à des fins d’identification et n’implique aucun parrainage, sponsoring ou affiliation.