Kaiju Hub AI

Spraaktypen

Serviceselectie voor stemtypen in Kaiju Hub-instellingen

Overzicht

Kies een lokale transcriptie-engine of de ingebouwde dicteerservice van uw besturingssysteem. De beschikbaarheid is afhankelijk van uw platform en welke optionele motoren zijn geïnstalleerd.

Wat spraak-naar-tekst doet

Spraak-naar-tekst verandert wat u zegt in bewerkbare tekst, overal waar Kaiju Hub AI een microfoonactie biedt. Gebruik het om instructies van agenten te dicteren, een Kaiju Voice-gesprek voort te zetten en langere instructies in te voeren zonder te typen. Lokale zoekmachines zoals Whisper en Parakeet houden de transcriptie op uw machine; platformdicteren maakt gebruik van de spraakservice van Windows of macOS.

Beschikbare diensten

Fluister

Lokale OpenAI Whisper-transcriptie met selecteerbare modelgrootte en hardwareversnelling.

NVIDIA-parkiet

Snelle lokale spraakherkenning met behulp van de optionele Parakeet-engine.

Waanzinnig snel gefluister

Een geoptimaliseerd Whisper-pad voor ondersteunde GPU-configuraties.

Windows-stemtypen

Maakt gebruik van Windows-dictatie en de geconfigureerde systeemsneltoets.

Apple-dictaat

Maakt gebruik van de ingebouwde macOS-dicteerservice.

Fluister

Fluisteren: lokale spraak-naar-tekst met transcriptie-engineselectie en installatiestatus

Whisper-instellingen

Configureer OpenAI Whisper-instellingen voor lokale spraak-naar-tekst-transcriptie. Whisper draait volledig op je machine voor offline, privé spraakinvoer. Download, installeer en verwijder modellen rechtstreeks vanuit dit tabblad.

Beschikbare modellen

Tiny

39M parameters, ~75 MB download, ~10x realtimesnelheid, vereist 1 GB VRAM.

Base

74M parameters, ~145 MB download, ~7x realtimesnelheid, vereist 1 GB VRAM.

Small

244M parameters, ~465 MB download, ~4x realtimesnelheid, vereist 2 GB VRAM.

Medium

769M parameters, ~1.5 GB download, ~2x realtimesnelheid, vereist 5 GB VRAM.

Large

1550M parameters, ~3 GB download, 1x realtimesnelheid, vereist 10 GB VRAM.

Turbo

809M parameters, ~1.6 GB download, ~8x realtimesnelheid, vereist 6 GB VRAM.

Welk Whisper-model moet ik kiezen?

Begin met Small voor een praktische balans tussen snelheid, geheugengebruik en transcriptiekwaliteit. Ga omlaag als de hardware beperkt is, of kies Medium, Large of Turbo als nauwkeurigheid en GPU-prestaties belangrijker zijn.

Tiny

Wake-word-detectie, snelle opdrachten en testen op systemen met het laagste geheugen.

Base

Korte notities, aanwijzingen en algemeen dictaat op bescheiden hardware.

Small

Een uitgebalanceerde dagelijkse keuze voor agentprompts en langer dicteren.

Medium

Nauwkeurigheidsgerichte transcriptie waarbij u extra verwerkingstijd en geheugen kunt inruilen.

Large

De lokale optie met de hoogste nauwkeurigheid voor systemen met minimaal 10 GB beschikbaar VRAM.

Turbo

Snelle transcriptie van hoge kwaliteit op een ondersteunde GPU met minimaal 6 GB beschikbaar VRAM.

Installatiestatus

De instellingenpagina toont de installatiestatus van vereiste afhankelijkheden:

Fluister
FFmpeg
CUDA
UV (Python env)

Parkiet en waanzinnig snel gefluister

Optionele snelle motoren

Deze zoekmachines zijn afzonderlijke downloads, dus de standaardinstallatie blijft klein. Het instellingenscherm toont de installatie- en hardwarestatus voor elke engine.

Zie woorden verschijnen terwijl u spreekt met live lokale transcriptie. Insanely Fast Whisper is geoptimaliseerd voor moderne NVIDIA-GPU's; Whisper, Parakeet en spraakopties via de cloud en het platform zijn ook beschikbaar.

NVIDIA-parkiet

Een snelle lokale spraak-naar-tekst-engine. Installeer de optionele runtime vanuit de instellingen voor Voice Typing voordat u deze selecteert.

Waanzinnig snel gefluister

Een versnelde Whisper-implementatie bedoeld voor compatibele GPU-systemen. Installeer de optionele motor vóór gebruik.

Als u er een selecteert via Kaiju Voice, start u nooit stilletjes een grote download. Installeer het eerst in Instellingen; de assistent kan vervolgens de beschikbaarheid verifiëren en van dienst wisselen.

Platformspraak

Windows Voice Typing — keyboard shortcut configuration and system setup

Windows-spraaktypen

Configureer Windows-spraaktypen voor spraak-naar-tekst-transcriptie. Deze dienst gebruikt Azure Speech Services ingebouwd in Windows 10 en later. Een internetverbinding is vereist. Volg de installatie-instructies om spraakherkenning in te schakelen in Windows-instellingen.

Systeemvereisten

Windows 10 of later met spraakherkenning ingeschakeld in systeeminstellingen.

Sneltoets

Standaard activeringssneltoets: Ctrl+Shift+W. Configureerbaar naar je voorkeur.

Testactivering

Testknop om te verifiëren dat spraaktypen correct werkt met je microfoon.

Apple Dictation

Configureer Apple Dictation voor spraak-naar-tekst-transcriptie op macOS. Dit is een native macOS-functie waarvoor geen extra installatie nodig is behalve het inschakelen van dicteren in Systeeminstellingen.

Systeemvereisten

macOS met Dictation ingeschakeld in Systeeminstellingen > Toetsenbord.

Sneltoets

Standaard activeringssneltoets: Ctrl+Shift+D. Configureerbaar naar je voorkeur.

Testactivering

Testknop om te verifiëren dat dicteren correct werkt met je microfoon.

Tekst-naar-spraak en AI-stemmen

Lokale stemmodellen

AI Brain spreekt via het geselecteerde geïnstalleerde model. Als u van model verandert, wordt het vorige model verwijderd voordat u het nieuwe laadt, en de stemmenlijst wordt gefilterd op stemmen die compatibel zijn met dat model.

Kokoro 82M

Lichtgewicht, snelle lokale spraak met een brede ingebouwde stemselectie.

Chatterbox-turbo

Expressieve spraak met lage latentie en ondersteunde stemklonering.

Babbelbox

Het volledige Chatterbox-model voor expressieve lokale synthese en klonen.

OmniVoice 0.6B

Compacte meertalige lokale tekst-naar-spraak.

OuteTTS 1.0 1B

Lokale spraakgeneratie met een eigen compatibele stemset.

Qwen3-TTS 1.7B

Grotere meertalige en expressieve lokale synthese.

Fish Speech S2 Pro

Lokale spraak van hoge kwaliteit met ondersteunde referentiestemworkflows.

De spraaksnelheid kan worden ingesteld van 0,5× tot 2×. Spraakklonen verschijnt alleen voor modellen die dit ondersteunen; gebruik audio waarvan u de eigenaar bent of waarvoor u toestemming heeft om deze te gebruiken.

Catalogus van cloudproviders

De instellingencatalogus bevat ook configuratie voor OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech en Microsoft Azure. De beschikbaarheid is afhankelijk van de providerconfiguratie en de inloggegevens die u opgeeft.

API-inloggegevens blijven in Instellingen staan en zijn uitgesloten van de gesproken of gestructureerde samenvattingen van de instellingen van Kaiju Voice.

Alle logo's, handelsmerken en merknamen van derden die worden weergegeven in Kaiju Hub AI zijn eigendom van hun respectievelijke eigenaren. Het gebruik ervan is uitsluitend bedoeld voor identificatiedoeleinden en impliceert geen goedkeuring, sponsoring of aansluiting.