Spraaktypen
Overzicht
Kies een lokale transcriptie-engine of de ingebouwde dicteerservice van uw besturingssysteem. De beschikbaarheid is afhankelijk van uw platform en welke optionele motoren zijn geïnstalleerd.
Wat spraak-naar-tekst doet
Spraak-naar-tekst verandert wat u zegt in bewerkbare tekst, overal waar Kaiju Hub AI een microfoonactie biedt. Gebruik het om instructies van agenten te dicteren, een Kaiju Voice-gesprek voort te zetten en langere instructies in te voeren zonder te typen. Lokale zoekmachines zoals Whisper en Parakeet houden de transcriptie op uw machine; platformdicteren maakt gebruik van de spraakservice van Windows of macOS.
Beschikbare diensten
Fluister
Lokale OpenAI Whisper-transcriptie met selecteerbare modelgrootte en hardwareversnelling.
NVIDIA-parkiet
Snelle lokale spraakherkenning met behulp van de optionele Parakeet-engine.
Waanzinnig snel gefluister
Een geoptimaliseerd Whisper-pad voor ondersteunde GPU-configuraties.
Windows-stemtypen
Maakt gebruik van Windows-dictatie en de geconfigureerde systeemsneltoets.
Apple-dictaat
Maakt gebruik van de ingebouwde macOS-dicteerservice.
Fluister
Whisper-instellingen
Configureer OpenAI Whisper-instellingen voor lokale spraak-naar-tekst-transcriptie. Whisper draait volledig op je machine voor offline, privé spraakinvoer. Download, installeer en verwijder modellen rechtstreeks vanuit dit tabblad.
Beschikbare modellen
Tiny
39M parameters, ~75 MB download, ~10x realtimesnelheid, vereist 1 GB VRAM.
Base
74M parameters, ~145 MB download, ~7x realtimesnelheid, vereist 1 GB VRAM.
Small
244M parameters, ~465 MB download, ~4x realtimesnelheid, vereist 2 GB VRAM.
Medium
769M parameters, ~1.5 GB download, ~2x realtimesnelheid, vereist 5 GB VRAM.
Large
1550M parameters, ~3 GB download, 1x realtimesnelheid, vereist 10 GB VRAM.
Turbo
809M parameters, ~1.6 GB download, ~8x realtimesnelheid, vereist 6 GB VRAM.
Welk Whisper-model moet ik kiezen?
Begin met Small voor een praktische balans tussen snelheid, geheugengebruik en transcriptiekwaliteit. Ga omlaag als de hardware beperkt is, of kies Medium, Large of Turbo als nauwkeurigheid en GPU-prestaties belangrijker zijn.
Tiny
Wake-word-detectie, snelle opdrachten en testen op systemen met het laagste geheugen.
Base
Korte notities, aanwijzingen en algemeen dictaat op bescheiden hardware.
Small
Een uitgebalanceerde dagelijkse keuze voor agentprompts en langer dicteren.
Medium
Nauwkeurigheidsgerichte transcriptie waarbij u extra verwerkingstijd en geheugen kunt inruilen.
Large
De lokale optie met de hoogste nauwkeurigheid voor systemen met minimaal 10 GB beschikbaar VRAM.
Turbo
Snelle transcriptie van hoge kwaliteit op een ondersteunde GPU met minimaal 6 GB beschikbaar VRAM.
Installatiestatus
De instellingenpagina toont de installatiestatus van vereiste afhankelijkheden:
Parkiet en waanzinnig snel gefluister
Optionele snelle motoren
Deze zoekmachines zijn afzonderlijke downloads, dus de standaardinstallatie blijft klein. Het instellingenscherm toont de installatie- en hardwarestatus voor elke engine.
Zie woorden verschijnen terwijl u spreekt met live lokale transcriptie. Insanely Fast Whisper is geoptimaliseerd voor moderne NVIDIA-GPU's; Whisper, Parakeet en spraakopties via de cloud en het platform zijn ook beschikbaar.
NVIDIA-parkiet
Een snelle lokale spraak-naar-tekst-engine. Installeer de optionele runtime vanuit de instellingen voor Voice Typing voordat u deze selecteert.
Waanzinnig snel gefluister
Een versnelde Whisper-implementatie bedoeld voor compatibele GPU-systemen. Installeer de optionele motor vóór gebruik.
Als u er een selecteert via Kaiju Voice, start u nooit stilletjes een grote download. Installeer het eerst in Instellingen; de assistent kan vervolgens de beschikbaarheid verifiëren en van dienst wisselen.
Platformspraak
Windows-spraaktypen
Configureer Windows-spraaktypen voor spraak-naar-tekst-transcriptie. Deze dienst gebruikt Azure Speech Services ingebouwd in Windows 10 en later. Een internetverbinding is vereist. Volg de installatie-instructies om spraakherkenning in te schakelen in Windows-instellingen.
Systeemvereisten
Windows 10 of later met spraakherkenning ingeschakeld in systeeminstellingen.
Sneltoets
Standaard activeringssneltoets: Ctrl+Shift+W. Configureerbaar naar je voorkeur.
Testactivering
Testknop om te verifiëren dat spraaktypen correct werkt met je microfoon.
Apple Dictation
Configureer Apple Dictation voor spraak-naar-tekst-transcriptie op macOS. Dit is een native macOS-functie waarvoor geen extra installatie nodig is behalve het inschakelen van dicteren in Systeeminstellingen.
Systeemvereisten
macOS met Dictation ingeschakeld in Systeeminstellingen > Toetsenbord.
Sneltoets
Standaard activeringssneltoets: Ctrl+Shift+D. Configureerbaar naar je voorkeur.
Testactivering
Testknop om te verifiëren dat dicteren correct werkt met je microfoon.
Tekst-naar-spraak en AI-stemmen
Lokale stemmodellen
AI Brain spreekt via het geselecteerde geïnstalleerde model. Als u van model verandert, wordt het vorige model verwijderd voordat u het nieuwe laadt, en de stemmenlijst wordt gefilterd op stemmen die compatibel zijn met dat model.
Kokoro 82M
Lichtgewicht, snelle lokale spraak met een brede ingebouwde stemselectie.
Chatterbox-turbo
Expressieve spraak met lage latentie en ondersteunde stemklonering.
Babbelbox
Het volledige Chatterbox-model voor expressieve lokale synthese en klonen.
OmniVoice 0.6B
Compacte meertalige lokale tekst-naar-spraak.
OuteTTS 1.0 1B
Lokale spraakgeneratie met een eigen compatibele stemset.
Qwen3-TTS 1.7B
Grotere meertalige en expressieve lokale synthese.
Fish Speech S2 Pro
Lokale spraak van hoge kwaliteit met ondersteunde referentiestemworkflows.
De spraaksnelheid kan worden ingesteld van 0,5× tot 2×. Spraakklonen verschijnt alleen voor modellen die dit ondersteunen; gebruik audio waarvan u de eigenaar bent of waarvoor u toestemming heeft om deze te gebruiken.
Catalogus van cloudproviders
De instellingencatalogus bevat ook configuratie voor OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech en Microsoft Azure. De beschikbaarheid is afhankelijk van de providerconfiguratie en de inloggegevens die u opgeeft.
API-inloggegevens blijven in Instellingen staan en zijn uitgesloten van de gesproken of gestructureerde samenvattingen van de instellingen van Kaiju Voice.
