Stemmeskrivning
Oversigt
Vælg en lokal transskriptionsmaskine eller dit operativsystems indbyggede dikteringstjeneste. Tilgængeligheden afhænger af din platform og hvilke valgfrie motorer, der er installeret.
Hvad tale-til-tekst gør
Tale til tekst forvandler det, du siger, til redigerbar tekst, hvor Kaiju Hub AI tilbyder en mikrofonhandling. Brug den til at diktere agentprompter, fortsætte en Kaiju Voice-samtale og indtaste længere instruktioner uden at skrive. Lokale motorer som Whisper og Parakeet holder transskription på din maskine; platformsdiktering bruger taletjenesten leveret af Windows eller macOS.
Tilgængelige tjenester
Hviske
Lokal OpenAI Whisper-transskription med valgbar modelstørrelse og hardwareacceleration.
NVIDIA Parakit
Hurtig lokal talegenkendelse ved hjælp af den valgfri Parakeet-motor.
Sindssygt hurtig hvisken
En optimeret Whisper-sti til understøttede GPU-konfigurationer.
Windows Stemmeskrivning
Bruger Windows-diktering og den konfigurerede systemgenvejstast.
Apple-diktering
Bruger den indbyggede macOS-dikteringstjeneste.
Hviske
Whisper-indstillinger
Konfigurer OpenAI Whisper-indstillingerne for lokal tale-til-tekst-transskription. Whisper kører udelukkende på din maskine for offline, privat stemmeindtastning. Download, installer og fjern modeller direkte fra denne fane.
Tilgængelige modeller
Lille
39 millioner parametre, ca. 75 MB download, ca. 10x realtidshastighed, kræver 1 GB VRAM.
Grundlæggende
74 millioner parametre, ca. 145 MB download, ca. 7x realtidshastighed, kræver 1 GB VRAM.
Lille
244 millioner parametre, ca. 465 MB download, ca. 4x realtidshastighed, kræver 2 GB VRAM.
Mellem
769 millioner parametre, ca. 1,5 GB download, ca. 2x realtidshastighed, kræver 5 GB VRAM.
Stor
1.550 millioner parametre, ca. 3 GB download, 1x realtidshastighed, kræver 10 GB VRAM.
Turbo
809 millioner parametre, ca. 1,6 GB download, ca. 8x realtidshastighed, kræver 6 GB VRAM.
Hvilken Whisper-model skal jeg vælge?
Start med Small for en praktisk balance mellem hastighed, hukommelsesbrug og transskriptionskvalitet. Flyt ned, når hardwaren er begrænset, eller vælg Medium, Large eller Turbo, når nøjagtighed og GPU-ydeevne betyder mere.
Lille
Wake-word-detektering, hurtige kommandoer og test på de systemer med den laveste hukommelse.
Grundlæggende
Korte noter, prompter og generel diktat på beskeden hardware.
Lille
Et afbalanceret hverdagsvalg til agentbeskeder og længere diktering.
Mellem
Nøjagtighedsfokuseret transskription, når du kan bytte ekstra behandlingstid og hukommelse.
Stor
Den lokale mulighed med højeste nøjagtighed for systemer med mindst 10 GB tilgængelig VRAM.
Turbo
Hurtig transskription af høj kvalitet på en understøttet GPU med mindst 6 GB tilgængelig VRAM.
Installationsstatus
Siden med indstillinger viser installationsstatus for de nødvendige afhængigheder:
Parakit og sindssygt hurtig hvisken
Valgfri hurtige motorer
Disse motorer er separate downloads, så standardinstallationen forbliver lille. Indstillingsskærmen viser installations- og hardwarestatus for hver motor.
Se ordene dukke op, mens du taler, med live lokal transskription. Insanely Fast Whisper er optimeret til moderne NVIDIA-GPU'er, og Whisper, Parakeet samt cloud- og platformsbaserede talemuligheder er også tilgængelige.
NVIDIA Parakit
En højhastigheds lokal tale-til-tekst-motor. Installer dens valgfrie runtime fra indstillingerne for Voice Typing, før du vælger den.
Sindssygt hurtig hvisken
En accelereret Whisper-implementering beregnet til kompatible GPU-systemer. Installer den valgfrie motor før brug.
At vælge en gennem Kaiju Voice starter aldrig en stor download lydløst. Installer det i Indstillinger først; assistenten kan derefter bekræfte tilgængelighed og skifte tjenester.
Platformstemme
Windows-stemmestyring
Konfigurer Windows-stemmestyring til tale-til-tekst-transskription. Denne tjeneste bruger Azure-tale-tjenester, der er indbygget i Windows 10 og nyere. Der kræves en internetforbindelse. Følg opsætningsinstruktionerne for at aktivere talegenkendelse i Windows-indstillinger.
Systemkrav
Windows 10 eller nyere med aktiveret talegenkendelse i systemindstillinger.
Genvejstast
Standardgenvejstast: Ctrl+Shift+W. Kan konfigureres efter dine præferencer.
Testudløser
Testknap for at verificere, at stemmestyringen fungerer korrekt med din mikrofon.
Apple-diktering
Konfigurer Apple-diktering til tale-til-tekst-transskription på macOS. Dette er en indbygget macOS-funktion uden yderligere opsætning ud over at aktivere diktering i Systemindstillinger.
Systemkrav
macOS med aktiveret diktering i Systemindstillinger > Tastatur.
Genvejstast
Standardgenvejstast: Ctrl+Shift+D. Kan konfigureres efter dine præferencer.
Testudløser
Testknap for at verificere, at diktering fungerer korrekt med din mikrofon.
Tekst til tale og AI-stemmer
Lokale stemmemodeller
AI Brain taler gennem den valgte installerede model. Ændring af model aflæser den tidligere model, før den nye indlæses, og stemmelisten filtreres til stemmer, der er kompatible med den model.
Kokoro 82M
Let, hurtig lokal tale med et bredt indbygget stemmevalg.
Chatterbox Turbo
Ekspressiv tale med lav latens og understøttet stemmekloning.
Chatterbox
Den fulde Chatterbox-model til ekspressiv lokal syntese og kloning.
OmniVoice 0.6B
Kompakt flersproget lokal tekst-til-tale.
OuteTTS 1.0 1B
Lokal talegenerering med sit eget kompatible stemmesæt.
Qwen3-TTS 1.7B
Større flersproget og udtryksfuld lokal syntese.
Fish Speech S2 Pro
Lokal tale af høj kvalitet med understøttede reference-stemme arbejdsgange.
Talehastigheden kan indstilles fra 0,5× til 2×. Stemmekloning vises kun for modeller, der understøtter det; bruge lyd, du ejer eller har tilladelse til at bruge.
Cloud udbyder katalog
Indstillingskataloget inkluderer også konfiguration for OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech og Microsoft Azure. Tilgængelighed afhænger af udbyderens konfiguration og legitimationsoplysninger, du angiver.
API-legitimationsoplysninger forbliver i Indstillinger og er udelukket fra Kaiju Voices talte eller strukturerede indstillingsoversigter.
