Kaiju Hub AI

Stemmeskrivning

Valg af stemmetypetjeneste i Kaiju Hub-indstillinger

Oversigt

Vælg en lokal transskriptionsmaskine eller dit operativsystems indbyggede dikteringstjeneste. Tilgængeligheden afhænger af din platform og hvilke valgfrie motorer, der er installeret.

Hvad tale-til-tekst gør

Tale til tekst forvandler det, du siger, til redigerbar tekst, hvor Kaiju Hub AI tilbyder en mikrofonhandling. Brug den til at diktere agentprompter, fortsætte en Kaiju Voice-samtale og indtaste længere instruktioner uden at skrive. Lokale motorer som Whisper og Parakeet holder transskription på din maskine; platformsdiktering bruger taletjenesten leveret af Windows eller macOS.

Tilgængelige tjenester

Hviske

Lokal OpenAI Whisper-transskription med valgbar modelstørrelse og hardwareacceleration.

NVIDIA Parakit

Hurtig lokal talegenkendelse ved hjælp af den valgfri Parakeet-motor.

Sindssygt hurtig hvisken

En optimeret Whisper-sti til understøttede GPU-konfigurationer.

Windows Stemmeskrivning

Bruger Windows-diktering og den konfigurerede systemgenvejstast.

Apple-diktering

Bruger den indbyggede macOS-dikteringstjeneste.

Hviske

Whisper — lokal tale-til-tekst med valg af transskriptionsmotor og installationsstatus

Whisper-indstillinger

Konfigurer OpenAI Whisper-indstillingerne for lokal tale-til-tekst-transskription. Whisper kører udelukkende på din maskine for offline, privat stemmeindtastning. Download, installer og fjern modeller direkte fra denne fane.

Tilgængelige modeller

Lille

39 millioner parametre, ca. 75 MB download, ca. 10x realtidshastighed, kræver 1 GB VRAM.

Grundlæggende

74 millioner parametre, ca. 145 MB download, ca. 7x realtidshastighed, kræver 1 GB VRAM.

Lille

244 millioner parametre, ca. 465 MB download, ca. 4x realtidshastighed, kræver 2 GB VRAM.

Mellem

769 millioner parametre, ca. 1,5 GB download, ca. 2x realtidshastighed, kræver 5 GB VRAM.

Stor

1.550 millioner parametre, ca. 3 GB download, 1x realtidshastighed, kræver 10 GB VRAM.

Turbo

809 millioner parametre, ca. 1,6 GB download, ca. 8x realtidshastighed, kræver 6 GB VRAM.

Hvilken Whisper-model skal jeg vælge?

Start med Small for en praktisk balance mellem hastighed, hukommelsesbrug og transskriptionskvalitet. Flyt ned, når hardwaren er begrænset, eller vælg Medium, Large eller Turbo, når nøjagtighed og GPU-ydeevne betyder mere.

Lille

Wake-word-detektering, hurtige kommandoer og test på de systemer med den laveste hukommelse.

Grundlæggende

Korte noter, prompter og generel diktat på beskeden hardware.

Lille

Et afbalanceret hverdagsvalg til agentbeskeder og længere diktering.

Mellem

Nøjagtighedsfokuseret transskription, når du kan bytte ekstra behandlingstid og hukommelse.

Stor

Den lokale mulighed med højeste nøjagtighed for systemer med mindst 10 GB tilgængelig VRAM.

Turbo

Hurtig transskription af høj kvalitet på en understøttet GPU med mindst 6 GB tilgængelig VRAM.

Installationsstatus

Siden med indstillinger viser installationsstatus for de nødvendige afhængigheder:

Hviske
FFmpeg
CUDA
UV (Python env)

Parakit og sindssygt hurtig hvisken

Valgfri hurtige motorer

Disse motorer er separate downloads, så standardinstallationen forbliver lille. Indstillingsskærmen viser installations- og hardwarestatus for hver motor.

Se ordene dukke op, mens du taler, med live lokal transskription. Insanely Fast Whisper er optimeret til moderne NVIDIA-GPU'er, og Whisper, Parakeet samt cloud- og platformsbaserede talemuligheder er også tilgængelige.

NVIDIA Parakit

En højhastigheds lokal tale-til-tekst-motor. Installer dens valgfrie runtime fra indstillingerne for Voice Typing, før du vælger den.

Sindssygt hurtig hvisken

En accelereret Whisper-implementering beregnet til kompatible GPU-systemer. Installer den valgfrie motor før brug.

At vælge en gennem Kaiju Voice starter aldrig en stor download lydløst. Installer det i Indstillinger først; assistenten kan derefter bekræfte tilgængelighed og skifte tjenester.

Platformstemme

Windows Voice Typing — keyboard shortcut configuration and system setup

Windows-stemmestyring

Konfigurer Windows-stemmestyring til tale-til-tekst-transskription. Denne tjeneste bruger Azure-tale-tjenester, der er indbygget i Windows 10 og nyere. Der kræves en internetforbindelse. Følg opsætningsinstruktionerne for at aktivere talegenkendelse i Windows-indstillinger.

Systemkrav

Windows 10 eller nyere med aktiveret talegenkendelse i systemindstillinger.

Genvejstast

Standardgenvejstast: Ctrl+Shift+W. Kan konfigureres efter dine præferencer.

Testudløser

Testknap for at verificere, at stemmestyringen fungerer korrekt med din mikrofon.

Apple-diktering

Konfigurer Apple-diktering til tale-til-tekst-transskription på macOS. Dette er en indbygget macOS-funktion uden yderligere opsætning ud over at aktivere diktering i Systemindstillinger.

Systemkrav

macOS med aktiveret diktering i Systemindstillinger > Tastatur.

Genvejstast

Standardgenvejstast: Ctrl+Shift+D. Kan konfigureres efter dine præferencer.

Testudløser

Testknap for at verificere, at diktering fungerer korrekt med din mikrofon.

Tekst til tale og AI-stemmer

Lokale stemmemodeller

AI Brain taler gennem den valgte installerede model. Ændring af model aflæser den tidligere model, før den nye indlæses, og stemmelisten filtreres til stemmer, der er kompatible med den model.

Kokoro 82M

Let, hurtig lokal tale med et bredt indbygget stemmevalg.

Chatterbox Turbo

Ekspressiv tale med lav latens og understøttet stemmekloning.

Chatterbox

Den fulde Chatterbox-model til ekspressiv lokal syntese og kloning.

OmniVoice 0.6B

Kompakt flersproget lokal tekst-til-tale.

OuteTTS 1.0 1B

Lokal talegenerering med sit eget kompatible stemmesæt.

Qwen3-TTS 1.7B

Større flersproget og udtryksfuld lokal syntese.

Fish Speech S2 Pro

Lokal tale af høj kvalitet med understøttede reference-stemme arbejdsgange.

Talehastigheden kan indstilles fra 0,5× til 2×. Stemmekloning vises kun for modeller, der understøtter det; bruge lyd, du ejer eller har tilladelse til at bruge.

Cloud udbyder katalog

Indstillingskataloget inkluderer også konfiguration for OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech og Microsoft Azure. Tilgængelighed afhænger af udbyderens konfiguration og legitimationsoplysninger, du angiver.

API-legitimationsoplysninger forbliver i Indstillinger og er udelukket fra Kaiju Voices talte eller strukturerede indstillingsoversigter.

Alle tredjepartslogoer, vaeremaerker og brandnavne vist i Kaiju Hub AI tilhoerer deres respektive ejere. Deres brug er udelukkende til identifikationsformaal og indeboerer ikke stotte, sponsorat eller tilknytning.