Stemmeskriving
Oversikt
Velg en lokal transkripsjonsmotor eller operativsystemets innebygde dikteringstjeneste. Tilgjengelighet avhenger av plattformen din og hvilke valgfrie motorer som er installert.
Hva tale-til-tekst gjør
Tale til tekst gjør det du sier til redigerbar tekst der Kaiju Hub AI tilbyr en mikrofonhandling. Bruk den til å diktere agentforespørsler, fortsette en Kaiju Voice-samtale og angi lengre instruksjoner uten å skrive. Lokale motorer som Whisper og Parakeet holder transkripsjon på maskinen din; plattformdiktering bruker taletjenesten levert av Windows eller macOS.
Tilgjengelige tjenester
Hviske
Lokal OpenAI Whisper-transkripsjon med valgbar modellstørrelse og maskinvareakselerasjon.
NVIDIA Parakeet
Rask lokal talegjenkjenning ved hjelp av den valgfrie Parakeet-motoren.
Vanvittig rask hvisking
En optimalisert Whisper-bane for støttede GPU-konfigurasjoner.
Windows Stemmeskriving
Bruker Windows-diktering og den konfigurerte systemhurtigtasten.
Apple-diktasjon
Bruker den innebygde macOS-dikteringstjenesten.
Hviske
Whisper-innstillinger
Konfigurer OpenAI Whisper-innstillinger for lokal tale-til-tekst-transkripsjon. Whisper kjører helt på maskinen din for offline, privat stemmeinndata. Last ned, installer og fjern modeller direkte fra denne fanen.
Tilgjengelige modeller
Liten
39 millioner parametere, ~75 MB nedlasting, ~10x sanntidshastighet, krever 1 GB VRAM.
Grunnleggende
74 millioner parametere, ~145 MB nedlasting, ~7x sanntidshastighet, krever 1 GB VRAM.
Liten
244 millioner parametere, ~465 MB nedlasting, ~4x sanntidshastighet, krever 2 GB VRAM.
Middels
769 millioner parametere, ~1,5 GB nedlasting, ~2x sanntidshastighet, krever 5 GB VRAM.
Stor
1550 millioner parametere, ~3 GB nedlasting, 1x sanntidshastighet, krever 10 GB VRAM.
Turbo
809 millioner parametere, ~1,6 GB nedlasting, ~8x sanntidshastighet, krever 6 GB VRAM.
Hvilken Whisper-modell bør jeg velge?
Start med Small for en praktisk balanse mellom hastighet, minnebruk og transkripsjonskvalitet. Flytt ned når maskinvaren er begrenset, eller velg Medium, Large eller Turbo når nøyaktighet og GPU-ytelse betyr mer.
Liten
Wake-word-deteksjon, raske kommandoer og testing på systemene med lavest minne.
Grunnleggende
Korte notater, meldinger og generell diktering på beskjeden maskinvare.
Liten
Et balansert hverdagsvalg for oppfordringer fra agenter og lengre diktering.
Middels
Nøyaktighetsfokusert transkripsjon når du kan bytte ekstra behandlingstid og minne.
Stor
Det lokale alternativet med høyest nøyaktighet for systemer med minst 10 GB tilgjengelig VRAM.
Turbo
Rask transkripsjon av høy kvalitet på en støttet GPU med minst 6 GB tilgjengelig VRAM.
Installasjonsstatus
Innstillingssiden viser installasjonsstatusen for nødvendige avhengigheter:
Parakeet og sinnsykt rask hvisking
Valgfrie raske motorer
Disse motorene er separate nedlastinger slik at standardinstallasjonen forblir liten. Innstillingsskjermen viser installasjon og maskinvarestatus for hver motor.
Se ordene vises mens du snakker med direkte lokal transkripsjon. Insanely Fast Whisper er optimalisert for moderne NVIDIA-GPU-er, og Whisper, Parakeet samt sky- og plattformbaserte talealternativer er også tilgjengelige.
NVIDIA Parakeet
En høyhastighets lokal tale-til-tekst-motor. Installer den valgfrie kjøretiden fra Voice Typing-innstillingene før du velger den.
Vanvittig rask hvisking
En akselerert Whisper-implementering beregnet på kompatible GPU-systemer. Installer den valgfrie motoren før bruk.
Å velge en gjennom Kaiju Voice starter aldri en stor nedlasting stille. Installer den i Innstillinger først; assistenten kan deretter bekrefte tilgjengelighet og bytte tjenester.
Plattformstemme
Windows-stemmetyping
Konfigurer Windows-stemmetyping for tale-til-tekst-transkripsjon. Denne tjenesten bruker Azure-tale tjenester som er innebygd i Windows 10 og nyere. En internettforbindelse kreves. Følg oppsettsinstruksjonene for å aktivere talegjenkjenning i Windows-innstillinger.
Systemkrav
Windows 10 eller nyere med talegjenkjenning aktivert i systeminnstillingene.
Snarvei
Standard snarvei: Ctrl+Shift+W. Kan konfigureres etter dine preferanser.
Test utløser
Testknapp for å bekrefte at stemmetyping fungerer som det skal med mikrofonen din.
Apple-diktat
Konfigurer Apple-diktat for tale-til-tekst-transkripsjon på macOS. Dette er en macOS-innfødt funksjon uten ytterligere oppsett, bortsett fra å aktivere diktat i Systeminnstillinger.
Systemkrav
macOS med diktat aktivert i Systeminnstillinger > Tastatur.
Snarvei
Standard snarvei: Ctrl+Shift+D. Kan konfigureres etter dine preferanser.
Test utløser
Testknapp for å bekrefte at diktat fungerer som det skal med mikrofonen din.
Tekst til tale og AI-stemmer
Lokale stemmemodeller
AI Brain snakker gjennom den valgte installerte modellen. Endring av modell laster ut den forrige modellen før den nye lastes inn, og stemmelisten filtreres til stemmer som er kompatible med den modellen.
Kokoro 82M
Lett, rask lokal tale med et bredt innebygd stemmevalg.
Chatterbox Turbo
Ekspressiv tale med lav latens og støttet stemmekloning.
Chatterbox
Den fullstendige Chatterbox-modellen for uttrykksfull lokal syntese og kloning.
OmniVoice 0.6B
Kompakt flerspråklig lokal tekst-til-tale.
OuteTTS 1.0 1B
Lokal talegenerering med sitt eget kompatible stemmesett.
Qwen3-TTS 1.7B
Større flerspråklig og uttrykksfull lokal syntese.
Fish Speech S2 Pro
Høykvalitets lokal tale med støttede referanse-stemme arbeidsflyter.
Talehastigheten kan stilles inn fra 0,5× til 2×. Stemmekloning vises bare for modeller som støtter det; bruke lyd du eier eller har tillatelse til å bruke.
Nettskyleverandørkatalog
Innstillingskatalogen inkluderer også konfigurasjon for OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech og Microsoft Azure. Tilgjengelighet avhenger av leverandørkonfigurasjonen og påloggingsinformasjonen du oppgir.
API-legitimasjon forblir i Innstillinger og er ekskludert fra Kaiju Voices talte eller strukturerte innstillingssammendrag.
