Kaiju Hub AI

Stemmeskriving

Valg av taleskrivingstjeneste i Kaiju Hub-innstillingene

Oversikt

Velg en lokal transkripsjonsmotor eller operativsystemets innebygde dikteringstjeneste. Tilgjengelighet avhenger av plattformen din og hvilke valgfrie motorer som er installert.

Hva tale-til-tekst gjør

Tale til tekst gjør det du sier til redigerbar tekst der Kaiju Hub AI tilbyr en mikrofonhandling. Bruk den til å diktere agentforespørsler, fortsette en Kaiju Voice-samtale og angi lengre instruksjoner uten å skrive. Lokale motorer som Whisper og Parakeet holder transkripsjon på maskinen din; plattformdiktering bruker taletjenesten levert av Windows eller macOS.

Tilgjengelige tjenester

Hviske

Lokal OpenAI Whisper-transkripsjon med valgbar modellstørrelse og maskinvareakselerasjon.

NVIDIA Parakeet

Rask lokal talegjenkjenning ved hjelp av den valgfrie Parakeet-motoren.

Vanvittig rask hvisking

En optimalisert Whisper-bane for støttede GPU-konfigurasjoner.

Windows Stemmeskriving

Bruker Windows-diktering og den konfigurerte systemhurtigtasten.

Apple-diktasjon

Bruker den innebygde macOS-dikteringstjenesten.

Hviske

Whisper — lokal tale-til-tekst med valg av transkripsjonsmotor og installasjonsstatus

Whisper-innstillinger

Konfigurer OpenAI Whisper-innstillinger for lokal tale-til-tekst-transkripsjon. Whisper kjører helt på maskinen din for offline, privat stemmeinndata. Last ned, installer og fjern modeller direkte fra denne fanen.

Tilgjengelige modeller

Liten

39 millioner parametere, ~75 MB nedlasting, ~10x sanntidshastighet, krever 1 GB VRAM.

Grunnleggende

74 millioner parametere, ~145 MB nedlasting, ~7x sanntidshastighet, krever 1 GB VRAM.

Liten

244 millioner parametere, ~465 MB nedlasting, ~4x sanntidshastighet, krever 2 GB VRAM.

Middels

769 millioner parametere, ~1,5 GB nedlasting, ~2x sanntidshastighet, krever 5 GB VRAM.

Stor

1550 millioner parametere, ~3 GB nedlasting, 1x sanntidshastighet, krever 10 GB VRAM.

Turbo

809 millioner parametere, ~1,6 GB nedlasting, ~8x sanntidshastighet, krever 6 GB VRAM.

Hvilken Whisper-modell bør jeg velge?

Start med Small for en praktisk balanse mellom hastighet, minnebruk og transkripsjonskvalitet. Flytt ned når maskinvaren er begrenset, eller velg Medium, Large eller Turbo når nøyaktighet og GPU-ytelse betyr mer.

Liten

Wake-word-deteksjon, raske kommandoer og testing på systemene med lavest minne.

Grunnleggende

Korte notater, meldinger og generell diktering på beskjeden maskinvare.

Liten

Et balansert hverdagsvalg for oppfordringer fra agenter og lengre diktering.

Middels

Nøyaktighetsfokusert transkripsjon når du kan bytte ekstra behandlingstid og minne.

Stor

Det lokale alternativet med høyest nøyaktighet for systemer med minst 10 GB tilgjengelig VRAM.

Turbo

Rask transkripsjon av høy kvalitet på en støttet GPU med minst 6 GB tilgjengelig VRAM.

Installasjonsstatus

Innstillingssiden viser installasjonsstatusen for nødvendige avhengigheter:

Hviske
FFmpeg
CUDA
UV (Python env)

Parakeet og sinnsykt rask hvisking

Valgfrie raske motorer

Disse motorene er separate nedlastinger slik at standardinstallasjonen forblir liten. Innstillingsskjermen viser installasjon og maskinvarestatus for hver motor.

Se ordene vises mens du snakker med direkte lokal transkripsjon. Insanely Fast Whisper er optimalisert for moderne NVIDIA-GPU-er, og Whisper, Parakeet samt sky- og plattformbaserte talealternativer er også tilgjengelige.

NVIDIA Parakeet

En høyhastighets lokal tale-til-tekst-motor. Installer den valgfrie kjøretiden fra Voice Typing-innstillingene før du velger den.

Vanvittig rask hvisking

En akselerert Whisper-implementering beregnet på kompatible GPU-systemer. Installer den valgfrie motoren før bruk.

Å velge en gjennom Kaiju Voice starter aldri en stor nedlasting stille. Installer den i Innstillinger først; assistenten kan deretter bekrefte tilgjengelighet og bytte tjenester.

Plattformstemme

Windows Voice Typing — keyboard shortcut configuration and system setup

Windows-stemmetyping

Konfigurer Windows-stemmetyping for tale-til-tekst-transkripsjon. Denne tjenesten bruker Azure-tale tjenester som er innebygd i Windows 10 og nyere. En internettforbindelse kreves. Følg oppsettsinstruksjonene for å aktivere talegjenkjenning i Windows-innstillinger.

Systemkrav

Windows 10 eller nyere med talegjenkjenning aktivert i systeminnstillingene.

Snarvei

Standard snarvei: Ctrl+Shift+W. Kan konfigureres etter dine preferanser.

Test utløser

Testknapp for å bekrefte at stemmetyping fungerer som det skal med mikrofonen din.

Apple-diktat

Konfigurer Apple-diktat for tale-til-tekst-transkripsjon på macOS. Dette er en macOS-innfødt funksjon uten ytterligere oppsett, bortsett fra å aktivere diktat i Systeminnstillinger.

Systemkrav

macOS med diktat aktivert i Systeminnstillinger > Tastatur.

Snarvei

Standard snarvei: Ctrl+Shift+D. Kan konfigureres etter dine preferanser.

Test utløser

Testknapp for å bekrefte at diktat fungerer som det skal med mikrofonen din.

Tekst til tale og AI-stemmer

Lokale stemmemodeller

AI Brain snakker gjennom den valgte installerte modellen. Endring av modell laster ut den forrige modellen før den nye lastes inn, og stemmelisten filtreres til stemmer som er kompatible med den modellen.

Kokoro 82M

Lett, rask lokal tale med et bredt innebygd stemmevalg.

Chatterbox Turbo

Ekspressiv tale med lav latens og støttet stemmekloning.

Chatterbox

Den fullstendige Chatterbox-modellen for uttrykksfull lokal syntese og kloning.

OmniVoice 0.6B

Kompakt flerspråklig lokal tekst-til-tale.

OuteTTS 1.0 1B

Lokal talegenerering med sitt eget kompatible stemmesett.

Qwen3-TTS 1.7B

Større flerspråklig og uttrykksfull lokal syntese.

Fish Speech S2 Pro

Høykvalitets lokal tale med støttede referanse-stemme arbeidsflyter.

Talehastigheten kan stilles inn fra 0,5× til 2×. Stemmekloning vises bare for modeller som støtter det; bruke lyd du eier eller har tillatelse til å bruke.

Nettskyleverandørkatalog

Innstillingskatalogen inkluderer også konfigurasjon for OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech og Microsoft Azure. Tilgjengelighet avhenger av leverandørkonfigurasjonen og påloggingsinformasjonen du oppgir.

API-legitimasjon forblir i Innstillinger og er ekskludert fra Kaiju Voices talte eller strukturerte innstillingssammendrag.

Alle tredjepartslogoer, varemerker og merkenavn vist i Kaiju Hub AI tilhorer sine respektive eiere. Bruken er utelukkende til identifikasjonsformaal og innebaeerer ikke stotte, sponsing eller tilknytning.