Röstskrivning
Översikt
Välj en lokal transkriptionsmotor eller ditt operativsystems inbyggda dikteringstjänst. Tillgängligheten beror på din plattform och vilka tillvalsmotorer som är installerade.
Vad tal-till-text gör
Tal till text förvandlar det du säger till redigerbar text varhelst Kaiju Hub AI erbjuder en mikrofonåtgärd. Använd den för att diktera agentuppmaningar, fortsätta en Kaiju Voice-konversation och ange längre instruktioner utan att skriva. Lokala motorer som Whisper och Parakeet håller transkription på din maskin; plattformsdiktering använder taltjänsten som tillhandahålls av Windows eller macOS.
Tillgängliga tjänster
Viska
Lokal OpenAI Whisper-transkription med valbar modellstorlek och hårdvaruacceleration.
NVIDIA Parakit
Snabb lokal taligenkänning med hjälp av Parakeet-motorn som tillval.
Vansinnigt snabb Whisper
En optimerad Whisper-bana för GPU-konfigurationer som stöds.
Windows Röstskrivning
Använder Windows-diktering och den konfigurerade systemkommandot.
Apple diktering
Använder den inbyggda macOS-dikteringstjänsten.
Viska
Whisper-installningar
Konfigurera OpenAI Whisper-installningar for lokal tal-till-text-transkription. Whisper kor helt pa din dator for offline, privat rostinmatning. Ladda ner, installera och ta bort modeller direkt fran denna flik.
Tillgangliga modeller
Tiny
39M parametrar, ~75 MB nedladdning, ~10x realtidshastighet, kraver 1 GB VRAM.
Base
74M parametrar, ~145 MB nedladdning, ~7x realtidshastighet, kraver 1 GB VRAM.
Small
244M parametrar, ~465 MB nedladdning, ~4x realtidshastighet, kraver 2 GB VRAM.
Medium
769M parametrar, ~1.5 GB nedladdning, ~2x realtidshastighet, kraver 5 GB VRAM.
Large
1550M parametrar, ~3 GB nedladdning, 1x realtidshastighet, kraver 10 GB VRAM.
Turbo
809M parametrar, ~1.6 GB nedladdning, ~8x realtidshastighet, kraver 6 GB VRAM.
Vilken Whisper-modell ska jag välja?
Börja med Small för en praktisk balans mellan hastighet, minnesanvändning och transkriptionskvalitet. Flytta nedåt när hårdvaran är begränsad, eller välj Medium, Large eller Turbo när noggrannhet och GPU-prestanda är viktigare.
Tiny
Detektering av vakna ord, snabba kommandon och testning på systemen med lägst minne.
Base
Korta anteckningar, uppmaningar och allmän diktering på blygsam hårdvara.
Small
Ett balanserat vardagsval för agentuppmaningar och längre diktering.
Medium
Noggrannhetsfokuserad transkription när du kan byta extra bearbetningstid och minne.
Large
Det lokala alternativet med högsta noggrannhet för system med minst 10 GB tillgängligt VRAM.
Turbo
Snabb, högkvalitativ transkription på en GPU som stöds med minst 6 GB tillgängligt VRAM.
Installationsstatus
Installningssidan visar installationsstatusen for nodvandiga beroenden:
Parakit och Vansinnigt Snabb Whisper
Snabba motorer som tillval
Dessa motorer är separata nedladdningar så standardinstallationen förblir liten. Inställningsskärmen visar installations- och maskinvarustatus för varje motor.
Se orden visas medan du talar med lokal transkribering i realtid. Insanely Fast Whisper är optimerat för moderna NVIDIA-GPU:er, och Whisper, Parakeet samt moln- och plattformsbaserade talalternativ finns också tillgängliga.
NVIDIA Parakit
En höghastighets lokal tal-till-text-motor. Installera dess valfria körtid från inställningarna för röstinmatning innan du väljer den.
Vansinnigt snabb Whisper
En accelererad Whisper-implementering avsedd för kompatibla GPU-system. Installera tillvalsmotorn före användning.
Att välja en genom Kaiju Voice startar aldrig en stor nedladdning tyst. Installera det i Inställningar först; assistenten kan sedan verifiera tillgänglighet och byta tjänster.
Plattformsrost
Windows rostinmatning
Konfigurera Windows rostinmatning for tal-till-text-transkription. Denna tjanst anvander Azure Speech Services inbyggt i Windows 10 och senare. En internetanslutning kravs. Folj installationsanvisningarna for att aktivera taligenkanning i Windows-installningar.
Systemkrav
Windows 10 eller senare med taligenkanning aktiverat i systeminstellningar.
Snabbtangent
Standard utlosande snabbtangent: Ctrl+Shift+W. Konfigurerbar efter dina preferenser.
Testutlosare
Testknapp for att verifiera att rostinmatning fungerar korrekt med din mikrofon.
Apple Dictation
Konfigurera Apple Dictation for tal-till-text-transkription pa macOS. Detta ar en nativ macOS-funktion utan behov av ytterligare installation utover att aktivera diktering i Systeminstellningar.
Systemkrav
macOS med Diktering aktiverat i Systeminstellningar > Tangentbord.
Snabbtangent
Standard utlosande snabbtangent: Ctrl+Shift+D. Konfigurerbar efter dina preferenser.
Testutlosare
Testknapp for att verifiera att diktering fungerar korrekt med din mikrofon.
Text till tal och AI-röster
Lokala röstmodeller
AI Brain talar genom den valda installerade modellen. Genom att byta modell laddas den tidigare modellen av innan den nya laddas, och röstlistan filtreras till röster som är kompatibla med den modellen.
Kokoro 82M
Lättviktigt, snabbt lokalt tal med ett brett inbyggt röstval.
Chatterbox Turbo
Expressivt tal med låg latens och stödd röstkloning.
Chatterbox
Den fullständiga Chatterbox-modellen för uttrycksfull lokal syntes och kloning.
OmniVoice 0.6B
Kompakt flerspråkig lokal text-till-tal.
OuteTTS 1.0 1B
Lokal talgenerering med sin egen kompatibla röstuppsättning.
Qwen3-TTS 1.7B
Större flerspråkig och uttrycksfull lokal syntes.
Fish Speech S2 Pro
Högkvalitativt lokalt tal med stödda referens-röst-arbetsflöden.
Talhastigheten kan ställas in från 0,5× till 2×. Röstkloning visas endast för modeller som stöder det; använda ljud du äger eller har tillstånd att använda.
Molnleverantörskatalog
Inställningskatalogen innehåller även konfiguration för OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech och Microsoft Azure. Tillgänglighet beror på leverantörens konfiguration och användaruppgifter du anger.
API-uppgifter finns kvar i Inställningar och exkluderas från Kaiju Voices talade eller strukturerade inställningssammanfattningar.
