Pag-type ng Boses
Pangkalahatang-ideya
Pumili ng lokal na transcription engine o ang built-in na serbisyo sa pagdidikta ng iyong operating system. Ang availability ay depende sa iyong platform at kung aling mga opsyonal na engine ang naka-install.
Ano ang ginagawa ng speech-to-text
Ginagawa ng speech sa text ang iyong sinasabi sa nae-edit na text saanman nag-aalok ang Kaiju Hub AI ng aksyong mikropono. Gamitin ito upang magdikta ng mga senyas ng ahente, magpatuloy sa isang pag-uusap sa Kaiju Voice, at magpasok ng mas mahabang tagubilin nang hindi nagta-type. Ang mga lokal na makina tulad ng Whisper at Parakeet ay nagpapanatili ng transkripsyon sa iyong makina; ginagamit ng platform dictation ang speech service na ibinigay ng Windows o macOS.
Mga magagamit na serbisyo
Bulong
Lokal na OpenAI Whisper transcription na may napiling laki ng modelo at hardware acceleration.
NVIDIA Parakeet
Mabilis na local speech recognition gamit ang opsyonal na Parakeet engine.
Nakakabaliw Mabilis Bulong
Isang na-optimize na Whisper path para sa mga sinusuportahang configuration ng GPU.
Pag-type gamit ang boses sa Windows
Gumagamit ng Windows dictation at ang naka-configure na system hotkey.
Diktasyon ng Apple
Gumagamit ng built-in na serbisyo sa pagdidikta ng macOS.
Bulong
Mga Setting ng Whisper
I-configure ang mga setting ng OpenAI Whisper para sa lokal na speech-to-text transcription. Tumatakbo ang Whisper nang buo sa iyong makina para sa offline, pribadong input ng boses. I-download, i-install, at tanggalin ang mga modelo nang direkta mula sa tab na ito.
Mga Available na Modelo
Maliit
39M na parameter, ~75 MB na pag-download, ~10x na bilis ng real-time, nangangailangan ng 1 GB ng VRAM.
Pangunahin
74M na parameter, ~145 MB na pag-download, ~7x na bilis ng real-time, nangangailangan ng 1 GB ng VRAM.
Maliit
244M na parameter, ~465 MB na pag-download, ~4x na bilis ng real-time, nangangailangan ng 2 GB ng VRAM.
Katamtaman
769M na parameter, ~1.5 GB na pag-download, ~2x na bilis ng real-time, nangangailangan ng 5 GB ng VRAM.
Malaki
1550M na parameter, ~3 GB na pag-download, 1x na bilis ng real-time, nangangailangan ng 10 GB ng VRAM.
Mabilis
809M na parameter, ~1.6 GB na pag-download, ~8x na bilis ng real-time, nangangailangan ng 6 GB ng VRAM.
Aling modelo ng Whisper ang dapat kong piliin?
Magsimula sa Small para sa praktikal na balanse ng bilis, paggamit ng memorya, at kalidad ng transkripsyon. Bumaba kapag limitado ang hardware, o piliin ang Medium, Large, o Turbo kapag mas mahalaga ang katumpakan at pagganap ng GPU.
Maliit
Wake-word detection, mabilis na command, at pagsubok sa mga system na may pinakamababang memory.
Pangunahin
Maikling tala, senyas, at pangkalahatang pagdidikta sa katamtamang hardware.
Maliit
Isang balanseng pang-araw-araw na pagpipilian para sa mga senyas ng ahente at mas mahabang pagdidikta.
Katamtaman
Transkripsyon na nakatuon sa katumpakan kapag maaari mong ipagpalit ang dagdag na oras at memorya sa pagpoproseso.
Malaki
Ang lokal na opsyon na may pinakamataas na katumpakan para sa mga system na may hindi bababa sa 10 GB ng available na VRAM.
Mabilis
Mabilis at mataas na kalidad na transkripsyon sa isang sinusuportahang GPU na may hindi bababa sa 6 GB ng available na VRAM.
Katayuan ng Pag-install
Ipinapakita ng pahina ng mga setting ang katayuan ng pag-install ng mga kinakailangang dependency:
Parakeet at Nakakabaliw na Mabilis na Bulong
Opsyonal na mabilis na mga makina
Ang mga engine na ito ay hiwalay na pag-download kaya nananatiling maliit ang default na pag-install. Ipinapakita ng screen ng mga setting ang katayuan ng pag-install at hardware para sa bawat engine.
Makita ang mga salita habang nagsasalita ka gamit ang live na lokal na transkripsyon. Ino-optimize ang Insanely Fast Whisper para sa mga modernong NVIDIA GPU, at available din ang Whisper, Parakeet, cloud, at platform speech options.
NVIDIA Parakeet
Isang high-speed na lokal na speech-to-text engine. I-install ang opsyonal na runtime nito mula sa mga setting ng Voice Typing bago ito piliin.
Nakakabaliw Mabilis Bulong
Isang pinabilis na pagpapatupad ng Whisper na nilayon para sa mga katugmang GPU system. I-install ang opsyonal na makina bago gamitin.
Ang pagpili ng isa sa pamamagitan ng Kaiju Voice ay hindi magsisimula ng isang malaking pag-download nang tahimik. I-install muna ito sa Mga Setting; maaari nang i-verify ng assistant ang availability at lumipat ng mga serbisyo.
Boses ng Platform
Pag-type ng Boses ng Windows
I-configure ang Pag-type ng Boses ng Windows para sa speech-to-text transcription. Gumagamit ang serbisyong ito ng Azure Speech Services na binuo sa Windows 10 at mas bago. Kinakailangan ang koneksyon sa internet. Sundin ang mga tagubilin sa pag-setup upang paganahin ang pagkilala sa pagsasalita sa Mga Setting ng Windows.
Mga Kinakailangan sa System
Windows 10 o mas bago na may pinagana ang pagkilala sa pagsasalita sa mga setting ng system.
Hotkey
Default na trigger na hotkey: Ctrl+Shift+W. Maaaring i-configure sa iyong kagustuhan.
Subukan ang Trigger
Button ng pagsubok upang i-verify na gumagana nang tama ang pag-type ng boses sa iyong mikropono.
Pagsasalita ng Apple
I-configure ang Apple Dictation para sa speech-to-text transcription sa macOS. Ito ay isang katutubong feature ng macOS na walang karagdagang kinakailangang pag-setup maliban sa pagpapagana ng dikta sa Mga Setting ng System.
Mga Kinakailangan sa System
macOS na may pinagana ang Dikta sa Mga Setting ng System > Keyboard.
Hotkey
Default na trigger na hotkey: Ctrl+Shift+D. Maaaring i-configure sa iyong kagustuhan.
Subukan ang Trigger
Button ng pagsubok upang i-verify na gumagana nang tama ang dikta sa iyong mikropono.
Text to Speech at AI Voices
Mga lokal na modelo ng boses
Nagsasalita ang AI Brain sa pamamagitan ng napiling naka-install na modelo. Ang pagpapalit ng mga modelo ay naglalabas ng dating modelo bago i-load ang bago, at ang listahan ng boses ay sinasala sa mga boses na tugma sa modelong iyon.
Kokoro 82M
Magaan, mabilis na lokal na pagsasalita na may malawak na built-in na pagpili ng boses.
Chatterbox Turbo
Mababang latency na nagpapahayag ng pagsasalita at suportadong pag-clone ng boses.
Chatterbox
Ang buong modelo ng Chatterbox para sa nagpapahayag ng lokal na synthesis at pag-clone.
OmniVoice 0.6B
Compact multilingual na lokal na text-to-speech.
OuteTTS 1.0 1B
Lokal na henerasyon ng pagsasalita na may sarili nitong katugmang set ng boses.
Qwen3-TTS 1.7B
Mas malaking multilingual at nagpapahayag ng lokal na synthesis.
Pagsasalita ng Isda S2 Pro
Mataas na kalidad na lokal na pagsasalita na may suportadong reference-voice workflow.
Maaaring itakda ang bilis ng pagsasalita mula 0.5× hanggang 2×. Ang voice cloning ay lalabas lamang para sa mga modelong sumusuporta dito; gumamit ng audio na pagmamay-ari mo o may pahintulot na gamitin.
Catalog ng provider ng cloud
Kasama rin sa catalog ng mga setting ang configuration para sa OpenAI, ElevenLabs, Cartesia, Pinakamaliit na AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech, at Microsoft Azure. Ang pagiging available ay depende sa configuration ng provider at mga kredensyal na ibinibigay mo.
Ang mga kredensyal ng API ay nananatili sa Mga Setting at hindi kasama sa pasalitang o structured na mga buod ng setting ng Kaiju Voice.
