Kaiju Hub AI

Pag-type ng Boses

Pagpili ng serbisyo ng Voice Typing sa mga setting ng Kaiju Hub

Pangkalahatang-ideya

Pumili ng lokal na transcription engine o ang built-in na serbisyo sa pagdidikta ng iyong operating system. Ang availability ay depende sa iyong platform at kung aling mga opsyonal na engine ang naka-install.

Ano ang ginagawa ng speech-to-text

Ginagawa ng speech sa text ang iyong sinasabi sa nae-edit na text saanman nag-aalok ang Kaiju Hub AI ng aksyong mikropono. Gamitin ito upang magdikta ng mga senyas ng ahente, magpatuloy sa isang pag-uusap sa Kaiju Voice, at magpasok ng mas mahabang tagubilin nang hindi nagta-type. Ang mga lokal na makina tulad ng Whisper at Parakeet ay nagpapanatili ng transkripsyon sa iyong makina; ginagamit ng platform dictation ang speech service na ibinigay ng Windows o macOS.

Mga magagamit na serbisyo

Bulong

Lokal na OpenAI Whisper transcription na may napiling laki ng modelo at hardware acceleration.

NVIDIA Parakeet

Mabilis na local speech recognition gamit ang opsyonal na Parakeet engine.

Nakakabaliw Mabilis Bulong

Isang na-optimize na Whisper path para sa mga sinusuportahang configuration ng GPU.

Pag-type gamit ang boses sa Windows

Gumagamit ng Windows dictation at ang naka-configure na system hotkey.

Diktasyon ng Apple

Gumagamit ng built-in na serbisyo sa pagdidikta ng macOS.

Bulong

Whisper — lokal na speech-to-text na may pagpili ng transcription engine at status ng pag-install

Mga Setting ng Whisper

I-configure ang mga setting ng OpenAI Whisper para sa lokal na speech-to-text transcription. Tumatakbo ang Whisper nang buo sa iyong makina para sa offline, pribadong input ng boses. I-download, i-install, at tanggalin ang mga modelo nang direkta mula sa tab na ito.

Mga Available na Modelo

Maliit

39M na parameter, ~75 MB na pag-download, ~10x na bilis ng real-time, nangangailangan ng 1 GB ng VRAM.

Pangunahin

74M na parameter, ~145 MB na pag-download, ~7x na bilis ng real-time, nangangailangan ng 1 GB ng VRAM.

Maliit

244M na parameter, ~465 MB na pag-download, ~4x na bilis ng real-time, nangangailangan ng 2 GB ng VRAM.

Katamtaman

769M na parameter, ~1.5 GB na pag-download, ~2x na bilis ng real-time, nangangailangan ng 5 GB ng VRAM.

Malaki

1550M na parameter, ~3 GB na pag-download, 1x na bilis ng real-time, nangangailangan ng 10 GB ng VRAM.

Mabilis

809M na parameter, ~1.6 GB na pag-download, ~8x na bilis ng real-time, nangangailangan ng 6 GB ng VRAM.

Aling modelo ng Whisper ang dapat kong piliin?

Magsimula sa Small para sa praktikal na balanse ng bilis, paggamit ng memorya, at kalidad ng transkripsyon. Bumaba kapag limitado ang hardware, o piliin ang Medium, Large, o Turbo kapag mas mahalaga ang katumpakan at pagganap ng GPU.

Maliit

Wake-word detection, mabilis na command, at pagsubok sa mga system na may pinakamababang memory.

Pangunahin

Maikling tala, senyas, at pangkalahatang pagdidikta sa katamtamang hardware.

Maliit

Isang balanseng pang-araw-araw na pagpipilian para sa mga senyas ng ahente at mas mahabang pagdidikta.

Katamtaman

Transkripsyon na nakatuon sa katumpakan kapag maaari mong ipagpalit ang dagdag na oras at memorya sa pagpoproseso.

Malaki

Ang lokal na opsyon na may pinakamataas na katumpakan para sa mga system na may hindi bababa sa 10 GB ng available na VRAM.

Mabilis

Mabilis at mataas na kalidad na transkripsyon sa isang sinusuportahang GPU na may hindi bababa sa 6 GB ng available na VRAM.

Katayuan ng Pag-install

Ipinapakita ng pahina ng mga setting ang katayuan ng pag-install ng mga kinakailangang dependency:

Bulong
FFmpeg
CUDA
UV (Python env)

Parakeet at Nakakabaliw na Mabilis na Bulong

Opsyonal na mabilis na mga makina

Ang mga engine na ito ay hiwalay na pag-download kaya nananatiling maliit ang default na pag-install. Ipinapakita ng screen ng mga setting ang katayuan ng pag-install at hardware para sa bawat engine.

Makita ang mga salita habang nagsasalita ka gamit ang live na lokal na transkripsyon. Ino-optimize ang Insanely Fast Whisper para sa mga modernong NVIDIA GPU, at available din ang Whisper, Parakeet, cloud, at platform speech options.

NVIDIA Parakeet

Isang high-speed na lokal na speech-to-text engine. I-install ang opsyonal na runtime nito mula sa mga setting ng Voice Typing bago ito piliin.

Nakakabaliw Mabilis Bulong

Isang pinabilis na pagpapatupad ng Whisper na nilayon para sa mga katugmang GPU system. I-install ang opsyonal na makina bago gamitin.

Ang pagpili ng isa sa pamamagitan ng Kaiju Voice ay hindi magsisimula ng isang malaking pag-download nang tahimik. I-install muna ito sa Mga Setting; maaari nang i-verify ng assistant ang availability at lumipat ng mga serbisyo.

Boses ng Platform

Windows Voice Typing — keyboard shortcut configuration and system setup

Pag-type ng Boses ng Windows

I-configure ang Pag-type ng Boses ng Windows para sa speech-to-text transcription. Gumagamit ang serbisyong ito ng Azure Speech Services na binuo sa Windows 10 at mas bago. Kinakailangan ang koneksyon sa internet. Sundin ang mga tagubilin sa pag-setup upang paganahin ang pagkilala sa pagsasalita sa Mga Setting ng Windows.

Mga Kinakailangan sa System

Windows 10 o mas bago na may pinagana ang pagkilala sa pagsasalita sa mga setting ng system.

Hotkey

Default na trigger na hotkey: Ctrl+Shift+W. Maaaring i-configure sa iyong kagustuhan.

Subukan ang Trigger

Button ng pagsubok upang i-verify na gumagana nang tama ang pag-type ng boses sa iyong mikropono.

Pagsasalita ng Apple

I-configure ang Apple Dictation para sa speech-to-text transcription sa macOS. Ito ay isang katutubong feature ng macOS na walang karagdagang kinakailangang pag-setup maliban sa pagpapagana ng dikta sa Mga Setting ng System.

Mga Kinakailangan sa System

macOS na may pinagana ang Dikta sa Mga Setting ng System > Keyboard.

Hotkey

Default na trigger na hotkey: Ctrl+Shift+D. Maaaring i-configure sa iyong kagustuhan.

Subukan ang Trigger

Button ng pagsubok upang i-verify na gumagana nang tama ang dikta sa iyong mikropono.

Text to Speech at AI Voices

Mga lokal na modelo ng boses

Nagsasalita ang AI Brain sa pamamagitan ng napiling naka-install na modelo. Ang pagpapalit ng mga modelo ay naglalabas ng dating modelo bago i-load ang bago, at ang listahan ng boses ay sinasala sa mga boses na tugma sa modelong iyon.

Kokoro 82M

Magaan, mabilis na lokal na pagsasalita na may malawak na built-in na pagpili ng boses.

Chatterbox Turbo

Mababang latency na nagpapahayag ng pagsasalita at suportadong pag-clone ng boses.

Chatterbox

Ang buong modelo ng Chatterbox para sa nagpapahayag ng lokal na synthesis at pag-clone.

OmniVoice 0.6B

Compact multilingual na lokal na text-to-speech.

OuteTTS 1.0 1B

Lokal na henerasyon ng pagsasalita na may sarili nitong katugmang set ng boses.

Qwen3-TTS 1.7B

Mas malaking multilingual at nagpapahayag ng lokal na synthesis.

Pagsasalita ng Isda S2 Pro

Mataas na kalidad na lokal na pagsasalita na may suportadong reference-voice workflow.

Maaaring itakda ang bilis ng pagsasalita mula 0.5× hanggang 2×. Ang voice cloning ay lalabas lamang para sa mga modelong sumusuporta dito; gumamit ng audio na pagmamay-ari mo o may pahintulot na gamitin.

Catalog ng provider ng cloud

Kasama rin sa catalog ng mga setting ang configuration para sa OpenAI, ElevenLabs, Cartesia, Pinakamaliit na AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech, at Microsoft Azure. Ang pagiging available ay depende sa configuration ng provider at mga kredensyal na ibinibigay mo.

Ang mga kredensyal ng API ay nananatili sa Mga Setting at hindi kasama sa pasalitang o structured na mga buod ng setting ng Kaiju Voice.

Lahat ng third-party logo, trademark, at brand name na ipinapakita sa Kaiju Hub AI ay pag-aari ng kani-kanilang may-ari. Ang paggamit nito ay para lamang sa pagkakakilanlan at hindi nangangahulugan ng endorsement, sponsorship, o affiliation.