Penaipan Suara
Gambaran keseluruhan
Pilih enjin transkripsi tempatan atau perkhidmatan imlak terbina dalam sistem pengendalian anda. Ketersediaan bergantung pada platform anda dan enjin pilihan yang dipasang.
Apa yang dilakukan oleh ucapan-ke-teks
Pertuturan kepada teks menukar apa yang anda perkatakan kepada teks boleh diedit di mana-mana sahaja Kaiju Hub AI menawarkan tindakan mikrofon. Gunakannya untuk menentukan gesaan ejen, meneruskan perbualan Kaiju Voice, dan masukkan arahan yang lebih panjang tanpa menaip. Enjin tempatan seperti Whisper dan Parakeet menyimpan transkripsi pada mesin anda; imlak platform menggunakan perkhidmatan pertuturan yang disediakan oleh Windows atau macOS.
Perkhidmatan yang tersedia
Bisik
Transkripsi OpenAI Whisper tempatan dengan saiz model yang boleh dipilih dan pecutan perkakasan.
NVIDIA Parakeet
Pengecaman pertuturan tempatan pantas menggunakan enjin Parakeet pilihan.
Bisikan Cepat Gila
Laluan Whisper yang dioptimumkan untuk konfigurasi GPU yang disokong.
Penaipan Suara Windows
Menggunakan imlak Windows dan hotkey sistem yang dikonfigurasikan.
Dikte Apple
Menggunakan perkhidmatan imlak macOS terbina dalam.
Bisikan
Pengaturan Bisikan
Konfigurasikan pengaturan OpenAI Whisper untuk transkripsi ucapan-ke-teks lokal. Whisper berjalan sepenuhnya di mesin Anda untuk input suara offline dan pribadi. Unduh, instal, dan hapus model langsung dari tab ini.
Model yang Tersedia
Kecil
39 juta parameter, ~75 MB unduhan, ~10x kecepatan waktu nyata, memerlukan 1 GB VRAM.
Dasar
74 juta parameter, ~145 MB unduhan, ~7x kecepatan waktu nyata, memerlukan 1 GB VRAM.
Kecil
244 juta parameter, ~465 MB unduhan, ~4x kecepatan waktu nyata, memerlukan 2 GB VRAM.
Sedang
769 juta parameter, ~1,5 GB unduhan, ~2x kecepatan waktu nyata, memerlukan 5 GB VRAM.
Besar
1550 juta parameter, ~3 GB unduhan, 1x kecepatan waktu nyata, memerlukan 10 GB VRAM.
Turbo
809 juta parameter, ~1,6 GB unduhan, ~8x kecepatan waktu nyata, memerlukan 6 GB VRAM.
Model Whisper yang manakah harus saya pilih?
Mulakan dengan Small untuk keseimbangan praktikal kelajuan, penggunaan memori dan kualiti transkripsi. Beralih ke bawah apabila perkakasan terhad, atau pilih Medium, Large atau Turbo apabila ketepatan dan prestasi GPU lebih penting.
Kecil
Pengesanan wake-word, arahan pantas dan ujian pada sistem memori terendah.
Dasar
Nota ringkas, gesaan dan imlak umum pada perkakasan sederhana.
Kecil
Pilihan harian yang seimbang untuk gesaan ejen dan imlak yang lebih panjang.
Sedang
Transkripsi berfokuskan ketepatan apabila anda boleh menukar masa pemprosesan dan memori tambahan.
Besar
Pilihan tempatan ketepatan tertinggi untuk sistem dengan sekurang-kurangnya 10 GB VRAM yang tersedia.
Turbo
Transkripsi pantas dan berkualiti tinggi pada GPU yang disokong dengan sekurang-kurangnya 6 GB VRAM yang tersedia.
Status Instalasi
Halaman pengaturan menunjukkan status instalasi dependensi yang diperlukan:
Parkit dan Bisikan Cepat Gila
Enjin pantas pilihan
Enjin ini adalah muat turun berasingan jadi pemasangan lalai kekal kecil. Skrin tetapan menunjukkan status pemasangan dan perkakasan untuk setiap enjin.
Lihat perkataan muncul semasa anda bercakap dengan transkripsi setempat secara langsung. Insanely Fast Whisper dioptimumkan untuk GPU NVIDIA moden; pilihan pertuturan Whisper, Parakeet, awan dan platform turut tersedia.
NVIDIA Parakeet
Enjin pertuturan ke teks tempatan berkelajuan tinggi. Pasang masa jalan pilihannya daripada tetapan Penaipan Suara sebelum memilihnya.
Bisikan Cepat Gila
Pelaksanaan Whisper dipercepatkan untuk sistem GPU yang serasi. Pasang enjin pilihan sebelum digunakan.
Memilih satu melalui Kaiju Voice tidak pernah memulakan muat turun besar secara senyap. Pasangnya dalam Tetapan dahulu; pembantu kemudiannya boleh mengesahkan ketersediaan dan menukar perkhidmatan.
Platform Suara
Pengetikan Suara Windows
Konfigurasikan Pengetikan Suara Windows untuk transkripsi ucapan-ke-teks. Layanan ini menggunakan Layanan Ucapan Azure yang dibangun ke dalam Windows 10 dan yang lebih baru. Koneksi internet diperlukan. Ikuti instruksi pengaturan untuk mengaktifkan pengenalan ucapan di Pengaturan Windows.
Persyaratan Sistem
Windows 10 atau yang lebih baru dengan pengenalan ucapan diaktifkan di pengaturan sistem.
Tombol Pintas
Tombol pintas pemicu default: Ctrl+Shift+W. Dapat dikonfigurasi sesuai dengan preferensi Anda.
Uji Pemicu
Tombol uji untuk memverifikasi apakah pengetikan suara berfungsi dengan benar dengan mikrofon Anda.
Dikte Apple
Konfigurasikan Dikte Apple untuk transkripsi ucapan-ke-teks di macOS. Ini adalah fitur macOS asli tanpa pengaturan tambahan yang diperlukan selain mengaktifkan dikte di Pengaturan Sistem.
Persyaratan Sistem
macOS dengan Dikte diaktifkan di Pengaturan Sistem > Keyboard.
Tombol Pintas
Tombol pintas pemicu default: Ctrl+Shift+D. Dapat dikonfigurasi sesuai dengan preferensi Anda.
Uji Pemicu
Tombol uji untuk memverifikasi apakah dikte berfungsi dengan benar dengan mikrofon Anda.
Teks kepada Pertuturan dan Suara AI
Model suara tempatan
AI Brain bercakap melalui model yang dipasang yang dipilih. Menukar model memunggah model sebelumnya sebelum memuatkan model baharu dan senarai suara ditapis kepada suara yang serasi dengan model tersebut.
Kokoro 82M
Pertuturan tempatan yang ringan dan pantas dengan pilihan suara terbina dalam yang luas.
Turbo Kotak Chatter
Pertuturan ekspresif kependaman rendah dan pengklonan suara yang disokong.
Kotak cerewet
Model Chatterbox penuh untuk sintesis dan pengklonan tempatan yang ekspresif.
OmniVoice 0.6B
Teks-ke-ucapan tempatan berbilang bahasa yang padat.
OuteTTS 1.0 1B
Penjanaan pertuturan tempatan dengan set suara yang serasi sendiri.
Qwen3-TTS 1.7B
Sintesis tempatan berbilang bahasa dan ekspresif yang lebih besar.
Ucapan Ikan S2 Pro
Pertuturan tempatan berkualiti tinggi dengan aliran kerja rujukan-suara yang disokong.
Kelajuan pertuturan boleh ditetapkan dari 0.5× hingga 2×. Pengklonan suara muncul hanya untuk model yang menyokongnya; gunakan audio yang anda miliki atau mempunyai kebenaran untuk digunakan.
Katalog pembekal awan
Katalog tetapan juga termasuk konfigurasi untuk OpenAI, ElevenLabs, Cartesia, AI Terkecil, Audio Ikan, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech dan Microsoft Azure. Ketersediaan bergantung pada konfigurasi pembekal dan kelayakan yang anda bekalkan.
Bukti kelayakan API kekal dalam Tetapan dan dikecualikan daripada ringkasan tetapan pertuturan atau berstruktur Kaiju Voice.
