Pengetikan Suara
Ikhtisar
Pilih mesin transkripsi lokal atau layanan dikte bawaan sistem operasi Anda. Ketersediaannya bergantung pada platform Anda dan mesin opsional mana yang dipasang.
Apa yang dilakukan ucapan-ke-teks
Ucapan ke teks mengubah ucapan Anda menjadi teks yang dapat diedit di mana pun Kaiju Hub AI menawarkan tindakan mikrofon. Gunakan untuk mendiktekan perintah agen, melanjutkan percakapan Kaiju Voice, dan memasukkan instruksi yang lebih panjang tanpa mengetik. Mesin lokal seperti Whisper dan Parkit menyimpan transkripsi di mesin Anda; dikte platform menggunakan layanan ucapan yang disediakan oleh Windows atau macOS.
Layanan yang tersedia
Bisikan
Transkripsi OpenAI Whisper lokal dengan ukuran model dan akselerasi perangkat keras yang dapat dipilih.
Parkit NVIDIA
Pengenalan ucapan lokal yang cepat menggunakan mesin Parkit opsional.
Bisikan Sangat Cepat
Jalur Whisper yang dioptimalkan untuk konfigurasi GPU yang didukung.
Pengetikan Suara Windows
Menggunakan dikte Windows dan hotkey sistem yang dikonfigurasi.
Dikte Apple
Menggunakan layanan dikte macOS bawaan.
Bisikan
Pengaturan Whisper
Konfigurasi pengaturan OpenAI Whisper untuk transkripsi speech-to-text lokal. Whisper berjalan sepenuhnya di mesin Anda untuk input suara offline yang privat. Unduh, instal, dan hapus model langsung dari tab ini.
Model yang Tersedia
Tiny
39M parameter, ~75 MB unduhan, ~10x kecepatan realtime, memerlukan 1 GB VRAM.
Base
74M parameter, ~145 MB unduhan, ~7x kecepatan realtime, memerlukan 1 GB VRAM.
Small
244M parameter, ~465 MB unduhan, ~4x kecepatan realtime, memerlukan 2 GB VRAM.
Medium
769M parameter, ~1,5 GB unduhan, ~2x kecepatan realtime, memerlukan 5 GB VRAM.
Large
1550M parameter, ~3 GB unduhan, 1x kecepatan realtime, memerlukan 10 GB VRAM.
Turbo
809M parameter, ~1,6 GB unduhan, ~8x kecepatan realtime, memerlukan 6 GB VRAM.
Model Bisikan mana yang harus saya pilih?
Mulailah dengan Small untuk keseimbangan praktis antara kecepatan, penggunaan memori, dan kualitas transkripsi. Turun saat perangkat keras terbatas, atau pilih Medium, Large, atau Turbo saat akurasi dan performa GPU lebih penting.
Tiny
Deteksi kata bangun, perintah cepat, dan pengujian pada sistem dengan memori terendah.
Base
Catatan singkat, petunjuk, dan dikte umum pada perangkat keras sederhana.
Small
Pilihan sehari-hari yang seimbang untuk perintah agen dan dikte yang lebih lama.
Medium
Transkripsi yang berfokus pada akurasi ketika Anda dapat menukar waktu pemrosesan dan memori ekstra.
Large
Opsi lokal dengan akurasi tertinggi untuk sistem dengan VRAM tersedia minimal 10 GB.
Turbo
Transkripsi cepat dan berkualitas tinggi pada GPU yang didukung dengan VRAM tersedia minimal 6 GB.
Status Instalasi
Halaman pengaturan menampilkan status instalasi dependensi yang diperlukan:
Parkit dan Bisikan Sangat Cepat
Mesin cepat opsional
Mesin ini merupakan unduhan terpisah sehingga instalasi defaultnya tetap kecil. Layar pengaturan menunjukkan status instalasi dan perangkat keras untuk setiap mesin.
Lihat kata-kata muncul saat Anda berbicara dengan transkripsi lokal langsung. Insanely Fast Whisper dioptimalkan untuk GPU NVIDIA modern; Whisper, Parakeet, serta opsi ucapan cloud dan platform juga tersedia.
Parkit NVIDIA
Mesin ucapan-ke-teks lokal berkecepatan tinggi. Instal runtime opsionalnya dari pengaturan Pengetikan Suara sebelum memilihnya.
Bisikan Sangat Cepat
Implementasi Whisper yang dipercepat ditujukan untuk sistem GPU yang kompatibel. Pasang mesin opsional sebelum digunakan.
Memilih satu melalui Kaiju Voice tidak akan pernah memulai pengunduhan besar secara diam-diam. Instal di Pengaturan terlebih dahulu; asisten kemudian dapat memverifikasi ketersediaan dan beralih layanan.
Suara Platform
Windows Voice Typing
Konfigurasi Windows Voice Typing untuk transkripsi speech-to-text. Layanan ini menggunakan Azure Speech Services yang dibangun ke dalam Windows 10 dan yang lebih baru. Koneksi internet diperlukan. Ikuti instruksi pengaturan untuk mengaktifkan pengenalan suara di Pengaturan Windows.
Persyaratan Sistem
Windows 10 atau yang lebih baru dengan pengenalan suara diaktifkan di pengaturan sistem.
Tombol Pintas
Tombol pintas pemicu default: Ctrl+Shift+W. Dapat dikonfigurasi sesuai preferensi Anda.
Uji Pemicu
Tombol uji untuk memverifikasi pengetikan suara berfungsi dengan benar dengan mikrofon Anda.
Apple Dictation
Konfigurasi Apple Dictation untuk transkripsi speech-to-text di macOS. Ini adalah fitur native macOS tanpa pengaturan tambahan yang diperlukan selain mengaktifkan dikte di Pengaturan Sistem.
Persyaratan Sistem
macOS dengan Dikte diaktifkan di Pengaturan Sistem > Keyboard.
Tombol Pintas
Tombol pintas pemicu default: Ctrl+Shift+D. Dapat dikonfigurasi sesuai preferensi Anda.
Uji Pemicu
Tombol uji untuk memverifikasi dikte berfungsi dengan benar dengan mikrofon Anda.
Teks ke Ucapan dan Suara AI
Model suara lokal
AI Brain berbicara melalui model terinstal yang dipilih. Mengganti model akan mengeluarkan model sebelumnya sebelum memuat yang baru, dan daftar suara disaring ke suara yang kompatibel dengan model tersebut.
Kokoro 82M
Pidato lokal yang ringan dan cepat dengan pilihan suara bawaan yang luas.
Turbo Kotak Obrolan
Ucapan ekspresif berlatensi rendah dan mendukung kloning suara.
Kotak Obrolan
Model Chatterbox lengkap untuk sintesis dan kloning lokal yang ekspresif.
OmniVoice 0.6B
Text-to-speech lokal multibahasa yang ringkas.
KeluarTTS 1.0 1B
Pembuatan ucapan lokal dengan kumpulan suaranya sendiri yang kompatibel.
Qwen3-TTS 1.7B
Sintesis lokal multibahasa dan ekspresif yang lebih besar.
Pidato Ikan S2 Pro
Pidato lokal berkualitas tinggi dengan alur kerja suara referensi yang didukung.
Kecepatan bicara dapat diatur dari 0,5× hingga 2×. Kloning suara hanya muncul untuk model yang mendukungnya; gunakan audio yang Anda miliki atau punya izin untuk menggunakannya.
Katalog penyedia cloud
Katalog pengaturan juga mencakup konfigurasi untuk OpenAI, ElevenLabs, Cartesia, AI Terkecil, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech, dan Microsoft Azure. Ketersediaan bergantung pada konfigurasi penyedia dan kredensial yang Anda berikan.
Kredensial API tetap ada di Pengaturan dan dikecualikan dari ringkasan pengaturan lisan atau terstruktur Kaiju Voice.
