Kaiju Hub AI

Penaipan Suara

Pemilihan perkhidmatan Penaipan Suara dalam tetapan Hab Kaiju

Gambaran keseluruhan

Pilih enjin transkripsi tempatan atau perkhidmatan imlak terbina dalam sistem pengendalian anda. Ketersediaan bergantung pada platform anda dan enjin pilihan yang dipasang.

Apa yang dilakukan oleh ucapan-ke-teks

Pertuturan kepada teks menukar apa yang anda perkatakan kepada teks boleh diedit di mana-mana sahaja Kaiju Hub AI menawarkan tindakan mikrofon. Gunakannya untuk menentukan gesaan ejen, meneruskan perbualan Kaiju Voice, dan masukkan arahan yang lebih panjang tanpa menaip. Enjin tempatan seperti Whisper dan Parakeet menyimpan transkripsi pada mesin anda; imlak platform menggunakan perkhidmatan pertuturan yang disediakan oleh Windows atau macOS.

Perkhidmatan yang tersedia

Bisik

Transkripsi OpenAI Whisper tempatan dengan saiz model yang boleh dipilih dan pecutan perkakasan.

NVIDIA Parakeet

Pengecaman pertuturan tempatan pantas menggunakan enjin Parakeet pilihan.

Bisikan Cepat Gila

Laluan Whisper yang dioptimumkan untuk konfigurasi GPU yang disokong.

Penaipan Suara Windows

Menggunakan imlak Windows dan hotkey sistem yang dikonfigurasikan.

Dikte Apple

Menggunakan perkhidmatan imlak macOS terbina dalam.

Bisikan

Whisper — pertuturan-ke-teks tempatan dengan pemilihan enjin transkripsi dan status pemasangan

Pengaturan Bisikan

Konfigurasikan pengaturan OpenAI Whisper untuk transkripsi ucapan-ke-teks lokal. Whisper berjalan sepenuhnya di mesin Anda untuk input suara offline dan pribadi. Unduh, instal, dan hapus model langsung dari tab ini.

Model yang Tersedia

Kecil

39 juta parameter, ~75 MB unduhan, ~10x kecepatan waktu nyata, memerlukan 1 GB VRAM.

Dasar

74 juta parameter, ~145 MB unduhan, ~7x kecepatan waktu nyata, memerlukan 1 GB VRAM.

Kecil

244 juta parameter, ~465 MB unduhan, ~4x kecepatan waktu nyata, memerlukan 2 GB VRAM.

Sedang

769 juta parameter, ~1,5 GB unduhan, ~2x kecepatan waktu nyata, memerlukan 5 GB VRAM.

Besar

1550 juta parameter, ~3 GB unduhan, 1x kecepatan waktu nyata, memerlukan 10 GB VRAM.

Turbo

809 juta parameter, ~1,6 GB unduhan, ~8x kecepatan waktu nyata, memerlukan 6 GB VRAM.

Model Whisper yang manakah harus saya pilih?

Mulakan dengan Small untuk keseimbangan praktikal kelajuan, penggunaan memori dan kualiti transkripsi. Beralih ke bawah apabila perkakasan terhad, atau pilih Medium, Large atau Turbo apabila ketepatan dan prestasi GPU lebih penting.

Kecil

Pengesanan wake-word, arahan pantas dan ujian pada sistem memori terendah.

Dasar

Nota ringkas, gesaan dan imlak umum pada perkakasan sederhana.

Kecil

Pilihan harian yang seimbang untuk gesaan ejen dan imlak yang lebih panjang.

Sedang

Transkripsi berfokuskan ketepatan apabila anda boleh menukar masa pemprosesan dan memori tambahan.

Besar

Pilihan tempatan ketepatan tertinggi untuk sistem dengan sekurang-kurangnya 10 GB VRAM yang tersedia.

Turbo

Transkripsi pantas dan berkualiti tinggi pada GPU yang disokong dengan sekurang-kurangnya 6 GB VRAM yang tersedia.

Status Instalasi

Halaman pengaturan menunjukkan status instalasi dependensi yang diperlukan:

Bisik
FFmpeg
CUDA
UV (Python env)

Parkit dan Bisikan Cepat Gila

Enjin pantas pilihan

Enjin ini adalah muat turun berasingan jadi pemasangan lalai kekal kecil. Skrin tetapan menunjukkan status pemasangan dan perkakasan untuk setiap enjin.

Lihat perkataan muncul semasa anda bercakap dengan transkripsi setempat secara langsung. Insanely Fast Whisper dioptimumkan untuk GPU NVIDIA moden; pilihan pertuturan Whisper, Parakeet, awan dan platform turut tersedia.

NVIDIA Parakeet

Enjin pertuturan ke teks tempatan berkelajuan tinggi. Pasang masa jalan pilihannya daripada tetapan Penaipan Suara sebelum memilihnya.

Bisikan Cepat Gila

Pelaksanaan Whisper dipercepatkan untuk sistem GPU yang serasi. Pasang enjin pilihan sebelum digunakan.

Memilih satu melalui Kaiju Voice tidak pernah memulakan muat turun besar secara senyap. Pasangnya dalam Tetapan dahulu; pembantu kemudiannya boleh mengesahkan ketersediaan dan menukar perkhidmatan.

Platform Suara

Windows Voice Typing — keyboard shortcut configuration and system setup

Pengetikan Suara Windows

Konfigurasikan Pengetikan Suara Windows untuk transkripsi ucapan-ke-teks. Layanan ini menggunakan Layanan Ucapan Azure yang dibangun ke dalam Windows 10 dan yang lebih baru. Koneksi internet diperlukan. Ikuti instruksi pengaturan untuk mengaktifkan pengenalan ucapan di Pengaturan Windows.

Persyaratan Sistem

Windows 10 atau yang lebih baru dengan pengenalan ucapan diaktifkan di pengaturan sistem.

Tombol Pintas

Tombol pintas pemicu default: Ctrl+Shift+W. Dapat dikonfigurasi sesuai dengan preferensi Anda.

Uji Pemicu

Tombol uji untuk memverifikasi apakah pengetikan suara berfungsi dengan benar dengan mikrofon Anda.

Dikte Apple

Konfigurasikan Dikte Apple untuk transkripsi ucapan-ke-teks di macOS. Ini adalah fitur macOS asli tanpa pengaturan tambahan yang diperlukan selain mengaktifkan dikte di Pengaturan Sistem.

Persyaratan Sistem

macOS dengan Dikte diaktifkan di Pengaturan Sistem > Keyboard.

Tombol Pintas

Tombol pintas pemicu default: Ctrl+Shift+D. Dapat dikonfigurasi sesuai dengan preferensi Anda.

Uji Pemicu

Tombol uji untuk memverifikasi apakah dikte berfungsi dengan benar dengan mikrofon Anda.

Teks kepada Pertuturan dan Suara AI

Model suara tempatan

AI Brain bercakap melalui model yang dipasang yang dipilih. Menukar model memunggah model sebelumnya sebelum memuatkan model baharu dan senarai suara ditapis kepada suara yang serasi dengan model tersebut.

Kokoro 82M

Pertuturan tempatan yang ringan dan pantas dengan pilihan suara terbina dalam yang luas.

Turbo Kotak Chatter

Pertuturan ekspresif kependaman rendah dan pengklonan suara yang disokong.

Kotak cerewet

Model Chatterbox penuh untuk sintesis dan pengklonan tempatan yang ekspresif.

OmniVoice 0.6B

Teks-ke-ucapan tempatan berbilang bahasa yang padat.

OuteTTS 1.0 1B

Penjanaan pertuturan tempatan dengan set suara yang serasi sendiri.

Qwen3-TTS 1.7B

Sintesis tempatan berbilang bahasa dan ekspresif yang lebih besar.

Ucapan Ikan S2 Pro

Pertuturan tempatan berkualiti tinggi dengan aliran kerja rujukan-suara yang disokong.

Kelajuan pertuturan boleh ditetapkan dari 0.5× hingga 2×. Pengklonan suara muncul hanya untuk model yang menyokongnya; gunakan audio yang anda miliki atau mempunyai kebenaran untuk digunakan.

Katalog pembekal awan

Katalog tetapan juga termasuk konfigurasi untuk OpenAI, ElevenLabs, Cartesia, AI Terkecil, Audio Ikan, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech dan Microsoft Azure. Ketersediaan bergantung pada konfigurasi pembekal dan kelayakan yang anda bekalkan.

Bukti kelayakan API kekal dalam Tetapan dan dikecualikan daripada ringkasan tetapan pertuturan atau berstruktur Kaiju Voice.

Semua logo, tanda dagangan dan nama jenama pihak ketiga yang dipaparkan di Kaiju Hub AI adalah hak milik pemilik masing-masing. Penggunaannya adalah semata-mata untuk tujuan pengenalan dan tidak membayangkan sokongan, tajaan atau gabungan.