Kaiju Hub AI

Pengetikan Suara

Pemilihan layanan Pengetikan Suara di pengaturan Kaiju Hub

Ikhtisar

Pilih mesin transkripsi lokal atau layanan dikte bawaan sistem operasi Anda. Ketersediaannya bergantung pada platform Anda dan mesin opsional mana yang dipasang.

Apa yang dilakukan ucapan-ke-teks

Ucapan ke teks mengubah ucapan Anda menjadi teks yang dapat diedit di mana pun Kaiju Hub AI menawarkan tindakan mikrofon. Gunakan untuk mendiktekan perintah agen, melanjutkan percakapan Kaiju Voice, dan memasukkan instruksi yang lebih panjang tanpa mengetik. Mesin lokal seperti Whisper dan Parkit menyimpan transkripsi di mesin Anda; dikte platform menggunakan layanan ucapan yang disediakan oleh Windows atau macOS.

Layanan yang tersedia

Bisikan

Transkripsi OpenAI Whisper lokal dengan ukuran model dan akselerasi perangkat keras yang dapat dipilih.

Parkit NVIDIA

Pengenalan ucapan lokal yang cepat menggunakan mesin Parkit opsional.

Bisikan Sangat Cepat

Jalur Whisper yang dioptimalkan untuk konfigurasi GPU yang didukung.

Pengetikan Suara Windows

Menggunakan dikte Windows dan hotkey sistem yang dikonfigurasi.

Dikte Apple

Menggunakan layanan dikte macOS bawaan.

Bisikan

Whisper — ucapan-ke-teks lokal dengan pemilihan mesin transkripsi dan status pemasangan

Pengaturan Whisper

Konfigurasi pengaturan OpenAI Whisper untuk transkripsi speech-to-text lokal. Whisper berjalan sepenuhnya di mesin Anda untuk input suara offline yang privat. Unduh, instal, dan hapus model langsung dari tab ini.

Model yang Tersedia

Tiny

39M parameter, ~75 MB unduhan, ~10x kecepatan realtime, memerlukan 1 GB VRAM.

Base

74M parameter, ~145 MB unduhan, ~7x kecepatan realtime, memerlukan 1 GB VRAM.

Small

244M parameter, ~465 MB unduhan, ~4x kecepatan realtime, memerlukan 2 GB VRAM.

Medium

769M parameter, ~1,5 GB unduhan, ~2x kecepatan realtime, memerlukan 5 GB VRAM.

Large

1550M parameter, ~3 GB unduhan, 1x kecepatan realtime, memerlukan 10 GB VRAM.

Turbo

809M parameter, ~1,6 GB unduhan, ~8x kecepatan realtime, memerlukan 6 GB VRAM.

Model Bisikan mana yang harus saya pilih?

Mulailah dengan Small untuk keseimbangan praktis antara kecepatan, penggunaan memori, dan kualitas transkripsi. Turun saat perangkat keras terbatas, atau pilih Medium, Large, atau Turbo saat akurasi dan performa GPU lebih penting.

Tiny

Deteksi kata bangun, perintah cepat, dan pengujian pada sistem dengan memori terendah.

Base

Catatan singkat, petunjuk, dan dikte umum pada perangkat keras sederhana.

Small

Pilihan sehari-hari yang seimbang untuk perintah agen dan dikte yang lebih lama.

Medium

Transkripsi yang berfokus pada akurasi ketika Anda dapat menukar waktu pemrosesan dan memori ekstra.

Large

Opsi lokal dengan akurasi tertinggi untuk sistem dengan VRAM tersedia minimal 10 GB.

Turbo

Transkripsi cepat dan berkualitas tinggi pada GPU yang didukung dengan VRAM tersedia minimal 6 GB.

Status Instalasi

Halaman pengaturan menampilkan status instalasi dependensi yang diperlukan:

Bisikan
FFmpeg
CUDA
UV (Python env)

Parkit dan Bisikan Sangat Cepat

Mesin cepat opsional

Mesin ini merupakan unduhan terpisah sehingga instalasi defaultnya tetap kecil. Layar pengaturan menunjukkan status instalasi dan perangkat keras untuk setiap mesin.

Lihat kata-kata muncul saat Anda berbicara dengan transkripsi lokal langsung. Insanely Fast Whisper dioptimalkan untuk GPU NVIDIA modern; Whisper, Parakeet, serta opsi ucapan cloud dan platform juga tersedia.

Parkit NVIDIA

Mesin ucapan-ke-teks lokal berkecepatan tinggi. Instal runtime opsionalnya dari pengaturan Pengetikan Suara sebelum memilihnya.

Bisikan Sangat Cepat

Implementasi Whisper yang dipercepat ditujukan untuk sistem GPU yang kompatibel. Pasang mesin opsional sebelum digunakan.

Memilih satu melalui Kaiju Voice tidak akan pernah memulai pengunduhan besar secara diam-diam. Instal di Pengaturan terlebih dahulu; asisten kemudian dapat memverifikasi ketersediaan dan beralih layanan.

Suara Platform

Windows Voice Typing — keyboard shortcut configuration and system setup

Windows Voice Typing

Konfigurasi Windows Voice Typing untuk transkripsi speech-to-text. Layanan ini menggunakan Azure Speech Services yang dibangun ke dalam Windows 10 dan yang lebih baru. Koneksi internet diperlukan. Ikuti instruksi pengaturan untuk mengaktifkan pengenalan suara di Pengaturan Windows.

Persyaratan Sistem

Windows 10 atau yang lebih baru dengan pengenalan suara diaktifkan di pengaturan sistem.

Tombol Pintas

Tombol pintas pemicu default: Ctrl+Shift+W. Dapat dikonfigurasi sesuai preferensi Anda.

Uji Pemicu

Tombol uji untuk memverifikasi pengetikan suara berfungsi dengan benar dengan mikrofon Anda.

Apple Dictation

Konfigurasi Apple Dictation untuk transkripsi speech-to-text di macOS. Ini adalah fitur native macOS tanpa pengaturan tambahan yang diperlukan selain mengaktifkan dikte di Pengaturan Sistem.

Persyaratan Sistem

macOS dengan Dikte diaktifkan di Pengaturan Sistem > Keyboard.

Tombol Pintas

Tombol pintas pemicu default: Ctrl+Shift+D. Dapat dikonfigurasi sesuai preferensi Anda.

Uji Pemicu

Tombol uji untuk memverifikasi dikte berfungsi dengan benar dengan mikrofon Anda.

Teks ke Ucapan dan Suara AI

Model suara lokal

AI Brain berbicara melalui model terinstal yang dipilih. Mengganti model akan mengeluarkan model sebelumnya sebelum memuat yang baru, dan daftar suara disaring ke suara yang kompatibel dengan model tersebut.

Kokoro 82M

Pidato lokal yang ringan dan cepat dengan pilihan suara bawaan yang luas.

Turbo Kotak Obrolan

Ucapan ekspresif berlatensi rendah dan mendukung kloning suara.

Kotak Obrolan

Model Chatterbox lengkap untuk sintesis dan kloning lokal yang ekspresif.

OmniVoice 0.6B

Text-to-speech lokal multibahasa yang ringkas.

KeluarTTS 1.0 1B

Pembuatan ucapan lokal dengan kumpulan suaranya sendiri yang kompatibel.

Qwen3-TTS 1.7B

Sintesis lokal multibahasa dan ekspresif yang lebih besar.

Pidato Ikan S2 Pro

Pidato lokal berkualitas tinggi dengan alur kerja suara referensi yang didukung.

Kecepatan bicara dapat diatur dari 0,5× hingga 2×. Kloning suara hanya muncul untuk model yang mendukungnya; gunakan audio yang Anda miliki atau punya izin untuk menggunakannya.

Katalog penyedia cloud

Katalog pengaturan juga mencakup konfigurasi untuk OpenAI, ElevenLabs, Cartesia, AI Terkecil, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech, dan Microsoft Azure. Ketersediaan bergantung pada konfigurasi penyedia dan kredensial yang Anda berikan.

Kredensial API tetap ada di Pengaturan dan dikecualikan dari ringkasan pengaturan lisan atau terstruktur Kaiju Voice.

Semua logo, merek dagang, dan nama merek pihak ketiga yang ditampilkan di Kaiju Hub AI adalah milik dari pemiliknya masing-masing. Penggunaannya semata-mata untuk tujuan identifikasi dan tidak menyiratkan dukungan, sponsor, atau afiliasi.