Kaiju Hub AI

Nhập bằng giọng nói

Lựa chọn dịch vụ Nhập liệu bằng giọng nói trong cài đặt Kaiju Hub

Tổng quan

Chọn công cụ phiên âm cục bộ hoặc dịch vụ đọc chính tả tích hợp trong hệ điều hành của bạn. Tính khả dụng tùy thuộc vào nền tảng của bạn và công cụ tùy chọn nào được cài đặt.

Tính năng chuyển lời nói thành văn bản

Lời nói thành văn bản biến những gì bạn nói thành văn bản có thể chỉnh sửa ở bất cứ nơi nào Kaiju Hub AI cung cấp tác vụ micrô. Sử dụng nó để ra lệnh cho nhân viên, tiếp tục cuộc trò chuyện bằng Kaiju Voice và nhập hướng dẫn dài hơn mà không cần gõ. Các công cụ cục bộ như Whisper và Parakeet tiếp tục phiên âm trên máy của bạn; chính tả nền tảng sử dụng dịch vụ giọng nói do Windows hoặc macOS cung cấp.

Dịch vụ có sẵn

Thì thầm

Phiên âm OpenAI Whisper cục bộ với kích thước mô hình có thể lựa chọn và khả năng tăng tốc phần cứng.

Vẹt đuôi dài NVIDIA

Nhận dạng giọng nói cục bộ nhanh chóng bằng cách sử dụng công cụ Parakeet tùy chọn.

Lời thì thầm cực nhanh

Đường dẫn Whisper được tối ưu hóa cho các cấu hình GPU được hỗ trợ.

Nhập liệu bằng giọng nói của Windows

Sử dụng tính năng đọc chính tả của Windows và phím nóng hệ thống được định cấu hình.

Apple chính tả

Sử dụng dịch vụ đọc chính tả macOS tích hợp.

Thì thầm

Whisper - chuyển giọng nói thành văn bản cục bộ với trạng thái cài đặt và lựa chọn công cụ phiên âm

Cài Đặt Whisper

Cấu hình cài đặt OpenAI Whisper cho phiên âm giọng nói sang văn bản cục bộ. Whisper chạy hoàn toàn trên máy của bạn cho đầu vào giọng nói ngoại tuyến, riêng tư. Tải xuống, cài đặt và gỡ bỏ mô hình trực tiếp từ tab này.

Mô Hình Có Sẵn

Tiny

39M parameters, ~75 MB download, ~10x realtime speed, requires 1 GB VRAM.

Base

74M parameters, ~145 MB download, ~7x realtime speed, requires 1 GB VRAM.

Small

244M parameters, ~465 MB download, ~4x realtime speed, requires 2 GB VRAM.

Medium

769M parameters, ~1.5 GB download, ~2x realtime speed, requires 5 GB VRAM.

Large

1550M parameters, ~3 GB download, 1x realtime speed, requires 10 GB VRAM.

Turbo

809M parameters, ~1.6 GB download, ~8x realtime speed, requires 6 GB VRAM.

Tôi nên chọn mẫu Whisper nào?

Bắt đầu với Small để có sự cân bằng thực tế về tốc độ, mức sử dụng bộ nhớ và chất lượng phiên âm. Di chuyển xuống khi phần cứng bị hạn chế hoặc chọn Medium, Large hoặc Turbo khi độ chính xác và hiệu suất GPU quan trọng hơn.

Tiny

Phát hiện từ đánh thức, ra lệnh nhanh và kiểm tra trên các hệ thống có bộ nhớ thấp nhất.

Base

Ghi chú ngắn, lời nhắc và chính tả chung trên phần cứng khiêm tốn.

Small

Một sự lựa chọn cân bằng hàng ngày cho lời nhắc của nhân viên và chính tả dài hơn.

Medium

Phiên âm tập trung vào độ chính xác khi bạn có thể đánh đổi thêm thời gian xử lý và bộ nhớ.

Large

Tùy chọn cục bộ có độ chính xác cao nhất cho các hệ thống có ít nhất 10 GB VRAM khả dụng.

Turbo

Phiên âm nhanh, chất lượng cao trên GPU được hỗ trợ với ít nhất 6 GB VRAM khả dụng.

Trạng Thái Cài Đặt

Trang cài đặt hiển thị trạng thái cài đặt của các phụ thuộc bắt buộc:

Thì thầm
FFmpeg
CUDA
UV (Python env)

Vẹt đuôi dài và lời thì thầm cực nhanh

Động cơ nhanh tùy chọn

Các công cụ này là các bản tải xuống riêng biệt nên cài đặt mặc định vẫn ở mức nhỏ. Màn hình cài đặt hiển thị trạng thái cài đặt và phần cứng cho từng động cơ.

Xem các từ xuất hiện ngay khi bạn nói nhờ phiên âm trực tiếp trên máy. Insanely Fast Whisper được tối ưu hóa cho GPU NVIDIA hiện đại; Whisper, Parakeet cùng các tùy chọn giọng nói đám mây và nền tảng cũng có sẵn.

Vẹt đuôi dài NVIDIA

Công cụ chuyển lời nói thành văn bản cục bộ tốc độ cao. Cài đặt thời gian chạy tùy chọn của nó từ cài đặt Nhập bằng giọng nói trước khi chọn.

Lời thì thầm cực nhanh

Việc triển khai Whisper được tăng tốc dành cho các hệ thống GPU tương thích. Cài đặt công cụ tùy chọn trước khi sử dụng.

Việc chọn một thông qua Kaiju Voice không bao giờ bắt đầu tải xuống một cách âm thầm. Trước tiên hãy cài đặt nó trong Cài đặt; sau đó trợ lý có thể xác minh tính khả dụng và chuyển đổi dịch vụ.

Giọng Nói Nền Tảng

Windows Voice Typing — keyboard shortcut configuration and system setup

Windows Voice Typing

Cấu hình Windows Voice Typing cho phiên âm giọng nói sang văn bản. Dịch vụ này sử dụng Azure Speech Services tích hợp trong Windows 10 trở lên. Cần kết nối internet. Làm theo hướng dẫn thiết lập để bật nhận dạng giọng nói trong Cài đặt Windows.

Yêu Cầu Hệ Thống

Windows 10 trở lên với nhận dạng giọng nói được bật trong cài đặt hệ thống.

Phím Tắt

Phím tắt kích hoạt mặc định: Ctrl+Shift+W. Có thể tùy chỉnh theo sở thích.

Kiểm Tra Kích Hoạt

Nút kiểm tra để xác minh nhập giọng nói hoạt động chính xác với micro của bạn.

Apple Dictation

Cấu hình Apple Dictation cho phiên âm giọng nói sang văn bản trên macOS. Đây là tính năng gốc macOS không cần thiết lập bổ sung ngoài việc bật đọc chính tả trong Cài đặt Hệ thống.

Yêu Cầu Hệ Thống

macOS với Đọc chính tả được bật trong Cài đặt Hệ thống > Bàn phím.

Phím Tắt

Phím tắt kích hoạt mặc định: Ctrl+Shift+D. Có thể tùy chỉnh theo sở thích.

Kiểm Tra Kích Hoạt

Nút kiểm tra để xác minh đọc chính tả hoạt động chính xác với micro của bạn.

Chuyển văn bản thành giọng nói và giọng nói AI

Mẫu giọng nói địa phương

AI Brain nói thông qua mô hình được cài đặt đã chọn. Việc thay đổi kiểu máy sẽ dỡ bỏ kiểu máy trước đó trước khi tải kiểu máy mới và danh sách giọng nói được lọc thành các giọng nói tương thích với kiểu máy đó.

Kokoro 82M

Giọng nói địa phương nhẹ nhàng, nhanh chóng với nhiều lựa chọn giọng nói tích hợp sẵn.

Chatterbox Turbo

Giọng nói biểu cảm có độ trễ thấp và nhân bản giọng nói được hỗ trợ.

Hộp trò chuyện

Mô hình Chatterbox đầy đủ để tổng hợp và nhân bản cục bộ một cách biểu cảm.

OmniVoice 0.6B

Chuyển văn bản thành giọng nói cục bộ đa ngôn ngữ nhỏ gọn.

OuteTTS 1.0 1B

Tạo giọng nói cục bộ với bộ giọng nói tương thích của riêng nó.

Qwen3-TTS 1.7B

Tổng hợp cục bộ đa ngôn ngữ và biểu cảm lớn hơn.

Cá Nói S2 Pro

Giọng nói cục bộ chất lượng cao với quy trình làm việc bằng giọng nói tham chiếu được hỗ trợ.

Tốc độ giọng nói có thể được đặt từ 0,5× đến 2×. Nhân bản giọng nói chỉ xuất hiện ở những kiểu máy hỗ trợ nó; sử dụng âm thanh bạn sở hữu hoặc được phép sử dụng.

Danh mục nhà cung cấp đám mây

Danh mục cài đặt cũng bao gồm cấu hình cho OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech và Microsoft Azure. Tính khả dụng tùy thuộc vào cấu hình nhà cung cấp và thông tin đăng nhập mà bạn cung cấp.

Thông tin xác thực API vẫn còn trong Cài đặt và bị loại khỏi bản tóm tắt cài đặt có cấu trúc hoặc giọng nói của Kaiju Voice.

Tất cả các logo, nhãn hiệu và tên thương hiệu của bên thứ ba hiển thị trong Kaiju Hub AI đều là tài sản của chủ sở hữu tương ứng. Việc sử dụng chúng chỉ nhằm mục đích nhận dạng và không ngụ ý chứng thực, tài trợ hoặc liên kết.