Kaiju Hub AI

Голосовий набір

Вибір служби голосового введення в налаштуваннях Kaiju Hub

Огляд

Виберіть локальний механізм транскрипції або вбудовану службу диктування вашої операційної системи. Доступність залежить від вашої платформи та встановлених додаткових двигунів.

Що робить мовлення в текст

Функція мовлення в текст перетворює те, що ви говорите, на редагований текст усюди, де Kaiju Hub AI пропонує дію мікрофона. Використовуйте його, щоб диктувати підказки агента, продовжувати розмову Kaiju Voice і вводити довші інструкції, не вводячи текст. Локальні механізми, такі як Whisper і Parakeet, зберігають транскрипцію на вашій машині; платформний диктант використовує службу мовлення, надану Windows або macOS.

Доступні послуги

Шепіт

Локальна транскрипція OpenAI Whisper із можливістю вибору розміру моделі та апаратним прискоренням.

NVIDIA Parakeet

Швидке локальне розпізнавання мовлення за допомогою додаткового двигуна Parakeet.

Шалено швидкий шепіт

Оптимізований шлях Whisper для підтримуваних конфігурацій GPU.

Голосовий набір Windows

Використовує диктування Windows і налаштовану системну гарячу клавішу.

Яблучний диктант

Використовує вбудовану службу диктування macOS.

Шепіт

Whisper — локальне перетворення мови в текст із вибором механізму транскрипції та статусом встановлення

Налаштування Whisper

Налаштуйте параметри OpenAI Whisper для локальної транскрипції мовлення в текст. Whisper повністю працює на вашому комп’ютері для автономного приватного голосового введення. Завантажуйте, встановлюйте та видаляйте моделі безпосередньо з цієї вкладки.

Доступні моделі

Крихітний

39 млн параметрів, ~75 МБ завантаження, ~10-кратна швидкість у реальному часі, потрібен 1 ГБ VRAM.

База

74 МБ параметрів, ~145 МБ завантаження, ~7-кратна швидкість реального часу, потрібен 1 ГБ VRAM.

Маленький

244 МБ параметрів, ~465 МБ завантаження, ~4-кратна швидкість реального часу, потрібно 2 ГБ VRAM.

Середній

769M параметрів, ~1,5 ГБ завантаження, ~2x швидкість реального часу, потрібно 5 ГБ VRAM.

Великий

1550M параметрів, ~3 ГБ завантаження, 1x швидкість реального часу, потрібно 10 ГБ VRAM.

Турбо

Параметри 809M, завантаження ~1,6 ГБ, швидкість у реальному часі ~8x, потрібно 6 ГБ VRAM.

Яку модель Whisper вибрати?

Почніть із Small для практичного балансу швидкості, використання пам’яті та якості транскрипції. Перейдіть униз, якщо апаратне забезпечення обмежене, або виберіть Medium, Large або Turbo, коли точність і продуктивність GPU важливіші.

Крихітний

Виявлення пробуджувального слова, швидкі команди та тестування на системах з найменшим обсягом пам’яті.

База

Короткі замітки, підказки та загальні диктанти на скромному обладнанні.

Маленький

Збалансований повсякденний вибір для підказок агента та тривалого диктування.

Середній

Транскрипція, орієнтована на точність, коли ви можете обмінюватися додатковим часом обробки та пам’яттю.

Великий

Найточніший локальний варіант для систем із принаймні 10 ГБ доступної відеопам’яті.

Турбо

Швидка, високоякісна транскрипція на підтримуваному GPU з принаймні 6 ГБ доступної VRAM.

Статус встановлення

Сторінка налаштувань показує статус встановлення необхідних залежностей:

Шепіт
FFmpeg
CUDA
UV (Python env)

Папуга і шалено швидкий шепіт

Додаткові швидкісні двигуни

Ці механізми завантажуються окремо, тому інсталяція за замовчуванням залишається невеликою. На екрані налаштувань показано встановлення та стан апаратного забезпечення для кожного двигуна.

Спостерігайте, як слова з’являються під час мовлення завдяки локальній транскрипції наживо. Insanely Fast Whisper оптимізовано для сучасних GPU NVIDIA; також доступні Whisper, Parakeet, хмарні та системні засоби розпізнавання мовлення.

NVIDIA Parakeet

Високошвидкісний локальний механізм перетворення мови в текст. Установіть додаткове середовище виконання з налаштувань голосового введення, перш ніж вибрати його.

Шалено швидкий шепіт

Прискорена реалізація Whisper, призначена для сумісних систем GPU. Встановіть додатковий двигун перед використанням.

Вибір одного через Kaiju Voice ніколи не розпочинає велике завантаження без звуку. Спочатку встановіть його в налаштуваннях; потім помічник може перевірити доступність і переключити послуги.

Голос платформи

Windows Voice Typing — keyboard shortcut configuration and system setup

Голосовий набір Windows

Налаштуйте голосовий ввід Windows для транскрипції мовлення в текст. Ця служба використовує Azure Speech Services, вбудовану в Windows 10 і пізніші версії. Потрібне підключення до Інтернету. Дотримуйтесь інструкцій із налаштування, щоб увімкнути розпізнавання мовлення в налаштуваннях Windows.

Системні вимоги

Windows 10 або пізнішої версії з увімкненим розпізнаванням мовлення в налаштуваннях системи.

Гаряча клавіша

Стандартна гаряча клавіша запуску: Ctrl+Shift+W. Налаштовується відповідно до ваших уподобань.

Тестовий тригер

Кнопка Test для перевірки правильності роботи голосового введення з мікрофоном.

Яблучний диктант

Налаштуйте Apple Dictation для транскрипції мовлення в текст у macOS. Це рідна функція macOS, яка не потребує додаткових налаштувань, крім увімкнення диктування в параметрах системи.

Системні вимоги

macOS із увімкненим режимом диктування в системних параметрах > клавіатура.

Гаряча клавіша

Стандартна гаряча клавіша запуску: Ctrl+Shift+D. Налаштовується відповідно до ваших уподобань.

Тестовий тригер

Кнопка «Тест», щоб перевірити, чи диктування правильно працює з мікрофоном.

Перетворення тексту в мовлення та голоси AI

Локальні моделі голосу

AI Brain говорить через обрану встановлену модель. Зміна моделей вивантажує попередню модель перед завантаженням нової, а список голосів фільтрується до голосів, сумісних із цією моделлю.

Кокоро 82М

Легка, швидка місцева мова з широким вбудованим вибором голосу.

Балакуня Турбо

Виразне мовлення з низькою затримкою та підтримується клонування голосу.

Балакуна

Повна модель Chatterbox для експресивного локального синтезу та клонування.

OmniVoice 0.6B

Компактний багатомовний локальний синтез мовлення.

OuteTTS 1.0 1B

Генерація локального мовлення з власним сумісним набором голосів.

Qwen3-TTS 1.7B

Більший багатомовний і виразний локальний синтез.

Fish Speech S2 Pro

Високоякісна локальна мова з підтримкою робочих процесів довідкового голосу.

Швидкість мовлення можна встановити від 0,5× до 2×. Клонування голосу з'являється лише для моделей, які його підтримують; використовувати аудіо, яким ви володієте або маєте дозвіл на використання.

Каталог хмарних провайдерів

Каталог налаштувань також містить конфігурацію для OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech і Microsoft Azure. Доступність залежить від конфігурації постачальника та облікових даних, які ви надаєте.

Облікові дані API залишаються в налаштуваннях і виключаються зі зведення голосових або структурованих налаштувань Kaiju Voice.

Усі логотипи, торгові марки та назви брендів третіх осіб, що відображаються в Kaiju Hub AI, є власністю їхніх відповідних власників. Їх використання здійснюється виключно з метою ідентифікації та не означає схвалення, спонсорство або афіліацію.