Kaiju Hub AI

Голосовой ввод

Выбор услуги голосового набора в настройках Kaiju Hub

Обзор

Выберите локальную систему транскрипции или встроенную службу диктовки вашей операционной системы. Доступность зависит от вашей платформы и установленных дополнительных модулей.

Что делает речь в текст

Преобразование речи в текст превращает то, что вы говорите, в редактируемый текст везде, где Kaiju Hub AI предлагает действие микрофона. Используйте его, чтобы диктовать подсказки агенту, продолжать разговор с помощью голоса Кайдзю и вводить более длинные инструкции без ввода текста. Локальные движки, такие как Whisper и Parakeet, сохраняют транскрипцию на вашем компьютере; Платформенная диктовка использует речевую службу, предоставляемую Windows или macOS.

Доступные услуги

Шепот

Локальная транскрипция OpenAI Whisper с возможностью выбора размера модели и аппаратным ускорением.

NVIDIA Попугай

Быстрое локальное распознавание речи с помощью дополнительного механизма Parakeet.

Безумно быстрый шепот

Оптимизированный путь Whisper для поддерживаемых конфигураций графического процессора.

Голосовой ввод Windows

Использует диктовку Windows и настроенную системную горячую клавишу.

Яблочный диктант

Использует встроенный сервис диктовки macOS.

Шепот

Whisper — локальное преобразование речи в текст с выбором механизма транскрипции и статусом установки.

Настройки Whisper

Настройте параметры OpenAI Whisper для локальной транскрипции речи в текст. Whisper работает полностью на вашем компьютере для офлайн и приватного голосового ввода. Скачивайте, устанавливайте и удаляйте модели непосредственно из этой вкладки.

Доступные модели

Tiny

39M параметры, ~75 MB скачать, ~10x realtime speed, требует 1 GB VRAM.

Base

74M параметры, ~145 MB скачать, ~7x realtime speed, требует 1 GB VRAM.

Small

244M параметры, ~465 MB скачать, ~4x realtime speed, требует 2 GB VRAM.

Medium

769M параметры, ~1.5 GB скачать, ~2x realtime speed, требует 5 GB VRAM.

Large

1550M параметры, ~3 GB скачать, 1x realtime speed, требует 10 GB VRAM.

Turbo

809M параметры, ~1.6 GB скачать, ~8x realtime speed, требует 6 GB VRAM.

Какую модель Whisper мне выбрать?

Начните с Small, чтобы получить практический баланс скорости, использования памяти и качества транскрипции. Переместитесь вниз, если аппаратное обеспечение ограничено, или выберите Medium, Large или Turbo, если точность и производительность графического процессора имеют большее значение.

Tiny

Обнаружение пробуждающих слов, быстрые команды и тестирование на системах с самым низким объемом памяти.

Base

Короткие конспекты, подсказки и общий диктант на скромном железе.

Small

Сбалансированный повседневный выбор для подсказок агента и длительной диктовки.

Medium

Транскрипция, ориентированная на точность, когда вы можете потратить дополнительное время обработки и память.

Large

Локальный вариант высочайшей точности для систем с объемом доступной видеопамяти не менее 10 ГБ.

Turbo

Быстрая и качественная транскрипция на поддерживаемом графическом процессоре с не менее 6 ГБ доступной видеопамяти.

Статус установки

Страница настроек показывает статус установки необходимых зависимостей:

Шепот
FFmpeg
CUDA
UV (Python env)

Попугай и безумно быстрый шепот

Дополнительные быстрые двигатели

Эти движки загружаются отдельно, поэтому установка по умолчанию остается небольшой. На экране настроек отображается состояние установки и оборудования для каждого механизма.

Наблюдайте, как слова появляются по мере речи благодаря локальной транскрипции в реальном времени. Insanely Fast Whisper оптимизирован для современных графических процессоров NVIDIA; также доступны Whisper, Parakeet, облачные и системные средства распознавания речи.

NVIDIA Попугай

Высокоскоростной локальный механизм преобразования речи в текст. Прежде чем выбирать его, установите дополнительную среду выполнения из настроек голосового набора.

Безумно быстрый шепот

Ускоренная реализация Whisper, предназначенная для совместимых систем графических процессоров. Перед использованием установите дополнительный двигатель.

Выбор одного из них через Kaiju Voice никогда не запускает большую загрузку автоматически. Сначала установите его в настройках; Затем помощник может проверить доступность и переключить услуги.

Платформенный голос

Windows Voice Typing — keyboard shortcut configuration and system setup

Голосовой ввод Windows

Настройте голосовой ввод Windows для транскрипции речи в текст. Этот сервис использует Azure Speech Services, встроенный в Windows 10 и новее. Требуется интернет-подключение. Следуйте инструкциям по настройке для включения распознавания речи в настройках Windows.

Системные требования

Windows 10 или новее с включённым распознаванием речи в системных настройках.

Горячая клавиша

Горячая клавиша запуска по умолчанию: Ctrl+Shift+W. Настраивается по вашему предпочтению.

Тестовый запуск

Кнопка тестирования для проверки правильной работы голосового ввода с вашим микрофоном.

Диктовка Apple

Настройте Apple Dictation для транскрипции речи в текст на macOS. Это нативная функция macOS, не требующая дополнительной настройки, кроме включения диктовки в Системных настройках.

Системные требования

macOS с включённой диктовкой в Системные настройки > Клавиатура.

Горячая клавиша

Горячая клавиша запуска по умолчанию: Ctrl+Shift+D. Настраивается по вашему предпочтению.

Тестовый запуск

Кнопка тестирования для проверки правильной работы диктовки с вашим микрофоном.

Преобразование текста в речь и голоса AI

Местные голосовые модели

AI Brain говорит через выбранную установленную модель. При смене модели предыдущая модель выгружается перед загрузкой новой, а список голосов фильтруется до голосов, совместимых с этой моделью.

Кокоро 82М

Легкая, быстрая местная речь с широким встроенным голосовым выбором.

Болтун Турбо

Выразительная речь с малой задержкой и поддержка клонирования голоса.

болтун

Полная модель Chatterbox для выразительного локального синтеза и клонирования.

ОмниВойс 0.6Б

Компактное многоязычное преобразование текста в речь.

OuteTTS 1.0 1B

Локальная генерация речи с собственным совместимым голосовым набором.

Квен3-ТТС 1.7Б

Более широкий многоязычный и выразительный местный синтез.

Рыбья речь S2 Pro

Высококачественная местная речь с поддерживаемыми рабочими процессами с опорным голосом.

Скорость речи можно установить от 0,5× до 2×. Клонирование голоса появляется только для моделей, которые его поддерживают; использовать аудио, которым вы владеете или имеете разрешение на использование.

Каталог облачных провайдеров

Каталог настроек также включает конфигурации для OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech и Microsoft Azure. Доступность зависит от конфигурации поставщика и предоставленных вами учетных данных.

Учетные данные API остаются в настройках и исключаются из речевых или структурированных сводок настроек Kaiju Voice.

Все сторонние логотипы, товарные знаки и названия брендов, представленные в Kaiju Hub AI, являются собственностью их владельцев. Их использование предназначено исключительно для целей идентификации и не подразумевает одобрения, спонсорства или принадлежности.