Голосовой ввод
Обзор
Выберите локальную систему транскрипции или встроенную службу диктовки вашей операционной системы. Доступность зависит от вашей платформы и установленных дополнительных модулей.
Что делает речь в текст
Преобразование речи в текст превращает то, что вы говорите, в редактируемый текст везде, где Kaiju Hub AI предлагает действие микрофона. Используйте его, чтобы диктовать подсказки агенту, продолжать разговор с помощью голоса Кайдзю и вводить более длинные инструкции без ввода текста. Локальные движки, такие как Whisper и Parakeet, сохраняют транскрипцию на вашем компьютере; Платформенная диктовка использует речевую службу, предоставляемую Windows или macOS.
Доступные услуги
Шепот
Локальная транскрипция OpenAI Whisper с возможностью выбора размера модели и аппаратным ускорением.
NVIDIA Попугай
Быстрое локальное распознавание речи с помощью дополнительного механизма Parakeet.
Безумно быстрый шепот
Оптимизированный путь Whisper для поддерживаемых конфигураций графического процессора.
Голосовой ввод Windows
Использует диктовку Windows и настроенную системную горячую клавишу.
Яблочный диктант
Использует встроенный сервис диктовки macOS.
Шепот
Настройки Whisper
Настройте параметры OpenAI Whisper для локальной транскрипции речи в текст. Whisper работает полностью на вашем компьютере для офлайн и приватного голосового ввода. Скачивайте, устанавливайте и удаляйте модели непосредственно из этой вкладки.
Доступные модели
Tiny
39M параметры, ~75 MB скачать, ~10x realtime speed, требует 1 GB VRAM.
Base
74M параметры, ~145 MB скачать, ~7x realtime speed, требует 1 GB VRAM.
Small
244M параметры, ~465 MB скачать, ~4x realtime speed, требует 2 GB VRAM.
Medium
769M параметры, ~1.5 GB скачать, ~2x realtime speed, требует 5 GB VRAM.
Large
1550M параметры, ~3 GB скачать, 1x realtime speed, требует 10 GB VRAM.
Turbo
809M параметры, ~1.6 GB скачать, ~8x realtime speed, требует 6 GB VRAM.
Какую модель Whisper мне выбрать?
Начните с Small, чтобы получить практический баланс скорости, использования памяти и качества транскрипции. Переместитесь вниз, если аппаратное обеспечение ограничено, или выберите Medium, Large или Turbo, если точность и производительность графического процессора имеют большее значение.
Tiny
Обнаружение пробуждающих слов, быстрые команды и тестирование на системах с самым низким объемом памяти.
Base
Короткие конспекты, подсказки и общий диктант на скромном железе.
Small
Сбалансированный повседневный выбор для подсказок агента и длительной диктовки.
Medium
Транскрипция, ориентированная на точность, когда вы можете потратить дополнительное время обработки и память.
Large
Локальный вариант высочайшей точности для систем с объемом доступной видеопамяти не менее 10 ГБ.
Turbo
Быстрая и качественная транскрипция на поддерживаемом графическом процессоре с не менее 6 ГБ доступной видеопамяти.
Статус установки
Страница настроек показывает статус установки необходимых зависимостей:
Попугай и безумно быстрый шепот
Дополнительные быстрые двигатели
Эти движки загружаются отдельно, поэтому установка по умолчанию остается небольшой. На экране настроек отображается состояние установки и оборудования для каждого механизма.
Наблюдайте, как слова появляются по мере речи благодаря локальной транскрипции в реальном времени. Insanely Fast Whisper оптимизирован для современных графических процессоров NVIDIA; также доступны Whisper, Parakeet, облачные и системные средства распознавания речи.
NVIDIA Попугай
Высокоскоростной локальный механизм преобразования речи в текст. Прежде чем выбирать его, установите дополнительную среду выполнения из настроек голосового набора.
Безумно быстрый шепот
Ускоренная реализация Whisper, предназначенная для совместимых систем графических процессоров. Перед использованием установите дополнительный двигатель.
Выбор одного из них через Kaiju Voice никогда не запускает большую загрузку автоматически. Сначала установите его в настройках; Затем помощник может проверить доступность и переключить услуги.
Платформенный голос
Голосовой ввод Windows
Настройте голосовой ввод Windows для транскрипции речи в текст. Этот сервис использует Azure Speech Services, встроенный в Windows 10 и новее. Требуется интернет-подключение. Следуйте инструкциям по настройке для включения распознавания речи в настройках Windows.
Системные требования
Windows 10 или новее с включённым распознаванием речи в системных настройках.
Горячая клавиша
Горячая клавиша запуска по умолчанию: Ctrl+Shift+W. Настраивается по вашему предпочтению.
Тестовый запуск
Кнопка тестирования для проверки правильной работы голосового ввода с вашим микрофоном.
Диктовка Apple
Настройте Apple Dictation для транскрипции речи в текст на macOS. Это нативная функция macOS, не требующая дополнительной настройки, кроме включения диктовки в Системных настройках.
Системные требования
macOS с включённой диктовкой в Системные настройки > Клавиатура.
Горячая клавиша
Горячая клавиша запуска по умолчанию: Ctrl+Shift+D. Настраивается по вашему предпочтению.
Тестовый запуск
Кнопка тестирования для проверки правильной работы диктовки с вашим микрофоном.
Преобразование текста в речь и голоса AI
Местные голосовые модели
AI Brain говорит через выбранную установленную модель. При смене модели предыдущая модель выгружается перед загрузкой новой, а список голосов фильтруется до голосов, совместимых с этой моделью.
Кокоро 82М
Легкая, быстрая местная речь с широким встроенным голосовым выбором.
Болтун Турбо
Выразительная речь с малой задержкой и поддержка клонирования голоса.
болтун
Полная модель Chatterbox для выразительного локального синтеза и клонирования.
ОмниВойс 0.6Б
Компактное многоязычное преобразование текста в речь.
OuteTTS 1.0 1B
Локальная генерация речи с собственным совместимым голосовым набором.
Квен3-ТТС 1.7Б
Более широкий многоязычный и выразительный местный синтез.
Рыбья речь S2 Pro
Высококачественная местная речь с поддерживаемыми рабочими процессами с опорным голосом.
Скорость речи можно установить от 0,5× до 2×. Клонирование голоса появляется только для моделей, которые его поддерживают; использовать аудио, которым вы владеете или имеете разрешение на использование.
Каталог облачных провайдеров
Каталог настроек также включает конфигурации для OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech и Microsoft Azure. Доступность зависит от конфигурации поставщика и предоставленных вами учетных данных.
Учетные данные API остаются в настройках и исключаются из речевых или структурированных сводок настроек Kaiju Voice.
