Kaiju Hub AI

음성 입력

괴수 허브 설정에서 음성 입력 서비스 선택

개요

로컬 전사 엔진이나 운영 체제에 내장된 받아쓰기 서비스를 선택하세요. 가용성은 플랫폼과 설치된 선택적 엔진에 따라 다릅니다.

음성-텍스트의 기능

음성 텍스트 변환 기능은 Kaiju Hub AI가 마이크 동작을 제공할 때마다 사용자가 말하는 내용을 편집 가능한 텍스트로 변환합니다. 이를 사용하여 에이전트 프롬프트를 받아쓰고, Kaiju Voice 대화를 계속하고, 입력하지 않고도 더 긴 지침을 입력할 수 있습니다. Whisper 및 Parakeet과 같은 로컬 엔진은 컴퓨터에 전사를 유지합니다. 플랫폼 받아쓰기는 Windows 또는 macOS에서 제공되는 음성 서비스를 사용합니다.

이용 가능한 서비스

속삭임

선택 가능한 모델 크기 및 하드웨어 가속을 갖춘 로컬 OpenAI Whisper 전사.

엔비디아 잉꼬

옵션인 앵무새 엔진을 사용한 빠른 로컬 음성 인식.

엄청나게 빠른 속삭임

지원되는 GPU 구성에 최적화된 Whisper 경로입니다.

Windows 음성 입력

Windows 받아쓰기 및 구성된 시스템 단축키를 사용합니다.

애플 받아쓰기

내장된 macOS 받아쓰기 서비스를 사용합니다.

속삭임

속삭임 - 전사 엔진 선택 및 설치 상태가 포함된 로컬 음성-텍스트 변환

Whisper 설정

로컬 음성-텍스트 변환을 위한 OpenAI Whisper 설정을 구성합니다. Whisper는 오프라인 비공개 음성 입력을 위해 완전히 로컬 머신에서 실행됩니다. 이 탭에서 직접 모델을 다운로드, 설치, 제거합니다.

사용 가능한 모델

Tiny

39M 매개변수, ~75 MB 다운로드, ~10배 실시간 속도, 1 GB VRAM 필요.

Base

74M 매개변수, ~145 MB 다운로드, ~7배 실시간 속도, 1 GB VRAM 필요.

Small

244M 매개변수, ~465 MB 다운로드, ~4배 실시간 속도, 2 GB VRAM 필요.

Medium

769M 매개변수, ~1.5 GB 다운로드, ~2배 실시간 속도, 5 GB VRAM 필요.

Large

1550M 매개변수, ~3 GB 다운로드, 1배 실시간 속도, 10 GB VRAM 필요.

Turbo

809M 매개변수, ~1.6 GB 다운로드, ~8배 실시간 속도, 6 GB VRAM 필요.

어떤 Whisper 모델을 선택해야 합니까?

속도, 메모리 사용 및 전사 품질의 실질적인 균형을 위해 Small로 시작하세요. 하드웨어가 제한되어 있으면 아래로 이동하고 정확도와 GPU 성능이 더 중요한 경우 Medium, Large 또는 Turbo를 선택하십시오.

Tiny

깨우기 단어 감지, 빠른 명령 및 최저 메모리 시스템에서의 테스트.

Base

적당한 하드웨어에 대한 짧은 메모, 프롬프트 및 일반 받아쓰기입니다.

Small

상담원 프롬프트와 긴 받아쓰기를 위한 균형잡힌 일상 선택입니다.

Medium

추가 처리 시간과 메모리를 교환할 수 있는 경우 정확성 중심의 전사입니다.

Large

사용 가능한 VRAM이 최소 10GB인 시스템을 위한 최고 정확도의 로컬 옵션입니다.

Turbo

최소 6GB의 사용 가능한 VRAM을 갖춘 지원되는 GPU에서 빠르고 고품질의 텍스트 변환이 가능합니다.

설치 상태

설정 페이지에 필수 종속성의 설치 상태가 표시됩니다:

속삭임
FFmpeg
CUDA
UV (Python env)

앵무새와 엄청나게 빠른 속삭임

선택적 고속 엔진

이러한 엔진은 별도의 다운로드이므로 기본 설치 크기는 작게 유지됩니다. 설정 화면에는 각 엔진의 설치 및 하드웨어 상태가 표시됩니다.

실시간 로컬 전사를 통해 말하는 동안 단어가 나타나는 것을 확인하세요. Insanely Fast Whisper는 최신 NVIDIA GPU에 최적화되어 있으며 Whisper, Parakeet, 클라우드 및 플랫폼 음성 옵션도 사용할 수 있습니다.

엔비디아 잉꼬

고속 로컬 음성-텍스트 엔진입니다. 선택하기 전에 음성 입력 설정에서 선택적 런타임을 설치하세요.

엄청나게 빠른 속삭임

호환 가능한 GPU 시스템을 위한 가속화된 Whisper 구현입니다. 사용하기 전에 옵션 엔진을 설치하십시오.

Kaiju Voice를 통해 하나를 선택하면 자동으로 대용량 다운로드가 시작되지 않습니다. 먼저 설정에서 설치하세요. 그런 다음 도우미는 가용성을 확인하고 서비스를 전환할 수 있습니다.

플랫폼 음성

Windows Voice Typing — keyboard shortcut configuration and system setup

Windows 음성 입력

음성-텍스트 변환을 위한 Windows 음성 입력을 구성합니다. 이 서비스는 Windows 10 이상에 내장된 Azure Speech Services를 사용합니다. 인터넷 연결이 필요합니다. Windows 설정에서 음성 인식을 활성화하려면 설정 지침을 따르세요.

시스템 요구 사항

시스템 설정에서 음성 인식이 활성화된 Windows 10 이상.

단축키

기본 트리거 단축키: Ctrl+Shift+W. 사용자 선호에 따라 변경 가능.

테스트 트리거

마이크와 함께 음성 입력이 올바르게 작동하는지 확인하는 테스트 버튼.

Apple 받아쓰기

macOS에서 음성-텍스트 변환을 위한 Apple 받아쓰기를 구성합니다. 시스템 설정에서 받아쓰기를 활성화하는 것 외에 추가 설정이 필요 없는 네이티브 macOS 기능입니다.

시스템 요구 사항

시스템 설정 > 키보드에서 받아쓰기가 활성화된 macOS.

단축키

기본 트리거 단축키: Ctrl+Shift+D. 사용자 선호에 따라 변경 가능.

테스트 트리거

마이크와 함께 받아쓰기가 올바르게 작동하는지 확인하는 테스트 버튼.

텍스트 음성 변환 및 AI 음성

지역 음성 모델

AI Brain은 선택된 설치된 모델을 통해 말합니다. 모델을 변경하면 새 모델을 로드하기 전에 이전 모델을 언로드하며, 음성 목록은 해당 모델과 호환되는 음성으로 필터링됩니다.

코코로 82M

광범위한 내장 음성 선택 기능을 갖춘 가볍고 빠른 로컬 음성입니다.

채터박스 터보

지연 시간이 짧은 표현 음성 및 음성 복제 지원.

채터박스

표현력이 풍부한 로컬 합성 및 복제를 위한 전체 Chatterbox 모델입니다.

옴니보이스 0.6B

컴팩트한 다국어 로컬 텍스트 음성 변환.

OuteTTS 1.0 1B

자체 호환 가능한 음성 세트를 갖춘 로컬 음성 생성.

Qwen3-TTS 1.7B

더 큰 다국어 및 표현력 있는 로컬 합성.

피쉬 스피치 S2 Pro

참조 음성 워크플로가 지원되는 고품질 로컬 음성.

음성 속도는 0.5×에서 2×까지 설정할 수 있습니다. 음성 복제는 이를 지원하는 모델에만 나타납니다. 귀하가 소유하고 있거나 사용 권한이 있는 오디오를 사용하십시오.

클라우드 제공업체 카탈로그

설정 카탈로그에는 OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech 및 Microsoft Azure에 대한 구성도 포함되어 있습니다. 가용성은 제공하는 공급자 구성 및 자격 증명에 따라 다릅니다.

API 자격 증명은 설정에 남아 있으며 Kaiju Voice의 음성 또는 구조화된 설정 요약에서 제외됩니다.

Kaiju Hub AI에 표시된 모든 타사 로고, 상표 및 브랜드 이름은 해당 소유자의 자산입니다. 이러한 사용은 식별 목적으로만 사용되며 보증, 후원 또는 제휴를 의미하지 않습니다.