Kaiju Hub AI

语音打字

Kaiju Hub 设置中的语音输入服务选择

概述

选择本地转录引擎或操作系统的内置听写服务。可用性取决于您的平台以及安装的可选引擎。

语音转文字有什么作用

只要 Kaiju Hub AI 提供麦克风操作,语音转文本就会将您所说的内容转换为可编辑的文本。使用它来听写代理提示、继续 Kaiju 语音对话以及无需打字即可输入较长的指令。 Whisper 和 Parakeet 等本地引擎会在您的机器上保存转录;平台听写使用 Windows 或 macOS 提供的语音服务。

可用服务

耳语

具有可选模型大小和硬件加速功能的本地 OpenAI Whisper 转录。

NVIDIA 鹦鹉

使用可选的 Parakeet 引擎进行快速本地语音识别。

疯狂快速的耳语

针对支持的 GPU 配置的优化 Whisper 路径。

Windows 语音输入

使用 Windows 听写和配置的系统热键。

苹果听写

使用内置的 macOS 听写服务。

耳语

Whisper — 具有转录引擎选择和安装状态的本地语音到文本

Whisper 设置

配置 OpenAI Whisper 设置用于本地语音转文本转录。Whisper 完全在您的计算机上运行,提供离线、私密的语音输入。直接从此标签页下载、安装和移除模型。

可用模型

Tiny

3900 万参数,约 75 MB 下载,约 10 倍实时速度,需要 1 GB VRAM。

Base

7400 万参数,约 145 MB 下载,约 7 倍实时速度,需要 1 GB VRAM。

Small

2.44 亿参数,约 465 MB 下载,约 4 倍实时速度,需要 2 GB VRAM。

Medium

7.69 亿参数,约 1.5 GB 下载,约 2 倍实时速度,需要 5 GB VRAM。

Large

15.5 亿参数,约 3 GB 下载,1 倍实时速度,需要 10 GB VRAM。

Turbo

8.09 亿参数,约 1.6 GB 下载,约 8 倍实时速度,需要 6 GB VRAM。

我应该选择哪种 Whisper 型号?

从 Small 开始,以实现速度、内存使用和转录质量的实际平衡。当硬件有限时向下移动,或者当精度和 GPU 性能更重要时选择 Medium、Large 或 Turbo。

Tiny

唤醒词检测、快速命令以及在最低内存系统上的测试。

Base

在普通硬件上进行简短的笔记、提示和一般听写。

Small

座席提示和较长听写的平衡日常选择。

Medium

当您可以牺牲额外的处理时间和内存时,注重准确性的转录。

Large

适用于具有至少 10 GB 可用 VRAM 的系统的最高精度本地选项。

Turbo

在具有至少 6 GB 可用 VRAM 的受支持 GPU 上快速、高质量转录。

安装状态

设置页面显示所需依赖项的安装状态:

耳语
FFmpeg
CUDA
UV (Python env)

长尾小鹦鹉和疯狂的快速耳语

可选的快速发动机

这些引擎是单独下载的,因此默认安装较小。设置屏幕显示每个引擎的安装和硬件状态。

通过实时本地转录,在说话时即可看到文字出现。Insanely Fast Whisper 针对现代 NVIDIA GPU 进行了优化,同时还提供 Whisper、Parakeet、云端和平台语音选项。

NVIDIA 鹦鹉

高速本地语音转文本引擎。在选择之前,请从“语音输入”设置中安装其可选运行时。

疯狂快速的耳语

旨在兼容 GPU 系统的加速 Whisper 实现。使用前安装可选发动机。

通过 Kaiju Voice 选择一个绝不会默默地开始大量下载。首先在“设置”中安装;然后,助理可以验证可用性并切换服务。

平台语音

Windows Voice Typing — keyboard shortcut configuration and system setup

Windows 语音输入

配置 Windows 语音输入用于语音转文本转录。此服务使用内置于 Windows 10 及更高版本的 Azure Speech Services。需要互联网连接。按照设置说明在 Windows 设置中启用语音识别。

系统要求

Windows 10 或更高版本,并在系统设置中启用语音识别。

快捷键

默认触发快捷键:Ctrl+Shift+W。可根据偏好进行配置。

测试触发

测试按钮用于验证语音输入是否与您的麦克风正常工作。

Apple 听写

在 macOS 上配置 Apple 听写用于语音转文本转录。这是 macOS 的原生功能,只需在系统设置中启用听写即可,无需额外设置。

系统要求

macOS,并在系统设置 > 键盘中启用听写。

快捷键

默认触发快捷键:Ctrl+Shift+D。可根据偏好进行配置。

测试触发

测试按钮用于验证听写是否与您的麦克风正常工作。

文本转语音和人工智能语音

本地语音模型

AI Brain 通过选定的已安装模型进行对话。更改模型会在加载新模型之前卸载以前的模型,并且语音列表会过滤为与该模型兼容的语音。

心82M

轻量、快速的本地语音,具有广泛的内置语音选择。

话匣子涡轮

低延迟表达性语音并支持语音克隆。

话匣子

用于表达本地合成和克隆的完整 Chatterbox 模型。

OmniVoice 0.6B

紧凑的多语言本地文本转语音。

输出TTS 1.0 1B

具有自己的兼容语音集的本地语音生成。

Qwen3-TTS 1.7B

更大规模的多语言和富有表现力的本地综合。

鱼语S2 Pro

高质量本地语音以及受支持的参考语音工作流程。

语速可设置为 0.5 倍至 2 倍。语音克隆仅出现在支持它的型号上;使用您拥有或有权使用的音频。

云提供商目录

设置目录还包括 OpenAI、ElevenLabs、Cartesia、Smallest AI、Fish Audio、Speechmatics、Amazon Polly、Google Cloud Text-to Speech 和 Microsoft Azure 的配置。可用性取决于提供商配置和您提供的凭据。

API 凭据保留在“设置”中,并且不包含在 Kaiju Voice 的语音或结构化设置摘要中。

Kaiju Hub AI 中显示的所有第三方徽标、商标和品牌名称均为其各自所有者的财产。它们的使用仅用于识别目的,并不意味着认可、赞助或隶属关系。