语音打字
概述
选择本地转录引擎或操作系统的内置听写服务。可用性取决于您的平台以及安装的可选引擎。
语音转文字有什么作用
只要 Kaiju Hub AI 提供麦克风操作,语音转文本就会将您所说的内容转换为可编辑的文本。使用它来听写代理提示、继续 Kaiju 语音对话以及无需打字即可输入较长的指令。 Whisper 和 Parakeet 等本地引擎会在您的机器上保存转录;平台听写使用 Windows 或 macOS 提供的语音服务。
可用服务
耳语
具有可选模型大小和硬件加速功能的本地 OpenAI Whisper 转录。
NVIDIA 鹦鹉
使用可选的 Parakeet 引擎进行快速本地语音识别。
疯狂快速的耳语
针对支持的 GPU 配置的优化 Whisper 路径。
Windows 语音输入
使用 Windows 听写和配置的系统热键。
苹果听写
使用内置的 macOS 听写服务。
耳语
Whisper 设置
配置 OpenAI Whisper 设置用于本地语音转文本转录。Whisper 完全在您的计算机上运行,提供离线、私密的语音输入。直接从此标签页下载、安装和移除模型。
可用模型
Tiny
3900 万参数,约 75 MB 下载,约 10 倍实时速度,需要 1 GB VRAM。
Base
7400 万参数,约 145 MB 下载,约 7 倍实时速度,需要 1 GB VRAM。
Small
2.44 亿参数,约 465 MB 下载,约 4 倍实时速度,需要 2 GB VRAM。
Medium
7.69 亿参数,约 1.5 GB 下载,约 2 倍实时速度,需要 5 GB VRAM。
Large
15.5 亿参数,约 3 GB 下载,1 倍实时速度,需要 10 GB VRAM。
Turbo
8.09 亿参数,约 1.6 GB 下载,约 8 倍实时速度,需要 6 GB VRAM。
我应该选择哪种 Whisper 型号?
从 Small 开始,以实现速度、内存使用和转录质量的实际平衡。当硬件有限时向下移动,或者当精度和 GPU 性能更重要时选择 Medium、Large 或 Turbo。
Tiny
唤醒词检测、快速命令以及在最低内存系统上的测试。
Base
在普通硬件上进行简短的笔记、提示和一般听写。
Small
座席提示和较长听写的平衡日常选择。
Medium
当您可以牺牲额外的处理时间和内存时,注重准确性的转录。
Large
适用于具有至少 10 GB 可用 VRAM 的系统的最高精度本地选项。
Turbo
在具有至少 6 GB 可用 VRAM 的受支持 GPU 上快速、高质量转录。
安装状态
设置页面显示所需依赖项的安装状态:
长尾小鹦鹉和疯狂的快速耳语
可选的快速发动机
这些引擎是单独下载的,因此默认安装较小。设置屏幕显示每个引擎的安装和硬件状态。
通过实时本地转录,在说话时即可看到文字出现。Insanely Fast Whisper 针对现代 NVIDIA GPU 进行了优化,同时还提供 Whisper、Parakeet、云端和平台语音选项。
NVIDIA 鹦鹉
高速本地语音转文本引擎。在选择之前,请从“语音输入”设置中安装其可选运行时。
疯狂快速的耳语
旨在兼容 GPU 系统的加速 Whisper 实现。使用前安装可选发动机。
通过 Kaiju Voice 选择一个绝不会默默地开始大量下载。首先在“设置”中安装;然后,助理可以验证可用性并切换服务。
平台语音
Windows 语音输入
配置 Windows 语音输入用于语音转文本转录。此服务使用内置于 Windows 10 及更高版本的 Azure Speech Services。需要互联网连接。按照设置说明在 Windows 设置中启用语音识别。
系统要求
Windows 10 或更高版本,并在系统设置中启用语音识别。
快捷键
默认触发快捷键:Ctrl+Shift+W。可根据偏好进行配置。
测试触发
测试按钮用于验证语音输入是否与您的麦克风正常工作。
Apple 听写
在 macOS 上配置 Apple 听写用于语音转文本转录。这是 macOS 的原生功能,只需在系统设置中启用听写即可,无需额外设置。
系统要求
macOS,并在系统设置 > 键盘中启用听写。
快捷键
默认触发快捷键:Ctrl+Shift+D。可根据偏好进行配置。
测试触发
测试按钮用于验证听写是否与您的麦克风正常工作。
文本转语音和人工智能语音
本地语音模型
AI Brain 通过选定的已安装模型进行对话。更改模型会在加载新模型之前卸载以前的模型,并且语音列表会过滤为与该模型兼容的语音。
心82M
轻量、快速的本地语音,具有广泛的内置语音选择。
话匣子涡轮
低延迟表达性语音并支持语音克隆。
话匣子
用于表达本地合成和克隆的完整 Chatterbox 模型。
OmniVoice 0.6B
紧凑的多语言本地文本转语音。
输出TTS 1.0 1B
具有自己的兼容语音集的本地语音生成。
Qwen3-TTS 1.7B
更大规模的多语言和富有表现力的本地综合。
鱼语S2 Pro
高质量本地语音以及受支持的参考语音工作流程。
语速可设置为 0.5 倍至 2 倍。语音克隆仅出现在支持它的型号上;使用您拥有或有权使用的音频。
云提供商目录
设置目录还包括 OpenAI、ElevenLabs、Cartesia、Smallest AI、Fish Audio、Speechmatics、Amazon Polly、Google Cloud Text-to Speech 和 Microsoft Azure 的配置。可用性取决于提供商配置和您提供的凭据。
API 凭据保留在“设置”中,并且不包含在 Kaiju Voice 的语音或结构化设置摘要中。
