Kaiju Hub AI

Spracheingabe

Auswahl des Spracheingabedienstes in den Kaiju Hub-Einstellungen

Übersicht

Wählen Sie eine lokale Transkriptions-Engine oder den integrierten Diktierdienst Ihres Betriebssystems. Die Verfügbarkeit hängt von Ihrer Plattform und den installierten optionalen Engines ab.

Was Speech-to-Text bewirkt

Speech-to-Text wandelt das, was Sie sagen, überall dort in bearbeitbaren Text um, wo Kaiju Hub AI eine Mikrofonaktion anbietet. Verwenden Sie es, um Agentenaufforderungen zu diktieren, ein Kaiju Voice-Gespräch fortzusetzen und längere Anweisungen einzugeben, ohne zu tippen. Lokale Engines wie Whisper und Parakeet behalten die Transkription auf Ihrem Computer; Plattform-Diktieren nutzt den von Windows oder macOS bereitgestellten Sprachdienst.

Verfügbare Dienste

Flüstern

Lokale OpenAI Whisper-Transkription mit wählbarer Modellgröße und Hardwarebeschleunigung.

NVIDIA-Sittich

Schnelle lokale Spracherkennung mit der optionalen Parakeet-Engine.

Wahnsinnig schnelles Flüstern

Ein optimierter Whisper-Pfad für unterstützte GPU-Konfigurationen.

Windows-Spracheingabe

Verwendet Windows-Diktat und den konfigurierten System-Hotkey.

Apple-Diktat

Verwendet den integrierten macOS-Diktierdienst.

Flüstern

Whisper – lokale Spracherkennung mit Auswahl der Transkriptions-Engine und Installationsstatus

Whisper-Einstellungen

Konfigurieren Sie OpenAI Whisper-Einstellungen für die lokale Sprache-zu-Text-Transkription. Whisper läuft vollständig auf Ihrem Rechner für offline, private Spracheingabe. Laden Sie Modelle direkt von diesem Tab herunter, installieren und entfernen Sie sie.

Verfügbare Modelle

Tiny

39M Parameter, ~75 MB Download, ~10x Echtzeit-Geschwindigkeit, benötigt 1 GB VRAM.

Base

74M Parameter, ~145 MB Download, ~7x Echtzeit-Geschwindigkeit, benötigt 1 GB VRAM.

Small

244M Parameter, ~465 MB Download, ~4x Echtzeit-Geschwindigkeit, benötigt 2 GB VRAM.

Medium

769M Parameter, ~1,5 GB Download, ~2x Echtzeit-Geschwindigkeit, benötigt 5 GB VRAM.

Large

1550M Parameter, ~3 GB Download, 1x Echtzeit-Geschwindigkeit, benötigt 10 GB VRAM.

Turbo

809M Parameter, ~1,6 GB Download, ~8x Echtzeit-Geschwindigkeit, benötigt 6 GB VRAM.

Welches Whisper-Modell soll ich wählen?

Beginnen Sie mit Small für ein praktisches Gleichgewicht zwischen Geschwindigkeit, Speichernutzung und Transkriptionsqualität. Gehen Sie nach unten, wenn die Hardware begrenzt ist, oder wählen Sie Medium, Large oder Turbo, wenn Genauigkeit und GPU-Leistung wichtiger sind.

Tiny

Wake-Word-Erkennung, schnelle Befehle und Tests auf Systemen mit dem geringsten Arbeitsspeicher.

Base

Kurze Notizen, Eingabeaufforderungen und allgemeines Diktat auf bescheidener Hardware.

Small

Eine ausgewogene Alltagsauswahl für Agentenaufforderungen und längeres Diktat.

Medium

Genauigkeitsorientierte Transkription, bei der Sie zusätzliche Verarbeitungszeit und Speicher in Kauf nehmen können.

Large

Die lokale Option mit der höchsten Genauigkeit für Systeme mit mindestens 10 GB verfügbarem VRAM.

Turbo

Schnelle Transkription in hoher Qualität auf einer unterstützten GPU mit mindestens 6 GB verfügbarem VRAM.

Installationsstatus

Die Einstellungsseite zeigt den Installationsstatus der erforderlichen Abhängigkeiten:

Flüstern
FFmpeg
CUDA
UV (Python env)

Sittich und Wahnsinnig schnelles Flüstern

Optionale schnelle Motoren

Bei diesen Engines handelt es sich um separate Downloads, sodass die Standardinstallation klein bleibt. Der Einstellungsbildschirm zeigt den Installations- und Hardwarestatus für jede Engine an.

Sehen Sie mit lokaler Live-Transkription, wie Wörter während des Sprechens erscheinen. Insanely Fast Whisper ist für moderne NVIDIA-GPUs optimiert; außerdem stehen Whisper, Parakeet sowie Cloud- und Plattform-Sprachoptionen zur Verfügung.

NVIDIA-Sittich

Eine schnelle lokale Sprache-zu-Text-Engine. Installieren Sie die optionale Laufzeitumgebung über die Einstellungen für die Spracheingabe, bevor Sie sie auswählen.

Wahnsinnig schnelles Flüstern

Eine beschleunigte Whisper-Implementierung für kompatible GPU-Systeme. Installieren Sie den optionalen Motor vor der Verwendung.

Wenn Sie eines über Kaiju Voice auswählen, wird niemals stillschweigend ein großer Download gestartet. Installieren Sie es zuerst in den Einstellungen. Der Assistent kann dann die Verfügbarkeit überprüfen und Dienste wechseln.

Platform Voice

Windows Voice Typing — keyboard shortcut configuration and system setup

Windows Voice Typing

Konfigurieren Sie die Windows-Spracheingabe für die Sprache-zu-Text-Transkription. Dieser Dienst verwendet in Windows 10 und höher integrierte Azure Speech Services. Eine Internetverbindung ist erforderlich. Folgen Sie den Einrichtungsanweisungen, um die Spracherkennung in den Windows-Einstellungen zu aktivieren.

Systemanforderungen

Windows 10 oder höher mit aktivierter Spracherkennung in den Systemeinstellungen.

Tastenkürzel

Standard-Auslösetastenkürzel: Strg+Umschalt+W. Nach Ihren Wünschen konfigurierbar.

Testauslöser

Testschaltfläche zur Überprüfung, ob die Spracheingabe korrekt mit Ihrem Mikrofon funktioniert.

Apple Dictation

Konfigurieren Sie Apple Dictation für die Sprache-zu-Text-Transkription auf macOS. Dies ist eine native macOS-Funktion, die keine zusätzliche Einrichtung erfordert, außer das Aktivieren der Diktierfunktion in den Systemeinstellungen.

Systemanforderungen

macOS mit aktivierter Diktierfunktion in Systemeinstellungen > Tastatur.

Tastenkürzel

Standard-Auslösetastenkürzel: Strg+Umschalt+D. Nach Ihren Wünschen konfigurierbar.

Testauslöser

Testschaltfläche zur Überprüfung, ob die Diktierfunktion korrekt mit Ihrem Mikrofon funktioniert.

Text-to-Speech und KI-Stimmen

Lokale Sprachmodelle

AI Brain spricht durch das ausgewählte installierte Modell. Beim Ändern von Modellen wird das vorherige Modell entladen, bevor das neue geladen wird, und die Stimmenliste wird nach Stimmen gefiltert, die mit diesem Modell kompatibel sind.

Kokoro 82M

Leichte, schnelle lokale Sprache mit einer breiten integrierten Stimmenauswahl.

Chatterbox Turbo

Ausdrucksstarke Sprache mit geringer Latenz und unterstütztes Stimmenklonen.

Chatterbox

Das vollständige Chatterbox-Modell für ausdrucksstarke lokale Synthese und Klonen.

OmniVoice 0.6B

Kompakte mehrsprachige lokale Text-to-Speech-Funktion.

OuteTTS 1.0 1B

Lokale Sprachgenerierung mit eigenem kompatiblen Stimmensatz.

Qwen3-TTS 1.7B

Größere mehrsprachige und ausdrucksstarke lokale Synthese.

Fischsprache S2 Pro

Hochwertige lokale Sprache mit unterstützten Referenz-Sprach-Workflows.

Die Sprachgeschwindigkeit kann von 0,5× bis 2× eingestellt werden. Das Klonen von Stimmen wird nur bei Modellen angezeigt, die es unterstützen. Verwenden Sie Audio, das Ihnen gehört oder zu dessen Nutzung Sie berechtigt sind.

Katalog der Cloud-Anbieter

Der Einstellungskatalog umfasst auch Konfigurationen für OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech und Microsoft Azure. Die Verfügbarkeit hängt von der Anbieterkonfiguration und den von Ihnen angegebenen Anmeldeinformationen ab.

API-Anmeldeinformationen bleiben in den Einstellungen und werden von den gesprochenen oder strukturierten Einstellungszusammenfassungen von Kaiju Voice ausgeschlossen.

Alle Logos, Marken und Markennamen von Drittanbietern, die in Kaiju Hub AI angezeigt werden, sind Eigentum ihrer jeweiligen Inhaber. Ihre Verwendung dient ausschließlich der Identifizierung und impliziert keine Befürwortung, Sponsoring oder Zugehörigkeit.