Spracheingabe
Übersicht
Wählen Sie eine lokale Transkriptions-Engine oder den integrierten Diktierdienst Ihres Betriebssystems. Die Verfügbarkeit hängt von Ihrer Plattform und den installierten optionalen Engines ab.
Was Speech-to-Text bewirkt
Speech-to-Text wandelt das, was Sie sagen, überall dort in bearbeitbaren Text um, wo Kaiju Hub AI eine Mikrofonaktion anbietet. Verwenden Sie es, um Agentenaufforderungen zu diktieren, ein Kaiju Voice-Gespräch fortzusetzen und längere Anweisungen einzugeben, ohne zu tippen. Lokale Engines wie Whisper und Parakeet behalten die Transkription auf Ihrem Computer; Plattform-Diktieren nutzt den von Windows oder macOS bereitgestellten Sprachdienst.
Verfügbare Dienste
Flüstern
Lokale OpenAI Whisper-Transkription mit wählbarer Modellgröße und Hardwarebeschleunigung.
NVIDIA-Sittich
Schnelle lokale Spracherkennung mit der optionalen Parakeet-Engine.
Wahnsinnig schnelles Flüstern
Ein optimierter Whisper-Pfad für unterstützte GPU-Konfigurationen.
Windows-Spracheingabe
Verwendet Windows-Diktat und den konfigurierten System-Hotkey.
Apple-Diktat
Verwendet den integrierten macOS-Diktierdienst.
Flüstern
Whisper-Einstellungen
Konfigurieren Sie OpenAI Whisper-Einstellungen für die lokale Sprache-zu-Text-Transkription. Whisper läuft vollständig auf Ihrem Rechner für offline, private Spracheingabe. Laden Sie Modelle direkt von diesem Tab herunter, installieren und entfernen Sie sie.
Verfügbare Modelle
Tiny
39M Parameter, ~75 MB Download, ~10x Echtzeit-Geschwindigkeit, benötigt 1 GB VRAM.
Base
74M Parameter, ~145 MB Download, ~7x Echtzeit-Geschwindigkeit, benötigt 1 GB VRAM.
Small
244M Parameter, ~465 MB Download, ~4x Echtzeit-Geschwindigkeit, benötigt 2 GB VRAM.
Medium
769M Parameter, ~1,5 GB Download, ~2x Echtzeit-Geschwindigkeit, benötigt 5 GB VRAM.
Large
1550M Parameter, ~3 GB Download, 1x Echtzeit-Geschwindigkeit, benötigt 10 GB VRAM.
Turbo
809M Parameter, ~1,6 GB Download, ~8x Echtzeit-Geschwindigkeit, benötigt 6 GB VRAM.
Welches Whisper-Modell soll ich wählen?
Beginnen Sie mit Small für ein praktisches Gleichgewicht zwischen Geschwindigkeit, Speichernutzung und Transkriptionsqualität. Gehen Sie nach unten, wenn die Hardware begrenzt ist, oder wählen Sie Medium, Large oder Turbo, wenn Genauigkeit und GPU-Leistung wichtiger sind.
Tiny
Wake-Word-Erkennung, schnelle Befehle und Tests auf Systemen mit dem geringsten Arbeitsspeicher.
Base
Kurze Notizen, Eingabeaufforderungen und allgemeines Diktat auf bescheidener Hardware.
Small
Eine ausgewogene Alltagsauswahl für Agentenaufforderungen und längeres Diktat.
Medium
Genauigkeitsorientierte Transkription, bei der Sie zusätzliche Verarbeitungszeit und Speicher in Kauf nehmen können.
Large
Die lokale Option mit der höchsten Genauigkeit für Systeme mit mindestens 10 GB verfügbarem VRAM.
Turbo
Schnelle Transkription in hoher Qualität auf einer unterstützten GPU mit mindestens 6 GB verfügbarem VRAM.
Installationsstatus
Die Einstellungsseite zeigt den Installationsstatus der erforderlichen Abhängigkeiten:
Sittich und Wahnsinnig schnelles Flüstern
Optionale schnelle Motoren
Bei diesen Engines handelt es sich um separate Downloads, sodass die Standardinstallation klein bleibt. Der Einstellungsbildschirm zeigt den Installations- und Hardwarestatus für jede Engine an.
Sehen Sie mit lokaler Live-Transkription, wie Wörter während des Sprechens erscheinen. Insanely Fast Whisper ist für moderne NVIDIA-GPUs optimiert; außerdem stehen Whisper, Parakeet sowie Cloud- und Plattform-Sprachoptionen zur Verfügung.
NVIDIA-Sittich
Eine schnelle lokale Sprache-zu-Text-Engine. Installieren Sie die optionale Laufzeitumgebung über die Einstellungen für die Spracheingabe, bevor Sie sie auswählen.
Wahnsinnig schnelles Flüstern
Eine beschleunigte Whisper-Implementierung für kompatible GPU-Systeme. Installieren Sie den optionalen Motor vor der Verwendung.
Wenn Sie eines über Kaiju Voice auswählen, wird niemals stillschweigend ein großer Download gestartet. Installieren Sie es zuerst in den Einstellungen. Der Assistent kann dann die Verfügbarkeit überprüfen und Dienste wechseln.
Platform Voice
Windows Voice Typing
Konfigurieren Sie die Windows-Spracheingabe für die Sprache-zu-Text-Transkription. Dieser Dienst verwendet in Windows 10 und höher integrierte Azure Speech Services. Eine Internetverbindung ist erforderlich. Folgen Sie den Einrichtungsanweisungen, um die Spracherkennung in den Windows-Einstellungen zu aktivieren.
Systemanforderungen
Windows 10 oder höher mit aktivierter Spracherkennung in den Systemeinstellungen.
Tastenkürzel
Standard-Auslösetastenkürzel: Strg+Umschalt+W. Nach Ihren Wünschen konfigurierbar.
Testauslöser
Testschaltfläche zur Überprüfung, ob die Spracheingabe korrekt mit Ihrem Mikrofon funktioniert.
Apple Dictation
Konfigurieren Sie Apple Dictation für die Sprache-zu-Text-Transkription auf macOS. Dies ist eine native macOS-Funktion, die keine zusätzliche Einrichtung erfordert, außer das Aktivieren der Diktierfunktion in den Systemeinstellungen.
Systemanforderungen
macOS mit aktivierter Diktierfunktion in Systemeinstellungen > Tastatur.
Tastenkürzel
Standard-Auslösetastenkürzel: Strg+Umschalt+D. Nach Ihren Wünschen konfigurierbar.
Testauslöser
Testschaltfläche zur Überprüfung, ob die Diktierfunktion korrekt mit Ihrem Mikrofon funktioniert.
Text-to-Speech und KI-Stimmen
Lokale Sprachmodelle
AI Brain spricht durch das ausgewählte installierte Modell. Beim Ändern von Modellen wird das vorherige Modell entladen, bevor das neue geladen wird, und die Stimmenliste wird nach Stimmen gefiltert, die mit diesem Modell kompatibel sind.
Kokoro 82M
Leichte, schnelle lokale Sprache mit einer breiten integrierten Stimmenauswahl.
Chatterbox Turbo
Ausdrucksstarke Sprache mit geringer Latenz und unterstütztes Stimmenklonen.
Chatterbox
Das vollständige Chatterbox-Modell für ausdrucksstarke lokale Synthese und Klonen.
OmniVoice 0.6B
Kompakte mehrsprachige lokale Text-to-Speech-Funktion.
OuteTTS 1.0 1B
Lokale Sprachgenerierung mit eigenem kompatiblen Stimmensatz.
Qwen3-TTS 1.7B
Größere mehrsprachige und ausdrucksstarke lokale Synthese.
Fischsprache S2 Pro
Hochwertige lokale Sprache mit unterstützten Referenz-Sprach-Workflows.
Die Sprachgeschwindigkeit kann von 0,5× bis 2× eingestellt werden. Das Klonen von Stimmen wird nur bei Modellen angezeigt, die es unterstützen. Verwenden Sie Audio, das Ihnen gehört oder zu dessen Nutzung Sie berechtigt sind.
Katalog der Cloud-Anbieter
Der Einstellungskatalog umfasst auch Konfigurationen für OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech und Microsoft Azure. Die Verfügbarkeit hängt von der Anbieterkonfiguration und den von Ihnen angegebenen Anmeldeinformationen ab.
API-Anmeldeinformationen bleiben in den Einstellungen und werden von den gesprochenen oder strukturierten Einstellungszusammenfassungen von Kaiju Voice ausgeschlossen.
