Kaiju Hub AI

Φωνητική πληκτρολόγηση

Επιλογή υπηρεσίας φωνητικής πληκτρολόγησης στις ρυθμίσεις Kaiju Hub

Επισκόπηση

Επιλέξτε μια τοπική μηχανή μεταγραφής ή την ενσωματωμένη υπηρεσία υπαγόρευσης του λειτουργικού σας συστήματος. Η διαθεσιμότητα εξαρτάται από την πλατφόρμα σας και από ποιους προαιρετικούς κινητήρες είναι εγκατεστημένοι.

Τι κάνει η ομιλία σε κείμενο

Η ομιλία σε κείμενο μετατρέπει αυτό που λέτε σε επεξεργάσιμο κείμενο όπου το Kaiju Hub AI προσφέρει μια δράση μικροφώνου. Χρησιμοποιήστε το για να υπαγορεύσετε τις προτροπές των πρακτόρων, να συνεχίσετε μια συνομιλία Kaiju Voice και να εισαγάγετε μεγαλύτερες οδηγίες χωρίς να πληκτρολογείτε. Οι τοπικοί κινητήρες όπως οι Whisper και Parakeet διατηρούν τη μεταγραφή στο μηχάνημά σας. Η υπαγόρευση πλατφόρμας χρησιμοποιεί την υπηρεσία ομιλίας που παρέχεται από τα Windows ή το macOS.

Διαθέσιμες υπηρεσίες

Ψίθυρος

Τοπική μεταγραφή OpenAI Whisper με επιλέξιμο μέγεθος μοντέλου και επιτάχυνση υλικού.

NVIDIA Parakeet

Γρήγορη τοπική αναγνώριση ομιλίας χρησιμοποιώντας τον προαιρετικό κινητήρα Parakeet.

Τρελά γρήγορος ψίθυρος

Μια βελτιστοποιημένη διαδρομή Whisper για υποστηριζόμενες διαμορφώσεις GPU.

Φωνητική πληκτρολόγηση των Windows

Χρησιμοποιεί υπαγόρευση των Windows και το ρυθμισμένο πλήκτρο πρόσβασης συστήματος.

Υπαγόρευση της Apple

Χρησιμοποιεί την ενσωματωμένη υπηρεσία υπαγόρευσης macOS.

Ψίθυρος

Whisper — τοπική ομιλία σε κείμενο με επιλογή μηχανής μεταγραφής και κατάσταση εγκατάστασης

Ρυθμίσεις Whisper

Διαμορφώστε τις ρυθμίσεις OpenAI Whisper για τοπική μεταγραφή ομιλίας σε κείμενο. Το Whisper εκτελείται εξ ολοκλήρου στο μηχάνημά σας για ιδιωτική εισαγωγή φωνής εκτός σύνδεσης. Κατεβάστε, εγκαταστήστε και καταργήστε μοντέλα απευθείας από αυτήν την καρτέλα.

Διαθέσιμα Μοντέλα

Μικρό

39 εκατομμύρια παράμετροι, ~75 MB λήψη, ~10x ταχύτητα σε πραγματικό χρόνο, απαιτεί 1 GB VRAM.

Βασικό

74 εκατομμύρια παράμετροι, ~145 MB λήψη, ~7x ταχύτητα σε πραγματικό χρόνο, απαιτεί 1 GB VRAM.

Μικρό

244 εκατομμύρια παράμετροι, ~465 MB λήψη, ~4x ταχύτητα σε πραγματικό χρόνο, απαιτεί 2 GB VRAM.

Μεσαίο

769 εκατομμύρια παράμετροι, ~1,5 GB λήψη, ~2x ταχύτητα σε πραγματικό χρόνο, απαιτεί 5 GB VRAM.

Μεγάλο

1550 εκατομμύρια παράμετροι, ~3 GB λήψη, 1x ταχύτητα σε πραγματικό χρόνο, απαιτεί 10 GB VRAM.

Turbo

809 εκατομμύρια παράμετροι, ~1,6 GB λήψη, ~8x ταχύτητα σε πραγματικό χρόνο, απαιτεί 6 GB VRAM.

Ποιο μοντέλο Whisper να επιλέξω;

Ξεκινήστε με το Small για πρακτική ισορροπία ταχύτητας, χρήσης μνήμης και ποιότητας μεταγραφής. Μετακινηθείτε προς τα κάτω όταν το υλικό είναι περιορισμένο ή επιλέξτε Medium, Large ή Turbo όταν η ακρίβεια και η απόδοση της GPU έχουν μεγαλύτερη σημασία.

Μικρό

Ανίχνευση λέξεων αφύπνισης, γρήγορες εντολές και δοκιμή στα συστήματα με τη χαμηλότερη μνήμη.

Βασικό

Σύντομες σημειώσεις, προτροπές και γενική υπαγόρευση σε μέτριο υλικό.

Μικρό

Μια ισορροπημένη καθημερινή επιλογή για προτροπές πρακτόρων και μεγαλύτερη υπαγόρευση.

Μεσαίο

Μεταγραφή εστιασμένη στην ακρίβεια, όταν μπορείτε να ανταλλάξετε επιπλέον χρόνο επεξεργασίας και μνήμη.

Μεγάλο

Η τοπική επιλογή υψηλότερης ακρίβειας για συστήματα με τουλάχιστον 10 GB διαθέσιμης VRAM.

Turbo

Γρήγορη, υψηλής ποιότητας μεταγραφή σε υποστηριζόμενη GPU με τουλάχιστον 6 GB διαθέσιμης VRAM.

Κατάσταση Εγκατάστασης

Η σελίδα ρυθμίσεων εμφανίζει την κατάσταση εγκατάστασης των απαιτούμενων εξαρτημάτων:

Ψίθυρος
FFmpeg
CUDA
UV (Python env)

Parakeet και Insanely Fast Whisper

Προαιρετικοί γρήγοροι κινητήρες

Αυτές οι μηχανές είναι ξεχωριστές λήψεις, επομένως η προεπιλεγμένη εγκατάσταση παραμένει μικρή. Η οθόνη ρυθμίσεων δείχνει την κατάσταση εγκατάστασης και υλικού για κάθε κινητήρα.

Δείτε τις λέξεις να εμφανίζονται καθώς μιλάτε με ζωντανή τοπική μεταγραφή. Το Insanely Fast Whisper είναι βελτιστοποιημένο για σύγχρονες GPU NVIDIA, ενώ διατίθενται επίσης τα Whisper, Parakeet και επιλογές ομιλίας cloud και πλατφόρμας.

NVIDIA Parakeet

Μια τοπική μηχανή ομιλίας σε κείμενο υψηλής ταχύτητας. Εγκαταστήστε τον προαιρετικό χρόνο εκτέλεσης από τις ρυθμίσεις Φωνητική πληκτρολόγηση πριν τον επιλέξετε.

Τρελά γρήγορος ψίθυρος

Μια επιταχυνόμενη υλοποίηση Whisper που προορίζεται για συμβατά συστήματα GPU. Εγκαταστήστε τον προαιρετικό κινητήρα πριν από τη χρήση.

Η επιλογή ενός μέσω του Kaiju Voice δεν ξεκινά ποτέ σιωπηλά μια μεγάλη λήψη. Εγκαταστήστε το πρώτα στις Ρυθμίσεις. ο βοηθός μπορεί στη συνέχεια να επαληθεύσει τη διαθεσιμότητα και να αλλάξει υπηρεσίες.

Πλατφόρμα Φωνής

Windows Voice Typing — keyboard shortcut configuration and system setup

Εισαγωγή Φωνής των Windows

Διαμορφώστε την Εισαγωγή Φωνής των Windows για μεταγραφή ομιλίας σε κείμενο. Αυτή η υπηρεσία χρησιμοποιεί τις υπηρεσίες αναγνώρισης ομιλίας Azure που είναι ενσωματωμένες στα Windows 10 και νεότερες εκδόσεις. Απαιτείται σύνδεση στο Internet. Ακολουθήστε τις οδηγίες εγκατάστασης για να ενεργοποιήσετε την αναγνώριση ομιλίας στις Ρυθμίσεις των Windows.

Απαιτήσεις Συστήματος

Windows 10 ή νεότερη έκδοση με ενεργοποιημένη την αναγνώριση ομιλίας στις ρυθμίσεις του συστήματος.

Συντόμευση

Προεπιλεγμένη συντόμευση: Ctrl+Shift+W. Μπορεί να διαμορφωθεί σύμφωνα με τις προτιμήσεις σας.

Δοκιμή Ενεργοποίησης

Κουμπί δοκιμής για να επαληθεύσετε ότι η εισαγωγή φωνής λειτουργεί σωστά με το μικρόφωνό σας.

Λειτουργία φωνητικής εισαγωγής της Apple

Διαμορφώστε την Υπαγορεύση της Apple για μεταγραφή ομιλίας σε κείμενο στα macOS. Πρόκειται για μια εγγενή λειτουργία macOS χωρίς να απαιτείται πρόσθετη ρύθμιση, πέρα από την ενεργοποίηση της υπαγορεύσεων στις Ρυθμίσεις Συστήματος.

Απαιτήσεις Συστήματος

macOS με ενεργοποιημένη την Υπαγορεύση στις Ρυθμίσεις Συστήματος > Πληκτρολόγιο.

Συντόμευση

Προεπιλεγμένη συντόμευση: Ctrl+Shift+D. Μπορεί να διαμορφωθεί σύμφωνα με τις προτιμήσεις σας.

Δοκιμή Ενεργοποίησης

Κουμπί δοκιμής για να επαληθεύσετε ότι η υπαγορεύση λειτουργεί σωστά με το μικρόφωνό σας.

Text to Speech και AI Voices

Τοπικά μοντέλα φωνής

Το AI Brain μιλάει μέσω του επιλεγμένου εγκατεστημένου μοντέλου. Η αλλαγή μοντέλων ξεφορτώνει το προηγούμενο μοντέλο πριν φορτώσει το νέο και η λίστα φωνής φιλτράρεται σε φωνές συμβατές με αυτό το μοντέλο.

Κόκορο 82Μ

Ελαφριά, γρήγορη τοπική ομιλία με ευρεία ενσωματωμένη φωνητική επιλογή.

Chatterbox Turbo

Εκφραστική ομιλία χαμηλής καθυστέρησης και υποστηριζόμενη κλωνοποίηση φωνής.

Φλυαρία

Το πλήρες μοντέλο Chatterbox για εκφραστική τοπική σύνθεση και κλωνοποίηση.

OmniVoice 0.6B

Συμπαγής πολύγλωσση τοπική μετατροπή κειμένου σε ομιλία.

OuteTTS 1.0 1B

Τοπική παραγωγή ομιλίας με το δικό της συμβατό σετ φωνής.

Qwen3-TTS 1.7B

Μεγαλύτερη πολύγλωσση και εκφραστική τοπική σύνθεση.

Fish Speech S2 Pro

Τοπική ομιλία υψηλής ποιότητας με υποστηριζόμενες ροές εργασίας φωνής αναφοράς.

Η ταχύτητα ομιλίας μπορεί να ρυθμιστεί από 0,5× έως 2×. Η κλωνοποίηση φωνής εμφανίζεται μόνο για μοντέλα που την υποστηρίζουν. χρησιμοποιήστε τον ήχο που κατέχετε ή έχετε άδεια χρήσης.

Κατάλογος παρόχων cloud

Ο κατάλογος ρυθμίσεων περιλαμβάνει επίσης διαμόρφωση για OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech και Microsoft Azure. Η διαθεσιμότητα εξαρτάται από τη διαμόρφωση του παρόχου και τα διαπιστευτήρια που παρέχετε.

Τα διαπιστευτήρια API παραμένουν στις Ρυθμίσεις και εξαιρούνται από τις προφορικές ή δομημένες περιλήψεις ρυθμίσεων του Kaiju Voice.

Όλα τα λογότυπα, εμπορικά σήματα και ονόματα τρίτων που εμφανίζονται στο Kaiju Hub AI ανήκουν στους αντίστοιχους ιδιοκτήτες τους. Η χρήση τους είναι αποκλειστικά για σκοπούς αναγνώρισης και δεν υποδηλώνει υποστήριξη, χορηγία ή σύνδεση.