वॉयस टाइपिंग
सिंहावलोकन
एक स्थानीय ट्रांसक्रिप्शन इंजन या अपने ऑपरेटिंग सिस्टम की अंतर्निहित डिक्टेशन सेवा चुनें। उपलब्धता आपके प्लेटफ़ॉर्म पर निर्भर करती है और कौन से वैकल्पिक इंजन स्थापित हैं।
वाक्-से-पाठ क्या करता है
जहां भी काइजू हब एआई एक माइक्रोफोन कार्रवाई प्रदान करता है, भाषण से पाठ को आप जो कहते हैं उसे संपादन योग्य पाठ में बदल देता है। इसका उपयोग एजेंट संकेतों को निर्देशित करने, काइजू वॉयस वार्तालाप जारी रखने और बिना टाइप किए लंबे निर्देश दर्ज करने के लिए करें। व्हिस्पर और पैराकीट जैसे स्थानीय इंजन आपकी मशीन पर ट्रांसक्रिप्शन रखते हैं; प्लेटफ़ॉर्म डिक्टेशन विंडोज़ या मैकओएस द्वारा प्रदान की गई भाषण सेवा का उपयोग करता है।
उपलब्ध सेवाएँ
कानाफूसी
चयन योग्य मॉडल आकार और हार्डवेयर त्वरण के साथ स्थानीय ओपनएआई व्हिस्पर ट्रांसक्रिप्शन।
एनवीडिया पैराकीट
वैकल्पिक पैराकीट इंजन का उपयोग करके तेज़ स्थानीय वाक् पहचान।
बेहद तेज़ फुसफुसाहट
समर्थित GPU कॉन्फ़िगरेशन के लिए एक अनुकूलित व्हिस्पर पथ।
विंडोज़ वॉयस टाइपिंग
विंडोज़ डिक्टेशन और कॉन्फ़िगर सिस्टम हॉटकी का उपयोग करता है।
एप्पल डिक्टेशन
अंतर्निहित macOS डिक्टेशन सेवा का उपयोग करता है।
कानाफूसी
Whisper सेटिंग्स
स्थानीय स्पीच-टू-टेक्स्ट ट्रांसक्रिप्शन के लिए OpenAI Whisper सेटिंग्स कॉन्फ़िगर करें। Whisper ऑफलाइन, निजी वॉइस इनपुट के लिए पूरी तरह आपकी मशीन पर चलता है। इस टैब से सीधे मॉडल डाउनलोड, इंस्टॉल और हटाएँ।
उपलब्ध मॉडल
Tiny
39M पैरामीटर, ~75 MB डाउनलोड, ~10x रियलटाइम गति, 1 GB VRAM आवश्यक।
Base
74M पैरामीटर, ~145 MB डाउनलोड, ~7x रियलटाइम गति, 1 GB VRAM आवश्यक।
Small
244M पैरामीटर, ~465 MB डाउनलोड, ~4x रियलटाइम गति, 2 GB VRAM आवश्यक।
Medium
769M पैरामीटर, ~1.5 GB डाउनलोड, ~2x रियलटाइम गति, 5 GB VRAM आवश्यक।
Large
1550M पैरामीटर, ~3 GB डाउनलोड, 1x रियलटाइम गति, 10 GB VRAM आवश्यक।
Turbo
809M पैरामीटर, ~1.6 GB डाउनलोड, ~8x रियलटाइम गति, 6 GB VRAM आवश्यक।
मुझे कौन सा व्हिस्पर मॉडल चुनना चाहिए?
गति, मेमोरी उपयोग और ट्रांसक्रिप्शन गुणवत्ता के व्यावहारिक संतुलन के लिए Small से शुरुआत करें। जब हार्डवेयर सीमित हो तो नीचे जाएँ, या जब सटीकता और GPU प्रदर्शन अधिक मायने रखते हैं तो Medium, Large या Turbo चुनें।
Tiny
वेक-वर्ड डिटेक्शन, त्वरित कमांड और सबसे कम-मेमोरी सिस्टम पर परीक्षण।
Base
मामूली हार्डवेयर पर संक्षिप्त नोट्स, संकेत और सामान्य श्रुतलेख।
Small
एजेंट संकेतों और लंबे श्रुतलेख के लिए एक संतुलित रोजमर्रा का विकल्प।
Medium
सटीकता-केंद्रित प्रतिलेखन जब आप अतिरिक्त प्रसंस्करण समय और मेमोरी का व्यापार कर सकते हैं।
Large
कम से कम 10 जीबी उपलब्ध वीआरएएम वाले सिस्टम के लिए उच्चतम सटीकता वाला स्थानीय विकल्प।
Turbo
कम से कम 6 जीबी उपलब्ध वीआरएएम के साथ समर्थित जीपीयू पर तेज़, उच्च गुणवत्ता वाला ट्रांसक्रिप्शन।
इंस्टॉलेशन स्थिति
सेटिंग्स पेज आवश्यक निर्भरताओं की इंस्टॉलेशन स्थिति दिखाता है:
तोता और बेहद तेज़ फुसफुसाहट
वैकल्पिक तेज़ इंजन
ये इंजन अलग-अलग डाउनलोड हैं इसलिए डिफ़ॉल्ट इंस्टॉलेशन छोटा रहता है। सेटिंग्स स्क्रीन प्रत्येक इंजन के लिए इंस्टॉलेशन और हार्डवेयर स्थिति दिखाती है।
लाइव स्थानीय ट्रांसक्रिप्शन के साथ बोलते समय शब्दों को दिखाई देते देखें। Insanely Fast Whisper आधुनिक NVIDIA GPU के लिए अनुकूलित है; Whisper, Parakeet, क्लाउड और प्लेटफ़ॉर्म वाक् विकल्प भी उपलब्ध हैं।
एनवीडिया पैराकीट
एक उच्च गति वाला स्थानीय वाक्-से-पाठ इंजन। इसे चुनने से पहले वॉयस टाइपिंग सेटिंग्स से इसका वैकल्पिक रनटाइम इंस्टॉल करें।
बेहद तेज़ फुसफुसाहट
संगत जीपीयू सिस्टम के लिए एक त्वरित व्हिस्पर कार्यान्वयन। उपयोग से पहले वैकल्पिक इंजन स्थापित करें।
काइजू वॉयस के माध्यम से किसी एक का चयन करने से कभी भी चुपचाप एक बड़ा डाउनलोड शुरू नहीं होता है। इसे पहले सेटिंग्स में इंस्टॉल करें; इसके बाद सहायक उपलब्धता सत्यापित कर सकता है और सेवाएं बदल सकता है।
प्लेटफ़ॉर्म वॉइस
Windows Voice Typing
स्पीच-टू-टेक्स्ट ट्रांसक्रिप्शन के लिए Windows Voice Typing कॉन्फ़िगर करें। यह सेवा Windows 10 और बाद के संस्करण में बिल्ट-इन Azure Speech Services का उपयोग करती है। इंटरनेट कनेक्शन आवश्यक है। Windows सेटिंग्स में स्पीच रिकग्निशन सक्षम करने के लिए सेटअप निर्देशों का पालन करें।
सिस्टम आवश्यकताएँ
सिस्टम सेटिंग्स में स्पीच रिकग्निशन सक्षम के साथ Windows 10 या बाद का संस्करण।
हॉटकी
डिफ़ॉल्ट ट्रिगर हॉटकी: Ctrl+Shift+W। आपकी प्राथमिकता के अनुसार कॉन्फ़िगर करने योग्य।
टेस्ट ट्रिगर
अपने माइक्रोफ़ोन के साथ वॉइस टाइपिंग सही ढंग से काम कर रहा है यह सत्यापित करने के लिए टेस्ट बटन।
Apple Dictation
macOS पर स्पीच-टू-टेक्स्ट ट्रांसक्रिप्शन के लिए Apple Dictation कॉन्फ़िगर करें। यह नेटिव macOS सुविधा है जिसमें System Settings में डिक्टेशन सक्षम करने के अलावा कोई अतिरिक्त सेटअप आवश्यक नहीं।
सिस्टम आवश्यकताएँ
System Settings > Keyboard में Dictation सक्षम के साथ macOS।
हॉटकी
डिफ़ॉल्ट ट्रिगर हॉटकी: Ctrl+Shift+D। आपकी प्राथमिकता के अनुसार कॉन्फ़िगर करने योग्य।
टेस्ट ट्रिगर
अपने माइक्रोफ़ोन के साथ डिक्टेशन सही ढंग से काम कर रहा है यह सत्यापित करने के लिए टेस्ट बटन।
टेक्स्ट टू स्पीच और एआई वॉयस
स्थानीय आवाज मॉडल
एआई ब्रेन चयनित स्थापित मॉडल के माध्यम से बोलता है। मॉडल बदलने से नया मॉडल लोड करने से पहले पिछला मॉडल अनलोड हो जाता है, और ध्वनि सूची को उस मॉडल के साथ संगत आवाजों के लिए फ़िल्टर किया जाता है।
कोकोरो 82एम
व्यापक अंतर्निर्मित आवाज चयन के साथ हल्का, तेज़ स्थानीय भाषण।
चैटरबॉक्स टर्बो
कम-विलंबता अभिव्यंजक भाषण और समर्थित आवाज क्लोनिंग।
बकबक
अभिव्यंजक स्थानीय संश्लेषण और क्लोनिंग के लिए पूर्ण चैटरबॉक्स मॉडल।
ओम्निवॉइस 0.6B
संक्षिप्त बहुभाषी स्थानीय टेक्स्ट-टू-स्पीच।
आउटटीटीएस 1.0 1बी
अपने स्वयं के संगत ध्वनि सेट के साथ स्थानीय भाषण पीढ़ी।
क्वेन3-टीटीएस 1.7बी
बड़ा बहुभाषी और अभिव्यंजक स्थानीय संश्लेषण।
फिश स्पीच S2 प्रो
समर्थित संदर्भ-आवाज़ वर्कफ़्लो के साथ उच्च गुणवत्ता वाला स्थानीय भाषण।
स्पीच स्पीड को 0.5× से 2× तक सेट किया जा सकता है। वॉयस क्लोनिंग केवल उन मॉडलों के लिए दिखाई देती है जो इसका समर्थन करते हैं; उस ऑडियो का उपयोग करें जो आपके पास है या आपके पास उपयोग करने की अनुमति है।
क्लाउड प्रदाता कैटलॉग
सेटिंग्स कैटलॉग में ओपनएआई, इलेवनलैब्स, कार्टेसिया, स्मॉलेस्ट एआई, फिश ऑडियो, स्पीचमैटिक्स, अमेज़ॅन पोली, गूगल क्लाउड टेक्स्ट-टू-स्पीच और माइक्रोसॉफ्ट एज़्योर के लिए कॉन्फ़िगरेशन भी शामिल है। उपलब्धता आपके द्वारा आपूर्ति किए गए प्रदाता कॉन्फ़िगरेशन और क्रेडेंशियल्स पर निर्भर करती है।
एपीआई क्रेडेंशियल सेटिंग्स में रहते हैं और काइजू वॉयस की बोली जाने वाली या संरचित सेटिंग्स सारांश से बाहर रखे जाते हैं।
