Kaiju Hub AI

व्हॉइस टायपिंग

Kaiju Hub सेटिंग्जमध्ये व्हॉइस टायपिंग सेवा निवड

विहंगावलोकन

स्थानिक ट्रान्सक्रिप्शन इंजिन किंवा तुमच्या ऑपरेटिंग सिस्टमची अंगभूत श्रुतलेख सेवा निवडा. उपलब्धता तुमच्या प्लॅटफॉर्मवर आणि कोणती पर्यायी इंजिने स्थापित केली आहेत यावर अवलंबून असते.

भाषण ते मजकूर काय करते

जेथे जेथे Kaiju Hub AI मायक्रोफोन ॲक्शन ऑफर करते तेथे तुम्ही जे बोलता ते टेक्स्ट टू टेक्स्ट हे संपादन करण्यायोग्य मजकुरात बदलते. एजंट प्रॉम्प्ट लिहिण्यासाठी, Kaiju व्हॉइस संभाषण सुरू ठेवण्यासाठी आणि टाइप न करता दीर्घ सूचना एंटर करण्यासाठी याचा वापर करा. व्हिस्पर आणि पॅराकीट सारखी स्थानिक इंजिने तुमच्या मशीनवर ट्रान्सक्रिप्शन ठेवतात; प्लॅटफॉर्म डिक्टेशन Windows किंवा macOS द्वारे प्रदान केलेल्या भाषण सेवेचा वापर करते.

उपलब्ध सेवा

कुजबुज

निवडण्यायोग्य मॉडेल आकार आणि हार्डवेअर प्रवेगसह स्थानिक OpenAI Whisper ट्रान्सक्रिप्शन.

NVIDIA पॅराकीट

पर्यायी पॅराकीट इंजिन वापरून जलद स्थानिक उच्चार ओळख.

अत्यंत वेगवान कुजबुज

समर्थित GPU कॉन्फिगरेशनसाठी एक ऑप्टिमाइझ व्हिस्पर मार्ग.

विंडोज व्हॉइस टायपिंग

विंडोज डिक्टेशन आणि कॉन्फिगर केलेली सिस्टम हॉटकी वापरते.

ऍपल डिक्टेशन

अंगभूत macOS डिक्टेशन सेवा वापरते.

कुजबुज

व्हिस्पर — ट्रान्सक्रिप्शन इंजिन निवड आणि इंस्टॉलेशन स्थितीसह स्थानिक स्पीच-टू-टेक्स्ट

व्हिस्पर सेटिंग्ज

KEY: supportContent.appSettingsVoiceWhisper.configureOpenaiWhisperSettingsFor TEXT: स्थानिक स्पीच-टू-टेक्स्ट ट्रांसक्रिप्शनसाठी OpenAI व्हिस्पर सेटिंग्ज कॉन्फिगर करा. व्हिस्पर पूर्णपणे तुमच्या मशीनवर ऑफलाइन, खाजगी व्हॉइस इनपुटसाठी चालते. या टॅबमधून मॉडेल्स डाउनलोड, इंस्टॉल आणि काढून टाका.

उपलब्ध मॉडेल्स

लहान

KEY: supportContent.appSettingsVoiceWhisper.item1Desc TEXT: 39M पॅरामीटर्स, ~75 MB डाउनलोड, ~10x रिअलटाइम स्पीड, 1 GB VRAM आवश्यक.

मूळ

KEY: supportContent.appSettingsVoiceWhisper.item2Desc TEXT: 74M पॅरामीटर्स, ~145 MB डाउनलोड, ~7x रिअलटाइम स्पीड, 1 GB VRAM आवश्यक.

लहान

244M पॅरामीटर्स, ~465 MB डाउनलोड, ~4x रिअलटाइम वेग, 2 GB VRAM आवश्यक.

मध्यम

769M पॅरामीटर्स, ~1.5 GB डाउनलोड, ~2x रिअलटाइम वेग, 5 GB VRAM आवश्यक.

मोठे

1550M पॅरामीटर्स, ~3 GB डाउनलोड, 1x रिअलटाइम वेग, 10 GB VRAM आवश्यक.

टर्बो

809M पॅरामीटर्स, ~1.6 GB डाउनलोड, ~8x रिअलटाइम वेग, 6 GB VRAM आवश्यक.

मी कोणते व्हिस्पर मॉडेल निवडावे?

वेग, मेमरी वापर आणि ट्रान्सक्रिप्शन गुणवत्तेच्या व्यावहारिक संतुलनासाठी Small सह प्रारंभ करा. हार्डवेअर मर्यादित असताना खाली जा किंवा अचूकता आणि GPU कार्यप्रदर्शन अधिक महत्त्वाचे असताना Medium, Large किंवा Turbo निवडा.

लहान

वेक-वर्ड डिटेक्शन, द्रुत आदेश आणि सर्वात कमी मेमरी सिस्टमवर चाचणी.

मूळ

माफक हार्डवेअरवर लहान नोट्स, प्रॉम्प्ट आणि सामान्य श्रुतलेख.

लहान

एजंट प्रॉम्प्ट आणि दीर्घ श्रुतलेखनासाठी संतुलित दैनंदिन निवड.

मध्यम

अचूकता-केंद्रित प्रतिलेखन जेव्हा तुम्ही अतिरिक्त प्रक्रिया वेळ आणि मेमरी व्यापार करू शकता.

मोठे

किमान 10 GB उपलब्ध VRAM असलेल्या सिस्टमसाठी सर्वोच्च-अचूकता स्थानिक पर्याय.

टर्बो

किमान 6 GB उपलब्ध VRAM सह समर्थित GPU वर जलद, उच्च-गुणवत्तेचे प्रतिलेखन.

स्थापना स्थिती

सेटिंग्ज पृष्ठावर आवश्यक अवलंबित्व घटकांची स्थापना स्थिती दर्शविली जाते:

कुजबुज
FFmpeg
CUDA
UV (Python env)

पॅराकीट आणि अत्यंत वेगवान व्हिस्पर

पर्यायी वेगवान इंजिन

ही इंजिन स्वतंत्र डाउनलोड आहेत त्यामुळे डीफॉल्ट स्थापना लहान राहते. सेटिंग्ज स्क्रीन प्रत्येक इंजिनसाठी स्थापना आणि हार्डवेअर स्थिती दर्शवते.

लाइव्ह स्थानिक ट्रान्सक्रिप्शनमुळे तुम्ही बोलताना शब्द दिसताना पहा. Insanely Fast Whisper आधुनिक NVIDIA GPU साठी ऑप्टिमाइझ केले आहे; Whisper, Parakeet, क्लाउड आणि प्लॅटफॉर्म स्पीच पर्यायही उपलब्ध आहेत.

NVIDIA पॅराकीट

हाय-स्पीड लोकल स्पीच-टू-टेक्स्ट इंजिन. निवडण्यापूर्वी व्हॉइस टायपिंग सेटिंग्जमधून त्याचा पर्यायी रनटाइम स्थापित करा.

अत्यंत वेगवान कुजबुज

सुसंगत GPU सिस्टीमसाठी प्रवेगक व्हिस्पर अंमलबजावणी. वापरण्यापूर्वी पर्यायी इंजिन स्थापित करा.

Kaiju Voice द्वारे एक निवडणे कधीही शांतपणे मोठ्या प्रमाणात डाउनलोड सुरू होत नाही. प्रथम सेटिंग्जमध्ये स्थापित करा; सहाय्यक नंतर उपलब्धता सत्यापित करू शकतो आणि सेवा बदलू शकतो.

प्लॅटफॉर्म व्हॉइस

Windows Voice Typing — keyboard shortcut configuration and system setup

विंडोज व्हॉइस टाइपिंग

स्पीच-टू-टेक्स्ट ट्रांसक्रिप्शनसाठी विंडोज व्हॉइस टाइपिंग कॉन्फिगर करा. ही सेवा विंडोज 10 आणि त्यावरील आवृत्त्यांमध्ये तयार केलेल्या Azure स्पीच सर्व्हिसेस वापरते. इंटरनेट कनेक्शन आवश्यक आहे. विंडोज सेटिंग्जमध्ये स्पीच रेकग्निशन सक्षम करण्यासाठी सेटअप सूचनांचे पालन करा.

सिस्टम आवश्यकता

KEY: supportContent.appSettingsVoiceWindows.item1Desc TEXT: विंडोज 10 किंवा त्यावरील, ज्यामध्ये सिस्टम सेटिंग्जमध्ये स्पीच रेकग्निशन सक्षम केलेले आहे.

हॉटकी

KEY: supportContent.appSettingsVoiceWindows.item2Desc TEXT: डीफॉल्ट ट्रिगर हॉटकी: Ctrl+Shift+W. आपल्या आवडीनुसार कॉन्फिगर करता येते.

चाचणी ट्रिगर

KEY: supportContent.appSettingsVoiceWindows.item3Desc TEXT: व्हॉइस टाइपिंग योग्यरित्या कार्य करत आहे की नाही हे तपासण्यासाठी टेस्ट बटण, जेणेकरून ते तुमच्या मायक्रोफोनसोबत व्यवस्थित काम करेल.

ॲपल डिक्टेशन

KEY: supportContent.appSettingsVoiceWindows.configureAppleDictationForSpeechto TEXT: macOS वर स्पीच-टू-टेक्स्ट ट्रांसक्रिप्शनसाठी ॲपल डिक्टेशन कॉन्फिगर करा. हे एक मूळ macOS वैशिष्ट्य आहे ज्यासाठी सिस्टम सेटिंग्जमध्ये डिक्टेशन सक्षम करण्याव्यतिरिक्त अतिरिक्त सेटअपची आवश्यकता नाही.

सिस्टम आवश्यकता

KEY: supportContent.appSettingsVoiceWindows.item4Desc TEXT: macOS, ज्यामध्ये सिस्टम सेटिंग्ज > कीबोर्डमध्ये डिक्टेशन सक्षम केलेले आहे.

हॉटकी

KEY: supportContent.appSettingsVoiceWindows.item5Desc TEXT: डीफॉल्ट ट्रिगर हॉटकी: Ctrl+Shift+D. आपल्या आवडीनुसार बदलता येते.

चाचणी ट्रिगर

KEY: supportContent.appSettingsVoiceWindows.item6Desc TEXT: आपल्या मायक्रोफोनसह व्हॉइस रेकॉर्डिंग योग्यरित्या कार्य करत आहे की नाही हे तपासण्यासाठी चाचणी बटण.

टेक्स्ट टू स्पीच आणि एआय व्हॉइसेस

स्थानिक आवाज मॉडेल

एआय ब्रेन निवडलेल्या स्थापित मॉडेलद्वारे बोलतो. मॉडेल बदलल्याने नवीन लोड करण्यापूर्वी मागील मॉडेल अनलोड केले जाते आणि व्हॉइस सूची त्या मॉडेलशी सुसंगत असलेल्या आवाजांमध्ये फिल्टर केली जाते.

कोकोरो 82M

विस्तृत अंगभूत आवाज निवडीसह हलके, जलद स्थानिक भाषण.

चॅटरबॉक्स टर्बो

कमी विलंब अभिव्यक्त भाषण आणि समर्थित व्हॉइस क्लोनिंग.

चॅटरबॉक्स

अभिव्यक्त स्थानिक संश्लेषण आणि क्लोनिंगसाठी संपूर्ण चॅटरबॉक्स मॉडेल.

OmniVoice 0.6B

कॉम्पॅक्ट बहुभाषिक स्थानिक मजकूर-ते-भाषण.

OuteTTS 1.0 1B

त्याच्या स्वतःच्या सुसंगत व्हॉइस सेटसह स्थानिक भाषण निर्मिती.

Qwen3-TTS 1.7B

मोठे बहुभाषिक आणि अभिव्यक्त स्थानिक संश्लेषण.

फिश स्पीच S2 प्रो

समर्थित संदर्भ-आवाज वर्कफ्लोसह उच्च दर्जाचे स्थानिक भाषण.

बोलण्याचा वेग 0.5× ते 2× पर्यंत सेट केला जाऊ शकतो. व्हॉईस क्लोनिंग फक्त मॉडेल्ससाठी दिसते जे त्यास समर्थन देतात; तुमच्या मालकीचा ऑडिओ वापरा किंवा वापरण्याची परवानगी आहे.

क्लाउड प्रदाता कॅटलॉग

सेटिंग्ज कॅटलॉगमध्ये OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech आणि Microsoft Azure साठी कॉन्फिगरेशन देखील समाविष्ट आहे. उपलब्धता तुम्ही पुरवत असलेल्या प्रदाता कॉन्फिगरेशन आणि क्रेडेन्शियलवर अवलंबून असते.

API क्रेडेन्शियल सेटिंग्जमध्ये राहतात आणि Kaiju Voice च्या बोललेल्या किंवा संरचित सेटिंग्ज सारांशांमधून वगळले जातात.

Kaiju Hub AI वर दिसणारे सर्व तृतीय-पक्ष लोगो, ट्रेडमार्क आणि ब्रँड नावे त्यांच्या संबंधित मालकांच्या मालमत्ता आहेत. त्यांचा वापर केवळ ओळखीसाठी आहे आणि समर्थन, प्रायोजकत्व किंवा संलग्नता सूचित करत नाही.