وائس ٹائپنگ
جائزہ
مقامی ٹرانسکرپشن انجن یا آپریٹنگ سسٹم کی بلٹ ان ڈکٹیشن سروس کا انتخاب کریں۔ دستیابی کا انحصار آپ کے پلیٹ فارم پر ہے اور کون سے اختیاری انجن نصب ہیں۔
تقریر سے متن کیا کرتا ہے۔
جہاں کہیں بھی Kaiju Hub AI مائیکروفون ایکشن پیش کرتا ہے وہاں اسپیچ ٹو ٹیکسٹ آپ کی بات کو قابل تدوین متن میں بدل دیتا ہے۔ ایجنٹ کے اشارے پر حکم دینے کے لیے اس کا استعمال کریں، ایک Kaiju Voice گفتگو جاری رکھیں، اور ٹائپ کیے بغیر طویل ہدایات درج کریں۔ مقامی انجن جیسے کہ Whisper اور Parakeet آپ کی مشین پر ٹرانسکرپشن رکھتے ہیں۔ پلیٹ فارم ڈکٹیشن ونڈوز یا میک او ایس کے ذریعہ فراہم کردہ اسپیچ سروس کا استعمال کرتی ہے۔
دستیاب خدمات
سرگوشی
منتخب ماڈل سائز اور ہارڈویئر ایکسلریشن کے ساتھ لوکل OpenAI Whisper ٹرانسکرپشن۔
NVIDIA Parakeet
اختیاری پیراکیٹ انجن کا استعمال کرتے ہوئے تیز رفتار مقامی تقریر کی شناخت۔
انتہائی تیز سرگوشی
تعاون یافتہ GPU کنفیگریشنز کے لیے ایک آپٹمائزڈ وِسپر پاتھ۔
ونڈوز وائس ٹائپنگ
ونڈوز ڈکٹیشن اور کنفیگرڈ سسٹم ہاٹکی استعمال کرتا ہے۔
ایپل ڈکٹیشن
بلٹ ان macOS ڈکٹیشن سروس استعمال کرتا ہے۔
دستیاب ماڈلز
انسٹالیشن کی حیثیت
KEY: supportContent.appSettingsVoiceWhisper.configureOpenaiWhisperSettingsFor TEXT: مقامی تقریر سے متن میں تبدیلی کے لیے OpenAI Whisper کی ترتیبات کو ترتیب دیں۔ وِسپَر مکمل طور پر آپ کے آلے پر چلتا ہے تاکہ آف لائن، نجی وائس ان پٹ ممکن ہو سکے۔ یہاں سے ماڈلز کو ڈاؤن لوڈ، انسٹال اور ہٹا دیں۔
دستیاب ماڈلز
چھوٹا
74M پیرامیٹرز، ~145 MB ڈاؤن لوڈ، ~7x ریئل ٹائم کی رفتار، 1 GB VRAM کی ضرورت ہے۔
بنیادی
244M پیرامیٹرز، ~465 MB ڈاؤن لوڈ، ~4x ریئل ٹائم کی رفتار، 2 GB VRAM کی ضرورت ہے۔
چھوٹا
769M پیرامیٹرز، ~1.5 GB ڈاؤن لوڈ، ~2x ریئل ٹائم کی رفتار، 5 GB VRAM کی ضرورت ہے۔
درمیانہ
1550M پیرامیٹرز، ~3 GB ڈاؤن لوڈ، 1x ریئل ٹائم کی رفتار، 10 GB VRAM کی ضرورت ہے۔
بڑا
809M پیرامیٹرز، ~1.6 GB ڈاؤن لوڈ، ~8x ریئل ٹائم کی رفتار، 6 GB VRAM کی ضرورت ہے۔
پلیٹ فارم وائس
سپیچ ٹو ٹیکسٹ ٹرانسکرپشن کے لیے Windows Voice Typing کو ترتیب دیں۔ یہ سروس Azure سپیچ سروسز کا استعمال کرتی ہے جو Windows 10 اور بعد کے ورژن میں بنائی گئی ہیں۔ Windows کی سیٹنگز میں سپیچ ریکگنیشن کو فعال کرنے کے لیے سیٹ اپ ہدایات پر عمل کریں۔
مجھے کس وسپر ماڈل کا انتخاب کرنا چاہئے؟
رفتار، میموری کے استعمال اور ٹرانسکرپشن کوالٹی کے عملی توازن کے لیے Small سے شروع کریں۔ جب ہارڈ ویئر محدود ہو تو نیچے کی طرف بڑھیں، یا جب درستگی اور GPU کارکردگی زیادہ اہمیت رکھتی ہو تو Medium، Large، یا Turbo منتخب کریں۔
چھوٹا
ویک ورڈ کا پتہ لگانا، فوری کمانڈز، اور سب سے کم میموری والے سسٹمز پر ٹیسٹنگ۔
بنیادی
معمولی ہارڈ ویئر پر مختصر نوٹس، اشارے، اور عام ڈکٹیشن۔
چھوٹا
ایجنٹ کے اشارے اور طویل ڈکٹیشن کے لیے روزمرہ کا متوازن انتخاب۔
درمیانہ
درستگی پر مرکوز ٹرانسکرپشن جب آپ اضافی پروسیسنگ وقت اور میموری کی تجارت کر سکتے ہیں۔
بڑا
کم از کم 10 GB دستیاب VRAM والے سسٹمز کے لیے سب سے زیادہ درستگی والا مقامی آپشن۔
پلیٹ فارم وائس
کم از کم 6 GB دستیاب VRAM کے ساتھ تعاون یافتہ GPU پر تیز، اعلیٰ معیار کی نقل۔
تنصیب کی حیثیت
39M پیرامیٹرز، ~75 MB ڈاؤن لوڈ، ~10x ریئل ٹائم کی رفتار، 1 GB VRAM کی ضرورت ہے۔
پیراکیٹ اور انتہائی تیز سرگوشی
اختیاری تیز انجن
یہ انجن الگ الگ ڈاؤن لوڈز ہیں لہذا ڈیفالٹ انسٹالیشن چھوٹا رہتا ہے۔ سیٹنگز اسکرین ہر انجن کے لیے انسٹالیشن اور ہارڈویئر کی حیثیت دکھاتی ہے۔
لائیو مقامی ٹرانسکرپشن کے ساتھ بولتے ہی الفاظ کو ظاہر ہوتے دیکھیں۔ Insanely Fast Whisper جدید NVIDIA GPU کے لیے بہتر بنایا گیا ہے؛ Whisper، Parakeet، کلاؤڈ اور پلیٹ فارم اسپیچ کے اختیارات بھی دستیاب ہیں۔
NVIDIA Parakeet
ایک تیز رفتار مقامی اسپیچ ٹو ٹیکسٹ انجن۔ اسے منتخب کرنے سے پہلے وائس ٹائپنگ کی ترتیبات سے اس کا اختیاری رن ٹائم انسٹال کریں۔
انتہائی تیز سرگوشی
مطابقت پذیر GPU سسٹمز کے لیے ایک تیز رفتار وسوسے کا نفاذ۔ استعمال سے پہلے اختیاری انجن انسٹال کریں۔
Kaiju Voice کے ذریعے ایک کو منتخب کرنے سے کبھی بھی خاموشی سے بڑا ڈاؤن لوڈ شروع نہیں ہوتا ہے۔ پہلے اسے سیٹنگز میں انسٹال کریں۔ اس کے بعد اسسٹنٹ دستیابی کی تصدیق کر سکتا ہے اور خدمات کو تبدیل کر سکتا ہے۔
پلیٹ فارم وائس
ونڈوز وائس ٹائپنگ
سسٹم کی ضروریات
ہاٹکی
ڈیفالٹ ٹرگر ہاٹکی: Ctrl+Shift+W۔ آپ کی ترجیح کے مطابق ترتیب دی جا سکتی ہے۔
ٹیسٹ ٹرگر
یہ جانچنے کے لیے کہ آیا وائس ٹائپنگ آپ کے مائیکروفون کے ساتھ صحیح طریقے سے کام کر رہی ہے، ایک ٹیسٹ بٹن۔
ٹیسٹ ٹرگر
ڈیفالٹ ٹرگر ہاٹکی: Ctrl+Shift+D۔ آپ کی ترجیح کے مطابق ترتیب دی جا سکتی ہے۔
Whisper
Windows 10 یا بعد کا ورژن جس میں سسٹم کی سیٹنگز میں سپیچ ریکگنیشن فعال ہے۔
ہاٹکی
یہ جانچنے کے لیے کہ آیا ڈکٹیٹ آپ کے مائیکروفون کے ساتھ صحیح طریقے سے کام کر رہی ہے، ایک ٹیسٹ بٹن۔
ٹیسٹ ٹرگر
ویک ورڈ
ٹیسٹ ٹرگر
ویک ورڈ ایکٹیویشن
ٹیکسٹ ٹو اسپیچ اور اے آئی وائسز
مقامی آواز کے ماڈل
اے آئی برین منتخب انسٹال ماڈل کے ذریعے بولتا ہے۔ ماڈلز کو تبدیل کرنے سے نئے کو لوڈ کرنے سے پہلے پچھلے ماڈل کو اتار دیا جاتا ہے، اور آواز کی فہرست کو اس ماڈل کے ساتھ ہم آہنگ آوازوں پر فلٹر کیا جاتا ہے۔
کوکورو 82 ایم
ایک وسیع بلٹ ان صوتی انتخاب کے ساتھ ہلکی، تیز مقامی تقریر۔
چیٹرباکس ٹربو
کم تاخیر سے اظہار خیال کرنے والی تقریر اور معاون صوتی کلوننگ۔
چیٹر باکس
تاثراتی مقامی ترکیب اور کلوننگ کے لیے مکمل چیٹر باکس ماڈل۔
OmniVoice 0.6B
کمپیکٹ کثیر لسانی مقامی متن سے تقریر۔
OutetTTS 1.0 1B
اس کے اپنے ہم آہنگ آواز کے سیٹ کے ساتھ مقامی اسپیچ جنریشن۔
Qwen3-TTS 1.7B
بڑی کثیر لسانی اور اظہاری مقامی ترکیب۔
Fish Speech S2 Pro
معاون حوالہ آواز ورک فلو کے ساتھ اعلیٰ معیار کی مقامی تقریر۔
تقریر کی رفتار 0.5× سے 2× تک سیٹ کی جا سکتی ہے۔ صوتی کلوننگ صرف ان ماڈلز کے لیے ظاہر ہوتی ہے جو اس کی حمایت کرتے ہیں۔ آڈیو استعمال کریں جو آپ کے پاس ہے یا آپ کو استعمال کرنے کی اجازت ہے۔
کلاؤڈ فراہم کنندہ کیٹلاگ
ترتیبات کے کیٹلاگ میں OpenAI، ElevenLabs، Cartesia، Smallest AI، Fish Audio، Speechmatics، Amazon Polly، Google Cloud Text-to-Speech، اور Microsoft Azure کی ترتیب بھی شامل ہے۔ دستیابی کا انحصار فراہم کنندہ کی ترتیب اور آپ کی فراہم کردہ اسناد پر ہے۔
API کی اسناد سیٹنگز میں رہتی ہیں اور Kaiju Voice کی بولی جانے والی یا سٹرکچرڈ سیٹنگز کے خلاصے سے خارج ہیں۔
