Kaiju Hub AI

الكتابة الصوتية

اختيار خدمة الكتابة الصوتية في إعدادات Kaiju Hub

نظرة عامة

اختر محرك النسخ المحلي أو خدمة الإملاء المضمنة في نظام التشغيل الخاص بك. يعتمد التوفر على النظام الأساسي الخاص بك والمحركات الاختيارية المثبتة.

ما يفعله تحويل الكلام إلى نص

يحول الكلام إلى نص ما تقوله إلى نص قابل للتحرير أينما يوفر Kaiju Hub AI إجراء الميكروفون. استخدمه لإملاء مطالبات الوكيل، ومتابعة محادثة Kaiju Voice، وإدخال تعليمات أطول دون الكتابة. تحتفظ المحركات المحلية، مثل Whisper وParakeet، بالنسخ على جهازك؛ يستخدم إملاء النظام الأساسي خدمة الكلام التي يوفرها Windows أو macOS.

الخدمات المتاحة

الهمس

النسخ المحلي لـ OpenAI Whisper مع حجم نموذج قابل للتحديد وتسريع الأجهزة.

نفيديا ببغاء

التعرف السريع على الكلام المحلي باستخدام محرك Parakeet الاختياري.

الهمس السريع بجنون

مسار Whisper محسّن لتكوينات GPU المدعومة.

الكتابة الصوتية في ويندوز

يستخدم إملاء Windows ومفتاح التشغيل السريع للنظام الذي تم تكوينه.

إملاء أبل

يستخدم خدمة الإملاء المضمنة في macOS.

الهمس

Whisper — تحويل الكلام إلى نص محلي مع تحديد محرك النسخ وحالة التثبيت

إعدادات Whisper

كوّن إعدادات OpenAI Whisper لتحويل الكلام إلى نص محلياً. يعمل Whisper بالكامل على جهازك لإدخال صوتي بدون اتصال وخاص. نزّل وثبّت واحذف النماذج مباشرة من هذا التبويب.

النماذج المتاحة

Tiny

39 مليون معامل، ~75 ميجابايت تنزيل، سرعة ~10x في الوقت الفعلي، يتطلب 1 جيجابايت VRAM.

Base

74 مليون معامل، ~145 ميجابايت تنزيل، سرعة ~7x في الوقت الفعلي، يتطلب 1 جيجابايت VRAM.

Small

244 مليون معامل، ~465 ميجابايت تنزيل، سرعة ~4x في الوقت الفعلي، يتطلب 2 جيجابايت VRAM.

Medium

769 مليون معامل، ~1.5 جيجابايت تنزيل، سرعة ~2x في الوقت الفعلي، يتطلب 5 جيجابايت VRAM.

Large

1550 مليون معامل، ~3 جيجابايت تنزيل، سرعة 1x في الوقت الفعلي، يتطلب 10 جيجابايت VRAM.

Turbo

809 مليون معامل، ~1.6 جيجابايت تنزيل، سرعة ~8x في الوقت الفعلي، يتطلب 6 جيجابايت VRAM.

ما هو نموذج Whisper الذي يجب أن أختاره؟

ابدأ بنموذج Small لتحقيق توازن عملي بين السرعة واستخدام الذاكرة وجودة النسخ. انتقل للأسفل عندما تكون الأجهزة محدودة، أو اختر Medium أو Large أو Turbo عندما تكون الدقة وأداء وحدة معالجة الرسومات أكثر أهمية.

Tiny

اكتشاف كلمة التنبيه، والأوامر السريعة، والاختبار على أنظمة الذاكرة المنخفضة.

Base

ملاحظات قصيرة، ومطالبات، وإملاء عام على الأجهزة المتواضعة.

Small

خيار يومي متوازن لمطالبات الوكيل والإملاء لفترة أطول.

Medium

النسخ الذي يركز على الدقة عندما يمكنك استبدال وقت المعالجة والذاكرة الإضافية.

Large

الخيار المحلي الأعلى دقة للأنظمة التي تحتوي على 10 جيجابايت على الأقل من VRAM المتوفرة.

Turbo

نسخ سريع وعالي الجودة على وحدة معالجة الرسومات المدعومة مع ما لا يقل عن 6 جيجابايت من VRAM المتوفرة.

حالة التثبيت

تعرض صفحة الإعدادات حالة تثبيت التبعيات المطلوبة:

الهمس
FFmpeg
CUDA
UV (Python env)

الببغاء والهمس السريع بجنون

محركات سريعة اختيارية

هذه المحركات عبارة عن تنزيلات منفصلة لذا يظل التثبيت الافتراضي صغيرًا. تعرض شاشة الإعدادات حالة التثبيت والأجهزة لكل محرك.

شاهد الكلمات تظهر أثناء التحدث بفضل النسخ المحلي المباشر. تم تحسين Insanely Fast Whisper لوحدات معالجة الرسومات الحديثة من NVIDIA، مع توفر خيارات Whisper وParakeet والنسخ السحابي وخدمات النطق المدمجة في النظام.

نفيديا ببغاء

محرك تحويل الكلام إلى نص محلي عالي السرعة. قم بتثبيت وقت التشغيل الاختياري الخاص به من إعدادات الكتابة الصوتية قبل تحديده.

الهمس السريع بجنون

تطبيق Whisper سريع مخصص لأنظمة GPU المتوافقة. قم بتثبيت المحرك الاختياري قبل الاستخدام.

لا يؤدي تحديد واحد من خلال Kaiju Voice إلى بدء عملية تنزيل كبيرة بصمت. قم بتثبيته في الإعدادات أولاً؛ يمكن للمساعد بعد ذلك التحقق من التوفر وتبديل الخدمات.

صوت المنصة

Windows Voice Typing — keyboard shortcut configuration and system setup

الكتابة الصوتية لـ Windows

كوّن الكتابة الصوتية لـ Windows لتحويل الكلام إلى نص. تستخدم هذه الخدمة Azure Speech Services المدمجة في Windows 10 والإصدارات الأحدث. يتطلب اتصالاً بالإنترنت. اتبع تعليمات الإعداد لتمكين التعرف على الكلام في إعدادات Windows.

متطلبات النظام

Windows 10 أو أحدث مع تمكين التعرف على الكلام في إعدادات النظام.

مفتاح الاختصار

مفتاح الاختصار الافتراضي: Ctrl+Shift+W. قابل للتكوين حسب تفضيلك.

اختبار التفعيل

زر اختبار للتحقق من أن الكتابة الصوتية تعمل بشكل صحيح مع الميكروفون.

إملاء Apple

كوّن إملاء Apple لتحويل الكلام إلى نص على macOS. هذه ميزة أصلية في macOS لا تتطلب إعداداً إضافياً بخلاف تمكين الإملاء في إعدادات النظام.

متطلبات النظام

macOS مع تمكين الإملاء في إعدادات النظام > لوحة المفاتيح.

مفتاح الاختصار

مفتاح الاختصار الافتراضي: Ctrl+Shift+D. قابل للتكوين حسب تفضيلك.

اختبار التفعيل

زر اختبار للتحقق من أن الإملاء يعمل بشكل صحيح مع الميكروفون.

تحويل النص إلى كلام وأصوات الذكاء الاصطناعي

نماذج صوتية محلية

يتحدث AI Brain من خلال النموذج المثبت المحدد. يؤدي تغيير النماذج إلى إلغاء تحميل النموذج السابق قبل تحميل النموذج الجديد، وتتم تصفية قائمة الصوت إلى الأصوات المتوافقة مع هذا النموذج.

كوكورو 82 م

خطاب محلي خفيف الوزن وسريع مع مجموعة واسعة من الخيارات الصوتية المدمجة.

صندوق الدردشة توربو

الكلام التعبيري منخفض الكمون واستنساخ الصوت المدعوم.

صندوق الثرثرة

نموذج Chatterbox الكامل للتوليف والاستنساخ المحلي المعبر.

أومني فويس 0.6B

تحويل النص إلى كلام محلي متعدد اللغات.

أوت تي تي إس 1.0 1 ب

توليد الكلام المحلي مع مجموعة الصوت المتوافقة الخاصة به.

Qwen3-TTS 1.7B

تركيب محلي أكبر متعدد اللغات ومعبر.

خطاب السمك S2 برو

خطاب محلي عالي الجودة مع سير عمل صوتي مرجعي مدعوم.

يمكن ضبط سرعة الكلام من 0.5× إلى 2×. يظهر استنساخ الصوت فقط للنماذج التي تدعمه؛ استخدام الصوت الذي تملكه أو لديك إذن باستخدامه.

كتالوج مزود السحابة

يتضمن كتالوج الإعدادات أيضًا تكوينات لـ OpenAI وElevenLabs وCartesia وSmallest AI وFish Audio وSpeechmatics وAmazon Polly وGoogle Cloud Text to Speech وMicrosoft Azure. يعتمد التوفر على تكوين الموفر وبيانات الاعتماد التي تقدمها.

تظل بيانات اعتماد API في الإعدادات ويتم استبعادها من ملخصات الإعدادات المنطوقة أو المنظمة لـ Kaiju Voice.

جميع الشعارات والعلامات التجارية والأسماء التجارية التابعة لجهات خارجية المعروضة في Kaiju Hub AI هي ملك لأصحابها. استخدامها هو فقط لأغراض تحديد الهوية ولا يعني التأييد أو الرعاية أو الانتماء.