Kaiju Hub AI

تایپ صوتی

انتخاب سرویس تایپ صوتی در تنظیمات Kaiju Hub

نمای کلی

یک موتور رونویسی محلی یا سرویس دیکته داخلی سیستم عامل خود را انتخاب کنید. در دسترس بودن بستگی به پلت فرم شما و موتورهای اختیاری نصب شده دارد.

کاری که گفتار به متن انجام می دهد

گفتار به نوشتار هر جا که هوش مصنوعی Kaiju Hub یک عملکرد میکروفون ارائه دهد، آنچه را که می‌گویید به متن قابل ویرایش تبدیل می‌کند. از آن برای دیکته کردن درخواست‌های نماینده، ادامه مکالمه Kaiju Voice و وارد کردن دستورالعمل‌های طولانی‌تر بدون تایپ استفاده کنید. موتورهای محلی مانند Whisper و Parakeet رونویسی را روی دستگاه شما نگه می‌دارند. دیکته پلت فرم از سرویس گفتاری ارائه شده توسط ویندوز یا macOS استفاده می کند.

خدمات موجود

زمزمه کن

رونویسی محلی OpenAI Whisper با اندازه مدل قابل انتخاب و شتاب سخت افزاری.

NVIDIA Parakeet

تشخیص سریع گفتار محلی با استفاده از موتور اختیاری Parakeet.

زمزمه دیوانه کننده سریع

یک مسیر Whisper بهینه برای پیکربندی‌های GPU پشتیبانی‌شده.

تایپ صوتی ویندوز

از دیکته ویندوز و کلید میانبر پیکربندی شده سیستم استفاده می کند.

دیکته سیب

از سرویس دیکته داخلی macOS استفاده می کند.

زمزمه کن

Whisper - گفتار به متن محلی با انتخاب موتور رونویسی و وضعیت نصب

تنظیمات Whisper

تنظیمات OpenAI Whisper را برای تبدیل گفتار به متن محلی پیکربندی کنید. Whisper به طور کامل روی دستگاه شما اجرا می‌شود و ورودی صوتی خصوصی و آفلاین را فراهم می‌کند. مدل‌ها را دانلود، نصب و حذف کنید.

مدل‌های موجود

کوچک

39 میلیون پارامتر، ~75 مگابایت دانلود، ~10 برابر سرعت بلادرنگ، به 1 گیگابایت VRAM نیاز دارد.

استاندارد

74 میلیون پارامتر، ~145 مگابایت دانلود، ~7 برابر سرعت بلادرنگ، به 1 گیگابایت VRAM نیاز دارد.

کوچک

244 میلیون پارامتر، ~465 مگابایت دانلود، ~4 برابر سرعت بلادرنگ، به 2 گیگابایت VRAM نیاز دارد.

متوسط

769 میلیون پارامتر، ~1.5 گیگابایت دانلود، ~2 برابر سرعت بلادرنگ، به 5 گیگابایت VRAM نیاز دارد.

بزرگ

1550 میلیون پارامتر، ~3 گیگابایت دانلود، 1 برابر سرعت بلادرنگ، به 10 گیگابایت VRAM نیاز دارد.

سریع

809 میلیون پارامتر، ~1.6 گیگابایت دانلود، ~8 برابر سرعت بلادرنگ، به 6 گیگابایت VRAM نیاز دارد.

کدام مدل Whisper را انتخاب کنم؟

برای تعادل عملی سرعت، استفاده از حافظه و کیفیت رونویسی با Small شروع کنید. وقتی سخت‌افزار محدود است، به سمت پایین حرکت کنید یا وقتی دقت و عملکرد GPU اهمیت بیشتری دارد، Medium، Large یا Turbo را انتخاب کنید.

کوچک

تشخیص کلمه بیدار، دستورات سریع و آزمایش بر روی سیستم های کم حافظه.

استاندارد

یادداشت‌های کوتاه، اعلان‌ها و دیکته‌های کلی در مورد سخت‌افزار متوسط.

کوچک

یک انتخاب متعادل روزانه برای دستورات نماینده و دیکته طولانی تر.

متوسط

رونویسی متمرکز بر دقت زمانی که می توانید زمان پردازش و حافظه اضافی را مبادله کنید.

بزرگ

گزینه محلی با بالاترین دقت برای سیستم هایی با حداقل 10 گیگابایت VRAM موجود.

سریع

رونویسی سریع و با کیفیت بالا در یک GPU پشتیبانی شده با حداقل 6 گیگابایت VRAM موجود.

وضعیت نصب

صفحه تنظیمات، وضعیت نصب وابستگی‌های مورد نیاز را نشان می‌دهد:

زمزمه کن
FFmpeg
CUDA
UV (Python env)

پاراکیت و زمزمه دیوانه کننده سریع

موتورهای سریع اختیاری

این موتورها دانلودهای جداگانه هستند بنابراین نصب پیش فرض کوچک باقی می ماند. صفحه تنظیمات وضعیت نصب و سخت افزار را برای هر موتور نشان می دهد.

با رونویسی زنده و محلی، واژه‌ها را هم‌زمان با صحبت کردن ببینید. Insanely Fast Whisper برای پردازنده‌های گرافیکی مدرن NVIDIA بهینه شده است و گزینه‌های Whisper، Parakeet، ابری و گفتار داخلی سیستم نیز در دسترس هستند.

NVIDIA Parakeet

یک موتور محلی گفتار به متن با سرعت بالا. قبل از انتخاب زمان اجرا اختیاری آن را از تنظیمات تایپ صوتی نصب کنید.

زمزمه دیوانه کننده سریع

اجرای سریع Whisper که برای سیستم‌های GPU سازگار در نظر گرفته شده است. موتور اختیاری را قبل از استفاده نصب کنید.

انتخاب یکی از طریق Kaiju Voice هرگز یک بارگیری بزرگ را بی سر و صدا شروع نمی کند. ابتدا آن را در تنظیمات نصب کنید. سپس دستیار می تواند در دسترس بودن را تأیید کند و سرویس ها را تغییر دهد.

صدای پلتفرم

Windows Voice Typing — keyboard shortcut configuration and system setup

تایپ صوتی ویندوز

تایپ صوتی ویندوز را برای تبدیل گفتار به متن پیکربندی کنید. این سرویس از سرویس‌های گفتار Azure که در ویندوز 10 و جدیدتر ساخته شده‌اند، استفاده می‌کند. برای فعال کردن تشخیص گفتار در تنظیمات ویندوز، دستورالعمل‌ها را دنبال کنید.

الزامات سیستم

ویندوز 10 یا جدیدتر با فعال بودن تشخیص گفتار در تنظیمات سیستم.

میانبر

میانبر پیش‌فرض: Ctrl+Shift+W. قابل تنظیم به دلخواه شما.

تست فعال‌سازی

دکمه تست برای تأیید اینکه تایپ صوتی به درستی با میکروفون شما کار می‌کند.

دیکته اپل

دیکته اپل را برای تبدیل گفتار به متن در macOS پیکربندی کنید. این یک ویژگی بومی macOS است که به تنظیمات اضافی نیاز ندارد، به جز فعال کردن دیکته در تنظیمات سیستم.

الزامات سیستم

macOS با دیکته فعال در تنظیمات سیستم > صفحه کلید.

میانبر

میانبر پیش‌فرض: Ctrl+Shift+D. قابل تنظیم به دلخواه شما.

تست فعال‌سازی

دکمه تست برای تأیید اینکه دیکته به درستی با میکروفون شما کار می‌کند.

متن به گفتار و صداهای هوش مصنوعی

مدل های صدای محلی

هوش مصنوعی مغز از طریق مدل نصب شده انتخاب شده صحبت می کند. تغییر مدل، مدل قبلی را قبل از بارگیری مدل جدید تخلیه می‌کند و فهرست صوتی برای صداهای سازگار با آن مدل فیلتر می‌شود.

کوکورو 82 م

گفتار محلی سبک و سریع با انتخاب صدای داخلی گسترده.

Chatterbox Turbo

گفتار گویا با تاخیر کم و شبیه سازی صدا پشتیبانی می شود.

چتر باکس

مدل کامل Chatterbox برای سنتز و شبیه سازی محلی بیانی.

OmniVoice 0.6B

متن به گفتار محلی چندزبانه فشرده.

OuteTTS 1.0 1B

تولید گفتار محلی با مجموعه صدای سازگار خود.

Qwen3-TTS 1.7B

سنتز محلی چندزبانه و گویاتر.

Fish Speech S2 Pro

گفتار محلی با کیفیت بالا با پشتیبانی از گردش کار صدای مرجع.

سرعت گفتار را می توان از 0.5× تا 2× تنظیم کرد. شبیه سازی صدا فقط برای مدل هایی که از آن پشتیبانی می کنند ظاهر می شود. از صدایی که مالک آن هستید یا اجازه استفاده از آن را دارید استفاده کنید.

کاتالوگ ارائه دهنده ابر

کاتالوگ تنظیمات همچنین شامل پیکربندی برای OpenAI، ElevenLabs، Cartesia، Smallest AI، Fish Audio، Speechmatics، Amazon Polly، Google Cloud Text to Speech و Microsoft Azure است. در دسترس بودن به پیکربندی ارائه دهنده و اعتبارنامه هایی که ارائه می کنید بستگی دارد.

اعتبارنامه‌های API در تنظیمات باقی می‌مانند و از خلاصه‌های تنظیمات گفتاری یا ساخت‌یافته Kaiju Voice حذف می‌شوند.

تمام لوگوها، علائم تجاری و نام‌های برند شخص ثالث نمایش داده شده در Kaiju Hub AI متعلق به صاحبان مربوطه هستند. استفاده از آن‌ها صرفاً برای اهداف شناسایی است و حمایت، حمایت مالی یا وابستگی را نشان نمی‌دهد.