تایپ صوتی
نمای کلی
یک موتور رونویسی محلی یا سرویس دیکته داخلی سیستم عامل خود را انتخاب کنید. در دسترس بودن بستگی به پلت فرم شما و موتورهای اختیاری نصب شده دارد.
کاری که گفتار به متن انجام می دهد
گفتار به نوشتار هر جا که هوش مصنوعی Kaiju Hub یک عملکرد میکروفون ارائه دهد، آنچه را که میگویید به متن قابل ویرایش تبدیل میکند. از آن برای دیکته کردن درخواستهای نماینده، ادامه مکالمه Kaiju Voice و وارد کردن دستورالعملهای طولانیتر بدون تایپ استفاده کنید. موتورهای محلی مانند Whisper و Parakeet رونویسی را روی دستگاه شما نگه میدارند. دیکته پلت فرم از سرویس گفتاری ارائه شده توسط ویندوز یا macOS استفاده می کند.
خدمات موجود
زمزمه کن
رونویسی محلی OpenAI Whisper با اندازه مدل قابل انتخاب و شتاب سخت افزاری.
NVIDIA Parakeet
تشخیص سریع گفتار محلی با استفاده از موتور اختیاری Parakeet.
زمزمه دیوانه کننده سریع
یک مسیر Whisper بهینه برای پیکربندیهای GPU پشتیبانیشده.
تایپ صوتی ویندوز
از دیکته ویندوز و کلید میانبر پیکربندی شده سیستم استفاده می کند.
دیکته سیب
از سرویس دیکته داخلی macOS استفاده می کند.
زمزمه کن
تنظیمات Whisper
تنظیمات OpenAI Whisper را برای تبدیل گفتار به متن محلی پیکربندی کنید. Whisper به طور کامل روی دستگاه شما اجرا میشود و ورودی صوتی خصوصی و آفلاین را فراهم میکند. مدلها را دانلود، نصب و حذف کنید.
مدلهای موجود
کوچک
39 میلیون پارامتر، ~75 مگابایت دانلود، ~10 برابر سرعت بلادرنگ، به 1 گیگابایت VRAM نیاز دارد.
استاندارد
74 میلیون پارامتر، ~145 مگابایت دانلود، ~7 برابر سرعت بلادرنگ، به 1 گیگابایت VRAM نیاز دارد.
کوچک
244 میلیون پارامتر، ~465 مگابایت دانلود، ~4 برابر سرعت بلادرنگ، به 2 گیگابایت VRAM نیاز دارد.
متوسط
769 میلیون پارامتر، ~1.5 گیگابایت دانلود، ~2 برابر سرعت بلادرنگ، به 5 گیگابایت VRAM نیاز دارد.
بزرگ
1550 میلیون پارامتر، ~3 گیگابایت دانلود، 1 برابر سرعت بلادرنگ، به 10 گیگابایت VRAM نیاز دارد.
سریع
809 میلیون پارامتر، ~1.6 گیگابایت دانلود، ~8 برابر سرعت بلادرنگ، به 6 گیگابایت VRAM نیاز دارد.
کدام مدل Whisper را انتخاب کنم؟
برای تعادل عملی سرعت، استفاده از حافظه و کیفیت رونویسی با Small شروع کنید. وقتی سختافزار محدود است، به سمت پایین حرکت کنید یا وقتی دقت و عملکرد GPU اهمیت بیشتری دارد، Medium، Large یا Turbo را انتخاب کنید.
کوچک
تشخیص کلمه بیدار، دستورات سریع و آزمایش بر روی سیستم های کم حافظه.
استاندارد
یادداشتهای کوتاه، اعلانها و دیکتههای کلی در مورد سختافزار متوسط.
کوچک
یک انتخاب متعادل روزانه برای دستورات نماینده و دیکته طولانی تر.
متوسط
رونویسی متمرکز بر دقت زمانی که می توانید زمان پردازش و حافظه اضافی را مبادله کنید.
بزرگ
گزینه محلی با بالاترین دقت برای سیستم هایی با حداقل 10 گیگابایت VRAM موجود.
سریع
رونویسی سریع و با کیفیت بالا در یک GPU پشتیبانی شده با حداقل 6 گیگابایت VRAM موجود.
وضعیت نصب
صفحه تنظیمات، وضعیت نصب وابستگیهای مورد نیاز را نشان میدهد:
پاراکیت و زمزمه دیوانه کننده سریع
موتورهای سریع اختیاری
این موتورها دانلودهای جداگانه هستند بنابراین نصب پیش فرض کوچک باقی می ماند. صفحه تنظیمات وضعیت نصب و سخت افزار را برای هر موتور نشان می دهد.
با رونویسی زنده و محلی، واژهها را همزمان با صحبت کردن ببینید. Insanely Fast Whisper برای پردازندههای گرافیکی مدرن NVIDIA بهینه شده است و گزینههای Whisper، Parakeet، ابری و گفتار داخلی سیستم نیز در دسترس هستند.
NVIDIA Parakeet
یک موتور محلی گفتار به متن با سرعت بالا. قبل از انتخاب زمان اجرا اختیاری آن را از تنظیمات تایپ صوتی نصب کنید.
زمزمه دیوانه کننده سریع
اجرای سریع Whisper که برای سیستمهای GPU سازگار در نظر گرفته شده است. موتور اختیاری را قبل از استفاده نصب کنید.
انتخاب یکی از طریق Kaiju Voice هرگز یک بارگیری بزرگ را بی سر و صدا شروع نمی کند. ابتدا آن را در تنظیمات نصب کنید. سپس دستیار می تواند در دسترس بودن را تأیید کند و سرویس ها را تغییر دهد.
صدای پلتفرم
تایپ صوتی ویندوز
تایپ صوتی ویندوز را برای تبدیل گفتار به متن پیکربندی کنید. این سرویس از سرویسهای گفتار Azure که در ویندوز 10 و جدیدتر ساخته شدهاند، استفاده میکند. برای فعال کردن تشخیص گفتار در تنظیمات ویندوز، دستورالعملها را دنبال کنید.
الزامات سیستم
ویندوز 10 یا جدیدتر با فعال بودن تشخیص گفتار در تنظیمات سیستم.
میانبر
میانبر پیشفرض: Ctrl+Shift+W. قابل تنظیم به دلخواه شما.
تست فعالسازی
دکمه تست برای تأیید اینکه تایپ صوتی به درستی با میکروفون شما کار میکند.
دیکته اپل
دیکته اپل را برای تبدیل گفتار به متن در macOS پیکربندی کنید. این یک ویژگی بومی macOS است که به تنظیمات اضافی نیاز ندارد، به جز فعال کردن دیکته در تنظیمات سیستم.
الزامات سیستم
macOS با دیکته فعال در تنظیمات سیستم > صفحه کلید.
میانبر
میانبر پیشفرض: Ctrl+Shift+D. قابل تنظیم به دلخواه شما.
تست فعالسازی
دکمه تست برای تأیید اینکه دیکته به درستی با میکروفون شما کار میکند.
متن به گفتار و صداهای هوش مصنوعی
مدل های صدای محلی
هوش مصنوعی مغز از طریق مدل نصب شده انتخاب شده صحبت می کند. تغییر مدل، مدل قبلی را قبل از بارگیری مدل جدید تخلیه میکند و فهرست صوتی برای صداهای سازگار با آن مدل فیلتر میشود.
کوکورو 82 م
گفتار محلی سبک و سریع با انتخاب صدای داخلی گسترده.
Chatterbox Turbo
گفتار گویا با تاخیر کم و شبیه سازی صدا پشتیبانی می شود.
چتر باکس
مدل کامل Chatterbox برای سنتز و شبیه سازی محلی بیانی.
OmniVoice 0.6B
متن به گفتار محلی چندزبانه فشرده.
OuteTTS 1.0 1B
تولید گفتار محلی با مجموعه صدای سازگار خود.
Qwen3-TTS 1.7B
سنتز محلی چندزبانه و گویاتر.
Fish Speech S2 Pro
گفتار محلی با کیفیت بالا با پشتیبانی از گردش کار صدای مرجع.
سرعت گفتار را می توان از 0.5× تا 2× تنظیم کرد. شبیه سازی صدا فقط برای مدل هایی که از آن پشتیبانی می کنند ظاهر می شود. از صدایی که مالک آن هستید یا اجازه استفاده از آن را دارید استفاده کنید.
کاتالوگ ارائه دهنده ابر
کاتالوگ تنظیمات همچنین شامل پیکربندی برای OpenAI، ElevenLabs، Cartesia، Smallest AI، Fish Audio، Speechmatics، Amazon Polly، Google Cloud Text to Speech و Microsoft Azure است. در دسترس بودن به پیکربندی ارائه دهنده و اعتبارنامه هایی که ارائه می کنید بستگی دارد.
اعتبارنامههای API در تنظیمات باقی میمانند و از خلاصههای تنظیمات گفتاری یا ساختیافته Kaiju Voice حذف میشوند.
