הקלדה קולית
סקירה כללית
בחר במנוע תמלול מקומי או בשירות ההכתבה המובנה של מערכת ההפעלה שלך. הזמינות תלויה בפלטפורמה שלך ובאילו מנועים אופציונליים מותקנים.
מה שדיבור לטקסט עושה
דיבור לטקסט הופך את מה שאתה אומר לטקסט הניתן לעריכה בכל מקום שבו Kaiju Hub AI מציע פעולת מיקרופון. השתמש בו כדי להכתיב הנחיות לסוכן, להמשיך בשיחת Kaiju Voice ולהזין הוראות ארוכות יותר מבלי להקליד. מנועים מקומיים כגון Whisper ו- Parakeet שומרים על התמלול במכונה שלך; הכתבת פלטפורמה משתמשת בשירות הדיבור המסופק על ידי Windows או macOS.
שירותים זמינים
לחשה
תמלול OpenAI Whisper מקומי עם גודל דגם הניתן לבחירה והאצת חומרה.
תוכי NVIDIA
זיהוי דיבור מקומי מהיר באמצעות מנוע Parakeet האופציונלי.
לחישה מהירה בטירוף
נתיב Whisper אופטימלי עבור תצורות GPU נתמכות.
הקלדה קולית של Windows
משתמש בהכתבת Windows ובמקש הקיצור של המערכת המוגדר.
הכתבה של אפל
משתמש בשירות ההכתבה המובנה של macOS.
לחשה
הגדרות Whisper
הגדר את הגדרות OpenAI Whisper לתמלול דיבור לטקסט מקומי. Whisper פועל כולו במחשב שלך לקלט קולי מקוון ופרטי. הורד, התקן והסר מודלים ישירות מכרטיסייה זו.
מודלים זמינים
קטן
39 מיליון פרמטרים, ~75MB להורדה, ~מהירות בזמן אמת פי 10, דורש 1GB VRAM.
בסיסי
74 מיליון פרמטרים, ~145MB להורדה, ~מהירות בזמן אמת פי 7, דורש 1GB VRAM.
קטן
244 מיליון פרמטרים, ~465MB להורדה, ~מהירות בזמן אמת פי 4, דורש 2GB VRAM.
בינוני
769 מיליון פרמטרים, ~1.5GB להורדה, ~מהירות בזמן אמת פי 2, דורש 5GB VRAM.
גדול
1550 מיליון פרמטרים, ~3GB להורדה, מהירות בזמן אמת פי 1, דורש 10GB VRAM.
טורבו
809 מיליון פרמטרים, ~1.6GB להורדה, ~מהירות בזמן אמת פי 8, דורש 6GB VRAM.
איזה דגם Whisper כדאי לי לבחור?
התחל עם Small לאיזון מעשי של מהירות, שימוש בזיכרון ואיכות תמלול. זז למטה כאשר החומרה מוגבלת, או בחר Medium, Large או Turbo כאשר הדיוק וביצועי ה-GPU חשובים יותר.
קטן
זיהוי מילות התעוררות, פקודות מהירות ובדיקה במערכות בעלות הזיכרון הנמוך ביותר.
בסיסי
הערות קצרות, הנחיות והכתבה כללית על חומרה צנועה.
קטן
בחירה יומיומית מאוזנת להנחיות סוכן והכתבה ארוכה יותר.
בינוני
תמלול ממוקד דיוק כאשר אתה יכול להחליף זמן עיבוד וזיכרון נוספים.
גדול
האפשרות המקומית בעלת הדיוק הגבוה ביותר עבור מערכות עם לפחות 10 GB של VRAM זמין.
טורבו
תמלול מהיר ואיכותי ב-GPU נתמך עם לפחות 6 GB של VRAM זמין.
סטטוס התקנה
הדף ההגדרות מציג את סטטוס ההתקנה של התלות הנדרשת:
תוכי ולחישה מהירה בטירוף
אופציונלי מנועים מהירים
מנועים אלה הם הורדות נפרדות כך שהתקנת ברירת המחדל נשארת קטנה. מסך ההגדרות מציג את מצב ההתקנה וחומרה עבור כל מנוע.
ראו את המילים מופיעות בזמן הדיבור באמצעות תמלול מקומי חי. Insanely Fast Whisper מותאם למעבדי GPU מודרניים של NVIDIA, ובנוסף זמינות אפשרויות Whisper, Parakeet, ענן ושירותי דיבור מובנים במערכת.
תוכי NVIDIA
מנוע דיבור לטקסט מקומי במהירות גבוהה. התקן את זמן הריצה האופציונלי שלו מהגדרות הקלדה קולית לפני בחירתו.
לחישה מהירה בטירוף
יישום Whisper מואץ המיועד למערכות GPU תואמות. התקן את המנוע האופציונלי לפני השימוש.
בחירה באחד דרך Kaiju Voice אף פעם לא מתחילה הורדה גדולה בשקט. התקן אותו תחילה בהגדרות; לאחר מכן, העוזר יכול לאמת זמינות ולהחליף שירותים.
קול של פלטפורמה
הקלדה קולית של Windows
הגדר את ההקלדה הקולית של Windows לתמלול דיבור לטקסט. שירות זה משתמש בשירותי דיבור של Azure המובנים ב-Windows 10 ומעלה. נדרש חיבור לאינטרנט. עקוב אחר הוראות ההגדרה כדי להפעיל זיהוי דיבור בהגדרות המערכת.
דרישות מערכת
Windows 10 ומעלה עם זיהוי דיבור מופעל בהגדרות המערכת.
קיצור מקלדת
קיצור המקלדת המוגדר כברירת מחדל: Ctrl+Shift+W. ניתן להגדרה לפי העדפתך.
בדוק טריגר
כפתור בדיקה כדי לוודא שהקלדה קולית פועלת כהלכה עם המיקרופון שלך.
הכתבה של אפל
הגדר את Apple Dictation לתמלול דיבור לטקסט ב-macOS. זהו תכונה מקורית של macOS ללא צורך בהגדרה נוספת מעבר להפעלת הכתבה בהגדרות המערכת.
דרישות מערכת
macOS עם הכתבה מופעלת בהגדרות המערכת.
קיצור מקלדת
קיצור המקלדת המוגדר כברירת מחדל: Ctrl+Shift+D. ניתן להגדרה לפי העדפתך.
בדוק טריגר
כפתור בדיקה כדי לוודא שהכתבה פועלת כהלכה עם המיקרופון שלך.
טקסט לדיבור וקולות בינה מלאכותית
דגמי קול מקומיים
AI Brain מדבר דרך הדגם המותקן הנבחר. שינוי דגמים פורק את הדגם הקודם לפני טעינת הדגם החדש, ורשימת הקולות מסוננת לקולות התואמים לדגם זה.
קוקורו 82M
דיבור מקומי קל ומהיר עם מבחר קולי מובנה רחב.
Chatterbox Turbo
דיבור אקספרסיבי עם אחזור נמוך ושיבוט קול נתמך.
Chatterbox
המודל המלא של Chatterbox לסינתזה ושיבוט מקומיים אקספרסיביים.
OmniVoice 0.6B
טקסט לדיבור מקומי קומפקטי רב לשוני.
OuteTTS 1.0 1B
יצירת דיבור מקומי עם סט קול תואם משלו.
Qwen3-TTS 1.7B
סינתזה מקומית רב לשונית ואקספרסיבית גדולה יותר.
Fish Speech S2 Pro
דיבור מקומי איכותי עם זרימות עבודה נתמכות של הפניה קולית.
ניתן להגדיר את מהירות הדיבור מ-0.5× עד 2×. שיבוט קול מופיע רק עבור דגמים התומכים בו; השתמש באודיו שבבעלותך או שיש לך הרשאה להשתמש בו.
קטלוג ספקי ענן
קטלוג ההגדרות כולל גם תצורה עבור OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech ו-Microsoft Azure. הזמינות תלויה בתצורת הספק ובאישורים שאתה מספק.
אישורי API נשארים בהגדרות ואינם נכללים בסיכומי ההגדרות המדוברות או המובנות של Kaiju Voice.
