การพิมพ์ด้วยเสียง
ภาพรวม
เลือกกลไกการถอดเสียงในเครื่องหรือบริการเขียนตามคำบอกในตัวของระบบปฏิบัติการของคุณ ความพร้อมใช้งานขึ้นอยู่กับแพลตฟอร์มของคุณและเอ็นจิ้นเสริมที่ติดตั้งอยู่
คำพูดเป็นข้อความทำอะไรได้บ้าง
คำพูดเป็นข้อความเปลี่ยนสิ่งที่คุณพูดให้เป็นข้อความที่แก้ไขได้ทุกที่ที่ Kaiju Hub AI เสนอการกระทำของไมโครโฟน ใช้คำสั่งนี้เพื่อบอกคำสั่งของเจ้าหน้าที่ สนทนาต่อด้วยเสียงของ Kaiju และป้อนคำแนะนำที่ยาวขึ้นโดยไม่ต้องพิมพ์ เอ็นจิ้นท้องถิ่น เช่น Whisper และ Parakeet จะเก็บการถอดเสียงไว้ในเครื่องของคุณ การเขียนตามคำบอกแพลตฟอร์มใช้บริการเสียงพูดของ Windows หรือ macOS
บริการที่มีอยู่
กระซิบ
การถอดเสียง OpenAI Whisper ภายในเครื่องพร้อมขนาดโมเดลที่เลือกได้และการเร่งความเร็วด้วยฮาร์ดแวร์
NVIDIA นกแก้ว
การรู้จำเสียงพูดในท้องถิ่นอย่างรวดเร็วโดยใช้เครื่องมือเสริม Parakeet
กระซิบอย่างรวดเร็วอย่างบ้าคลั่ง
เส้นทาง Whisper ที่ปรับให้เหมาะสมสำหรับการกำหนดค่า GPU ที่รองรับ
การพิมพ์ด้วยเสียงของ Windows
ใช้การเขียนตามคำบอกของ Windows และปุ่มลัดของระบบที่กำหนดค่าไว้
การเขียนตามคำบอกของ Apple
ใช้บริการเขียนตามคำบอก macOS ในตัว
กระซิบ
ตั้งค่า Whisper
กำหนดค่า OpenAI Whisper สำหรับการถอดเสียง speech-to-text ในเครื่อง Whisper ทำงานบนเครื่องของคุณทั้งหมดสำหรับการป้อนข้อมูลเสียงแบบออฟไลน์และส่วนตัว ดาวน์โหลด ติดตั้ง และลบโมเดลโดยตรงจากแท็บนี้
โมเดลที่ใช้ได้
Tiny
39M พารามิเตอร์, ดาวน์โหลด ~75 MB, ความเร็ว ~10x เรียลไทม์, ต้องการ VRAM 1 GB
Base
74M พารามิเตอร์, ดาวน์โหลด ~145 MB, ความเร็ว ~7x เรียลไทม์, ต้องการ VRAM 1 GB
Small
244M พารามิเตอร์, ดาวน์โหลด ~465 MB, ความเร็ว ~4x เรียลไทม์, ต้องการ VRAM 2 GB
Medium
769M พารามิเตอร์, ดาวน์โหลด ~1.5 GB, ความเร็ว ~2x เรียลไทม์, ต้องการ VRAM 5 GB
Large
1550M พารามิเตอร์, ดาวน์โหลด ~3 GB, ความเร็ว 1x เรียลไทม์, ต้องการ VRAM 10 GB
Turbo
809M พารามิเตอร์, ดาวน์โหลด ~1.6 GB, ความเร็ว ~8x เรียลไทม์, ต้องการ VRAM 6 GB
ฉันควรเลือก Whisper รุ่นใด?
เริ่มต้นด้วย Small เพื่อความสมดุลในทางปฏิบัติระหว่างความเร็ว การใช้หน่วยความจำ และคุณภาพการถอดเสียง เลื่อนลงเมื่อฮาร์ดแวร์มีจำกัด หรือเลือก Medium, Large หรือ Turbo เมื่อความแม่นยำและประสิทธิภาพของ GPU มีความสำคัญมากกว่า
Tiny
การตรวจจับคำปลุก คำสั่งด่วน และการทดสอบบนระบบหน่วยความจำต่ำสุด
Base
ข้อความสั้นๆ คำแนะนำ และคำสั่งทั่วไปเกี่ยวกับฮาร์ดแวร์ขนาดเล็ก
Small
ตัวเลือกประจำวันที่สมดุลสำหรับการแจ้งเตือนของเจ้าหน้าที่และการเขียนตามคำบอกที่ยาวขึ้น
Medium
การถอดเสียงที่เน้นความแม่นยำเมื่อคุณสามารถแลกเวลาการประมวลผลและหน่วยความจำเพิ่มเติมได้
Large
ตัวเลือกภายในที่มีความแม่นยำสูงสุดสำหรับระบบที่มี VRAM อย่างน้อย 10 GB
Turbo
การถอดเสียงที่รวดเร็วและมีคุณภาพสูงบน GPU ที่รองรับพร้อม VRAM ที่มีอยู่อย่างน้อย 6 GB
สถานะการติดตั้ง
หน้าตั้งค่าแสดงสถานะการติดตั้งของ dependency ที่จำเป็น:
นกแก้วและกระซิบอย่างรวดเร็วอย่างบ้าคลั่ง
เครื่องยนต์เร็วเสริม
เอ็นจิ้นเหล่านี้เป็นการดาวน์โหลดแยกต่างหาก ดังนั้นการติดตั้งเริ่มต้นจึงมีขนาดเล็ก หน้าจอการตั้งค่าแสดงสถานะการติดตั้งและฮาร์ดแวร์ของแต่ละเครื่องยนต์
ดูคำปรากฏขึ้นขณะที่คุณพูดด้วยการถอดเสียงในเครื่องแบบสด Insanely Fast Whisper ได้รับการปรับให้เหมาะกับ GPU NVIDIA รุ่นใหม่ และยังมี Whisper, Parakeet รวมถึงตัวเลือกเสียงพูดบนคลาวด์และของแพลตฟอร์มให้ใช้งาน
NVIDIA นกแก้ว
เครื่องมือแปลงคำพูดเป็นข้อความท้องถิ่นความเร็วสูง ติดตั้งรันไทม์เสริมจากการตั้งค่าการพิมพ์ด้วยเสียงก่อนที่จะเลือก
กระซิบอย่างรวดเร็วอย่างบ้าคลั่ง
การใช้งาน Whisper แบบเร่งซึ่งมีไว้สำหรับระบบ GPU ที่รองรับ ติดตั้งเครื่องยนต์เสริมก่อนใช้งาน
การเลือกรายการผ่าน Kaiju Voice จะไม่เริ่มการดาวน์โหลดขนาดใหญ่อย่างเงียบๆ ติดตั้งในการตั้งค่าก่อน ผู้ช่วยสามารถตรวจสอบความพร้อมใช้งานและเปลี่ยนบริการได้
เสียงแพลตฟอร์ม
Windows Voice Typing
กำหนดค่า Windows Voice Typing สำหรับการถอดเสียง speech-to-text บริการนี้ใช้ Azure Speech Services ที่มาพร้อม Windows 10 ขึ้นไป ต้องเชื่อมต่ออินเทอร์เน็ต ทำตามคำแนะนำการตั้งค่าเพื่อเปิดใช้งานการรู้จำเสียงในตั้งค่า Windows
ข้อกำหนดระบบ
Windows 10 ขึ้นไปพร้อมเปิดใช้งานการรู้จำเสียงในตั้งค่าระบบ
ปุ่มลัด
ปุ่มลัดเริ่มต้น: Ctrl+Shift+W กำหนดค่าได้ตามความต้องการ
ทดสอบทริกเกอร์
ปุ่มทดสอบเพื่อตรวจสอบว่าการพิมพ์ด้วยเสียงทำงานถูกต้องกับไมโครโฟนของคุณ
Apple Dictation
กำหนดค่า Apple Dictation สำหรับการถอดเสียง speech-to-text บน macOS นี่เป็นฟีเจอร์ดั้งเดิมของ macOS ที่ไม่ต้องตั้งค่าเพิ่มเติมนอกจากการเปิดใช้งานเขียนตามคำบอกในการตั้งค่าระบบ
ข้อกำหนดระบบ
macOS ที่เปิดใช้งานเขียนตามคำบอกในตั้งค่าระบบ > แป้นพิมพ์
ปุ่มลัด
ปุ่มลัดเริ่มต้น: Ctrl+Shift+D กำหนดค่าได้ตามความต้องการ
ทดสอบทริกเกอร์
ปุ่มทดสอบเพื่อตรวจสอบว่าเขียนตามคำบอกทำงานถูกต้องกับไมโครโฟนของคุณ
ข้อความเป็นคำพูดและเสียง AI
โมเดลเสียงท้องถิ่น
AI Brain พูดผ่านโมเดลที่ติดตั้งที่เลือก การเปลี่ยนโมเดลจะเป็นการยกเลิกการโหลดโมเดลก่อนหน้าก่อนที่จะโหลดโมเดลใหม่ และรายการเสียงจะถูกกรองเป็นเสียงที่เข้ากันได้กับโมเดลนั้น
โคโคโระ 82M
คำพูดท้องถิ่นที่เบาและรวดเร็วพร้อมตัวเลือกเสียงในตัวที่กว้าง
แชทเตอร์บ็อกซ์ เทอร์โบ
คำพูดที่แสดงออกในเวลาแฝงต่ำและการโคลนเสียงที่รองรับ
คนพูดพล่อยๆ
โมเดล Chatterbox เต็มรูปแบบสำหรับการสังเคราะห์และการโคลนเฉพาะที่แสดงออก
ออมนิวอยซ์ 0.6B
ข้อความเป็นคำพูดท้องถิ่นหลายภาษาขนาดกะทัดรัด
OuteTTS 1.0 1B
การสร้างคำพูดในท้องถิ่นพร้อมชุดเสียงที่เข้ากันได้ของตัวเอง
คิวเวน3-TTS 1.7B
การสังเคราะห์ในท้องถิ่นที่พูดได้หลายภาษาและแสดงออกมากขึ้น
ปลาคำพูด S2 Pro
คำพูดท้องถิ่นคุณภาพสูงพร้อมเวิร์กโฟลว์เสียงอ้างอิงที่รองรับ
ความเร็วคำพูดสามารถตั้งค่าได้ตั้งแต่ 0.5× ถึง 2× การโคลนเสียงจะปรากฏเฉพาะรุ่นที่รองรับเท่านั้น ใช้เสียงที่คุณเป็นเจ้าของหรือได้รับอนุญาตให้ใช้
แค็ตตาล็อกผู้ให้บริการคลาวด์
แค็ตตาล็อกการตั้งค่ายังรวมถึงการกำหนดค่าสำหรับ OpenAI, ElevenLabs, Cartesia, AI ที่เล็กที่สุด, เสียงปลา, Speechmatics, Amazon Polly, การอ่านออกเสียงข้อความของ Google Cloud และ Microsoft Azure ความพร้อมใช้งานขึ้นอยู่กับการกำหนดค่าของผู้ให้บริการและข้อมูลประจำตัวที่คุณระบุ
ข้อมูลรับรอง API ยังคงอยู่ในการตั้งค่าและแยกออกจากสรุปการตั้งค่าเสียงพูดหรือโครงสร้างของ Kaiju Voice
