Kaiju Hub AI

การพิมพ์ด้วยเสียง

การเลือกบริการการพิมพ์ด้วยเสียงในการตั้งค่า Kaiju Hub

ภาพรวม

เลือกกลไกการถอดเสียงในเครื่องหรือบริการเขียนตามคำบอกในตัวของระบบปฏิบัติการของคุณ ความพร้อมใช้งานขึ้นอยู่กับแพลตฟอร์มของคุณและเอ็นจิ้นเสริมที่ติดตั้งอยู่

คำพูดเป็นข้อความทำอะไรได้บ้าง

คำพูดเป็นข้อความเปลี่ยนสิ่งที่คุณพูดให้เป็นข้อความที่แก้ไขได้ทุกที่ที่ Kaiju Hub AI เสนอการกระทำของไมโครโฟน ใช้คำสั่งนี้เพื่อบอกคำสั่งของเจ้าหน้าที่ สนทนาต่อด้วยเสียงของ Kaiju และป้อนคำแนะนำที่ยาวขึ้นโดยไม่ต้องพิมพ์ เอ็นจิ้นท้องถิ่น เช่น Whisper และ Parakeet จะเก็บการถอดเสียงไว้ในเครื่องของคุณ การเขียนตามคำบอกแพลตฟอร์มใช้บริการเสียงพูดของ Windows หรือ macOS

บริการที่มีอยู่

กระซิบ

การถอดเสียง OpenAI Whisper ภายในเครื่องพร้อมขนาดโมเดลที่เลือกได้และการเร่งความเร็วด้วยฮาร์ดแวร์

NVIDIA นกแก้ว

การรู้จำเสียงพูดในท้องถิ่นอย่างรวดเร็วโดยใช้เครื่องมือเสริม Parakeet

กระซิบอย่างรวดเร็วอย่างบ้าคลั่ง

เส้นทาง Whisper ที่ปรับให้เหมาะสมสำหรับการกำหนดค่า GPU ที่รองรับ

การพิมพ์ด้วยเสียงของ Windows

ใช้การเขียนตามคำบอกของ Windows และปุ่มลัดของระบบที่กำหนดค่าไว้

การเขียนตามคำบอกของ Apple

ใช้บริการเขียนตามคำบอก macOS ในตัว

กระซิบ

Whisper — คำพูดเป็นข้อความท้องถิ่นพร้อมการเลือกกลไกการถอดเสียงและสถานะการติดตั้ง

ตั้งค่า Whisper

กำหนดค่า OpenAI Whisper สำหรับการถอดเสียง speech-to-text ในเครื่อง Whisper ทำงานบนเครื่องของคุณทั้งหมดสำหรับการป้อนข้อมูลเสียงแบบออฟไลน์และส่วนตัว ดาวน์โหลด ติดตั้ง และลบโมเดลโดยตรงจากแท็บนี้

โมเดลที่ใช้ได้

Tiny

39M พารามิเตอร์, ดาวน์โหลด ~75 MB, ความเร็ว ~10x เรียลไทม์, ต้องการ VRAM 1 GB

Base

74M พารามิเตอร์, ดาวน์โหลด ~145 MB, ความเร็ว ~7x เรียลไทม์, ต้องการ VRAM 1 GB

Small

244M พารามิเตอร์, ดาวน์โหลด ~465 MB, ความเร็ว ~4x เรียลไทม์, ต้องการ VRAM 2 GB

Medium

769M พารามิเตอร์, ดาวน์โหลด ~1.5 GB, ความเร็ว ~2x เรียลไทม์, ต้องการ VRAM 5 GB

Large

1550M พารามิเตอร์, ดาวน์โหลด ~3 GB, ความเร็ว 1x เรียลไทม์, ต้องการ VRAM 10 GB

Turbo

809M พารามิเตอร์, ดาวน์โหลด ~1.6 GB, ความเร็ว ~8x เรียลไทม์, ต้องการ VRAM 6 GB

ฉันควรเลือก Whisper รุ่นใด?

เริ่มต้นด้วย Small เพื่อความสมดุลในทางปฏิบัติระหว่างความเร็ว การใช้หน่วยความจำ และคุณภาพการถอดเสียง เลื่อนลงเมื่อฮาร์ดแวร์มีจำกัด หรือเลือก Medium, Large หรือ Turbo เมื่อความแม่นยำและประสิทธิภาพของ GPU มีความสำคัญมากกว่า

Tiny

การตรวจจับคำปลุก คำสั่งด่วน และการทดสอบบนระบบหน่วยความจำต่ำสุด

Base

ข้อความสั้นๆ คำแนะนำ และคำสั่งทั่วไปเกี่ยวกับฮาร์ดแวร์ขนาดเล็ก

Small

ตัวเลือกประจำวันที่สมดุลสำหรับการแจ้งเตือนของเจ้าหน้าที่และการเขียนตามคำบอกที่ยาวขึ้น

Medium

การถอดเสียงที่เน้นความแม่นยำเมื่อคุณสามารถแลกเวลาการประมวลผลและหน่วยความจำเพิ่มเติมได้

Large

ตัวเลือกภายในที่มีความแม่นยำสูงสุดสำหรับระบบที่มี VRAM อย่างน้อย 10 GB

Turbo

การถอดเสียงที่รวดเร็วและมีคุณภาพสูงบน GPU ที่รองรับพร้อม VRAM ที่มีอยู่อย่างน้อย 6 GB

สถานะการติดตั้ง

หน้าตั้งค่าแสดงสถานะการติดตั้งของ dependency ที่จำเป็น:

กระซิบ
FFmpeg
CUDA
UV (Python env)

นกแก้วและกระซิบอย่างรวดเร็วอย่างบ้าคลั่ง

เครื่องยนต์เร็วเสริม

เอ็นจิ้นเหล่านี้เป็นการดาวน์โหลดแยกต่างหาก ดังนั้นการติดตั้งเริ่มต้นจึงมีขนาดเล็ก หน้าจอการตั้งค่าแสดงสถานะการติดตั้งและฮาร์ดแวร์ของแต่ละเครื่องยนต์

ดูคำปรากฏขึ้นขณะที่คุณพูดด้วยการถอดเสียงในเครื่องแบบสด Insanely Fast Whisper ได้รับการปรับให้เหมาะกับ GPU NVIDIA รุ่นใหม่ และยังมี Whisper, Parakeet รวมถึงตัวเลือกเสียงพูดบนคลาวด์และของแพลตฟอร์มให้ใช้งาน

NVIDIA นกแก้ว

เครื่องมือแปลงคำพูดเป็นข้อความท้องถิ่นความเร็วสูง ติดตั้งรันไทม์เสริมจากการตั้งค่าการพิมพ์ด้วยเสียงก่อนที่จะเลือก

กระซิบอย่างรวดเร็วอย่างบ้าคลั่ง

การใช้งาน Whisper แบบเร่งซึ่งมีไว้สำหรับระบบ GPU ที่รองรับ ติดตั้งเครื่องยนต์เสริมก่อนใช้งาน

การเลือกรายการผ่าน Kaiju Voice จะไม่เริ่มการดาวน์โหลดขนาดใหญ่อย่างเงียบๆ ติดตั้งในการตั้งค่าก่อน ผู้ช่วยสามารถตรวจสอบความพร้อมใช้งานและเปลี่ยนบริการได้

เสียงแพลตฟอร์ม

Windows Voice Typing — keyboard shortcut configuration and system setup

Windows Voice Typing

กำหนดค่า Windows Voice Typing สำหรับการถอดเสียง speech-to-text บริการนี้ใช้ Azure Speech Services ที่มาพร้อม Windows 10 ขึ้นไป ต้องเชื่อมต่ออินเทอร์เน็ต ทำตามคำแนะนำการตั้งค่าเพื่อเปิดใช้งานการรู้จำเสียงในตั้งค่า Windows

ข้อกำหนดระบบ

Windows 10 ขึ้นไปพร้อมเปิดใช้งานการรู้จำเสียงในตั้งค่าระบบ

ปุ่มลัด

ปุ่มลัดเริ่มต้น: Ctrl+Shift+W กำหนดค่าได้ตามความต้องการ

ทดสอบทริกเกอร์

ปุ่มทดสอบเพื่อตรวจสอบว่าการพิมพ์ด้วยเสียงทำงานถูกต้องกับไมโครโฟนของคุณ

Apple Dictation

กำหนดค่า Apple Dictation สำหรับการถอดเสียง speech-to-text บน macOS นี่เป็นฟีเจอร์ดั้งเดิมของ macOS ที่ไม่ต้องตั้งค่าเพิ่มเติมนอกจากการเปิดใช้งานเขียนตามคำบอกในการตั้งค่าระบบ

ข้อกำหนดระบบ

macOS ที่เปิดใช้งานเขียนตามคำบอกในตั้งค่าระบบ > แป้นพิมพ์

ปุ่มลัด

ปุ่มลัดเริ่มต้น: Ctrl+Shift+D กำหนดค่าได้ตามความต้องการ

ทดสอบทริกเกอร์

ปุ่มทดสอบเพื่อตรวจสอบว่าเขียนตามคำบอกทำงานถูกต้องกับไมโครโฟนของคุณ

ข้อความเป็นคำพูดและเสียง AI

โมเดลเสียงท้องถิ่น

AI Brain พูดผ่านโมเดลที่ติดตั้งที่เลือก การเปลี่ยนโมเดลจะเป็นการยกเลิกการโหลดโมเดลก่อนหน้าก่อนที่จะโหลดโมเดลใหม่ และรายการเสียงจะถูกกรองเป็นเสียงที่เข้ากันได้กับโมเดลนั้น

โคโคโระ 82M

คำพูดท้องถิ่นที่เบาและรวดเร็วพร้อมตัวเลือกเสียงในตัวที่กว้าง

แชทเตอร์บ็อกซ์ เทอร์โบ

คำพูดที่แสดงออกในเวลาแฝงต่ำและการโคลนเสียงที่รองรับ

คนพูดพล่อยๆ

โมเดล Chatterbox เต็มรูปแบบสำหรับการสังเคราะห์และการโคลนเฉพาะที่แสดงออก

ออมนิวอยซ์ 0.6B

ข้อความเป็นคำพูดท้องถิ่นหลายภาษาขนาดกะทัดรัด

OuteTTS 1.0 1B

การสร้างคำพูดในท้องถิ่นพร้อมชุดเสียงที่เข้ากันได้ของตัวเอง

คิวเวน3-TTS 1.7B

การสังเคราะห์ในท้องถิ่นที่พูดได้หลายภาษาและแสดงออกมากขึ้น

ปลาคำพูด S2 Pro

คำพูดท้องถิ่นคุณภาพสูงพร้อมเวิร์กโฟลว์เสียงอ้างอิงที่รองรับ

ความเร็วคำพูดสามารถตั้งค่าได้ตั้งแต่ 0.5× ถึง 2× การโคลนเสียงจะปรากฏเฉพาะรุ่นที่รองรับเท่านั้น ใช้เสียงที่คุณเป็นเจ้าของหรือได้รับอนุญาตให้ใช้

แค็ตตาล็อกผู้ให้บริการคลาวด์

แค็ตตาล็อกการตั้งค่ายังรวมถึงการกำหนดค่าสำหรับ OpenAI, ElevenLabs, Cartesia, AI ที่เล็กที่สุด, เสียงปลา, Speechmatics, Amazon Polly, การอ่านออกเสียงข้อความของ Google Cloud และ Microsoft Azure ความพร้อมใช้งานขึ้นอยู่กับการกำหนดค่าของผู้ให้บริการและข้อมูลประจำตัวที่คุณระบุ

ข้อมูลรับรอง API ยังคงอยู่ในการตั้งค่าและแยกออกจากสรุปการตั้งค่าเสียงพูดหรือโครงสร้างของ Kaiju Voice

โลโก้ เครื่องหมายการค้า และชื่อแบรนด์ของบุคคลที่สามทั้งหมดที่แสดงใน Kaiju Hub AI เป็นทรัพย์สินของเจ้าของที่เกี่ยวข้อง การใช้งานมีไว้เพื่อวัตถุประสงค์ในการระบุตัวตนเท่านั้น และไม่ได้หมายความถึงการรับรอง การสนับสนุน หรือความเกี่ยวข้อง