Kaiju Hub AI

వాయిస్ టైపింగ్

కైజు హబ్ సెట్టింగ్‌లలో వాయిస్ టైపింగ్ సర్వీస్ ఎంపిక

అవలోకనం

స్థానిక ట్రాన్స్క్రిప్షన్ ఇంజిన్ లేదా మీ ఆపరేటింగ్ సిస్టమ్ యొక్క అంతర్నిర్మిత డిక్టేషన్ సేవను ఎంచుకోండి. లభ్యత మీ ప్లాట్‌ఫారమ్‌పై ఆధారపడి ఉంటుంది మరియు ఏ ఐచ్ఛిక ఇంజిన్‌లు ఇన్‌స్టాల్ చేయబడ్డాయి.

స్పీచ్-టు-టెక్స్ట్ ఏమి చేస్తుంది

కైజు హబ్ AI మైక్రోఫోన్ చర్యను అందించే చోట స్పీచ్ టు టెక్స్ట్ మీరు చెప్పేదాన్ని సవరించగలిగే వచనంగా మారుస్తుంది. ఏజెంట్ ప్రాంప్ట్‌లను నిర్దేశించడానికి, కైజు వాయిస్ సంభాషణను కొనసాగించడానికి మరియు టైప్ చేయకుండా సుదీర్ఘ సూచనలను నమోదు చేయడానికి దీన్ని ఉపయోగించండి. విస్పర్ మరియు పారాకీట్ వంటి స్థానిక ఇంజిన్‌లు మీ మెషీన్‌లో లిప్యంతరీకరణను ఉంచుతాయి; ప్లాట్‌ఫారమ్ డిక్టేషన్ Windows లేదా macOS అందించిన ప్రసంగ సేవను ఉపయోగిస్తుంది.

అందుబాటులో సేవలు

గుసగుసలాడే

ఎంచుకోదగిన మోడల్ పరిమాణం మరియు హార్డ్‌వేర్ త్వరణంతో స్థానిక OpenAI విస్పర్ ట్రాన్స్‌క్రిప్షన్.

NVIDIA పారాకీట్

ఐచ్ఛిక పారాకీట్ ఇంజిన్‌ని ఉపయోగించి వేగవంతమైన స్థానిక ప్రసంగ గుర్తింపు.

అతి వేగంగా విష్పర్

మద్దతు ఉన్న GPU కాన్ఫిగరేషన్‌ల కోసం ఆప్టిమైజ్ చేయబడిన విస్పర్ పాత్.

విండోస్ వాయిస్ టైపింగ్

Windows డిక్టేషన్ మరియు కాన్ఫిగర్ చేయబడిన సిస్టమ్ హాట్‌కీని ఉపయోగిస్తుంది.

ఆపిల్ డిక్టేషన్

అంతర్నిర్మిత macOS డిక్టేషన్ సేవను ఉపయోగిస్తుంది.

విస్పర్‌

విష్పర్ — ట్రాన్స్క్రిప్షన్ ఇంజిన్ ఎంపిక మరియు ఇన్‌స్టాలేషన్ స్థితితో స్థానిక స్పీచ్-టు-టెక్స్ట్

విస్పర్‌ సెట్టింగ్‌లు

స్థానిక స్పీచ్-టు-టెక్స్ట్ ట్రాన్స్‌క్రిప్షన్ కోసం OpenAI విస్పర్‌ సెట్టింగ్‌లను కాన్ఫిగర్ చేయండి. విస్పర్ పూర్తిగా మీ మెషీన్‌లో నడుస్తుంది, ఆఫ్‌లైన్, ప్రైవేట్ వాయిస్ ఇన్‌పుట్ కోసం. నమూనాలను డౌన్‌లోడ్ చేయండి, ఇన్‌స్టాల్ చేయండి మరియు వాటిని నేరుగా ఈ ట్యాబ్ నుండి తొలగించండి.

అందుబాటులో ఉన్న నమూనాలు

చిన్నది

39M పారామితులు, ~75 MB డౌన్‌లోడ్, ~10x రియల్ టైమ్ వేగం, 1 GB VRAM అవసరం.

బేస్

74M పారామితులు, ~145 MB డౌన్‌లోడ్, ~7x రియల్ టైమ్ వేగం, 1 GB VRAM అవసరం.

చిన్నది

244M పారామితులు, ~465 MB డౌన్‌లోడ్, ~4x రియల్ టైమ్ వేగం, 2 GB VRAM అవసరం.

మధ్యస్థం

769M పారామితులు, ~1.5 GB డౌన్‌లోడ్, ~2x రియల్ టైమ్ వేగం, 5 GB VRAM అవసరం.

పెద్దది

1550M పారామితులు, ~3 GB డౌన్‌లోడ్, 1x రియల్ టైమ్ వేగం, 10 GB VRAM అవసరం.

టర్బో

809M పారామితులు, ~1.6 GB డౌన్‌లోడ్, ~8x రియల్ టైమ్ వేగం, 6 GB VRAM అవసరం.

నేను ఏ విస్పర్ మోడల్‌ని ఎంచుకోవాలి?

వేగం, మెమరీ వినియోగం మరియు ట్రాన్స్‌క్రిప్షన్ నాణ్యత యొక్క ఆచరణాత్మక బ్యాలెన్స్ కోసం Smallతో ప్రారంభించండి. హార్డ్‌వేర్ పరిమితంగా ఉన్నప్పుడు క్రిందికి తరలించండి లేదా ఖచ్చితత్వం మరియు GPU పనితీరు ఎక్కువగా ఉన్నప్పుడు Medium, Large లేదా Turboను ఎంచుకోండి.

చిన్నది

వేక్-వర్డ్ డిటెక్షన్, శీఘ్ర ఆదేశాలు మరియు తక్కువ-మెమరీ సిస్టమ్‌లపై పరీక్ష.

బేస్

నిరాడంబరమైన హార్డ్‌వేర్‌పై చిన్న గమనికలు, ప్రాంప్ట్‌లు మరియు సాధారణ డిక్టేషన్.

చిన్నది

ఏజెంట్ ప్రాంప్ట్‌లు మరియు సుదీర్ఘ డిక్టేషన్ కోసం సమతుల్య రోజువారీ ఎంపిక.

మధ్యస్థం

మీరు అదనపు ప్రాసెసింగ్ సమయం మరియు మెమరీని వర్తకం చేయగలిగినప్పుడు ఖచ్చితత్వం-ఫోకస్డ్ ట్రాన్స్‌క్రిప్షన్.

పెద్దది

కనీసం 10 GB అందుబాటులో ఉన్న VRAM ఉన్న సిస్టమ్‌ల కోసం అత్యధిక ఖచ్చితత్వ స్థానిక ఎంపిక.

టర్బో

కనీసం 6 GB అందుబాటులో ఉన్న VRAMతో మద్దతు ఉన్న GPUలో వేగవంతమైన, అధిక-నాణ్యత ట్రాన్స్‌క్రిప్షన్.

ఇన్‌స్టాలేషన్ స్థితి

కింది అవసరమైన డిపెండెన్సీల ఇన్‌స్టాలేషన్ స్థితిని సెట్టింగ్‌ల పేజీ చూపుతుంది:

గుసగుసలాడే
FFmpeg
CUDA
UV (Python env)

పారాకీట్ మరియు అతి వేగంగా విష్పర్

ఐచ్ఛిక ఫాస్ట్ ఇంజన్లు

ఈ ఇంజన్‌లు ప్రత్యేక డౌన్‌లోడ్‌లు కాబట్టి డిఫాల్ట్ ఇన్‌స్టాలేషన్ చిన్నగా ఉంటుంది. సెట్టింగ్‌ల స్క్రీన్ ప్రతి ఇంజిన్‌కు ఇన్‌స్టాలేషన్ మరియు హార్డ్‌వేర్ స్థితిని చూపుతుంది.

లైవ్ లోకల్ ట్రాన్స్‌క్రిప్షన్‌తో మీరు మాట్లాడుతుండగానే పదాలు కనిపించడాన్ని చూడండి. Insanely Fast Whisper ఆధునిక NVIDIA GPUల కోసం ఆప్టిమైజ్ చేయబడింది; Whisper, Parakeet, క్లౌడ్ మరియు ప్లాట్‌ఫారమ్ స్పీచ్ ఎంపికలు కూడా అందుబాటులో ఉన్నాయి.

NVIDIA పారాకీట్

హై-స్పీడ్ లోకల్ స్పీచ్-టు-టెక్స్ట్ ఇంజన్. దాన్ని ఎంచుకునే ముందు వాయిస్ టైపింగ్ సెట్టింగ్‌ల నుండి దాని ఐచ్ఛిక రన్‌టైమ్‌ను ఇన్‌స్టాల్ చేయండి.

అతి వేగంగా విష్పర్

అనుకూలమైన GPU సిస్టమ్‌ల కోసం ఉద్దేశించిన వేగవంతమైన విస్పర్ అమలు. ఉపయోగించడానికి ముందు ఐచ్ఛిక ఇంజిన్‌ను ఇన్‌స్టాల్ చేయండి.

కైజు వాయిస్ ద్వారా ఒకదాన్ని ఎంచుకోవడం వలన పెద్ద డౌన్‌లోడ్ నిశ్శబ్దంగా ప్రారంభించబడదు. దీన్ని ముందుగా సెట్టింగ్‌లలో ఇన్‌స్టాల్ చేయండి; సహాయకుడు అప్పుడు లభ్యతను ధృవీకరించవచ్చు మరియు సేవలను మార్చవచ్చు.

ప్లాట్‌ఫారమ్ వాయిస్

Windows Voice Typing — keyboard shortcut configuration and system setup

Windows వాయిస్ టైపింగ్

స్పీచ్-టు-టెక్స్ట్ ట్రాన్స్‌క్రిప్షన్ కోసం Windows వాయిస్ టైపింగ్‌ను కాన్ఫిగర్ చేయండి. ఈ సేవ Windows 10 మరియు తర్వాతి వాటిలో నిర్మించబడిన Azure స్పీచ్ సర్వీసెస్‌ను ఉపయోగిస్తుంది. ఇంటర్నెట్ కనెక్షన్ అవసరం. Windows సెట్టింగ్‌లలో స్పీచ్ రికగ్నిషన్‌ను ప్రారంభించడానికి సూచనలను అనుసరించండి.

సిస్టమ్ అవసరాలు

సిస్టమ్ సెట్టింగ్‌లలో స్పీచ్ రికగ్నిషన్‌తో Windows 10 లేదా తర్వాతిది.

హాట్‌కీ

డిఫాల్ట్ ట్రిగ్గర్ హాట్‌కీ: Ctrl+Shift+W. మీ ప్రాధాన్యతకు అనుగుణంగా కాన్ఫిగర్ చేయవచ్చు.

ట్రిగ్గర్‌ను పరీక్షించండి

వాయిస్ టైపింగ్ సరిగ్గా పనిచేస్తుందో లేదో ధృవీకరించడానికి పరీక్ష బటన్.

Apple డిక్టేషన్

స్పీచ్-టు-టెక్స్ట్ ట్రాన్స్‌క్రిప్షన్ కోసం macOSలో Apple డిక్టేషన్‌ను కాన్ఫిగర్ చేయండి. ఇది అదనపు సెటప్ అవసరం లేకుండా macOSలో అంతర్నిర్మిత ఫీచర్. macOS సిస్టమ్ సెట్టింగ్‌లలో డిక్టేషన్‌ను ప్రారంభించండి.

సిస్టమ్ అవసరాలు

macOS, సిస్టమ్ సెట్టింగ్‌లు > కీబోర్డ్‌లో డిక్టేషన్‌తో.

హాట్‌కీ

డిఫాల్ట్ ట్రిగ్గర్ హాట్‌కీ: Ctrl+Shift+D. మీ ప్రాధాన్యతకు అనుగుణంగా కాన్ఫిగర్ చేయవచ్చు.

ట్రిగ్గర్‌ను పరీక్షించండి

డిక్టేషన్ సరిగ్గా పనిచేస్తుందో లేదో ధృవీకరించడానికి పరీక్ష బటన్.

టెక్స్ట్ టు స్పీచ్ మరియు AI వాయిస్‌లు

స్థానిక వాయిస్ మోడల్స్

ఎంచుకున్న ఇన్‌స్టాల్ చేసిన మోడల్ ద్వారా AI బ్రెయిన్ మాట్లాడుతుంది. కొత్త మోడల్‌ను లోడ్ చేయడానికి ముందు మోడల్‌లను మార్చడం మునుపటి మోడల్‌ను అన్‌లోడ్ చేస్తుంది మరియు వాయిస్ జాబితా ఆ మోడల్‌కు అనుకూలమైన వాయిస్‌లకు ఫిల్టర్ చేయబడుతుంది.

కోకోరో 82M

విస్తృత అంతర్నిర్మిత వాయిస్ ఎంపికతో తేలికైన, వేగవంతమైన స్థానిక ప్రసంగం.

చటర్‌బాక్స్ టర్బో

తక్కువ జాప్యం వ్యక్తీకరణ ప్రసంగం మరియు వాయిస్ క్లోనింగ్ మద్దతు.

కబుర్లు

వ్యక్తీకరణ స్థానిక సంశ్లేషణ మరియు క్లోనింగ్ కోసం పూర్తి Chatterbox మోడల్.

ఓమ్నివాయిస్ 0.6B

కాంపాక్ట్ బహుభాషా స్థానిక టెక్స్ట్-టు-స్పీచ్.

OuteTTS 1.0 1B

దాని స్వంత అనుకూల వాయిస్ సెట్‌తో స్థానిక ప్రసంగం ఉత్పత్తి.

Qwen3-TTS 1.7B

పెద్ద బహుభాషా మరియు వ్యక్తీకరణ స్థానిక సంశ్లేషణ.

ఫిష్ స్పీచ్ S2 ప్రో

మద్దతు ఉన్న రిఫరెన్స్-వాయిస్ వర్క్‌ఫ్లోలతో అధిక నాణ్యత గల స్థానిక ప్రసంగం.

ప్రసంగ వేగాన్ని 0.5× నుండి 2× వరకు సెట్ చేయవచ్చు. వాయిస్ క్లోనింగ్ మద్దతు ఇచ్చే మోడల్‌లకు మాత్రమే కనిపిస్తుంది; మీకు స్వంతమైన లేదా ఉపయోగించడానికి అనుమతి ఉన్న ఆడియోను ఉపయోగించండి.

క్లౌడ్ ప్రొవైడర్ కేటలాగ్

సెట్టింగ్‌ల కేటలాగ్‌లో OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech మరియు Microsoft Azure కోసం కాన్ఫిగరేషన్ కూడా ఉంది. మీరు అందించే ప్రొవైడర్ కాన్ఫిగరేషన్ మరియు ఆధారాలపై లభ్యత ఆధారపడి ఉంటుంది.

API ఆధారాలు సెట్టింగ్‌లలోనే ఉంటాయి మరియు Kaiju Voice యొక్క మాట్లాడే లేదా నిర్మాణాత్మక సెట్టింగ్‌ల సారాంశాల నుండి మినహాయించబడ్డాయి.

Kaiju Hub AI లో ప్రదర్శించబడే అన్ని థర్డ్-పార్టీ లోగోలు, ట్రేడ్‌మార్క్‌లు మరియు బ్రాండ్ పేర్లు వారి సంబంధిత యజమానుల ఆస్తి. వాటి వినియోగం గుర్తింపు ప్రయోజనాల కోసం మాత్రమే మరియు ఆమోదం, స్పాన్సర్‌షిప్ లేదా అనుబంధాన్ని సూచించదు.