వాయిస్ టైపింగ్
అవలోకనం
స్థానిక ట్రాన్స్క్రిప్షన్ ఇంజిన్ లేదా మీ ఆపరేటింగ్ సిస్టమ్ యొక్క అంతర్నిర్మిత డిక్టేషన్ సేవను ఎంచుకోండి. లభ్యత మీ ప్లాట్ఫారమ్పై ఆధారపడి ఉంటుంది మరియు ఏ ఐచ్ఛిక ఇంజిన్లు ఇన్స్టాల్ చేయబడ్డాయి.
స్పీచ్-టు-టెక్స్ట్ ఏమి చేస్తుంది
కైజు హబ్ AI మైక్రోఫోన్ చర్యను అందించే చోట స్పీచ్ టు టెక్స్ట్ మీరు చెప్పేదాన్ని సవరించగలిగే వచనంగా మారుస్తుంది. ఏజెంట్ ప్రాంప్ట్లను నిర్దేశించడానికి, కైజు వాయిస్ సంభాషణను కొనసాగించడానికి మరియు టైప్ చేయకుండా సుదీర్ఘ సూచనలను నమోదు చేయడానికి దీన్ని ఉపయోగించండి. విస్పర్ మరియు పారాకీట్ వంటి స్థానిక ఇంజిన్లు మీ మెషీన్లో లిప్యంతరీకరణను ఉంచుతాయి; ప్లాట్ఫారమ్ డిక్టేషన్ Windows లేదా macOS అందించిన ప్రసంగ సేవను ఉపయోగిస్తుంది.
అందుబాటులో సేవలు
గుసగుసలాడే
ఎంచుకోదగిన మోడల్ పరిమాణం మరియు హార్డ్వేర్ త్వరణంతో స్థానిక OpenAI విస్పర్ ట్రాన్స్క్రిప్షన్.
NVIDIA పారాకీట్
ఐచ్ఛిక పారాకీట్ ఇంజిన్ని ఉపయోగించి వేగవంతమైన స్థానిక ప్రసంగ గుర్తింపు.
అతి వేగంగా విష్పర్
మద్దతు ఉన్న GPU కాన్ఫిగరేషన్ల కోసం ఆప్టిమైజ్ చేయబడిన విస్పర్ పాత్.
విండోస్ వాయిస్ టైపింగ్
Windows డిక్టేషన్ మరియు కాన్ఫిగర్ చేయబడిన సిస్టమ్ హాట్కీని ఉపయోగిస్తుంది.
ఆపిల్ డిక్టేషన్
అంతర్నిర్మిత macOS డిక్టేషన్ సేవను ఉపయోగిస్తుంది.
విస్పర్
విస్పర్ సెట్టింగ్లు
స్థానిక స్పీచ్-టు-టెక్స్ట్ ట్రాన్స్క్రిప్షన్ కోసం OpenAI విస్పర్ సెట్టింగ్లను కాన్ఫిగర్ చేయండి. విస్పర్ పూర్తిగా మీ మెషీన్లో నడుస్తుంది, ఆఫ్లైన్, ప్రైవేట్ వాయిస్ ఇన్పుట్ కోసం. నమూనాలను డౌన్లోడ్ చేయండి, ఇన్స్టాల్ చేయండి మరియు వాటిని నేరుగా ఈ ట్యాబ్ నుండి తొలగించండి.
అందుబాటులో ఉన్న నమూనాలు
చిన్నది
39M పారామితులు, ~75 MB డౌన్లోడ్, ~10x రియల్ టైమ్ వేగం, 1 GB VRAM అవసరం.
బేస్
74M పారామితులు, ~145 MB డౌన్లోడ్, ~7x రియల్ టైమ్ వేగం, 1 GB VRAM అవసరం.
చిన్నది
244M పారామితులు, ~465 MB డౌన్లోడ్, ~4x రియల్ టైమ్ వేగం, 2 GB VRAM అవసరం.
మధ్యస్థం
769M పారామితులు, ~1.5 GB డౌన్లోడ్, ~2x రియల్ టైమ్ వేగం, 5 GB VRAM అవసరం.
పెద్దది
1550M పారామితులు, ~3 GB డౌన్లోడ్, 1x రియల్ టైమ్ వేగం, 10 GB VRAM అవసరం.
టర్బో
809M పారామితులు, ~1.6 GB డౌన్లోడ్, ~8x రియల్ టైమ్ వేగం, 6 GB VRAM అవసరం.
నేను ఏ విస్పర్ మోడల్ని ఎంచుకోవాలి?
వేగం, మెమరీ వినియోగం మరియు ట్రాన్స్క్రిప్షన్ నాణ్యత యొక్క ఆచరణాత్మక బ్యాలెన్స్ కోసం Smallతో ప్రారంభించండి. హార్డ్వేర్ పరిమితంగా ఉన్నప్పుడు క్రిందికి తరలించండి లేదా ఖచ్చితత్వం మరియు GPU పనితీరు ఎక్కువగా ఉన్నప్పుడు Medium, Large లేదా Turboను ఎంచుకోండి.
చిన్నది
వేక్-వర్డ్ డిటెక్షన్, శీఘ్ర ఆదేశాలు మరియు తక్కువ-మెమరీ సిస్టమ్లపై పరీక్ష.
బేస్
నిరాడంబరమైన హార్డ్వేర్పై చిన్న గమనికలు, ప్రాంప్ట్లు మరియు సాధారణ డిక్టేషన్.
చిన్నది
ఏజెంట్ ప్రాంప్ట్లు మరియు సుదీర్ఘ డిక్టేషన్ కోసం సమతుల్య రోజువారీ ఎంపిక.
మధ్యస్థం
మీరు అదనపు ప్రాసెసింగ్ సమయం మరియు మెమరీని వర్తకం చేయగలిగినప్పుడు ఖచ్చితత్వం-ఫోకస్డ్ ట్రాన్స్క్రిప్షన్.
పెద్దది
కనీసం 10 GB అందుబాటులో ఉన్న VRAM ఉన్న సిస్టమ్ల కోసం అత్యధిక ఖచ్చితత్వ స్థానిక ఎంపిక.
టర్బో
కనీసం 6 GB అందుబాటులో ఉన్న VRAMతో మద్దతు ఉన్న GPUలో వేగవంతమైన, అధిక-నాణ్యత ట్రాన్స్క్రిప్షన్.
ఇన్స్టాలేషన్ స్థితి
కింది అవసరమైన డిపెండెన్సీల ఇన్స్టాలేషన్ స్థితిని సెట్టింగ్ల పేజీ చూపుతుంది:
పారాకీట్ మరియు అతి వేగంగా విష్పర్
ఐచ్ఛిక ఫాస్ట్ ఇంజన్లు
ఈ ఇంజన్లు ప్రత్యేక డౌన్లోడ్లు కాబట్టి డిఫాల్ట్ ఇన్స్టాలేషన్ చిన్నగా ఉంటుంది. సెట్టింగ్ల స్క్రీన్ ప్రతి ఇంజిన్కు ఇన్స్టాలేషన్ మరియు హార్డ్వేర్ స్థితిని చూపుతుంది.
లైవ్ లోకల్ ట్రాన్స్క్రిప్షన్తో మీరు మాట్లాడుతుండగానే పదాలు కనిపించడాన్ని చూడండి. Insanely Fast Whisper ఆధునిక NVIDIA GPUల కోసం ఆప్టిమైజ్ చేయబడింది; Whisper, Parakeet, క్లౌడ్ మరియు ప్లాట్ఫారమ్ స్పీచ్ ఎంపికలు కూడా అందుబాటులో ఉన్నాయి.
NVIDIA పారాకీట్
హై-స్పీడ్ లోకల్ స్పీచ్-టు-టెక్స్ట్ ఇంజన్. దాన్ని ఎంచుకునే ముందు వాయిస్ టైపింగ్ సెట్టింగ్ల నుండి దాని ఐచ్ఛిక రన్టైమ్ను ఇన్స్టాల్ చేయండి.
అతి వేగంగా విష్పర్
అనుకూలమైన GPU సిస్టమ్ల కోసం ఉద్దేశించిన వేగవంతమైన విస్పర్ అమలు. ఉపయోగించడానికి ముందు ఐచ్ఛిక ఇంజిన్ను ఇన్స్టాల్ చేయండి.
కైజు వాయిస్ ద్వారా ఒకదాన్ని ఎంచుకోవడం వలన పెద్ద డౌన్లోడ్ నిశ్శబ్దంగా ప్రారంభించబడదు. దీన్ని ముందుగా సెట్టింగ్లలో ఇన్స్టాల్ చేయండి; సహాయకుడు అప్పుడు లభ్యతను ధృవీకరించవచ్చు మరియు సేవలను మార్చవచ్చు.
ప్లాట్ఫారమ్ వాయిస్
Windows వాయిస్ టైపింగ్
స్పీచ్-టు-టెక్స్ట్ ట్రాన్స్క్రిప్షన్ కోసం Windows వాయిస్ టైపింగ్ను కాన్ఫిగర్ చేయండి. ఈ సేవ Windows 10 మరియు తర్వాతి వాటిలో నిర్మించబడిన Azure స్పీచ్ సర్వీసెస్ను ఉపయోగిస్తుంది. ఇంటర్నెట్ కనెక్షన్ అవసరం. Windows సెట్టింగ్లలో స్పీచ్ రికగ్నిషన్ను ప్రారంభించడానికి సూచనలను అనుసరించండి.
సిస్టమ్ అవసరాలు
సిస్టమ్ సెట్టింగ్లలో స్పీచ్ రికగ్నిషన్తో Windows 10 లేదా తర్వాతిది.
హాట్కీ
డిఫాల్ట్ ట్రిగ్గర్ హాట్కీ: Ctrl+Shift+W. మీ ప్రాధాన్యతకు అనుగుణంగా కాన్ఫిగర్ చేయవచ్చు.
ట్రిగ్గర్ను పరీక్షించండి
వాయిస్ టైపింగ్ సరిగ్గా పనిచేస్తుందో లేదో ధృవీకరించడానికి పరీక్ష బటన్.
Apple డిక్టేషన్
స్పీచ్-టు-టెక్స్ట్ ట్రాన్స్క్రిప్షన్ కోసం macOSలో Apple డిక్టేషన్ను కాన్ఫిగర్ చేయండి. ఇది అదనపు సెటప్ అవసరం లేకుండా macOSలో అంతర్నిర్మిత ఫీచర్. macOS సిస్టమ్ సెట్టింగ్లలో డిక్టేషన్ను ప్రారంభించండి.
సిస్టమ్ అవసరాలు
macOS, సిస్టమ్ సెట్టింగ్లు > కీబోర్డ్లో డిక్టేషన్తో.
హాట్కీ
డిఫాల్ట్ ట్రిగ్గర్ హాట్కీ: Ctrl+Shift+D. మీ ప్రాధాన్యతకు అనుగుణంగా కాన్ఫిగర్ చేయవచ్చు.
ట్రిగ్గర్ను పరీక్షించండి
డిక్టేషన్ సరిగ్గా పనిచేస్తుందో లేదో ధృవీకరించడానికి పరీక్ష బటన్.
టెక్స్ట్ టు స్పీచ్ మరియు AI వాయిస్లు
స్థానిక వాయిస్ మోడల్స్
ఎంచుకున్న ఇన్స్టాల్ చేసిన మోడల్ ద్వారా AI బ్రెయిన్ మాట్లాడుతుంది. కొత్త మోడల్ను లోడ్ చేయడానికి ముందు మోడల్లను మార్చడం మునుపటి మోడల్ను అన్లోడ్ చేస్తుంది మరియు వాయిస్ జాబితా ఆ మోడల్కు అనుకూలమైన వాయిస్లకు ఫిల్టర్ చేయబడుతుంది.
కోకోరో 82M
విస్తృత అంతర్నిర్మిత వాయిస్ ఎంపికతో తేలికైన, వేగవంతమైన స్థానిక ప్రసంగం.
చటర్బాక్స్ టర్బో
తక్కువ జాప్యం వ్యక్తీకరణ ప్రసంగం మరియు వాయిస్ క్లోనింగ్ మద్దతు.
కబుర్లు
వ్యక్తీకరణ స్థానిక సంశ్లేషణ మరియు క్లోనింగ్ కోసం పూర్తి Chatterbox మోడల్.
ఓమ్నివాయిస్ 0.6B
కాంపాక్ట్ బహుభాషా స్థానిక టెక్స్ట్-టు-స్పీచ్.
OuteTTS 1.0 1B
దాని స్వంత అనుకూల వాయిస్ సెట్తో స్థానిక ప్రసంగం ఉత్పత్తి.
Qwen3-TTS 1.7B
పెద్ద బహుభాషా మరియు వ్యక్తీకరణ స్థానిక సంశ్లేషణ.
ఫిష్ స్పీచ్ S2 ప్రో
మద్దతు ఉన్న రిఫరెన్స్-వాయిస్ వర్క్ఫ్లోలతో అధిక నాణ్యత గల స్థానిక ప్రసంగం.
ప్రసంగ వేగాన్ని 0.5× నుండి 2× వరకు సెట్ చేయవచ్చు. వాయిస్ క్లోనింగ్ మద్దతు ఇచ్చే మోడల్లకు మాత్రమే కనిపిస్తుంది; మీకు స్వంతమైన లేదా ఉపయోగించడానికి అనుమతి ఉన్న ఆడియోను ఉపయోగించండి.
క్లౌడ్ ప్రొవైడర్ కేటలాగ్
సెట్టింగ్ల కేటలాగ్లో OpenAI, ElevenLabs, Cartesia, Smallest AI, Fish Audio, Speechmatics, Amazon Polly, Google Cloud Text-to-Speech మరియు Microsoft Azure కోసం కాన్ఫిగరేషన్ కూడా ఉంది. మీరు అందించే ప్రొవైడర్ కాన్ఫిగరేషన్ మరియు ఆధారాలపై లభ్యత ఆధారపడి ఉంటుంది.
API ఆధారాలు సెట్టింగ్లలోనే ఉంటాయి మరియు Kaiju Voice యొక్క మాట్లాడే లేదా నిర్మాణాత్మక సెట్టింగ్ల సారాంశాల నుండి మినహాయించబడ్డాయి.
