Kaiju Hub AI

Äänikirjoitus

Äänityspalvelun valinta Kaiju Hubin asetuksista

Yleiskatsaus

Valitse paikallinen transkriptiomoottori tai käyttöjärjestelmäsi sisäänrakennettu sanelupalvelu. Saatavuus riippuu alustastasi ja asennetuista valinnaisista moottoreista.

Mitä puhe tekstiksi tekee

Puhe tekstiksi muuttaa sanomasi muokattavaa tekstiä kaikkialla, missä Kaiju Hub AI tarjoaa mikrofonitoiminnon. Käytä sitä sanelemaan agenttikehotteita, jatkamaan Kaiju Voice -keskustelua ja antamaan pidempiä ohjeita kirjoittamatta. Paikalliset moottorit, kuten Whisper ja Parakeet, pitävät transkription koneellasi; alustan sanelu käyttää Windowsin tai macOS:n tarjoamaa puhepalvelua.

Käytettävissä olevat palvelut

Kuiskaa

Paikallinen OpenAI Whisper -transkriptio valittavalla mallikoolla ja laitteistokiihdytyksellä.

NVIDIA papukaija

Nopea paikallinen puheentunnistus valinnaisella Parakeet-moottorilla.

Hullun nopea Whisper

Optimoitu Whisper-polku tuetuille GPU-kokoonpanoille.

Windowsin puhekirjoitus

Käyttää Windowsin sanelua ja määritettyä järjestelmän pikanäppäintä.

Applen sanelu

Käyttää sisäänrakennettua macOS-sanelupalvelua.

Kuiskaa

Whisper – paikallinen puhe tekstiksi transkriptiomoottorin valinnalla ja asennuksen tilalla

Whisper-asetukset

Määritä OpenAI Whisper -asetukset paikallista puheesta tekstiksi -transkriptiota varten. Whisper toimii kokonaan laitteellasi, mikä mahdollistaa offline- ja yksityisen äänisyötteen. Lataa, asenna ja poista malleja suoraan tästä välilehdestä.

Saatavilla olevat mallit

Pieni

39 miljoonaa parametria, noin 75 MB latauskoko, noin 10 kertaa reaaliaikainen nopeus, vaatii 1 GB VRAM-muistia.

Perus

74 miljoonaa parametria, noin 145 MB latauskoko, noin 7 kertaa reaaliaikainen nopeus, vaatii 1 GB VRAM-muistia.

Pieni

244 miljoonaa parametria, noin 465 MB latauskoko, noin 4 kertaa reaaliaikainen nopeus, vaatii 2 GB VRAM-muistia.

Keskikokoinen

769 miljoonaa parametria, noin 1,5 GB latauskoko, noin 2 kertaa reaaliaikainen nopeus, vaatii 5 GB VRAM-muistia.

Suuri

1550 miljoonaa parametria, noin 3 GB latauskoko, 1 kertaa reaaliaikainen nopeus, vaatii 10 GB VRAM-muistia.

Turbo

809 miljoonaa parametria, ~1,6 GB latauskoko, ~8 kertaa reaaliaikainen nopeus, vaatii 6 GB VRAM-muistia.

Mikä Whisper-malli minun pitäisi valita?

Aloita Smallilla saadaksesi käytännöllisen tasapainon nopeuden, muistin käytön ja transkription laadun välillä. Siirry alas, kun laitteisto on rajallinen, tai valitse Medium, Large tai Turbo, kun tarkkuus ja GPU-suorituskyky ovat tärkeämpiä.

Pieni

Herätyssanan tunnistus, pikakomennot ja testaus vähiten muistin omaavissa järjestelmissä.

Perus

Lyhyet muistiinpanot, kehotteet ja yleinen sanelu vaatimattomalla laitteistolla.

Pieni

Tasapainoinen arkivalinta agenttikehotuksiin ja pidempään saneluun.

Keskikokoinen

Tarkkuuteen keskittyvä transkriptio, kun voit vaihtaa ylimääräistä käsittelyaikaa ja muistia.

Suuri

Tarkin paikallinen vaihtoehto järjestelmille, joissa on vähintään 10 Gt VRAM-muistia.

Turbo

Nopea ja laadukas transkriptio tuetulla GPU:lla, jossa on vähintään 6 Gt käytettävissä olevaa VRAM-muistia.

Asennustila

Asetussivu näyttää vaadittavien riippuvuuksien asennustilan:

Kuiskaa
FFmpeg
CUDA
UV (Python env)

Papukaija ja Insanely Fast Whisper

Valinnaiset nopeat moottorit

Nämä moottorit ovat erillisiä latauksia, joten oletusasennus pysyy pienenä. Asetusnäytössä näkyy kunkin moottorin asennus ja laitteiston tila.

Katso sanojen ilmestyvän puhuessasi reaaliaikaisen paikallisen litteroinnin avulla. Insanely Fast Whisper on optimoitu moderneille NVIDIA-näytönohjaimille, ja myös Whisper-, Parakeet-, pilvi- ja käyttöjärjestelmän puhepalveluvaihtoehdot ovat käytettävissä.

NVIDIA papukaija

Nopea paikallinen puheen tekstiksi -moottori. Asenna sen valinnainen suoritusaika Äänitys-asetuksista ennen sen valitsemista.

Hullun nopea Whisper

Nopeutettu Whisper-toteutus, joka on tarkoitettu yhteensopiville GPU-järjestelmille. Asenna valinnainen moottori ennen käyttöä.

Yhden Kaiju Voicen kautta valitseminen ei koskaan aloita suurta latausta hiljaa. Asenna se ensin asetuksiin; avustaja voi sitten tarkistaa saatavuuden ja vaihtaa palveluita.

Alustan ääniasetukset

Windows Voice Typing — keyboard shortcut configuration and system setup

Windows Voice Typing

Määritä Windowsin puheentunnistus puheesta tekstiksi -transkriptiota varten. Tämä palvelu käyttää Windows 10:ssä ja sitä uudemmissa versioissa sisäänrakennettuja Azure Speech Services -palveluita. Internet-yhteys vaaditaan. Noudata asetusohjeita aktivoidaksesi puheentunnistuksen Windowsin asetuksissa.

Järjestelmävaatimukset

Windows 10 tai uudempi, jossa puheentunnistus on käytössä järjestelmäasetuksissa.

Pikanäppäin

Oletuspikanäppäin: Ctrl+Shift+W. Voit määrittää sen omien mieltymystesi mukaan.

Testilausain

Testipainike, jolla varmistetaan, että puheentunnistus toimii oikein mikrofonin kanssa.

Applen sanelu

Määritä Applen sanelu puheesta tekstiksi -transkriptiota varten macOS:ssä. Tämä on natiivi macOS-ominaisuus, joka ei vaadi muita määrityksiä kuin sanelun aktivoinnin järjestelmäasetuksissa.

Järjestelmävaatimukset

macOS, jossa sanelu on käytössä Järjestelmäasetuksissa > Näppäimistö.

Pikanäppäin

Oletuspikanäppäin: Ctrl+Shift+D. Voit muokata sen omien mieltymystesi mukaan.

Testilausain

Testipainike, jolla varmistetaan, että sanelu toimii oikein mikrofonin kanssa.

Tekstistä puheeksi ja tekoälyäänet

Paikalliset äänimallit

AI Brain puhuu valitun asennetun mallin kautta. Mallin vaihtaminen purkaa edellisen mallin ennen uuden lataamista, ja ääniluettelo suodatetaan tämän mallin kanssa yhteensopiviin ääniin.

Kokoro 82M

Kevyt, nopea paikallinen puhe laajalla sisäänrakennetulla äänivalikoimalla.

Chatterbox Turbo

Pienen latenssin ekspressiivinen puhe ja tuettu äänen kloonaus.

Chatterbox

Täysi Chatterbox-malli ilmeikkääseen paikalliseen synteesiin ja kloonaukseen.

OmniVoice 0.6B

Kompakti monikielinen paikallinen tekstistä puheeksi.

OuteTTS 1.0 1B

Paikallinen puheentuotanto omalla yhteensopivalla puhesarjalla.

Qwen3-TTS 1.7B

Laajempi monikielinen ja ilmeikäs paikallinen synteesi.

Fish Speech S2 Pro

Laadukas paikallinen puhe tuetuilla viiteäänityönkuluilla.

Puheen nopeus voidaan asettaa välillä 0,5× - 2×. Äänen kloonaus näkyy vain malleissa, jotka tukevat sitä; käytä omistamaasi tai sinulla on lupa käyttää ääntä.

Pilvipalveluntarjoajan luettelo

Asetusluettelo sisältää myös määritykset OpenAI:lle, ElevenLabsille, Cartesialle, Smallest AI:lle, Fish Audiolle, Speechmaticsille, Amazon Pollylle, Google Cloud Text-to-Speechille ja Microsoft Azurelle. Saatavuus riippuu palveluntarjoajan määrityksistä ja toimittamistasi tunnistetiedoista.

API-tunnistetiedot säilyvät asetuksissa, eivätkä ne näy Kaiju Voicen puhuttujen tai strukturoitujen asetusten yhteenvedoissa.

Kaikki kolmannen osapuolen logot, tavaramerkit ja brändinimet Kaiju Hub AIissa ovat omistajiensa omaisuutta. Niiden kaytto on vain tunnistustarkoituksiin eika tarkoita tukea, sponsorointia tai sidonnaisuutta.