G

Tekstistä puheeksi -tekniikka

📚 Mikä on TTS (tekstistä puheeksi)?

Tekstistä puheeksi, jota kutsutaan myös TTS:ksi, on tukiteknologian muoto, joka tuo elämään helppoutta ja mukavuutta. Järjestelmä lukee digitaaliset tekstit ääneen ja riittävän selkeästi, jotta henkilö ymmärtää. TTS tunnetaan myös ääneenlukuteknologiana, joka on laajalti hyväksytty joustavuuden vuoksi. Se on yhden kosketuksen päässä, jossa verkkosivuston teksti muunnetaan ääneksi.

Järjestelmä laajenee kaikille laitteille, kuten älypuhelimille, kannettaville tietokoneille, pöytätietokoneille ja tableteille, joita pidetään ihanteellisena lapsille, yli 20-vuotiaille ja vammaisille. Lukemisen kamppailu ja silmien rasittaminen elektroniikkalaitteisiin ovat hävinneet TTS:n myötä, samalla kun se lisää keskittymistä, oppimista ja tapaa lukea verkossa kuuntelemalla. Joten jos olet bloggaaja, lukija tai verkkosivuston omistaja, TTS on ohjelmisto, joka laajentaa tietämyshorisonttiasi. Mutta mitä hyötyä on siitä, että kaikessa on ääni, ilman rajoituksia ja rajoja? Se on erotettu käyttäjien mukaan, koska he ovat henkilöitä, jotka käyttävät palveluita.

Ihmisten mahdollisuus keskustella koneiden kanssa on pitkäaikainen unelma ihmisen ja tietokoneen vuorovaikutuksesta. Tietokoneiden kyky ymmärtää luonnollista puhetta on mullistanut viime vuosina syvän neuroverkkojen (esim. Google Voice Search) soveltamisen. Kuitenkin puheen tuottaminen tietokoneilla - prosessi, jota yleensä kutsutaan puhesynteesi tai tekstistä puheeksi (TTS) — perustuu edelleen suurelta osin ns konkatenatiivinen TTS, jossa yhdestä kaiuttimesta tallennetaan erittäin suuri tietokanta lyhyistä puhefragmenteista ja yhdistetään sitten muodostamaan täydelliset lausunnot. Tämän vuoksi äänen muokkaaminen (esimerkiksi vaihtaminen toiseen puhujaan tai puheen korostamisen tai tunteen muuttaminen) on vaikeaa muokkaamatta kokonaan uutta tietokantaa.

📚 Kuinka TTS-tekniikka toimii?

TTS-prosessi sisältää useita vaiheita:

  • 1. Tekstinsyöttö: Ensimmäinen askel on syöttää teksti, jonka haluat muuntaa puheeksi. Tämä voi olla kirjallinen asiakirja, verkkosivu, chatbot-keskustelu tai jopa sosiaalisen median viesti.
  • 2. Tekstianalyysi: Sen jälkeen teksti analysoidaan oikean ääntämisen, intonaation ja rytmin määrittämiseksi. Tämä edellyttää yksittäisten sanojen, lauseiden ja lauseiden tunnistamista sekä kontekstia, jossa niitä käytetään.
  • 3. Puhesynteesi: Analysoitu teksti käsitellään sitten käyttämällä puhesynteesialgoritmeja vastaavan äänilähdön generoimiseksi. Tämä edellyttää digitaalisen esityksen luomista puhutuista sanoista, mukaan lukien äänenkorkeus, sävy ja äänenvoimakkuus.
  • 4. Äänilähtö: Viimeinen vaihe on tuottaa äänilähtö, joka voidaan toistaa kaiuttimien, kuulokkeiden tai muiden äänilaitteiden kautta.

📚 TTS-tekniikan tyypit

TTS-tekniikkaa on useita tyyppejä, mukaan lukien:

  • Sääntöpohjaiset järjestelmät: Nämä järjestelmät käyttävät ennalta määritettyjä sääntöjä puheen tuottamiseen. Ne ovat yksinkertaisia ​​ja tehokkaita, mutta ne eivät välttämättä tuota korkealaatuista puhetta.
  • Tilastolliset mallit: Nämä järjestelmät käyttävät tilastollisia malleja puheen tuottamiseen. Ne ovat kehittyneempiä kuin sääntöpohjaiset järjestelmät ja voivat tuottaa korkealaatuisemman puheen.
  • Tekoäly (AI): Nämä järjestelmät käyttävät tekoälyalgoritmeja puheen tuottamiseen. Ne ovat edistyneintä TTS-teknologiaa ja voivat tuottaa erittäin luonnollista ja keskustelua herättävää puhetta.

📚 TTS:n edut!

GSpeech tarjoaa monia ominaisuuksia, mukaan lukien online-, SaaS-, paikalliset Text-to-Speech (TTS) -ratkaisut useisiin eri lähteisiin, kuten verkkosivustoihin, mobiilisovelluksiin, e-kirjoihin, verkko-oppimateriaaliin, asiakirjoihin, jokapäiväiseen asiakaskokemukseen, kuljetuksiin. kokemusta ja paljon muuta. Miten TTS-teknologiaa integroiva yritys, organisaatio ja julkaisijat hyötyvät.

🎯 Parempi saavutettavuus

TTS-teknologia tarjoaa paremman esteettömyyden näkövammaisille, lukihäiriöisille tai lukuvaikeuksista kärsiville henkilöille, mikä helpottaa tietojen saamista ja kommunikointia.

🎯 Tehostettu hakukoneoptimointi

Tarjoamalla käyttäjille vaihtoehtoisen tavan käyttää sisältöäsi, voit parantaa WordPress-sivustosi hakukoneoptimointia (SEO). Tämä on erityisen tärkeää käyttäjille, jotka luottavat verkossa liikkumiseen näytönlukuohjelmiin.

🎯 Parempi käyttökokemus

TTS-tekniikka voi parantaa käyttökokemusta tarjoamalla luonnollisemman ja intuitiivisemman tavan olla vuorovaikutuksessa laitteiden kanssa, mikä vähentää manuaalisen kirjoittamisen tai lukemisen tarvetta.

🎯 Paranneltu asiakaspalvelu

TTS-teknologia voi tarjota 24/7 asiakastukea, vastata usein kysyttyihin kysymyksiin ja tarjota asiakkaille tietoa tehokkaammin ja tehokkaammin.

🎯 Lisääntynyt tuottavuus

TTS-tekniikka voi lisätä tuottavuutta automatisoimalla tehtäviä, kuten tietojen syöttämistä, transkriptiota ja lukemista, mikä vapauttaa aikaa tärkeämpiin tehtäviin.

🎯 Monikielinen tuki

TTS-tekniikka voi tukea useita kieliä, mikä tekee siitä arvokkaan työkalun yrityksille ja organisaatioille, jotka toimivat maailmanlaajuisesti.

🎯 Parempi luetun ymmärtäminen

TTS-tekniikka voi parantaa luetun ymmärtämistä antamalla käyttäjien kuunnella tekstiä samalla, kun he seuraavat kirjoitettua sanaa, mikä helpottaa monimutkaisten tietojen ymmärtämistä.

🎯 Vähentynyt silmien rasitus

TTS-tekniikka voi vähentää silmien rasitusta ja väsymystä tarjoamalla vaihtoehdon lukemiselle ja kirjoittamiselle, mikä tekee siitä arvokkaan työkalun henkilöille, jotka viettävät pitkiä tunteja näyttöjen edessä.

🎯 Lisääntynyt sitoutuminen

TTS-tekniikka voi lisätä sitoutumista tarjoamalla interaktiivisemman ja mukaansatempaavamman kokemuksen, mikä tekee siitä arvokkaan työkalun koulutus- ja viihdesovelluksia varten.

🎯 Kilpailuetu

TTS-teknologia voi tarjota kilpailuetua tarjoamalla ainutlaatuisen ja innovatiivisen tavan olla vuorovaikutuksessa laitteiden kanssa ja erottaa tuotteesi tai palvelusi kilpailijoista.

Tämä on johtanut suureen kysyntään parametrinen TTS, jossa kaikki datan tuottamiseen tarvittavat tiedot on tallennettu mallin parametreihin, ja puheen sisältöä ja ominaisuuksia voidaan ohjata mallin syötteillä. Toistaiseksi parametrinen TTS on kuitenkin yleensä kuulostanut vähemmän luonnolliselta kuin ketjuttava. Olemassa olevat parametriset mallit tuottavat tyypillisesti audiosignaaleja välittämällä lähdön signaalinkäsittelyalgoritmien kautta vokoodereiden.

WaveNet muuttaa tätä paradigmaa mallinnamalla suoraan äänisignaalin raakaa aaltomuodon, yksi näyte kerrallaan. Raaka-aaltomuotojen käyttö tarkoittaa luonnollisen kuulostavan puheen lisäksi, että WaveNet voi mallintaa kaikenlaista ääntä, myös musiikkia.

WaveNet: Generatiivinen malli raa'alle äänelle



Tutkijat välttävät yleensä raakaäänen mallintamista, koska se tikittää niin nopeasti: tyypillisesti 16,000 XNUMX näytettä sekunnissa tai enemmän, ja niillä on tärkeä rakenne useilla aikaskaaloilla. Täysin autoregressiivisen mallin rakentaminen, jossa jokaisen otoksen ennusteeseen vaikuttavat kaikki aiemmat (tilastollisesti sanottuna jokainen ennustava jakauma on ehdollinen kaikkien aikaisempien havaintojen perusteella), on selvästi haastava tehtävä.


Kuitenkin, PixelRNN ja PixelCNN aiemmin julkaistut mallit osoittivat, että oli mahdollista luoda monimutkaisia ​​luonnollisia kuvia ei vain pikseli kerrallaan, vaan yksi värikanava kerrallaan, mikä vaatii tuhansia ennusteita kuvaa kohden. Tämä inspiroi meitä mukauttamaan kaksiulotteiset PixelNet-verkkomme yksiulotteiseen WaveNetiin.




Yllä oleva animaatio näyttää kuinka WaveNet on rakennettu. Se on täysin konvoluutiohermoverkko, jossa konvoluutiokerroksilla on erilaisia ​​laajentumistekijöitä, jotka sallivat sen vastaanottavan kentän kasvaa eksponentiaalisesti syvyyden myötä ja kattaa tuhansia aikaaskelia.


Harjoittelun aikana tulosekvenssit ovat ihmiskaiuttimista tallennettuja todellisia aaltomuotoja. Harjoittelun jälkeen voimme ottaa verkosta näytteitä synteettisten ilmaisujen luomiseksi. Näytteenoton jokaisessa vaiheessa otetaan arvo verkon laskemasta todennäköisyysjakaumasta. Tämä arvo syötetään sitten takaisin tuloon ja tehdään uusi ennuste seuraavaa vaihetta varten. Tällaisten näytteiden rakentaminen askel kerrallaan on laskennallisesti kallista, mutta olemme havainneet sen välttämättömäksi monimutkaisen, realistiselta kuulostavan äänen tuottamiseksi.


Tekniikan tason parantaminen

Treenattiin WaveNet käyttää joitakin Googlen TTS-tietosarjoja, jotta voimme arvioida sen tehokkuutta. Seuraava kuva näyttää WaveNetien laadun asteikolla 1-5 verrattuna Googlen parhaisiin TTS-järjestelmiin (muuttujien ja konkatenatiivinen) ja ihmispuhetta käyttämällä Keskimääräiset mielipidepisteet (MOS). MOS on standardimitta subjektiivisissa äänenlaatutesteissä, ja ne saatiin sokkotesteissä ihmisillä (yli 500 arviosta 100 testilauseessa). Kuten näemme, WaveNets pienentää eroa huipputason ja ihmistason suorituskyvyn välillä yli 50 % sekä Yhdysvaltain englannin että mandariinikiinan kielen kohdalla.


Googlen nykyisiä TTS-järjestelmiä pidetään sekä kiinalaisille että englanninkielisille maailman parhaiden joukossa, joten molempien parantaminen yhdellä mallilla on suuri saavutus.




GSpeechillä on tekoälyäänen synteesialgoritmi, joka on yksi alan edistyneimmistä ja realistisimmista. Useimmat äänisyntetisaattorit (mukaan lukien Applen Siri) käyttävät niin sanottua konkatenatiivista synteesiä, jossa ohjelma tallentaa yksittäisiä tavuja – ääniä, kuten "ba", "sht" ja "oo" - ja kokoaa ne yhteen lennossa sanojen ja lauseiden muodostamiseksi. . Tämä menetelmä on kehittynyt melko hyväksi vuosien varrella, mutta se kuulostaa silti tylyltä.


Vertailun vuoksi WaveNet käyttää koneoppimista äänen tuottamiseen tyhjästä. Se itse asiassa analysoi aaltomuodot valtavasta ihmispuheen tietokannasta ja luo ne uudelleen nopeudella 24,000 2016 näytettä sekunnissa. Lopputulos sisältää ääniä, joissa on hienouksia, kuten huulten haju ja aksentti. Kun Google julkisti WaveNetin ensimmäisen kerran vuonna XNUMX, se oli aivan liian laskennallisesti intensiivistä työskennelläkseen tutkimusympäristöjen ulkopuolella, mutta sitä on sittemmin supistettu merkittävästi, mikä osoittaa selkeän kulkureitin tutkimuksesta tuotteeseen.



11.06.2020
Siirrä sisältösi seuraavalle tasolle! Kokeile GSpeechiä nyt!
Liity ilmaiseksi