Tekstistä puheeksi, jota kutsutaan myös TTS:ksi, on tukiteknologian muoto, joka tuo elämään helppoutta ja mukavuutta. Järjestelmä lukee digitaaliset tekstit ääneen ja riittävän selkeästi, jotta henkilö ymmärtää. TTS tunnetaan myös ääneenlukuteknologiana, joka on laajalti hyväksytty joustavuuden vuoksi. Se on yhden kosketuksen päässä, jossa verkkosivuston teksti muunnetaan ääneksi.
Järjestelmä laajenee kaikille laitteille, kuten älypuhelimille, kannettaville tietokoneille, pöytätietokoneille ja tableteille, joita pidetään ihanteellisena lapsille, yli 20-vuotiaille ja vammaisille. Lukemisen kamppailu ja silmien rasittaminen elektroniikkalaitteisiin ovat hävinneet TTS:n myötä, samalla kun se lisää keskittymistä, oppimista ja tapaa lukea verkossa kuuntelemalla. Joten jos olet bloggaaja, lukija tai verkkosivuston omistaja, TTS on ohjelmisto, joka laajentaa tietämyshorisonttiasi. Mutta mitä hyötyä on siitä, että kaikessa on ääni, ilman rajoituksia ja rajoja? Se on erotettu käyttäjien mukaan, koska he ovat henkilöitä, jotka käyttävät palveluita.
Ihmisten mahdollisuus keskustella koneiden kanssa on pitkäaikainen unelma ihmisen ja tietokoneen vuorovaikutuksesta. Tietokoneiden kyky ymmärtää luonnollista puhetta on mullistanut viime vuosina syvän neuroverkkojen (esim. Google Voice Search) soveltamisen. Kuitenkin puheen tuottaminen tietokoneilla - prosessi, jota yleensä kutsutaan puhesynteesi tai tekstistä puheeksi (TTS) — perustuu edelleen suurelta osin ns konkatenatiivinen TTS, jossa yhdestä kaiuttimesta tallennetaan erittäin suuri tietokanta lyhyistä puhefragmenteista ja yhdistetään sitten muodostamaan täydelliset lausunnot. Tämän vuoksi äänen muokkaaminen (esimerkiksi vaihtaminen toiseen puhujaan tai puheen korostamisen tai tunteen muuttaminen) on vaikeaa muokkaamatta kokonaan uutta tietokantaa.
TTS-prosessi sisältää useita vaiheita:
TTS-tekniikkaa on useita tyyppejä, mukaan lukien:
GSpeech tarjoaa monia ominaisuuksia, mukaan lukien online-, SaaS-, paikalliset Text-to-Speech (TTS) -ratkaisut useisiin eri lähteisiin, kuten verkkosivustoihin, mobiilisovelluksiin, e-kirjoihin, verkko-oppimateriaaliin, asiakirjoihin, jokapäiväiseen asiakaskokemukseen, kuljetuksiin. kokemusta ja paljon muuta. Miten TTS-teknologiaa integroiva yritys, organisaatio ja julkaisijat hyötyvät.
TTS-teknologia tarjoaa paremman esteettömyyden näkövammaisille, lukihäiriöisille tai lukuvaikeuksista kärsiville henkilöille, mikä helpottaa tietojen saamista ja kommunikointia.
Tarjoamalla käyttäjille vaihtoehtoisen tavan käyttää sisältöäsi, voit parantaa WordPress-sivustosi hakukoneoptimointia (SEO). Tämä on erityisen tärkeää käyttäjille, jotka luottavat verkossa liikkumiseen näytönlukuohjelmiin.
TTS-tekniikka voi parantaa käyttökokemusta tarjoamalla luonnollisemman ja intuitiivisemman tavan olla vuorovaikutuksessa laitteiden kanssa, mikä vähentää manuaalisen kirjoittamisen tai lukemisen tarvetta.
TTS-teknologia voi tarjota 24/7 asiakastukea, vastata usein kysyttyihin kysymyksiin ja tarjota asiakkaille tietoa tehokkaammin ja tehokkaammin.
TTS-tekniikka voi lisätä tuottavuutta automatisoimalla tehtäviä, kuten tietojen syöttämistä, transkriptiota ja lukemista, mikä vapauttaa aikaa tärkeämpiin tehtäviin.
TTS-tekniikka voi tukea useita kieliä, mikä tekee siitä arvokkaan työkalun yrityksille ja organisaatioille, jotka toimivat maailmanlaajuisesti.
TTS-tekniikka voi parantaa luetun ymmärtämistä antamalla käyttäjien kuunnella tekstiä samalla, kun he seuraavat kirjoitettua sanaa, mikä helpottaa monimutkaisten tietojen ymmärtämistä.
TTS-tekniikka voi vähentää silmien rasitusta ja väsymystä tarjoamalla vaihtoehdon lukemiselle ja kirjoittamiselle, mikä tekee siitä arvokkaan työkalun henkilöille, jotka viettävät pitkiä tunteja näyttöjen edessä.
TTS-tekniikka voi lisätä sitoutumista tarjoamalla interaktiivisemman ja mukaansatempaavamman kokemuksen, mikä tekee siitä arvokkaan työkalun koulutus- ja viihdesovelluksia varten.
TTS-teknologia voi tarjota kilpailuetua tarjoamalla ainutlaatuisen ja innovatiivisen tavan olla vuorovaikutuksessa laitteiden kanssa ja erottaa tuotteesi tai palvelusi kilpailijoista.
Tämä on johtanut suureen kysyntään parametrinen TTS, jossa kaikki datan tuottamiseen tarvittavat tiedot on tallennettu mallin parametreihin, ja puheen sisältöä ja ominaisuuksia voidaan ohjata mallin syötteillä. Toistaiseksi parametrinen TTS on kuitenkin yleensä kuulostanut vähemmän luonnolliselta kuin ketjuttava. Olemassa olevat parametriset mallit tuottavat tyypillisesti audiosignaaleja välittämällä lähdön signaalinkäsittelyalgoritmien kautta vokoodereiden.
WaveNet muuttaa tätä paradigmaa mallinnamalla suoraan äänisignaalin raakaa aaltomuodon, yksi näyte kerrallaan. Raaka-aaltomuotojen käyttö tarkoittaa luonnollisen kuulostavan puheen lisäksi, että WaveNet voi mallintaa kaikenlaista ääntä, myös musiikkia.
Tutkijat välttävät yleensä raakaäänen mallintamista, koska se tikittää niin nopeasti: tyypillisesti 16,000 XNUMX näytettä sekunnissa tai enemmän, ja niillä on tärkeä rakenne useilla aikaskaaloilla. Täysin autoregressiivisen mallin rakentaminen, jossa jokaisen otoksen ennusteeseen vaikuttavat kaikki aiemmat (tilastollisesti sanottuna jokainen ennustava jakauma on ehdollinen kaikkien aikaisempien havaintojen perusteella), on selvästi haastava tehtävä.
Kuitenkin, PixelRNN ja PixelCNN aiemmin julkaistut mallit osoittivat, että oli mahdollista luoda monimutkaisia luonnollisia kuvia ei vain pikseli kerrallaan, vaan yksi värikanava kerrallaan, mikä vaatii tuhansia ennusteita kuvaa kohden. Tämä inspiroi meitä mukauttamaan kaksiulotteiset PixelNet-verkkomme yksiulotteiseen WaveNetiin.
Yllä oleva animaatio näyttää kuinka WaveNet on rakennettu. Se on täysin konvoluutiohermoverkko, jossa konvoluutiokerroksilla on erilaisia laajentumistekijöitä, jotka sallivat sen vastaanottavan kentän kasvaa eksponentiaalisesti syvyyden myötä ja kattaa tuhansia aikaaskelia.
Harjoittelun aikana tulosekvenssit ovat ihmiskaiuttimista tallennettuja todellisia aaltomuotoja. Harjoittelun jälkeen voimme ottaa verkosta näytteitä synteettisten ilmaisujen luomiseksi. Näytteenoton jokaisessa vaiheessa otetaan arvo verkon laskemasta todennäköisyysjakaumasta. Tämä arvo syötetään sitten takaisin tuloon ja tehdään uusi ennuste seuraavaa vaihetta varten. Tällaisten näytteiden rakentaminen askel kerrallaan on laskennallisesti kallista, mutta olemme havainneet sen välttämättömäksi monimutkaisen, realistiselta kuulostavan äänen tuottamiseksi.
Treenattiin WaveNet käyttää joitakin Googlen TTS-tietosarjoja, jotta voimme arvioida sen tehokkuutta. Seuraava kuva näyttää WaveNetien laadun asteikolla 1-5 verrattuna Googlen parhaisiin TTS-järjestelmiin (muuttujien ja konkatenatiivinen) ja ihmispuhetta käyttämällä Keskimääräiset mielipidepisteet (MOS). MOS on standardimitta subjektiivisissa äänenlaatutesteissä, ja ne saatiin sokkotesteissä ihmisillä (yli 500 arviosta 100 testilauseessa). Kuten näemme, WaveNets pienentää eroa huipputason ja ihmistason suorituskyvyn välillä yli 50 % sekä Yhdysvaltain englannin että mandariinikiinan kielen kohdalla.
Googlen nykyisiä TTS-järjestelmiä pidetään sekä kiinalaisille että englanninkielisille maailman parhaiden joukossa, joten molempien parantaminen yhdellä mallilla on suuri saavutus.
GSpeechillä on tekoälyäänen synteesialgoritmi, joka on yksi alan edistyneimmistä ja realistisimmista. Useimmat äänisyntetisaattorit (mukaan lukien Applen Siri) käyttävät niin sanottua konkatenatiivista synteesiä, jossa ohjelma tallentaa yksittäisiä tavuja – ääniä, kuten "ba", "sht" ja "oo" - ja kokoaa ne yhteen lennossa sanojen ja lauseiden muodostamiseksi. . Tämä menetelmä on kehittynyt melko hyväksi vuosien varrella, mutta se kuulostaa silti tylyltä.
Vertailun vuoksi WaveNet käyttää koneoppimista äänen tuottamiseen tyhjästä. Se itse asiassa analysoi aaltomuodot valtavasta ihmispuheen tietokannasta ja luo ne uudelleen nopeudella 24,000 2016 näytettä sekunnissa. Lopputulos sisältää ääniä, joissa on hienouksia, kuten huulten haju ja aksentti. Kun Google julkisti WaveNetin ensimmäisen kerran vuonna XNUMX, se oli aivan liian laskennallisesti intensiivistä työskennelläkseen tutkimusympäristöjen ulkopuolella, mutta sitä on sittemmin supistettu merkittävästi, mikä osoittaa selkeän kulkureitin tutkimuksesta tuotteeseen.