Simon Poghosyan on. perustaja ja toimitusjohtaja GSpeech, verkkopohjainen tekoälyalusta, joka auttaa tekemään verkkosisällöstä helpommin saavutettavaa muuntamalla tekstin luonnolliselta kuulostavaksi ääneksi yli 70 kielellä. Simonilla on VLSI-suunnittelun tausta ja vahva kiinnostus ohjelmointiin ja käyttökokemukseen, ja hän loi GSpeechin yksinkertaistaakseen tapaa, jolla verkkosivustot voivat tarjota ääniohjattua sisältöä.
Nykyään GSpeech tuottaa noin 200 miljoonaa merkkiä ääntä kuukaudessa, ja sitä käytetään yli 70 maassa. Sen mukautettavat äänisoittimet tarjoavat yli 200,000 1 toistokertaa kuukaudessa. GSpeech kasvaa edelleen nopeasti ylitettyään hiljattain miljardin merkin rajan äänisisällön tuottamisessa. Alusta on suunniteltu helposti integroitavaksi – se vaatii vain yhden koodirivin – ja tukee sisällöntuottajia, kouluttajia ja yrityksiä sisällöntuotannon tekemisessä osallistavammaksi ja kiinnostavammaksi.
VLSI-suunnittelun (Very Large Scale Integration) taustasi ja varhainen ohjelmointikokemuksesi loivat vahvan teknisen perustan. Mikä inspiroi sinua siirtymään mikroelektroniikasta tekoälypohjaisten ohjelmistojen rakentamiseen ja miten se johti GSpeechin luomiseen?
Ongelmanratkaisun intohimoni alkoi lukiossa rakkaudesta matematiikkaan ja fysiikkaan. Tämä kiinnostus johti minut suorittamaan kandidaatin (2009) ja maisterin (2011) tutkinnot VLSI-suunnittelussa Armenian valtion teknillisessä yliopistossa yhteistyössä Synopsys Armenian kanssa. Fysiikan opiskelu koulutti minua tarkkuuteen ja analyyttiseen ajatteluun, mutta vasta toisena opiskeluvuotenani löysin ohjelmoinnin – aloittaen Pascal-kielestä – ja rakastuin siihen välittömästi. Ystäväni ja minä teimme kurssitehtäviä heti saatuamme ne, vaikka meillä oli kuusi kuukautta aikaa tehdä ne. Sitten huvin vuoksi aloimme tehdä muiden opiskelijoiden tehtäviä.
Tämä intohimo johdatti minut syvemmälle ohjelmistokehitykseen. Aloitin verkkosivustojen luomisella ja rakensin sitten oman sisällönhallintajärjestelmäni. Saatuaani päätökseen useita prosessiautomaatio- ja tiedonhallinta-arkkitehtuuriprojekteja tajusin, kuinka paljon rakastin digitaalisten ratkaisujen rakentamista web-käyttöliittymille. 2GLux-projektissa tein yhteistyötä Edvard Ananyanin kanssa — suositun GTranslate käännöspalvelu ja koulukaveri Quantum Gymnasiumista. Hän tutustutti minut WordPress- ja Joomla-ekosysteemeihin ja konseptiin GSpeech sai alkunsa hänestä. Tuo varhainen työ johti työkalumme ensimmäiseen versioon, jonka avulla käyttäjät pystyivät kuuntelemaan verkkosivulla olevaa tekstiä, mikä kylvi siemenen sille, mistä myöhemmin tulisi täysimittainen tekoälyalusta. Vuoteen 2023 mennessä perustin Smarts Club LLC skaalata GSpeech globaaliksi tekoälyääniratkaisuksi, joka tukee yli 70 kieltä. Humanity Union:n ylistys GSpeechin roolista heidän kansalaisosallistumisalustansa saavutettavuuden parantamisessa heijastaa tehtävääni kuroa umpeen digitaalisia kuiluja tekoälyn avulla – visiota, joka juontaa juurensa ohjelmoinnin alkuaikoinani.
GSpeech sai alkunsa työkaluna näkövammaisten käyttäjien tukemiseen. Miten tämä varhainen tehtävä vaikutti alustan kehitykseen täysimittaiseksi tekoälypohjaiseksi tekstistä puheeksi -ratkaisuksi?
Keskittyminen saavutettavuuteen vauhditti korkealaatuisen, reaaliaikaisen tekoälyäänen kehittämistä, käännöksiä yli 70 kielelle ja saumatonta verkkosivustointegraatiota yksinkertaisen koodinpätkän avulla. Tämä missio johti ominaisuuksiin, kuten mukautettaviin äänisoittimiin, kieli- ja äänivalintapaneeleihin, kontekstitietoiseen toistoon, äänen latauksiin ja yksityiskohtaisiin käyttötilastoihin – mukaan lukien maa-, kaupunki- ja laitetiedot sekä toistoanalytiikka ajan kuluessa – jotka kaikki on suunniteltu tekemään sisällöstä osallistavampaa ja kiinnostavampaa. Kirjoitettuani yli 100,000 2023 riviä koodia julkaisin GSpeech Cloud Consolen vuonna XNUMX – skaalautuvan ratkaisun, joka tasapainottaa osallistavuuden ja edistyneet toiminnot ja antaa yrityksille ja sisällöntuottajille mahdollisuuden tehdä sisällöstään saavutettavaa, monikielistä ja vuorovaikutteista kaikkialla verkossa.
Mitkä olivat suurimpia teknisiä haasteita, joita kohtasitte GSpeech Cloud Console -kehityksen aikana?
Yksi suurimmista haasteista GSpeech Cloud Console -sovelluksen kehittämisessä oli skaalautuvan arkkitehtuurin suunnittelu reaaliaikaista, turvallista ja korkealaatuista tekoälyäänen tuottamista varten. Tämä vaati innovatiivisia ratkaisuja relevantin sisällön hakemiseen verkosta, äänen käsittelyyn palvelimillamme ja sen tallentamiseen pilveen nopeaa ja luotettavaa toimitusta varten. Vankkojen turvatoimenpiteiden, kuten salauksen ja käyttöoikeuksien hallinnan, käyttöönotto oli ratkaisevan tärkeää dynaamisen, käyttäjien luoman sisällön suojaamiseksi.
Toinen haaste oli reaaliaikaisen kääntämisen mahdollistaminen edistyneiden neuromoottorien avulla. Meidän piti varmistaa pienen latenssin ja tarkat käännökset samalla, kun rakensimme intuitiivisen käyttöliittymän, jonka avulla käyttäjät voivat valita kieliä ja haluamiaan ääniprofiileja toistoa varten, priorisoiden käyttäjämukavuutta ja personointia. Lopuksi kehitimme äänimallien luontitoiminnon, jossa on useita mukautettavia soitinnäkymiä, joiden avulla käyttäjät voivat suunnitella ainutlaatuisia, visuaalisesti miellyttäviä soittimia verkkosivustoilleen räätälöityinä. Joustavuuden, suorituskyvyn ja helppokäyttöisyyden tasapainottaminen eri laitteilla oli palkitseva haaste.
Reaaliaikaiset käännökset yli 70 kielellä ja yli 230 luonnolliselta kuulostavaa ääntä. Miten varmistat äänenlaadun ja säilytät tarkkuuden näin monimuotoisella kielijoukolla?
Tasaisen äänenlaadun ylläpitämiseksi integroimme useita edistyneitä tekstistä puheeksi (TTS) -malleja, joita optimoidaan ja päivitetään jatkuvasti. Nämä monikieliset moottorit käsittelevät sekakielistä sisältöä erittäin tarkasti. Otamme myös käyttöön yli 100 uutta äänivärähtelyä, jotka tarjoavat käyttäjille entistä ilmeikkäämpiä ja luonnollisemmalta kuulostavia vaihtoehtoja. Joka kuukausi GSpeech tuottaa yli 200 miljoonaa merkkiä ääntä, palvellen käyttäjiä yli 70 maassa. Verkkosoittimiamme käytetään yli 200,000 XNUMX kertaa kuukaudessa – ja määrä kasvaa. Tämä mittakaava varmistaa jatkuvan palautteen ja tosielämän testauksen, mikä ohjaa suoraan säätö- ja laadunvalvontaamme.
Voitko kertoa meille, miten GSpeech hyödyntää tekoälyä ja koneoppimista tuottaakseen luonnollisen äänisynteesin? Miten pysytte mukana neuroääniteknologian nopeassa kehityksessä?
GSpeech hyödyntää edistynyttä tekoälyä ja koneoppimista integroimalla useita huippuluokan tekstistä puheeksi -malleja tuottaakseen elävän näköistä äänisynteesiä. Nämä luonnollisuutta ja monikielisyyttä optimoidut mallit käsittelevät tekstisyötteitä luodakseen korkealaatuista ääntä realistisella intonaatiolla ja rytmillä, jopa sekakieliselle sisällölle. Parannamme käyttökokemusta tarjoamalla mukautettavia äänityylejä eri kielille. Olemme myös integroineet TTS-aliaksia, joiden avulla käyttäjät voivat määrittää mukautettuja sääntöjä tiettyjen sanojen tai lauseiden esittämiselle äänessä – esimerkiksi korvaamalla tiettyjä termejä tarkemman ääntämisen tai fraseerauksen saavuttamiseksi. Pysyäksemme ajan tasalla neuroääniteknologian suhteen arvioimme ja integroimme jatkuvasti uusimpia edistysaskeleita, teemme yhteistyötä alan johtajien kanssa ja suunnittelemme omien mallien kehittämistä tulevaisuudessa varmistaen, että GSpeech pysyy äänisynteesi-innovaation eturintamassa.
Kuinka tärkeää äänen viritys, äänenkorkeuden säätö ja toiston mukauttaminen ovat käyttäjillesi – ja missä käyttötapauksessa olet ylpein, jossa nämä ominaisuudet todella loistavat?
Äänen viritys, äänenkorkeuden säätö ja toiston mukauttaminen ovat käyttäjillemme kriittisen tärkeitä, sillä niiden avulla he voivat luoda ainutlaatuisia ja korkealaatuisia äänityylejä, jotka on räätälöity heidän erityistarpeisiinsa, uutisista ja blogeista aina saavutettavaan e-oppimissisältöön. Yli 100 uuden äänivärin jatkuva integrointi parantaa tätä entisestään ja tarjoaa käyttäjille vertaansa vailla olevaa joustavuutta luoda todella omaleimaisia selostuksia. Olen ylpein GSpeech Studiosta, uudesta äänenmuokkaus- ja luontialustasta, jota kehitän parhaillaan. Sen avulla käyttäjät voivat luoda useita äänikanavia, miksata niitä taustamusiikkiin ja viedä viimeisteltyjä selostuksia, mikä antaa sisällöntuottajille mahdollisuuden tuottaa ammattitason ääntä erilaisiin sovelluksiin. Näkövammaisen opiskelijan kirje, jossa hän kiitti GSpeechiä itsenäisen opiskelun mahdollistamisesta räätälöidyn äänen avulla, kosketti minua syvästi. Tämä käyttötapaus osoittaa, kuinka nämä ominaisuudet tekevät sisällöstä saavutettavan ja transformatiivisen, tavoitteen, jota olen tavoitellut ohjelmoinnin alkuajoistani lähtien.
GSpeech tarjoaa saumattomia integraatioita WordPressin, Shopifyn, Wixin ja muiden kanssa. Mikä on ollut strategianne tehdä alustasta helppokäyttöinen sisällöntuottajille ja yrityksille eri ekosysteemeissä?
GSpeechin plug-and-play-integraatiostrategiamme alustoille, kuten WordPress, Shopify ja Wix, keskittyi yksinkertaisuuteen, yhteensopivuuteen ja skaalautuvuuteen. Kehitimme kevyitä, modulaarisia laajennuksia ja koodinpätkiä, jotka integroituvat saumattomasti ja vaativat vain vähän asennusta – usein vain muutaman napsautuksen. Tämä tarkoittaa, että tuhannet artikkelit ja dynaamiset sisältölohkot voivat saada välittömästi äänituen – ilman manuaalista vaivaa. Tarjoamme erittäin joustavia ja kauniisti suunniteltuja soittimia, jotka mukautuvat eri laitteisiin, kuten mobiililaitteisiin, tabletteihin ja pöytätietokoneisiin. Soittimiamme voi paitsi muokata, myös optimoida saavutettavuuden ja käyttäjien sitoutumisen kannalta. WordPressin osalta upotimme GSpeech-pilvihallintapaneelin suoraan hallintapaneeliin laajennuksemme kautta, mikä virtaviivaistaa hallintaa käyttäjille. Yksityiskohtainen dokumentaatio ja intuitiiviset hallintapaneelit opastavat ei-teknisiä käyttäjiä asennuksen ja mukauttamisen läpi. Säännöllinen testaus varmistaa yhdenmukaisen suorituskyvyn erilaisissa ekosysteemeissä, antaen sisällöntuottajille ja yrityksille mahdollisuuden lisätä tekoälypohjaista tekstistä puheeksi -toimintoa vaivattomasti.
Kun katsot taaksepäin matkaasi vuodesta 2012 tähän päivään, mikä on ollut sinulle henkilökohtaisesti tai ammatillisesti suurin virstanpylväs GSpeechin rakentamisessa?
GSpeechin suurin virstanpylväs oli miljardin merkin verran korkealaatuista tekoälyääntä, joka havainnollistaa globaalia vaikutustamme saavutettavuuteen. Yhtä merkittävää on ollut palaute, jota olemme saaneet organisaatioilta, kuten Humanity Unionilta, joka kehui GSpeechiä heidän yhteiskuntavastuualustansa parantamisesta, ja blogien omistajilta, jotka kutsuivat sitä "käänteentekeväksi tekijäksi" käyttäjien sitoutumisessa. Yli 1 viiden tähden arvostelua eri alustoilla, kuten WordPress ja AppSumo viime kuukausina heijastavat tätä kasvavaa luottamusta.
GSpeechiä käyttävät nyt aktiivisesti myös Namanganin alueellinen tilastokeskus Uzbekistanissa — valtion laitos, jolla on merkittävää liikennettä ja kansallista näkyvyyttä. Julkisyhteisön näkeminen teknologiamme laajan käyttöönoton on ollut merkittävä virstanpylväs ja vahva osoitus luottamuksesta ratkaisuumme.
Kristittynä ja armenialaisena kirkon jäsenenä pyrin tukemaan myös muita uskonnollisia aloitteita aina kun mahdollista. Tarjoan usein GSpeechiä ilmaiseksi kristillisille verkkosivustoille keinona auttaa levittämään sanomaansa tehokkaammin ja tehdä Raamatusta helpommin saatavilla olevaa äänen kautta. Se on minun pieni panokseni johonkin suurempaan. Samaan aikaan olen ylpeä voidessani työskennellä omistautuneiden seurakuntien, kuten Johto — messiaaninen seurakunta ja arvostettu GSpeech-asiakas — jonka tehtävä ja sisältö heijastavat Raamatun voimaa toiminnassa.
Nämä hetket – jolloin teknologiasta tulee silta uskolle, ymmärrykselle ja osallisuudelle – muistuttavat minua siitä, miksi alun perin loimme GSpeechin.
Minkä roolin näet GSpeechillä olevan digitaalisen median tulevaisuudessa, erityisesti äänisisällön ja ääniliittymien tullessa yhä hallitsevammiksi?
Näen GSpeechin johtavana toimijana digitaalisen median saavutettavuuden ja kiinnostavuuden parantamisessa mahdollistamalla tekoälyllä toimivan äänikomennon verkossa. Tavoitteenamme on muuttaa koko verkkokokemus niin, että verkkosivustoista tulee luonnostaan ääni-vuorovaikutteisia, osallistavia ja oletusarvoisesti monikielisiä. Vain yhdellä koodirivillä sivustojen omistajat voivat muuntaa tuhansia artikkeleita äänitetyksi sisällöksi. Tulevaisuudessa kehitämme GSpeech Studiota tehokkaaksi ja ainutlaatuiseksi äänen luomisen ja muokkaamisen alustaksi, jonka avulla käyttäjät voivat luoda monikerroksista äänisisältöä taustamusiikilla, tehosteilla ja tarkalla virityksellä. Haluamme tehdä verkosta todella kuuluvan, intuitiivisen ja yleisesti saavutettavan.
GSpeech julkaistiin hiljattain AppSumossa ja on jo saanut lähes täydellisen arvosanan varhaisilta käyttöönottajilta. Mitä AppSumo-yhteisön vastaanotto on merkinnyt sinulle, ja miten aiot hyödyntää tätä vauhtia tulevaisuudessa?
AppSumon lanseeraus esitteli GSpeechin miljoonille ihmisille, ja sen lähes täydellinen arvosana on uskomattoman vahvistava. Käyttäjät, kuten verkkokursseja vetävät, ylistävät intuitiivisia työkalujamme ja reagoivaa tukeamme, toistaen Humanity Unionin palautetta. Eräs bloggaaja kutsui ääntämme "aidosti mukaansatempaaviksi" ja käännöksiä "vaikuttaviksi". Heidän positiivinen palautteensa vahvistaa tekoälypohjaisen tekstistä puheeksi -ratkaisumme arvon ja ruokkii intohimoani projektia kohtaan. Asiakkaiden tukeminen lanseerauksen aikana herätti myös uusia ideoita, erityisesti GSpeech Studioon, joka sai inspiraationsa käyttäjien pyynnöistä edistyneistä äänenmuokkaus- ja vientiominaisuuksista. Jatkossa aion rakentaa tätä vauhtia kuuntelemalla aktiivisesti yhteisöämme, integroimalla heidän palautteensa ja kehittämällä innovatiivisia ominaisuuksia, jotka parantavat saavutettavuutta ja sitoutumista varmistaen, että GSpeech kehittyy edelleen mullistavana työkaluna sisällöntuottajille ja yrityksille.
Lopuksi, mitä neuvoja antaisit nuorille kehittäjille tai yrittäjille, jotka haluavat rakentaa helppokäyttöisiä, tekoälypohjaisia työkaluja nykypäivän nopeasti muuttuvassa teknologiaympäristössä?
Nuorille kehittäjille ja yrittäjille neuvoni on panostaa työhön sydämellä ja tunnistaa todellinen ongelma, johon voit tarjota ainutlaatuisen ja älykkään ratkaisun. Aloita pienestä, ota tasaisia askeleita eteenpäin ja kuuntele tarkkaan asiakaspalautetta – se ohjaa polkuasi. Kohtele käyttäjiäsi kuin luotettuja ystäviä, anna kaikkesi ja pysy kärsivällisenä. Hyväksy tekoälyteknologiat voimakkaina liittolaisina; viisaasti käytettynä ne vahvistavat kykyäsi luoda vaikuttavia ja helppokäyttöisiä työkaluja. Rakenna intohimoisesti, sinnikkyydellä ja sitoutumisella muutoksen aikaansaamiseen, niin luot ratkaisuja, joilla on todella merkitystä.
Kiitos Antoine Tardif haastattelua varten. Voit lukea koko haastattelun täältä: unite.ai.