G

Saimons Pogosjans, GSpeech dibinātājs un izpilddirektors

Saimons Pogosjans, GSpeech dibinātājs un izpilddirektors

Simons Poghosjans ir. dibinātājs un izpilddirektors GSpeech, tīmekļa mākslīgā intelekta platforma, kas palīdz padarīt tiešsaistes saturu pieejamāku, pārveidojot tekstu dabiski skanošā audio formātā vairāk nekā 70 valodās. Ar pieredzi VLSI dizainā un lielu interesi par programmēšanu un lietotāja pieredzi, Saimons izveidoja GSpeech, lai vienkāršotu veidu, kā tīmekļa vietnes var piedāvāt ar balsi iespējotu saturu.

Mūsdienās GSpeech katru mēnesi ģenerē aptuveni 200 miljonus audio rakstzīmju un tiek izmantots vairāk nekā 70 valstīs, un tā pielāgojamie audio atskaņotāji apkalpo vairāk nekā 200,000 1 atskaņošanas reižu mēnesī. Nesen pārsniedzot kopējo ģenerēto audio rakstzīmju skaitu XNUMX miljarda apmērā, GSpeech turpina strauji augt. Platforma ir izstrādāta tā, lai to būtu viegli integrēt — nepieciešama tikai viena koda rindiņa —, un tā atbalsta satura veidotājus, pedagogus un uzņēmumus, lai padarītu savu saturu iekļaujošāku un saistošāku.

Jūsu pieredze VLSI dizainā (ļoti liela mēroga integrācija) un agrīnā programmēšanas pieredze lika stabilu tehnisko pamatu. Kas iedvesmoja jūsu pāreju no mikroelektronikas uz mākslīgā intelekta darbinātas programmatūras veidošanu un kā tas noveda pie GSpeech izveides?

Mana aizraušanās ar problēmu risināšanu aizsākās vidusskolā, ko virzīja mīlestība pret matemātiku un fiziku. Šī interese mani pamudināja iegūt bakalaura (2009. gadā) un maģistra (2011. gadā) grādu VLSI projektēšanā Armēnijas Valsts Inženierzinātņu universitātē sadarbībā ar Synopsys Armenia. Fizikas studijas mani apmācīja precizitātē un analītiskā domāšanā, bet tieši otrajā kursā es atklāju programmēšanu — sākot ar Pascal valodu — un uzreiz tajā iemīlējos. Mans draugs un es izpildījām kursa darbus, tiklīdz tos saņēmām, lai gan mums bija seši mēneši, lai tos pabeigtu. Pēc tam, prieka pēc, mēs sākām pildīt citu studentu uzdevumus.

Šī aizraušanās mani ieveda dziļāk programmatūras izstrādē. Es sāku ar tīmekļa vietņu izveidi, pēc tam izveidoju savu CMS. Pēc vairāku projektu pabeigšanas procesu automatizācijā un datu pārvaldības arhitektūru projektēšanā es sapratu, cik ļoti man patīk veidot digitālos risinājumus tīmekļa saskarnēm. 2GLux projekta ietvaros es sadarbojos ar Edvardu Ananjanu — populārā GTranslate tulkošanas pakalpojums un skolas draugs no Kvantu ģimnāzijas. Viņš iepazīstināja mani ar WordPress un Joomla ekosistēmām un koncepciju GSpeech radās ar viņu. Šis agrīnais darbs noveda pie mūsu rīka pirmās versijas, kas ļāva lietotājiem klausīties tekstu tīmekļa lapā, tādējādi ieliekot pamatu tam, kas vēlāk kļuva par pilnvērtīgu mākslīgā intelekta platformu. Līdz 2023. gadam es izveidoju Smarts Club LLC mērogot GSpeech globālā mākslīgā intelekta audio risinājumā, kas atbalsta vairāk nekā 70 valodas. Humanity Unionuzslavas par GSpeech lomu viņu pilsoniskās iesaistes platformas pieejamības uzlabošanā atspoguļo manu misiju pārvarēt digitālo plaisu, izmantojot mākslīgo intelektu, — vīziju, kas sakņojas manos agrīnajos programmēšanas gados.

GSpeech sākotnēji tika izstrādāts kā rīks vājredzīgu lietotāju atbalstam. Kā šī agrīnā misija ietekmēja platformas attīstību par pilnvērtīgu mākslīgā intelekta teksta pārveidošanas runā risinājumu?

Koncentrēšanās uz pieejamību veicināja augstas kvalitātes, reāllaika mākslīgā intelekta audio izstrādi, tulkošanu vairāk nekā 70 valodās un nemanāmu tīmekļa vietņu integrāciju, izmantojot vienkāršu koda fragmentu. Šī misija noveda pie tādām funkcijām kā pielāgojami audio atskaņotāji, valodas un balss atlases paneļi, kontekstam atbilstoša atskaņošana, audio lejupielādes un detalizēta lietošanas statistika, tostarp valsts, pilsētas, ierīces dati un atskaņošanas analīze laika gaitā, kas viss ir paredzēts, lai padarītu saturu iekļaujošāku un saistošāku. Pēc vairāk nekā 100,000 2023 koda rindiņu uzrakstīšanas es XNUMX. gadā izlaidu GSpeech Cloud Console — mērogojamu risinājumu, kas līdzsvaro iekļautību ar uzlabotu funkcionalitāti, dodot iespēju uzņēmumiem un veidotājiem padarīt savu saturu pieejamu, daudzvalodu un interaktīvu visā tīmeklī.

Kādi bija daži no lielākajiem tehniskajiem izaicinājumiem, ar kuriem saskārāties GSpeech mākoņkonsoles izstrādes laikā?

Viens no lielākajiem izaicinājumiem GSpeech mākoņkonsoles izstrādē bija mērogojamas arhitektūras izstrāde reāllaika, drošai un augstas kvalitātes mākslīgā intelekta audio ģenerēšanai. Tas prasīja inovatīvus risinājumus, lai izgūtu atbilstošu saturu no tīmekļa, apstrādātu audio mūsu serveros un saglabātu to mākonī ātrai un uzticamai piegādei. Spēcīgu drošības pasākumu, piemēram, šifrēšanas un piekļuves kontroles, ieviešana bija kritiski svarīga, lai aizsargātu dinamisko, lietotāju ģenerēto saturu.

Vēl viens šķērslis bija reāllaika tulkošanas iespējošana, izmantojot uzlabotus neironu dzinējus. Mums bija jānodrošina zema latentuma, precīzi tulkojumi, vienlaikus izveidojot intuitīvu saskarni, kas ļautu lietotājiem izvēlēties valodas un vēlamos balss profilus atskaņošanai, prioritāti piešķirot lietotāja ērtībām un personalizēšanai. Visbeidzot, mēs izstrādājām audio veidnes veidotāja vedni ar vairākiem pielāgojamiem atskaņotāja skatiem, kas ļauj lietotājiem izveidot unikālus, vizuāli pievilcīgus atskaņotājus, kas pielāgoti viņu tīmekļa vietnēm. Elastības, veiktspējas un lietošanas ērtuma līdzsvarošana dažādās ierīcēs bija atalgojošs izaicinājums.

Ar reāllaika tulkojumu vairāk nekā 70 valodās un vairāk nekā 230 dabiski skanošām balsīm. Kā jūs nodrošināt balss kvalitāti un saglabāt precizitāti tik daudzveidīgā valodu kopā?

Lai saglabātu nemainīgu balss kvalitāti, mēs integrējam vairākus uzlabotus teksta pārveidošanas runā (TTS) modeļus, kas tiek nepārtraukti optimizēti un atjaunināti. Šie daudzvalodu dzinēji apstrādā jauktas valodas saturu ar augstu precizitāti. Mēs arī ieviešam vairāk nekā 100 jaunas balss vibrācijas, lai lietotājiem sniegtu vēl izteiksmīgākas un dabiskāk skanošas iespējas. Katru mēnesi GSpeech ģenerē vairāk nekā 200 miljonus audio rakstzīmju, apkalpojot lietotājus vairāk nekā 70 valstīs, un mūsu tiešsaistes atskaņotāji tiek izmantoti vairāk nekā 200,000 XNUMX reižu mēnesī — un šis skaitlis turpina pieaugt. Šis mērogs nodrošina pastāvīgu atgriezenisko saiti un testēšanu reālajā pasaulē, kas tieši ietekmē mūsu regulēšanas un kvalitātes kontroles.

Vai varat pastāstīt, kā GSpeech izmanto mākslīgo intelektu un mašīnmācīšanos, lai nodrošinātu reālistisku balss sintēzi? Kā jūs sekojat līdzi straujajai attīstībai neironu balss tehnoloģijā?

GSpeech izmanto uzlabotu mākslīgo intelektu un mašīnmācīšanos, integrējot vairākus modernus teksta pārveidošanas runā modeļus, lai radītu reālistisku balss sintēzi. Šie modeļi, kas ir optimizēti dabiskumam un daudzvalodu atbalstam, apstrādā teksta ievadi, lai ģenerētu augstas kvalitātes audio ar reālistisku intonāciju un ritmu pat jauktas valodas saturam. Mēs uzlabojam lietotāja pieredzi, piedāvājot pielāgojamus balss stilus dažādām valodām. Esam arī integrējuši TTS aizstājvārdus, kas ļauj lietotājiem definēt pielāgotus noteikumus par to, kā noteikti vārdi vai frāzes tiek atveidoti audio formātā, piemēram, aizstājot konkrētus terminus, lai panāktu precīzāku izrunu vai frāzējumu. Lai neatpaliktu no neironu balss tehnoloģijas, mēs pastāvīgi izvērtējam un integrējam jaunākos sasniegumus, sadarbojamies ar nozares līderiem un plānojam nākotnē izstrādāt patentētus modeļus, nodrošinot, ka GSpeech saglabā vadošo pozīciju balss sintēzes inovāciju jomā.

Cik svarīga lietotājiem ir balss regulēšana, skaņas augstuma kontrole un atskaņošanas pielāgošana, un kurā lietošanas gadījumā jūs visvairāk lepojaties, kur šīs funkcijas patiešām izceļas?

Balss regulēšana, toņa kontrole un atskaņošanas pielāgošana ir ļoti svarīga mūsu lietotājiem, ļaujot viņiem izveidot unikālus, augstas kvalitātes balss stilus, kas pielāgoti viņu īpašajām vajadzībām, sākot no ziņu un emuāru vietnēm līdz pieejamam e-mācību saturam. Pastāvīgā vairāk nekā 100 jaunu balss vibrāciju integrācija to vēl vairāk uzlabo, piedāvājot lietotājiem nepārspējamu elastību, lai veidotu patiesi atšķirīgus balss pārraides. Visvairāk lepojos ar GSpeech Studio — jaunu audio rediģēšanas un ģenerēšanas platformu, ko izstrādāju. Tā ļauj lietotājiem izveidot vairākus audio kanālus, sajaukt tos ar fona mūziku un eksportēt noslīpētus balss pārraides, dodot iespēju veidotājiem radīt profesionālas kvalitātes audio dažādām lietojumprogrammām. Mani dziļi aizkustināja vājredzīga studenta vēstule, kurā viņš pateicās GSpeech par patstāvīgu mācību nodrošināšanu, izmantojot pielāgotu audio. Šis lietošanas gadījums parāda, kā šīs funkcijas padara saturu pieejamu un pārveidojošu — mērķi, uz kuru esmu tiecies kopš savām pirmajām programmēšanas dienām.

GSpeech piedāvā nemanāmu integrāciju ar WordPress, Shopify, Wix un citiem. Kāda ir jūsu stratēģija, lai platforma būtu viegli lietojama satura veidotājiem un uzņēmumiem dažādās ekosistēmās?

Mūsu stratēģija GSpeech plug-and-play integrācijai ar tādām platformām kā WordPress, Shopify un Wix koncentrējās uz vienkāršību, saderību un mērogojamību. Mēs izstrādājām vieglus, modulārus spraudņus un koda fragmentus, kas integrējas nemanāmi, un tiem nepieciešama minimāla iestatīšana — bieži vien tikai daži klikšķi. Tas nozīmē, ka tūkstošiem rakstu un dinamiskā satura bloku var uzreiz iegūt balss atbalstu — bez manuālas piepūles. Mēs piedāvājam ļoti elastīgus, skaisti noformētus atskaņotājus, kas pielāgojas dažādām ierīcēm, tostarp mobilajām ierīcēm, planšetdatoriem un galddatoriem. Mūsu atskaņotāji ir ne tikai pielāgojami, bet arī optimizēti pieejamībai un lietotāju iesaisti. WordPress gadījumā mēs iegulām GSpeech mākoņa informācijas paneli tieši administratora panelī, izmantojot mūsu spraudni, vienkāršojot pārvaldību lietotājiem. Detalizēta dokumentācija un intuitīvi informācijas paneļi palīdz netehniskiem lietotājiem veikt instalēšanu un pielāgošanu. Regulāra testēšana nodrošina nemainīgu veiktspēju dažādās ekosistēmās, dodot iespēju veidotājiem un uzņēmumiem bez piepūles pievienot mākslīgā intelekta darbinātu teksta pārveidotāju runā.

Atskatoties uz ceļojumu no 2012. gada līdz mūsdienām, kāds ir bijis lielākais pagrieziena punkts jūsu personīgajā vai profesionālajā dzīvē GSpeech veidošanā?

Lielākais sasniegums GSpeech attīstībai bija 1 miljarda rakstzīmju augstas kvalitātes mākslīgā intelekta audio ģenerēšana, demonstrējot mūsu globālo ietekmi uz pieejamību. Tikpat nozīmīgas ir bijušas atsauksmes, ko esam saņēmuši no tādām organizācijām kā Humanity Union, kas slavēja GSpeech par viņu sociālās atbildības platformas uzlabošanu, un no emuāru īpašniekiem, kas to nosauca par “spēles spēles mainītāju” lietotāju iesaisti jomā. Vairāk nekā 110 piecu zvaigžņu atsauksmes dažādās platformās, piemēram, WordPress un AppSumo pēdējos mēnešos atspoguļo šo pieaugošo uzticēšanos.

GSpeech tagad aktīvi izmanto arī Namanganas reģionālā statistikas pārvalde Uzbekistānā — valdības iestāde ar ievērojamu datu plūsmu un valsts līmeņa atpazīstamību. Redzēt, ka valsts iestāde tik plaši ievieš mūsu tehnoloģiju, ir bijis nozīmīgs pagrieziena punkts un spēcīga uzticības zīme mūsu risinājumam.

Kā kristietis un cilvēks, kas kalpo armēņu baznīcā, es arī cenšos atbalstīt citas uz ticību balstītas iniciatīvas, kad vien tas ir iespējams. Es bieži piedāvāju GSpeech bez maksas kristīgām tīmekļa vietnēm, lai palīdzētu efektīvāk izplatīt viņu vēstījumu un padarītu Svētos Rakstus pieejamākus, izmantojot audio. Tas ir mans nelielais ieguldījums kaut kam lielākam. Tajā pašā laikā man ir gods strādāt ar tādām veltītām kalpošanām kā Vads — mesiāniska draudze un vērtīgs GSpeech klients —, kuras misija un saturs atspoguļo Rakstu spēku darbībā.

Šie brīži — kad tehnoloģijas kļūst par tiltu ticībai, sapratnei un iekļaušanai — atgādina man, kāpēc mēs vispār izveidojām GSpeech.

Kādu lomu, jūsuprāt, GSpeech spēlēs digitālo mediju nākotnē, jo īpaši tāpēc, ka audio saturs un balss saskarnes kļūst arvien dominējošākas?

Es iztēlojos GSpeech kā līderi digitālo mediju pieejamāku un saistošāku padarīšanā, nodrošinot mākslīgā intelekta darbinātu balss piekļuvi tīmeklim. Mūsu mērķis ir pārveidot visu tiešsaistes pieredzi, lai tīmekļa vietnes pēc noklusējuma kļūtu dabiski ar balsi interaktīvas, iekļaujošas un daudzvalodu. Ar tikai vienu koda rindiņu vietņu īpašnieki var pārvērst tūkstošiem rakstu balss saturā. Raugoties nākotnē, mēs attīstām GSpeech Studio par jaudīgu un unikālu platformu audio ģenerēšanai un rediģēšanai, ļaujot lietotājiem veidot daudzslāņu balss saturu ar fona mūziku, efektiem un precīzu regulēšanu. Mēs vēlamies padarīt tīmekli patiesi dzirdamu, intuitīvu un universāli pieejamu.

GSpeech nesen tika palaists vietnē AppSumo un jau ir ieguvis gandrīz nevainojamu vērtējumu no agrīnajiem lietotājiem. Ko jums nozīmējusi AppSumo kopienas atsaucība, un kā jūs plānojat turpināt šo impulsu turpmāk?

AppSumo palaišana iepazīstināja GSpeech miljoniem lietotāju, un tā gandrīz nevainojamais vērtējums ir neticami apstiprinošs. Lietotāji, piemēram, tie, kas vada tiešsaistes kursus, slavē mūsu intuitīvos rīkus un atsaucīgo atbalstu, atkārtojot atsauksmes no Humanity Union. Kāds emuāra īpašnieks mūsu balsis nosauca par “patiesi saistošām” un tulkojumus par “iespaidīgiem”. Viņu pozitīvās atsauksmes apstiprina mūsu mākslīgā intelekta darbinātā teksta pārveidošanas runā risinājuma vērtību un veicina manu aizrautību ar projektu. Klientu atbalstīšana palaišanas laikā arī rosināja jaunas idejas, jo īpaši GSpeech Studio, ko iedvesmoja lietotāju pieprasījumi pēc uzlabotām audio rediģēšanas un eksportēšanas funkcijām. Virzoties uz priekšu, plānoju balstīties uz šo impulsu, aktīvi klausoties mūsu kopienā, integrējot viņu atsauksmes un izstrādājot inovatīvas funkcijas, lai uzlabotu pieejamību un iesaisti, nodrošinot, ka GSpeech turpina attīstīties kā pārveidojošs rīks satura veidotājiem un uzņēmumiem.

Visbeidzot, kādu padomu jūs sniegtu jaunajiem izstrādātājiem vai uzņēmējiem, kuri vēlas veidot pieejamus, mākslīgā intelekta darbināmus rīkus mūsdienu strauji mainīgajā tehnoloģiju vidē?

Jaunajiem izstrādātājiem un uzņēmējiem mans ieteikums ir iedziļināties savā darbā un noteikt reālu problēmu, kurai varat piedāvāt unikālu, gudru risinājumu. Sāciet ar mazumiņu, speriet stabilus soļus uz priekšu un uzmanīgi ieklausieties klientu atsauksmēs — tās vadīs jūsu ceļu. Izturieties pret saviem lietotājiem kā pret uzticamiem draugiem, atdodiet visu savu enerģiju un esiet pacietīgi. Izmantojiet mākslīgā intelekta tehnoloģijas kā spēcīgus sabiedrotos; ja tās tiek izmantotas gudri, tās pastiprina jūsu spēju radīt ietekmīgus un pieejamus rīkus. Veidojiet ar aizrautību, neatlaidību un apņemšanos radīt pārmaiņas, un jūs radīsiet risinājumus, kas patiesi ir svarīgi.

Paldies Antuāns Tardifs intervijai. Pilnu interviju varat izlasīt šeit: apvienoties.ai.

🎬 Videoklipi

🎬 GSpeech — video tūre
🎬 Atklājiet GSpeech: pārveidojiet tekstu audio formātā ar AI Magic!
Pārvietojiet savu saturu uz nākamo līmeni! Izmēģiniet GSpeech tūlīt!
Iegūstiet GSpeech