Teksta pārvēršana runā, ko sauc arī par TTS, ir atbalsta tehnoloģijas veids, kas nodrošina vieglumu un komfortu dzīvē. Sistēma nolasa digitālos tekstus pietiekami skaļi un skaidri, lai cilvēks tos saprastu. TTS ir pazīstama arī kā nolasīšanas tehnoloģija, kas ir plaši atzīta tās elastības dēļ. Tas ir viena pieskāriena attālumā, kur vietnes teksts tiek pārveidots par audio.
Sistēma tiek paplašināta visās ierīcēs, piemēram, viedtālruņos, klēpjdatoros, galddatoros un planšetdatoros, kas tiek uzskatīti par ideāli piemērotiem bērniem, sabiedrībai vecumā virs 20 gadiem un cilvēkiem ar invaliditāti. Cīņa par lasīšanu un acu skatīšanās uz elektroniskajām ierīcēm ir pazudusi, izmantojot TTS, vienlaikus palielinot uzmanību, mācīšanos un ieradumu lasīt tiešsaistē, klausoties. Tātad, ja esat emuāru autors, lasītājs vai vietnes īpašnieks, TTS ir programmatūra, kas paplašinās jūsu zināšanu apvārsni. Bet kādi ir ieguvumi no balss uz visu, bez ierobežojumiem un bez robežām? Tas ir nošķirts atkarībā no lietotājiem, jo viņi ir persona, kas izmanto pakalpojumus.
Ļaut cilvēkiem sarunāties ar mašīnām ir sens sapnis par cilvēka un datora mijiedarbību. Datoru spēja saprast dabisko runu pēdējos gados ir mainījusi dziļo neironu tīklu (piemēram, Google balss meklēšana) pielietojumu. Tomēr runas ģenerēšana ar datoriem — process, ko parasti dēvē par runas sintēze vai teksta pārvēršana runā (TTS) — joprojām lielā mērā balstās uz t.s konkatenatīvs TTS, kur ļoti liela īsu runas fragmentu datubāze tiek ierakstīta no viena runātāja un pēc tam apvienota, veidojot pilnīgus izteikumus. Tas apgrūtina balss pārveidošanu (piemēram, pārslēgšanos uz citu runātāju vai runas uzsvara vai emociju maiņu), neierakstot pilnīgi jaunu datubāzi.
TTS process ietver vairākus posmus:
Ir vairāki TTS tehnoloģiju veidi, tostarp:
GSpeech piedāvā daudzas funkcijas, tostarp tiešsaistes, SaaS, lokālos teksta pārvēršanas runā (TTS) risinājumus dažādiem avotiem, piemēram, vietnēm, mobilajām lietotnēm, e-grāmatām, e-mācību materiāliem, dokumentiem, ikdienas klientu pieredzei, transportam. pieredzi un daudz ko citu. Kā labumu gūst uzņēmums, organizācija un izdevēji, kas integrē TTS tehnoloģiju.
TTS tehnoloģija nodrošina lielāku pieejamību personām ar redzes traucējumiem, disleksiju vai lasīšanas grūtībām, ļaujot viņiem piekļūt informācijai un vieglāk sazināties.
Nodrošinot alternatīvu veidu, kā lietotāji var patērēt jūsu saturu, varat uzlabot savas WordPress vietnes meklētājprogrammu optimizāciju (SEO). Tas ir īpaši svarīgi lietotājiem, kuri paļaujas uz ekrāna lasītājiem, lai pārvietotos tīmeklī.
TTS tehnoloģija var uzlabot lietotāja pieredzi, nodrošinot dabiskāku un intuitīvāku veidu, kā mijiedarboties ar ierīcēm, samazinot vajadzību pēc manuālas rakstīšanas vai lasīšanas.
TTS tehnoloģija var nodrošināt 24/7 klientu atbalstu, atbildot uz bieži uzdotajiem jautājumiem un sniedzot informāciju klientiem efektīvākā un iedarbīgākā veidā.
TTS tehnoloģija var palielināt produktivitāti, automatizējot tādus uzdevumus kā datu ievade, transkripcija un lasīšana, tādējādi atbrīvojot laiku svarīgākiem uzdevumiem.
TTS tehnoloģija var atbalstīt vairākas valodas, padarot to par vērtīgu rīku uzņēmumiem un organizācijām, kas darbojas globāli.
TTS tehnoloģija var uzlabot lasīšanas izpratni, ļaujot lietotājiem klausīties tekstu, vienlaikus sekojot rakstītajam vārdam, tādējādi atvieglojot sarežģītas informācijas izpratni.
TTS tehnoloģija var samazināt acu nogurumu un nogurumu, nodrošinot alternatīvu lasīšanai un rakstīšanai, padarot to par vērtīgu rīku personām, kuras pavada ilgas stundas pie ekrāna.
TTS tehnoloģija var palielināt iesaisti, nodrošinot interaktīvāku un visaptverošāku pieredzi, padarot to par vērtīgu rīku izglītības un izklaides lietojumprogrammām.
TTS tehnoloģija var nodrošināt konkurences priekšrocības, piedāvājot unikālu un novatorisku veidu, kā mijiedarboties ar ierīcēm, izceļot jūsu produktu vai pakalpojumu no konkurentiem.
Tas ir radījis lielu pieprasījumu pēc parametru TTS, kur visa datu ģenerēšanai nepieciešamā informācija tiek glabāta modeļa parametros, un runas saturu un raksturlielumus var kontrolēt, izmantojot modeļa ievades. Tomēr līdz šim parametriskajai TTS ir bijusi tendence izklausīties mazāk dabiski nekā konkatenatīvi. Esošie parametru modeļi parasti ģenerē audio signālus, izvadot to izvadi caur signālu apstrādes algoritmiem, kas pazīstami kā vokoderi.
WaveNet maina šo paradigmu, tieši modelējot neapstrādātu audio signāla viļņu formu, pa vienam paraugam. Izmantojot neapstrādātas viļņu formas, WaveNet var modelēt jebkāda veida audio, tostarp mūziku, ne tikai rada dabiskāku runu.
Pētnieki parasti izvairās modelēt neapstrādātu audio, jo tas tik ātri atzīmējas: parasti 16,000 XNUMX paraugu sekundē vai vairāk, ar svarīgu struktūru daudzos laika skalos. Pilnīgi autoregresīva modeļa izveidošana, kurā prognozi katram no šiem paraugiem ietekmē visi iepriekšējie (statistikas ziņā katrs paredzamais sadalījums ir atkarīgs no visiem iepriekšējiem novērojumiem), noteikti ir sarežģīts uzdevums.
Tomēr, PixelRNN un PixelCNN modeļi, kas tika publicēti iepriekš, parādīja, ka ir iespējams ģenerēt sarežģītus dabiskus attēlus ne tikai pa vienam pikselim, bet arī vienam krāsu kanālam, katram attēlam ir nepieciešami tūkstošiem prognožu. Tas mūs iedvesmoja pielāgot mūsu divdimensiju PixelNets viendimensijas WaveNet.
Iepriekš redzamā animācija parāda, kā WaveNet ir strukturēts. Tas ir pilnībā konvolucionāls neironu tīkls, kurā konvolucionālajiem slāņiem ir dažādi dilatācijas faktori, kas ļauj tā uztverošajam laukam eksponenciāli augt ar dziļumu un aptvert tūkstošiem laika posmu.
Apmācības laikā ievades secības ir reālas viļņu formas, kas ierakstītas no cilvēka skaļruņiem. Pēc apmācības mēs varam atlasīt tīkla paraugus, lai ģenerētu sintētiskus izteikumus. Katrā izlases posmā vērtība tiek iegūta no tīkla aprēķinātā varbūtības sadalījuma. Pēc tam šī vērtība tiek ievadīta atpakaļ ievadē un tiek veikta jauna prognoze nākamajam solim. Šāda paraugu veidošana pa vienam solim ir skaitļošanas ziņā dārga, taču mēs esam atklājuši, ka tas ir būtiski, lai radītu sarežģītu, reālistisku skaņu.
Trenējāmies WaveNet izmantojot dažas Google TTS datu kopas, lai mēs varētu novērtēt tās veiktspēju. Nākamajā attēlā ir parādīta WaveNets kvalitāte skalā no 1 līdz 5, salīdzinot ar Google pašreizējām labākajām TTS sistēmām (parametrisks un konkatenatīvs), un ar cilvēka runu, izmantojot Vidējie viedokļu rādītāji (MOS). MOS ir standarta mērs subjektīviem skaņas kvalitātes testiem, un tie tika iegūti aklos testos ar cilvēkiem (no vairāk nekā 500 vērtējumiem 100 testa teikumos). Kā redzam, WaveNets samazina atšķirību starp jaunākajiem sasniegumiem un cilvēka līmeņa veiktspēju par vairāk nekā 50% gan ASV angļu, gan mandarīnu ķīniešu valodā.
Gan ķīniešu, gan angļu valodā Google pašreizējās TTS sistēmas tiek uzskatītas par vienu no labākajām visā pasaulē, tāpēc abu šo sistēmu uzlabošana ar vienu modeli ir liels sasniegums.
GSpeech ir AI balss sintēzes algoritms, kas ir viens no vismodernākajiem un reālistiskākajiem biznesā. Lielākā daļa balss sintezatoru (tostarp Apple Siri) izmanto tā saukto konkatenatīvo sintēzi, kurā programma saglabā atsevišķas zilbes — tādas skaņas kā “ba”, “sht” un “oo” — un lidojuma laikā saliek tās kopā, veidojot vārdus un teikumus. . Gadu gaitā šī metode ir kļuvusi diezgan laba, taču tā joprojām izklausās nežēlīgi.
Salīdzinājumam, WaveNet izmanto mašīnmācīšanos, lai ģenerētu audio no nulles. Tas faktiski analizē viļņu formas no milzīgas cilvēka runas datu bāzes un izveido tās no jauna ar ātrumu 24,000 2016 paraugu sekundē. Gala rezultātā ir iekļautas balsis ar tādiem smalkumiem kā lūpu smaržas un akcenti. Kad Google XNUMX. gadā pirmo reizi atklāja WaveNet, tas bija pārāk skaitļošanas ziņā intensīvs, lai strādātu ārpus pētniecības vides, taču kopš tā laika tas ir ievērojami samazināts, parādot skaidru virzību no pētījuma uz produktu.