В «Microsoft» разработали нейросеть, способную копировать голос любого человека
Узнав конкретный голос, «VALL-E» может синтезировать аудиозапись того, как человек говорит что-либо, стараясь сохранить его эмоциональный тон. Сама технология представляет из себя нейронную языковую модель, в основе которой лежит «EnCodec».
С его помощью «VALL-E» разделяет голоса человека на отдельные компоненты.
Эти компоненты, так называемые «лексемы», нейросеть сопоставляет с соответствующими голосами в своих обучающих данных для создания новых фраз за пределами первоначального трёхсекундного образца.
Помимо сохранения вокального тембра и эмоционального тона говорящего, «VALL-E» также может имитировать «акустическое окружение» сэмпла аудио. Например, если сэмпл взят из телефонного звонка, аудиовыход будет имитировать акустические и частотные свойства телефонного звонка в его синтезированном выходе.
04 августа, 16:26
78
Армия США израсходовала практически весь запас высокоточных ракет большой дальности – «ATACMS» и более новых «PrSM»
03 августа, 16:29
93
Украинские крылатые ракеты «FP-5» «Фламинго» начали оснащать новыми силовыми установками британского производства
02 августа, 09:41
144
Россия модернизировала реактивный ударный беспилотник “Герань-4 Сикер”, оснастив его оптико-электронной системой наведения
01 августа, 19:45
89

