В «Microsoft» разработали нейросеть, способную копировать голос любого человека
Узнав конкретный голос, «VALL-E» может синтезировать аудиозапись того, как человек говорит что-либо, стараясь сохранить его эмоциональный тон. Сама технология представляет из себя нейронную языковую модель, в основе которой лежит «EnCodec».
С его помощью «VALL-E» разделяет голоса человека на отдельные компоненты.
Эти компоненты, так называемые «лексемы», нейросеть сопоставляет с соответствующими голосами в своих обучающих данных для создания новых фраз за пределами первоначального трёхсекундного образца.
Помимо сохранения вокального тембра и эмоционального тона говорящего, «VALL-E» также может имитировать «акустическое окружение» сэмпла аудио. Например, если сэмпл взят из телефонного звонка, аудиовыход будет имитировать акустические и частотные свойства телефонного звонка в его синтезированном выходе.
25 августа, 23:30
24
Танки, которые были самым востребованным западным оружием в Украине, сейчас в основном простаивают, спрятанные в лесах и покрытые паутиной
25 августа, 14:29
67
После запуска «5G» Киев вышел на 55 место в мире по скорости мобильного интернета, Харьков – на 61-м месте
25 августа, 11:54
62
«Google» добавит в «Android 17» функцию «Motion Assist», предназначенную для уменьшения симптомов укачивания при использовании смартфона в транспорте
24 августа, 22:08
84

