Нов изкуствен интелект на Microsoft преобразува текст в жива реч за 3 секунди

Технолозите на Microsoft разкриха една от най-новите си разработки. Това е модел с изкуствен интелект (AI), наречен VALL-E, който е предназначен да преобразува текст в жива реч. Това не е първият модел от този вид, но ако алгоритъмът Lyrebird 2017, разработен в университета в Монреал, се нуждаеше от цяла минута запис за анализ, то моделът VALL-E се нуждае само от три секунди. След това започва да имитира речта на конкретен човек, включително акустична окраска и емоционалност на тона.
VALL-E е програмиран на 60 000 часа записи на реч на английски, предимно аудиокниги, четени от различни хора. Това даде своя резултат, моделът възпроизвежда изречения, които звучат напълно естествено.
Единственият недостатък на модела е, че прекъсва звука, когато в изреченията се появят неясни места от гледна точка на синтаксиса или пунктуацията. Моделът VALL-E също е много добър в пресъздаването на аудиосредата на оригиналния образец. Ако този образец, например, е записана от телефон, тогава цялата следваща синтезирана реч ще бъде "като от телефон". Също така моделът е в състояние да възпроизвежда тънкостите на речта, подобни образци, записани от американец или британец, дават напълно различни резултати.
Също така, моделът VALL-E е в състояние да придаде на речта емоционален характер. Може да предостави няколко примера на реч, отбелязани като ядосана, сънлива, изненадана, отвратена и т.н. Колкото повече такива образци се предоставят, толкова по-емоционална и естествена става синтезираната реч.
Последствията от подобни технологии са доста ясни. Положителната страна е, че можете да получите списък за пазаруване, озвучен от известен актьор, докато сте в супермаркета, или телефонът ви ще рецитира аудиокнига с глас, който отговаря на нейното съдържание, или дори с няколко гласа.
Но от лошата страна нещата изглеждат по-зле. Представете си измамник, който получава мостра от вашия глас и след това се обажда на близките ви роднини. Освен това с помощта на тази технология е възможно да се заобиколят системите за гласова идентификация, а фалшифициран запис на речта на всеки известен политик може да причини съкрушителен крах на кариерата му. И в заключение, трябва да се отбележи, че всички ние наскоро видяхме, че системите за изкуствен интелект като DALL-E, ChatGPT и други deepfake- технологии започват да се преместват от лабораториите в реалния свят. И тези промени, както обикновено, носят в същото време много нови рискове.
Ключови думи
ОЩЕ ОТ КАТЕГОРИЯТА
|
|
Ferrari сви наполовина плана си за производство на електрически коли до 2030 г.
Автомобили |Вашингтон има разработен план за унищожаване на венецуелския наркокартел „Слънцата“
Свят |Мъск се споразумя по дело с четирима бивши висши шефове на Twitter за 128 млн. долара
Компании |Bloomberg: Вашингтон одобри износ на високотехнолгични чипове за милиарди долари за ОАЕ
Икономика |Четвърт Век Съвършенство: Историята на Бова Кар и първото представителство на BMW в Бургас
Технологии | Технологии |Учени от Обединеното кралство направиха рядко откритие, свързано с гъбите
Наука и Здраве |Изследователи откриха микроби, които са в капан на арктическите ледове вече 40 000 години
Наука и Здраве |Зеленски: Ако Путин иска да превземе Източна Украйна, ще трябва да погребе един милион от войниците си
Свят |Макрон търси нов премиер, който да сложи край на кризата във Франция
Политика |Удар по сериалите: Турция задържа 19 популярни актьори и певци по дело за наркотици
Свят |"За нас боклукът е злато": Как мафията превърна Неапол в депо за токсични отпадъци
Общество |Данъчни реформи: Основателят на Revolut се премести от Великобритания в ОАЕ
Компании |Кристалина Георгиева: Несигурността е новото нормално за световната икономика
Икономика |

Коментари
Няма въведени кометари.