Нов изкуствен интелект на Microsoft преобразува текст в жива реч за 3 секунди

Технолозите на Microsoft разкриха една от най-новите си разработки. Това е модел с изкуствен интелект (AI), наречен VALL-E, който е предназначен да преобразува текст в жива реч. Това не е първият модел от този вид, но ако алгоритъмът Lyrebird 2017, разработен в университета в Монреал, се нуждаеше от цяла минута запис за анализ, то моделът VALL-E се нуждае само от три секунди. След това започва да имитира речта на конкретен човек, включително акустична окраска и емоционалност на тона.
VALL-E е програмиран на 60 000 часа записи на реч на английски, предимно аудиокниги, четени от различни хора. Това даде своя резултат, моделът възпроизвежда изречения, които звучат напълно естествено.
Единственият недостатък на модела е, че прекъсва звука, когато в изреченията се появят неясни места от гледна точка на синтаксиса или пунктуацията. Моделът VALL-E също е много добър в пресъздаването на аудиосредата на оригиналния образец. Ако този образец, например, е записана от телефон, тогава цялата следваща синтезирана реч ще бъде "като от телефон". Също така моделът е в състояние да възпроизвежда тънкостите на речта, подобни образци, записани от американец или британец, дават напълно различни резултати.
Също така, моделът VALL-E е в състояние да придаде на речта емоционален характер. Може да предостави няколко примера на реч, отбелязани като ядосана, сънлива, изненадана, отвратена и т.н. Колкото повече такива образци се предоставят, толкова по-емоционална и естествена става синтезираната реч.
Последствията от подобни технологии са доста ясни. Положителната страна е, че можете да получите списък за пазаруване, озвучен от известен актьор, докато сте в супермаркета, или телефонът ви ще рецитира аудиокнига с глас, който отговаря на нейното съдържание, или дори с няколко гласа.
Но от лошата страна нещата изглеждат по-зле. Представете си измамник, който получава мостра от вашия глас и след това се обажда на близките ви роднини. Освен това с помощта на тази технология е възможно да се заобиколят системите за гласова идентификация, а фалшифициран запис на речта на всеки известен политик може да причини съкрушителен крах на кариерата му. И в заключение, трябва да се отбележи, че всички ние наскоро видяхме, че системите за изкуствен интелект като DALL-E, ChatGPT и други deepfake- технологии започват да се преместват от лабораториите в реалния свят. И тези промени, както обикновено, носят в същото време много нови рискове.
Ключови думи
ОЩЕ ОТ КАТЕГОРИЯТА
|
|
Естония започна строителство на мащабни отбранителни съоръжения до границата с Русия
Свят |Тръмп обяви, че няма да има нови израелски удари срещу Катар
Свят |Милиони потребители са потенциално засегнати след кибератака срещу Gucci, Balenciaga и Alexander McQueen
Бизнес |Първата голяма конференция за финансова независимост на жените в България From Zero To Hero събира широка институционална подкрепа
ПР и събития | Advertorial |Технополис започва да приема предварителни поръчки за новите модели iPhone 17
Технологии | Advertorial |Седмичен хороскоп: Звездите за бизнеса от 15 до 21 септември
Хороскоп |5-минутно упражнение може да удължи вашия живот и да ви направи по-успешни
Техники за успех |Израел започна сухопътно настъпление в град Газа
Свят |Япония е на първо място по дял на възрастните хора в страните с население над 40 милиона
Свят |На днешната дата, 16 септември. Рождениците днес
На днешната дата |Тръмп подписа указ за разполагане на Националната гвардия в Мемфис
Свят |Смятана за изгубена от 400 г. картина на Рубенс е открита в имение в Париж
Свят |Времето: Сутринта мъгливо, следобед - слънчево
България |ADVERTORIAL

Първата голяма конференция за финансова независимост на жените в България From Zero To Hero събира широка институционална подкрепа

Партньорът на Microsoft за 2024 г. Noventiq Bulgaria със събитие за AI агенти и киберсигурност на 25 септември в София

Коментари
Няма въведени кометари.