Meta* научила нейросеть рисовать GIF-анимации и штамповать QR-коды прямо в картинке
Meta выпустила генератор изображений Muse Image с GIF-анимациями и рабочими QR-кодами, анонсировав видеогенератор Muse Video со звуком.
Компания Цукерберга выпустила генератор изображений Muse Image и показала превью видеогенератора Muse Video.
Muse Image рисует картинки по текстовому описанию, но перед этим «думает»: продумывает композицию и может вызывать вспомогательные инструменты. Например, если попросить QR-код, модель сгенерирует рабочий код, который действительно ведёт на нужный сайт — а не просто узор, похожий на QR-код.
Модель умеет сохранять внешность конкретного человека на фото и одевать его в вещи, которые сама же находит в интернете по запросу. А ещё она делает GIF-анимации: попросите «16 кадров драки двух персонажей» — и нейросеть продумает содержание каждого кадра отдельно, а потом соберёт их в анимацию.
Из практичного — редактирование фото: реставрация старых снимков, раскрашивание чёрно-белых, замена погоды или фона на изображении.
В рейтинге Arena, где люди вслепую сравнивают качество разных моделей, Muse Image заняла второе место по генерации картинок из текста, уступив gpt-image-2 от OpenAI, и второе — по редактированию.
Пользоваться Muse Image уже можно в чат-боте Meta AI, в сторис Instagram* в США и в WhatsApp в некоторых странах. Скоро добавят в Facebook*.
Muse Video, в отличие от Muse Image, ещё не запущен — это ранняя превью-версия, доступ через Meta AI обещают в ближайшее время. Модель генерирует видео сразу со звуком. Компания честно признаёт: с синхронизацией звука и картинки пока есть проблемы. Тем не менее в рейтинге Arena для видео Muse Video уже засветилась и заняла третье место, обойдя китайскую HappyHorse 1.0 от Alibaba.
Технология есть, продукт частично есть, а лидерство — нет: по обоим направлениям Meta* пока вторая-третья, а не первая.
*Компания Meta признана экстремистской и запрещена в РФ.