Нейросеть которая превращает текст в картинку
Перейти к содержимому

Нейросеть которая превращает текст в картинку

  • автор:

Нейросеть DALL-E 2 в реальном времени превращает любой текст в картинку. Результат нереальный

Favorite

В закладки

Год назад мы уже писали про нейросеть, которая способна сгенерировать картинку на основе текстового описания. То есть, пишешь «зелёный авокадо в кожаном кресле», сервис думает некоторое время и рисует требуемое изображение.

С тех пор создатели здорово прокачали своё детище, и вот появилась нейросеть DALL-E 2, которая стала умнее, быстрее и точнее. Только посмотрите, как быстро она генерирует рисунки, удивительно!

Релиз DALL-E 2 состоялся в апреле 2022 года. Сейчас нейросеть доступна для узкого круга разрабоотчиков, но вы можете подать заявку на тестирование DALL-E 2 на страничке проекта.

(11 голосов, общий рейтинг: 4.64 из 5)
�� Хочешь больше? Подпишись на наш Telegram.

Favorite

В закладки

Нейросеть которая превращает текст в картинку

Брейкданс Дарта Вейдера, падение астероида на Землю и животные в исторических костюмах — для искусственного интеллекта нет невозможного. Выбрали интересные проекты от Google, Сбера, NVIDIA и даже от бывшего инженера NASA, которые позволяют генерировать изображения по самым безумным описаниям — многие из них можно попробовать бесплатно.

Нейронные сети шагнули далеко вперед. Самая совершенная из них, DALL·E 2 от компании OpenAI (ее связывают с Илоном Маском), вот-вот бросит вызов творческим профессиям: иллюстраторам, фотографам и дизайнерам.

Ее суть в том, что она может создавать изображение по любому, даже самому безумному текстовому описанию. Начиная от «рестлеров в бальном платье эпохи Возрождения», заканчивая туристическими фотографиями Рыбинска. Результат получается порой впечатляющим.

Недавно бета-версия DALL·E 2 стала доступна онлайн — чтобы протестировать ее, нужно встать в лист ожидания и дождаться очереди. Если же хочется понять прямо сейчас, на что способны современные нейросети, составили подборку программ на базе ИИ, которые создают картинки по текстовому описанию. Одни из них идеально подходят для портретов, другие — для сюрреалистичного искусства и иллюстраций. Можете испытать их сами или посмотреть на картинки, которые сгенерировали мы.

Для навигации по статье:

Imagine — главный конкурент DALL·E 2

Компания Google (вернее, ее исследовательское отделение Google Brain) представила собственную нейросеть Imagine немногим позже DALL·E 2 — в мае 2022-го. Обучали ее на базе из 400 миллионов готовых пар изображений и текстовых описаний.

По словам разработчиков, Imagine работает лучше, чем детище OpenAI. Но верить приходится на слово — проект находится на экспериментальной стадии (и непонятно, когда из нее выйдет). Пока можно ознакомиться с примерами работ, либо попробовать небольшое демо на официальном сайте (нам предлагают составить запрос из нескольких готовых шаблонов).

Midjourney — самая художественная нейросеть

Проект одноименной независимой исследовательской лаборатории под руководством бывшего инженера NASA сейчас тоже на стадии бета-тестирования. Как и остальные, Midjourney относится к классу диффузионных нейронных сетей, то есть состоит как бы из двух нейросетей: одна отвечает за распознавание текста, другая — за генерацию изображений.

Инструмент быстро завоевывает популярность: с его помощью британский журнал The Economist создал обложку июньского номера 2022 года, а один из пользователей Reddit в августе перенес Гарри Поттера в мир киберпанка.

Midjourney называют более художественной нейросетью (в противовес DALL·E — более реалистичной), с ее помощью можно создавать сложные арты, удивляющие креативностью. Попробовать можно бесплатно в Discord (для этого нужно выбрать любую комнату в разделе Newcomer rooms, написать в чате /imagine и в строке promt вписать описание картинки на английском; если не поняли, вот инструкция).

ruDALL-E — российский ответ Илону Маску

Команда отечественных разработчиков (среди них сотрудники Sber AI) запустила российский аналог генератора в конце 2021-го, с тех пор нейросеть обзавелась несколькими вариациями:

ruDALL-E Kandinsky можно запустить в Discord или приложении Сбера Салют с помощью голосовой команды.

ruDALL-E Malevich доступна на сайте или в Telegram-боте Сбера.

Еще есть uDALL-E Emojich, которая генерирует смайлики по текстовому запросу — она тоже доступна на сайте или через бота.

Работает алгоритм не идеально — он ближе к уже устаревшей первой версии американской DALL·E. Однако это все еще самая сложная нейросеть в РФ. На ее тренировку ушло 24 тысяч GPU-дней — так называют произведение задействованных GPU (графических процессоров) и дней, которые ушли на обучение алгоритма (так, если вы используете 5 GPU и тренируете сеть 5 дней, потратите 25 GPU-дней).

DALL·E Mini — главный источник мемов

Еще одна программа, вдохновленная детищем OpenAI — ее создал энтузиаст из Техаса Борис Дайма для участия в конкурсе программистов. Сгенерировать картинку можно на сайте — вы получите сразу девять вариантов запроса не более, чем за две минуты. Правда, изображения в плане детальности уступают топовым проектам — нейронная сеть использует меньший набор параметров и обучена всего на 30 миллионах примеров, хотя создана на той же архитектуре, что и оригинальная DALL·E.

Не очень высокое качество отрисовки, тем не менее, не помешало проекту взорвать интернет. Довольно быстро появился форум на Reddit (сейчас там больше 100 тысяч подписчиков) и Twitter-сообщество (миллионник), где пользователи делятся самыми безумными вариантами генерации — нередко из них рождаются новые мемы (вот, например, Танос, который ищет свою маму в супермаркете Walmart, а вот Дарт Вейдер, попавший на камеру видеонаблюдения во время брейкданса).

В какой-то момент к DALL·E Mini обращались так часто, что компания Hugging Face — владелец серверов, на которых лежал проект — фиксировала по 50 тысяч генераций в сутки (команда не спала ночами, обслуживая нейросеть, пишет Wired). Популярность даже заставила разработчиков сменить название на Craiyon, чтобы алгоритм не ассоциировался с оригинальным проектом OpenAI.

Нейросеть научили превращать текст в картинки. Она изобразила редиску с собачкой и кресло-авокадо!

Американская команда разработчиков OpenAI создала нейросеть, способную превращать текст в картинки. В ее основе — алгоритм последнего поколения для обработки языка GPT-3, который уже обучали генерировать идеи для бизнеса, тексты песен, статьи и даже отвечать на философские вопросы.

Новая разработка получила название DALL·E. Принцип ее работы следующий: человек описывает некий предмет или ситуацию, к примеру, «редиска выгуливает собаку» или «кресло в форме авокадо», а алгоритм изображает это на картинке.

Текстовый запрос: «иллюстрация маленькой редиски дайкон в балетной пачке, выгуливающей собаку».

Тестовый запрос: «стул в форме авокадо»

При одном и том же запросе результат каждый раз получается разным. Некоторые из сгенерированных картинок будут неотличимы от созданных человеком, другие — едва связными и понятными. Однако серьезных ошибок и абсолютной бессмыслицы алгоритм не допускает.

На сайте OpenAI показаны десятки примеров работы алгоритма, в которых можно самостоятельно поменять параметры. Например, «профессиональную высококачественную иллюстрацию химеры жирафа и черепахи» можно превратить в не менее качественно нарисованную смесь кота и слона или льва и цыпленка, создавая сотни различных версий мутантов (иногда милых, иногда пугающих).

Все примеры на сайте — это 30 лучших, по мнению разработчиков, изображений из 512, сгенерированных нейросетью по указанному запросу. Никакой ретуши к картинкам не применялось.

Как зашифровать слово в картинке с помощью нейросети. Сервис Glif превращает котиков в буквы

Как зашифровать слово в картинке с помощью нейросети. Сервис Glif превращает котиков в буквы

Сервис Glif с помощью нейросети вписывает в изображение текст. Интернет-пользователи генерируют картинки с котами, электроникой, енотами и живописными пейзажами с тайными посланиями.

Пользователи Сети тестируют сервис Glif, который с помощью нейросети зашифровывает послания в картину. Искусственный интеллект генерирует изображение по описанию так, чтобы текст вписался естественным образом — с помощью теней и различных деталей. Попробовать создать свою картинку можно по ссылке.

Как сделать картинку с помощью Glif? Нужно зайти на сайт, выбрать функцию Controlnet Any Word и заполнить три поля. В первом на английском языке необходимо составить простое описание будущего изображения. Во втором поле вписать фразу или слово на любом языке заглавными буквами. В третьем надо выбрать размер букв, сервис предлагает от 100 до 170. Самый оптимальный вариант — 130.

Как зашифровать слово в картинке с помощью нейросети. Сервис Glif превращает котиков в буквы

В редакции Medialeaks решили изобразить набедокуривших белых и рыжих котиков с надписью «У нас лапки». Если не знать, что на картинке должна быть надпись, то её можно и не заметить. Чтобы разглядеть слова как следует, можно прищуриться или отвести экран подальше от глаз.

Как зашифровать слово в картинке с помощью нейросети. Сервис Glif превращает котиков в буквы

Пользователи Сети делятся картинками, которые создали с помощью Glif. Кто-то сделал постер с надписью Dream («Мечта»).

Как зашифровать слово в картинке с помощью нейросети. Сервис Glif превращает котиков в буквы

На просторах соцсетей можно найти и менее романтичные примеры, например, с надписью «Хочу пиво».

Как зашифровать слово в картинке с помощью нейросети. Сервис Glif превращает котиков в буквы

Нейросеть делает открытки с именами.

Как зашифровать слово в картинке с помощью нейросети. Сервис Glif превращает котиков в буквы

Кажется, нейросети не всегда удаётся вписать слова полностью. Один из пользователей сайта хотел сделать картинку с надписью «Как же хочется отчислиться», однако последнее слово не считывается.

Как зашифровать слово в картинке с помощью нейросети. Сервис Glif превращает котиков в буквы

В таком случае можно поменять формат изображения и уменьшить шрифт.

Ранее Medialeaks рассказывал, как сейчас выглядят актёры из сериала «Сабрина — маленькая ведьма». Каст собрался вместе спустя 20 лет.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *