Как создать вирусный AI-сервис и набрать 300 000 пользователей на виральных охватах: интервью с Максимом Цыганковым
Максим, расскажите, как вы придумали DreamPics, и почему решили сделать именно AI-бота для генерации аватаров?
Три года назад нейросети заметно шагнули вперед. Еще до этого на слуху были различные AI-инструменты, которые умели генерировать тексты и изображения, но только в 2022 году в этой сфере произошел прорыв. Были отшлифованы диффузионные модели нейросетей, которые смогли очень хорошо генерировать изображение по текстовому запросу.
Некоторые нейросетевые модели, такие как Stable Diffusion, были в открытом доступе — это позволяло развернуть их локально и взаимодействовать с их архитектурой. Главным инструментом для персонализации изображений в этой модели был DreamBooth — метод дообучения, который адаптировал генеративную модель под конкретные объекты или стили.
DreamBooth умел запоминать загруженные изображения и использовать их для генерации новых визуальных элементов. При этом каждый объект привязывался к уникальному токену — текстовому идентификатору, который вводился в запрос при генерации изображений. В дальнейшем, при вводе этого токена в текстовом описании, модель понимала, что в изображение нужно встроить конкретный объект.
Это давало возможность загружать фото определенного человека, присваивать ему токен и потом генерировать изображения этого человека в различных интерьерах и ситуациях — например, на вершине горы, в костюме рыцаря и так далее.
Хорошим решением было бы создать мобильное приложение с возможностью генерации изображений с любым лицом, но для этого было недостаточно финансов. Поэтому я решил начать с Telegram-бота — сделал его за несколько месяцев и выпустил в продакшн. Тогда DreamPics стало первым подобным приложением в России с таким уровнем качества.
Строго говоря, пионером в этом направлении стала Lensa, но качество генерируемых изображений было намного ниже, чем у DreamPics. И я на 100% уверен, что на момент выхода это был лучший в мире бот — все сравнения с конкурентами это подтверждали.
Главная особенность моей технологии — это гораздо большее сходство аватаров с реальными пользователями, чем у конкурентов. Кроме того, я стал первым в СНГ, кто ввел оплату сервиса с российских банковских карт, тогда как для оплаты в Lensa требовались дополнительные манипуляции.
Благодаря всему этому мой Telegram-бот с самого момента запуска начал получать сотни оплат в день, что обеспечило стремительный рост проекта.
Я знаю, что вы занимали позицию Senior Product Manager в Яндексе, чем вам в первую очередь пригодился корпоративный опыт в собственном бизнесе?
В Яндексе я как раз работал в сфере AI — занимался распознаванием речи и компьютерным зрением. Там серьезно погрузился в тему искусственного интеллекта и общался с продвинутыми разработчиками. Благодаря этому я был в курсе всех новостей о нейросетях, знал про развитие Stable Diffusion и читал статью о том, что библиотека DreamBooth вышла в открытый доступ.
Также я работал с облачным хранилищем Яндекс Cloud и хорошо разбирался в особенностях облачных сервисов. Начав работу над Telegram-ботом, я понял, что инфраструктура будет довольно тяжелой и дорогой. Поэтому решил разворачивать ее в облаке — и тут как раз пригодились мои знания.
За счет чего вы привлекли 300 000 пользователей, и какие маркетинговые стратегии работали лучше всего?
Лучше всего работали блогеры и виральная реклама. Блогеры просто получали доступ к боту и начинали им пользоваться, генерируя множество интересного контента, который видели подписчики. А они, в свою очередь, потом создавали свой контент и распространяли его в сети.
Совокупно за два года удалось привлечь 300 тысяч пользователей, а вскоре после запуска бот уже принимал до 1000 оплат от пользователей в день.
На каких технологиях и алгоритмах построен DreamPics?
Я использовал метод DreamBooth поверх нейросети Stable Diffusion 1.5. Несмотря на то, что это open source продукты, работать с ними не так легко, как может показаться. Пришлось провести серьезную работу, чтобы они делали то, что нам нужно. Также были собственные секреты, связанные с предпроцессингом и постпроцессингом фото.
Важно сказать, что мы не храним персональные данные и получившиеся фото. То есть использование сервиса полностью безопасно для тех, кто заботится о конфиденциальности.
Еще одной фишкой стала возможность оценки результата. Эта простая идея очень помогла: например, при внедрении в бота чего-то нового по оценкам сразу можно увидеть, насколько хорошо сработало обновление.
Работая над продуктом, как вы искали баланс между качеством AI-аватаров, скоростью их генерации и стоимостью вычислительных ресурсов, учитывая масштабируемость сервиса?
Важный момент был в том, чтобы сделать разработку дешевой. Сами процессы занимали очень много вычислительных ресурсов, и аренда облака для них стоила довольно дорого. Поэтому я решил поставить невысокую цену за использование сервиса — 300 рублей. Это позволило бы быстро окупить затраты на облако и заработать на дальнейшее развитие инструмента, так как чем ниже цена, тем больше пользователей захотят оплатить сервис.
Чтобы сэкономить, также была разработана целая модель управления вычислительными ресурсами в облаке, чтобы грамотно их масштабировать, когда нагрузка большая, и сворачивать, когда она становится меньше. Также это решение позволило планировать наперед траты ресурсов.
Важно, что люди получают сразу много картинок — 150 штук — за невысокую цену. И как я уже говорил, качество изображений все еще гораздо выше, чем у конкурентов. Поэтому люди охотно начали пользоваться сервисом и рекомендовать его своим друзьям, а это приводило к большему числу оплат.
Главной сложностью был прием платежей. Я интегрировал Telegram с платежными сервисами Робокасса и ЮКасса, но в самом механизме интеграции были проблемы, и иногда платеж не отображался, а пользователь не получал картинки. Приходилось разбираться с каждым случаем отдельно — у нас был аккаунт поддержки в Telegram, мы принимали там обращения и вручную отдавали аватарки или возвращали деньги, чтобы пользователь не заподозрил нас в мошенничестве.
В итоге я решил перейти на другую платежную систему. Это заняло много ресурсов, но в конце концов всё получилось, и теперь с приемом платежей проблем нет.
Какой потенциал вы видите в AI-генерации персонализированного контента, и какие направления развития подобной технологии вы считаете перспективными?
Главный тренд сейчас — создание фотореалистичных аватарок. Например, у айтишников, которые работают из дома, дефицит фотографий в деловом стиле — а они нужны, например, для резюме или LinkedIn. Поэтому фотореалистичные аватарки точно будут востребованы. Кстати, сейчас мы развиваем второй продукт DreamLooks, и он как раз заточен под эти задачи.
Второй тренд — это генерация маркетинговых изображений с подстройкой под текст и канал. Например, можно генерировать баннеры на сайтах, в моменте подстраивая их под контекст и пользователя. Это значительно упростит задачу маркетологов, копирайтеров и дизайнеров.
Еще один тренд — генерация видео с лицом пользователя. Например, можно будет создать видео, где вы в костюме джедая деретесь с мастером Йодой на световых мечах. Люди смогут снимать целые фильмы с собой и со своими друзьями.
AI-генерацию контента можно использовать и в прикладной сфере. Например, для моделирования дизайна интерьера, чтобы показать заказчику, как в его доме будет располагаться кровать, шкаф или комод. А заказчик сможет выбрать подходящие варианты. В общем, способов применения этой технологии множество — посмотрим, что из этого воплотится в жизнь.
Опубликовано 18.03.2023

