Что такое Kandinsky и чем он отличается от других нейросетей
Kandinsky — это нейросеть для генерации изображений, анимации и видео по текстовому описанию, разработанная компанией «Сбер» при поддержке учёных Института искусственного интеллекта AIRI. Модель получила название в честь художника-абстракциониста Василия Кандинского и доступна полностью бесплатно.
Главное отличие Kandinsky от зарубежных аналогов — отсутствие платных тарифов. Вы можете генерировать неограниченное количество картинок, анимаций и коротких видео без подписки. При этом по качеству и детализации изображений нейросеть находится примерно на одном уровне с Midjourney и Stable Diffusion.
Ещё одна особенность — мультиязычность. Kandinsky понимает запросы более чем на 100 языках, включая русский. Это особенно удобно для русскоязычных пользователей: не нужно переводить промпты на английский.
Нейросеть доступна на нескольких платформах: сайт Fusion Brain, чат-боты в Telegram и VK, приложение «СберБанк Онлайн», виртуальный ассистент «Салют» и даже «Салют ТВ» по команде «Включи художника».
История развития Kandinsky: от ruDALL-E до версии 5.0
Первой нейросетью «Сбера» для генерации изображений стала ruDALL-E, выпущенная в ноябре 2021 года. Её код и веса были открыты, что позволило сообществу использовать модель.
В июне 2022 года представили Kandinsky 1.0 с 12 миллиардами параметров. Модель генерировала изображения в три этапа: создание набора картинок, отбор лучших с помощью алгоритма ruCLIP и увеличение разрешения.
23 ноября 2022 года вышла Kandinsky 2.0 с мультиязычностью и новой архитектурой Latent Diffusion. В апреле 2023 года — версия 2.1 с 3,3 млрд параметров, а в июле 2023-го — Kandinsky 2.2, которая научилась создавать прямоугольные изображения и получила функционал ControlNet для локального редактирования.
22 ноября 2023 года на конференции AI Journey представили Kandinsky 3.0 с улучшенным пониманием запросов и фотореалистичностью. В апреле 2024 года вышла версия 3.1 с функцией улучшения промпта и возможностью генерации по изображению. Последняя известная версия — 5.0, которая продолжает развивать качество и скорость генерации.
Где и как пользоваться Kandinsky: все доступные платформы
Kandinsky доступен на множестве платформ, что делает его удобным для разных сценариев использования.
Веб-сайты:
- Fusion Brain — основной сайт с полным функционалом: генерация картинок, анимации, видео, редактирование. Интерфейс интуитивный, есть подсказки и горячие клавиши.
- ruDALL-E — более ранняя версия, но также доступна.
Мессенджеры:
- Чат-бот в Telegram — удобен для быстрой генерации. Результат обещают примерно за 10 секунд, хотя на практике может быть дольше.
- Чат-бот в VK — аналогичный функционал.
Мобильные приложения:
- «СберБанк Онлайн» — встроенная функция генерации изображений.
- Виртуальный ассистент «Салют» на Android — можно попросить нарисовать картинку голосом.
ТВ:
- «Салют ТВ» — команда «Включи художника» запускает генерацию на экране телевизора.
Выбор платформы зависит от ваших задач. Для полноценной работы с редактированием и разными соотношениями сторон лучше использовать Fusion Brain. Для быстрых экспериментов подойдут боты.
Генерация изображений: пошаговая инструкция и настройки
Создание картинки в Kandinsky занимает в среднем 2 минуты на сайте и быстрее в Telegram.
Пошаговая инструкция:
- Выберите раздел «Картинки» на Fusion Brain или соответствующую команду в боте.
- Выберите соотношение сторон: 1:1 (квадрат), 16:9 (горизонталь), 9:16 (вертикаль), 3:2, 2:3. От соотношения зависит максимальное разрешение: при 1:1 — 1024×1024 px, при 16:9 — 1024×576 px.
- Составьте промпт — текстовое описание того, что хотите увидеть. Чем больше деталей, тем точнее результат.
- При желании выберите стиль изображения из 17 доступных: «Детальное фото», «Цифровая живопись», «3D рендер», «Аниме», «Киберпанк», «Пикассо» и другие. Вероятность, что нейросеть применит выбранный стиль, очень высока.
- Добавьте негативный промпт, если нужно исключить определённые элементы (например, «ночь», «люди»).
- Нажмите кнопку генерации.
- Оцените результат. Если не устраивает — измените промпт и повторите.
Дополнительные возможности:
- Генерация на основе изображения: загрузите фото и получите его нарисованную версию или микс из двух картинок.
- Редактирование с помощью ControlNet: можно локально изменить часть изображения, не меняя всю сцену.
- Ластик: удалите ненужные объекты, а затем допишите, что должно быть на их месте.
- Inpainting/Outpainting: дорисовывание частей изображения или расширение за границы.
Формат скачивания — JPEG, кроме стиля «3D рендер», который сохраняется в PNG.
Создание анимации и видео в Kandinsky
Kandinsky умеет создавать не только статичные картинки, но и анимацию и видео.
Анимация появилась в версии 2.2 в октябре 2023 года. Она состоит из нескольких сцен (до 4), каждая длительностью 4 секунды. Можно выбрать направление камеры: зум, панорама, отдаление. Соотношение сторон: 1:1, 9:16, 16:9. Максимальное качество при 1:1 — 640×640 px. Время генерации анимации из 4 сцен — около 10 минут. Скачивается в MP4. Негативные промпты для анимации не работают.
Видео (Kandinsky Video) — первая российская модель для генерации видео по тексту, представленная 22 ноября 2023 года. Максимальная длительность — 5 секунд (в версии 4.0 — до 12 секунд в HD). Качество видео ниже, чем у картинок. Время генерации — около 4 минут. Соотношение сторон: 1:1, 9:16, 16:9. Негативные промпты не поддерживаются.
Как создать анимацию:
- Выберите модель «Анимация» в разделе «Видео».
- Составьте промпт для каждой сцены.
- Выберите направление камеры.
- Запустите генерацию.
- При необходимости отредактируйте промпты или поменяйте сцены местами.
Как создать видео:
- Выберите модель «Видео».
- Составьте промпт, выберите соотношение сторон.
- Нажмите «Создать видео».
- Оцените результат. Отредактировать уже сгенерированное видео нельзя, только перегенерировать.
Как правильно составлять промпты: советы и примеры
Качество результата напрямую зависит от промпта. Вот несколько правил, которые помогут получить желаемую картинку.
Основные принципы:
- Выносите самое важное в начало. Сначала укажите, кто или что на картинке, затем — действие, потом детали. Например: «Молодая девушка с длинными светлыми волосами сидит на скамейке в парке, солнечный день, крупный план».
- Добавляйте детали. Фон, время суток, погода, цвета, настроение, стиль — всё это помогает нейросети точнее понять задачу.
- Упрощайте конструкции. Избегайте сложных предложений и деепричастных оборотов. Чем проще формулировка, тем выше шанс, что ИИ её правильно интерпретирует.
- Используйте прямые отсылки. Вместо метафор укажите конкретного художника, фильм или стиль. Например: «Закат в стиле Ван Гога» или «Кот в стиле аниме».
- Негативные промпты. Если нужно убрать определённые элементы, пропишите их в негативном промпте. Например: «Без людей, без машин».
Примеры удачных промптов:
- «Реалистичное фото, плёнка 35 мм, милая молодая девушка блондинка с длинными волосами ночью, большие глаза, пухлые губы, естественный макияж, белая майка, крупные серьги, ночные огни, портрет, максимум деталей» — стиль «Детальное фото».
- «Мопс в короне сидит на троне, картина в стиле Веласкеса, максимум деталей» — без стиля.
- «Сочный бургер, картошка фри и бутылка колы на столе, яркие цвета, максимум деталей» — стиль «Детальное фото».
- «Бульдог идёт по ночному городу» — стиль «Киберпанк».
Чего избегать:
- Слишком абстрактных понятий («красота», «счастье»).
- Отрицаний в основном промпте (лучше вынести в негативный).
- Слишком длинных перечислений без структуры.
Даже с простым промптом, например «Лошадь», Kandinsky может создать симпатичное изображение, но для точного результата лучше потратить время на детализацию.
Возможности редактирования и микширования изображений
Kandinsky предлагает несколько инструментов для работы с уже созданными или загруженными изображениями.
Микширование изображений: можно объединить две картинки в одну. Например, взять фон от одного фото и персонажа от другого. Результат может быть как очень похож на исходники, так и лишь отдалённо напоминать их.
Генерация на основе изображения: загрузите фото и получите его версию, нарисованную нейросетью. Можно добавить текстовый промпт, чтобы изменить детали.
ControlNet: функция, позволяющая локально редактировать изображение, не меняя всю сцену. Например, можно заменить объект или изменить цвет элемента.
Ластик: удалите ненужные объекты с картинки, а затем допишите в промпте, что должно быть на их месте. Появятся слои, которые можно просматривать.
Inpainting/Outpainting: дорисовывание частей изображения (inpainting) или расширение за его границы (outpainting). Это полезно, если нужно добавить детали или изменить композицию.
Бьютификация промпта: в версии 3.1 появилась функция улучшения текстового запроса пользователя с помощью языковой модели. Если вы написали короткий или не очень точный промпт, нейросеть может сама его дополнить для лучшего результата.
Ограничения и частые ошибки при работе с Kandinsky
Несмотря на все достоинства, у Kandinsky есть ограничения, которые стоит учитывать.
Ограничения:
- Качество видео пока уступает картинкам. Разрешение 512×512 px, длительность до 5 секунд (в версии 4.0 — до 12 секунд HD).
- Анимация имеет максимальное разрешение 640×640 px и длительность до 16 секунд (4 сцены по 4 секунды).
- Негативные промпты не работают для анимации и видео.
- Галлюцинации ИИ: нейросеть может добавлять лишние детали или неправильно интерпретировать запрос. Например, при генерации двух персонажей может создать близнецов вместо разных героев.
- Сбои на сайте: иногда Fusion Brain начинает дублировать предыдущие генерации. Решение — перезагрузить страницу или войти в кабинет заново.
- Время генерации: на картинку уходит около 2 минут, на анимацию из 4 сцен — до 10 минут, на видео — около 4 минут.
Частые ошибки пользователей:
- Слишком сложные или абстрактные промпты.
- Отсутствие негативного промпта, когда нужно исключить детали.
- Использование метафор вместо прямых описаний.
- Ожидание идеального результата с первого раза. Обычно требуется несколько итераций.
Как избежать ошибок:
- Начинайте с простых запросов и постепенно усложняйте.
- Используйте негативные промпты для исключения нежелательных элементов.
- Если результат не устраивает, упрощайте логику запроса.
- Подсматривайте чужие промпты, чтобы понять логику нейросети.
Сравнение Kandinsky с другими нейросетями и перспективы развития
Kandinsky часто сравнивают с Midjourney, Stable Diffusion и DALL-E. По качеству фотореалистичных изображений он находится на одном уровне с этими моделями, но имеет ряд преимуществ.
Преимущества Kandinsky:
- Полностью бесплатный, без ограничений на количество генераций.
- Понимает русский язык и другие языки.
- Доступен на множестве платформ, включая Telegram и VK.
- Встроенные функции редактирования (ControlNet, ластик, микширование).
- Понимает русскую культуру и контекст лучше зарубежных аналогов.
Недостатки:
- Качество видео пока уступает специализированным моделям.
- Меньше стилей и настроек по сравнению со Stable Diffusion.
- Иногда возникают технические сбои на сайте.
Перспективы развития: Нейросеть активно развивается. Версия 3.1 добавила улучшение промптов и генерацию по изображению, а версия 4.0 для видео — HD-качество и длительность до 12 секунд. Последняя версия 5.0 продолжает улучшать качество и скорость. Можно ожидать дальнейшего улучшения фотореалистичности, увеличения разрешения видео и появления новых функций редактирования.
Kandinsky — это не просто инструмент для развлечения, но и полноценный рабочий инструмент для дизайнеров, маркетологов, SMM-специалистов и всех, кто создаёт визуальный контент.
Вопросы и ответы
Сколько стоит использование нейросети Kandinsky?
Kandinsky полностью бесплатен. Нет платных тарифов и ограничений на количество генераций. Вы можете создавать неограниченное количество картинок, анимаций и видео.
На каких языках можно писать промпты?
Kandinsky понимает запросы более чем на 100 языках, включая русский, английский, китайский и другие. Можно писать промпты на родном языке без перевода.
Почему нейросеть иногда создаёт не то, что я просил?
Это может быть связано с нечётким промптом, использованием метафор или слишком сложными конструкциями. Попробуйте упростить запрос, добавить больше деталей или использовать негативный промпт. Иногда требуется несколько итераций.
Можно ли использовать сгенерированные изображения в коммерческих целях?
Да, изображения, созданные с помощью Kandinsky, можно использовать в коммерческих проектах. Однако рекомендуется ознакомиться с пользовательским соглашением сервиса для уточнения деталей.
Как улучшить качество изображения?
Используйте более детальные промпты, выбирайте стиль «Детальное фото» или «3D рендер», указывайте «максимум деталей» в запросе. Также можно попробовать увеличить разрешение с помощью внешних инструментов.
В чём разница между анимацией и видео в Kandinsky?
Анимация состоит из нескольких сцен (до 4) длительностью 4 секунды каждая, с возможностью выбора направления камеры. Видео — это непрерывный ролик длительностью до 5 секунд (в версии 4.0 — до 12 секунд). Качество видео ниже, чем у анимации.
Как удалить лишние объекты с уже сгенерированной картинки?
Используйте инструмент «Ластик» на сайте Fusion Brain. Удалите ненужный объект, а затем введите промпт, описывающий, что должно быть на его месте. Также можно использовать негативный промпт при повторной генерации.