Kandinsky AI нейросеть: полное руководство по генерации изображений и видео от Сбера

Узнайте всё о нейросети Kandinsky от Сбера: возможности, версии, инструкции по генерации картинок, анимации и видео, секреты составления промптов и ответы на частые вопросы.

Что такое Kandinsky и чем он отличается от других нейросетей

Kandinsky — это нейросеть для генерации изображений, анимации и видео по текстовому описанию, разработанная компанией «Сбер» при поддержке учёных Института искусственного интеллекта AIRI. Модель получила название в честь художника-абстракциониста Василия Кандинского и доступна полностью бесплатно.

Главное отличие Kandinsky от зарубежных аналогов — отсутствие платных тарифов. Вы можете генерировать неограниченное количество картинок, анимаций и коротких видео без подписки. При этом по качеству и детализации изображений нейросеть находится примерно на одном уровне с Midjourney и Stable Diffusion.

Ещё одна особенность — мультиязычность. Kandinsky понимает запросы более чем на 100 языках, включая русский. Это особенно удобно для русскоязычных пользователей: не нужно переводить промпты на английский.

Нейросеть доступна на нескольких платформах: сайт Fusion Brain, чат-боты в Telegram и VK, приложение «СберБанк Онлайн», виртуальный ассистент «Салют» и даже «Салют ТВ» по команде «Включи художника».

История развития Kandinsky: от ruDALL-E до версии 5.0

Первой нейросетью «Сбера» для генерации изображений стала ruDALL-E, выпущенная в ноябре 2021 года. Её код и веса были открыты, что позволило сообществу использовать модель.

В июне 2022 года представили Kandinsky 1.0 с 12 миллиардами параметров. Модель генерировала изображения в три этапа: создание набора картинок, отбор лучших с помощью алгоритма ruCLIP и увеличение разрешения.

23 ноября 2022 года вышла Kandinsky 2.0 с мультиязычностью и новой архитектурой Latent Diffusion. В апреле 2023 года — версия 2.1 с 3,3 млрд параметров, а в июле 2023-го — Kandinsky 2.2, которая научилась создавать прямоугольные изображения и получила функционал ControlNet для локального редактирования.

22 ноября 2023 года на конференции AI Journey представили Kandinsky 3.0 с улучшенным пониманием запросов и фотореалистичностью. В апреле 2024 года вышла версия 3.1 с функцией улучшения промпта и возможностью генерации по изображению. Последняя известная версия — 5.0, которая продолжает развивать качество и скорость генерации.

Где и как пользоваться Kandinsky: все доступные платформы

Kandinsky доступен на множестве платформ, что делает его удобным для разных сценариев использования.

Веб-сайты:

  • Fusion Brain — основной сайт с полным функционалом: генерация картинок, анимации, видео, редактирование. Интерфейс интуитивный, есть подсказки и горячие клавиши.
  • ruDALL-E — более ранняя версия, но также доступна.

Мессенджеры:

  • Чат-бот в Telegram — удобен для быстрой генерации. Результат обещают примерно за 10 секунд, хотя на практике может быть дольше.
  • Чат-бот в VK — аналогичный функционал.

Мобильные приложения:

  • «СберБанк Онлайн» — встроенная функция генерации изображений.
  • Виртуальный ассистент «Салют» на Android — можно попросить нарисовать картинку голосом.

ТВ:

  • «Салют ТВ» — команда «Включи художника» запускает генерацию на экране телевизора.

Выбор платформы зависит от ваших задач. Для полноценной работы с редактированием и разными соотношениями сторон лучше использовать Fusion Brain. Для быстрых экспериментов подойдут боты.

Генерация изображений: пошаговая инструкция и настройки

Создание картинки в Kandinsky занимает в среднем 2 минуты на сайте и быстрее в Telegram.

Пошаговая инструкция:

  1. Выберите раздел «Картинки» на Fusion Brain или соответствующую команду в боте.
  2. Выберите соотношение сторон: 1:1 (квадрат), 16:9 (горизонталь), 9:16 (вертикаль), 3:2, 2:3. От соотношения зависит максимальное разрешение: при 1:1 — 1024×1024 px, при 16:9 — 1024×576 px.
  3. Составьте промпт — текстовое описание того, что хотите увидеть. Чем больше деталей, тем точнее результат.
  4. При желании выберите стиль изображения из 17 доступных: «Детальное фото», «Цифровая живопись», «3D рендер», «Аниме», «Киберпанк», «Пикассо» и другие. Вероятность, что нейросеть применит выбранный стиль, очень высока.
  5. Добавьте негативный промпт, если нужно исключить определённые элементы (например, «ночь», «люди»).
  6. Нажмите кнопку генерации.
  7. Оцените результат. Если не устраивает — измените промпт и повторите.

Дополнительные возможности:

  • Генерация на основе изображения: загрузите фото и получите его нарисованную версию или микс из двух картинок.
  • Редактирование с помощью ControlNet: можно локально изменить часть изображения, не меняя всю сцену.
  • Ластик: удалите ненужные объекты, а затем допишите, что должно быть на их месте.
  • Inpainting/Outpainting: дорисовывание частей изображения или расширение за границы.

Формат скачивания — JPEG, кроме стиля «3D рендер», который сохраняется в PNG.

Создание анимации и видео в Kandinsky

Kandinsky умеет создавать не только статичные картинки, но и анимацию и видео.

Анимация появилась в версии 2.2 в октябре 2023 года. Она состоит из нескольких сцен (до 4), каждая длительностью 4 секунды. Можно выбрать направление камеры: зум, панорама, отдаление. Соотношение сторон: 1:1, 9:16, 16:9. Максимальное качество при 1:1 — 640×640 px. Время генерации анимации из 4 сцен — около 10 минут. Скачивается в MP4. Негативные промпты для анимации не работают.

Видео (Kandinsky Video) — первая российская модель для генерации видео по тексту, представленная 22 ноября 2023 года. Максимальная длительность — 5 секунд (в версии 4.0 — до 12 секунд в HD). Качество видео ниже, чем у картинок. Время генерации — около 4 минут. Соотношение сторон: 1:1, 9:16, 16:9. Негативные промпты не поддерживаются.

Как создать анимацию:

  1. Выберите модель «Анимация» в разделе «Видео».
  2. Составьте промпт для каждой сцены.
  3. Выберите направление камеры.
  4. Запустите генерацию.
  5. При необходимости отредактируйте промпты или поменяйте сцены местами.

Как создать видео:

  1. Выберите модель «Видео».
  2. Составьте промпт, выберите соотношение сторон.
  3. Нажмите «Создать видео».
  4. Оцените результат. Отредактировать уже сгенерированное видео нельзя, только перегенерировать.

Как правильно составлять промпты: советы и примеры

Качество результата напрямую зависит от промпта. Вот несколько правил, которые помогут получить желаемую картинку.

Основные принципы:

  • Выносите самое важное в начало. Сначала укажите, кто или что на картинке, затем — действие, потом детали. Например: «Молодая девушка с длинными светлыми волосами сидит на скамейке в парке, солнечный день, крупный план».
  • Добавляйте детали. Фон, время суток, погода, цвета, настроение, стиль — всё это помогает нейросети точнее понять задачу.
  • Упрощайте конструкции. Избегайте сложных предложений и деепричастных оборотов. Чем проще формулировка, тем выше шанс, что ИИ её правильно интерпретирует.
  • Используйте прямые отсылки. Вместо метафор укажите конкретного художника, фильм или стиль. Например: «Закат в стиле Ван Гога» или «Кот в стиле аниме».
  • Негативные промпты. Если нужно убрать определённые элементы, пропишите их в негативном промпте. Например: «Без людей, без машин».

Примеры удачных промптов:

  • «Реалистичное фото, плёнка 35 мм, милая молодая девушка блондинка с длинными волосами ночью, большие глаза, пухлые губы, естественный макияж, белая майка, крупные серьги, ночные огни, портрет, максимум деталей» — стиль «Детальное фото».
  • «Мопс в короне сидит на троне, картина в стиле Веласкеса, максимум деталей» — без стиля.
  • «Сочный бургер, картошка фри и бутылка колы на столе, яркие цвета, максимум деталей» — стиль «Детальное фото».
  • «Бульдог идёт по ночному городу» — стиль «Киберпанк».

Чего избегать:

  • Слишком абстрактных понятий («красота», «счастье»).
  • Отрицаний в основном промпте (лучше вынести в негативный).
  • Слишком длинных перечислений без структуры.

Даже с простым промптом, например «Лошадь», Kandinsky может создать симпатичное изображение, но для точного результата лучше потратить время на детализацию.

Возможности редактирования и микширования изображений

Kandinsky предлагает несколько инструментов для работы с уже созданными или загруженными изображениями.

Микширование изображений: можно объединить две картинки в одну. Например, взять фон от одного фото и персонажа от другого. Результат может быть как очень похож на исходники, так и лишь отдалённо напоминать их.

Генерация на основе изображения: загрузите фото и получите его версию, нарисованную нейросетью. Можно добавить текстовый промпт, чтобы изменить детали.

ControlNet: функция, позволяющая локально редактировать изображение, не меняя всю сцену. Например, можно заменить объект или изменить цвет элемента.

Ластик: удалите ненужные объекты с картинки, а затем допишите в промпте, что должно быть на их месте. Появятся слои, которые можно просматривать.

Inpainting/Outpainting: дорисовывание частей изображения (inpainting) или расширение за его границы (outpainting). Это полезно, если нужно добавить детали или изменить композицию.

Бьютификация промпта: в версии 3.1 появилась функция улучшения текстового запроса пользователя с помощью языковой модели. Если вы написали короткий или не очень точный промпт, нейросеть может сама его дополнить для лучшего результата.

Ограничения и частые ошибки при работе с Kandinsky

Несмотря на все достоинства, у Kandinsky есть ограничения, которые стоит учитывать.

Ограничения:

  • Качество видео пока уступает картинкам. Разрешение 512×512 px, длительность до 5 секунд (в версии 4.0 — до 12 секунд HD).
  • Анимация имеет максимальное разрешение 640×640 px и длительность до 16 секунд (4 сцены по 4 секунды).
  • Негативные промпты не работают для анимации и видео.
  • Галлюцинации ИИ: нейросеть может добавлять лишние детали или неправильно интерпретировать запрос. Например, при генерации двух персонажей может создать близнецов вместо разных героев.
  • Сбои на сайте: иногда Fusion Brain начинает дублировать предыдущие генерации. Решение — перезагрузить страницу или войти в кабинет заново.
  • Время генерации: на картинку уходит около 2 минут, на анимацию из 4 сцен — до 10 минут, на видео — около 4 минут.

Частые ошибки пользователей:

  • Слишком сложные или абстрактные промпты.
  • Отсутствие негативного промпта, когда нужно исключить детали.
  • Использование метафор вместо прямых описаний.
  • Ожидание идеального результата с первого раза. Обычно требуется несколько итераций.

Как избежать ошибок:

  • Начинайте с простых запросов и постепенно усложняйте.
  • Используйте негативные промпты для исключения нежелательных элементов.
  • Если результат не устраивает, упрощайте логику запроса.
  • Подсматривайте чужие промпты, чтобы понять логику нейросети.

Сравнение Kandinsky с другими нейросетями и перспективы развития

Kandinsky часто сравнивают с Midjourney, Stable Diffusion и DALL-E. По качеству фотореалистичных изображений он находится на одном уровне с этими моделями, но имеет ряд преимуществ.

Преимущества Kandinsky:

  • Полностью бесплатный, без ограничений на количество генераций.
  • Понимает русский язык и другие языки.
  • Доступен на множестве платформ, включая Telegram и VK.
  • Встроенные функции редактирования (ControlNet, ластик, микширование).
  • Понимает русскую культуру и контекст лучше зарубежных аналогов.

Недостатки:

  • Качество видео пока уступает специализированным моделям.
  • Меньше стилей и настроек по сравнению со Stable Diffusion.
  • Иногда возникают технические сбои на сайте.

Перспективы развития: Нейросеть активно развивается. Версия 3.1 добавила улучшение промптов и генерацию по изображению, а версия 4.0 для видео — HD-качество и длительность до 12 секунд. Последняя версия 5.0 продолжает улучшать качество и скорость. Можно ожидать дальнейшего улучшения фотореалистичности, увеличения разрешения видео и появления новых функций редактирования.

Kandinsky — это не просто инструмент для развлечения, но и полноценный рабочий инструмент для дизайнеров, маркетологов, SMM-специалистов и всех, кто создаёт визуальный контент.

Вопросы и ответы

Сколько стоит использование нейросети Kandinsky?

Kandinsky полностью бесплатен. Нет платных тарифов и ограничений на количество генераций. Вы можете создавать неограниченное количество картинок, анимаций и видео.

На каких языках можно писать промпты?

Kandinsky понимает запросы более чем на 100 языках, включая русский, английский, китайский и другие. Можно писать промпты на родном языке без перевода.

Почему нейросеть иногда создаёт не то, что я просил?

Это может быть связано с нечётким промптом, использованием метафор или слишком сложными конструкциями. Попробуйте упростить запрос, добавить больше деталей или использовать негативный промпт. Иногда требуется несколько итераций.

Можно ли использовать сгенерированные изображения в коммерческих целях?

Да, изображения, созданные с помощью Kandinsky, можно использовать в коммерческих проектах. Однако рекомендуется ознакомиться с пользовательским соглашением сервиса для уточнения деталей.

Как улучшить качество изображения?

Используйте более детальные промпты, выбирайте стиль «Детальное фото» или «3D рендер», указывайте «максимум деталей» в запросе. Также можно попробовать увеличить разрешение с помощью внешних инструментов.

В чём разница между анимацией и видео в Kandinsky?

Анимация состоит из нескольких сцен (до 4) длительностью 4 секунды каждая, с возможностью выбора направления камеры. Видео — это непрерывный ролик длительностью до 5 секунд (в версии 4.0 — до 12 секунд). Качество видео ниже, чем у анимации.

Как удалить лишние объекты с уже сгенерированной картинки?

Используйте инструмент «Ластик» на сайте Fusion Brain. Удалите ненужный объект, а затем введите промпт, описывающий, что должно быть на его месте. Также можно использовать негативный промпт при повторной генерации.