- 6 октября, 2026
Пользователи ГигаЧата теперь могут создавать видео со звуком
Пользователи ГигаЧата могут создавать видео с речью, музыкой и звуками окружения — в Full HD-качестве и полностью бесплатно. Это стало возможно благодаря новой модели Kandinsky 6.0 Video, которая генерирует ролики с синхронным звуком. Чтобы получить готовый ролик с озвучкой, достаточно описать сцену текстом или загрузить первый кадр и добавить описание звукового ряда. Максимальная длительность ролика со звуком — пять секунд, со временем разработчики планируют её увеличить. Кроме того, модель стала лучше передавать физику реального мира: движения людей, животных и техники в роликах выглядят естественнее и правдоподобнее. Kandinsky стал первой российской нейросетью, способной создавать видео с синхронным звуком.
Антон Фролов, старший вице-президент, руководитель блока «Развитие генеративного ИИ» Сбербанка:
«Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона. Любой человек получает возможность снимать более выразительные личные видео. А для профессионального контента это означает более быстрое и выгодное производство. Модель Kandinsky 6.0 Video мы отдаём разработчикам бесплатно и без ограничений — строить на ней свои сервисы может каждый».
Возможности модели
Kandinsky 6.0 Video — мультимодальная модель, которая одновременно «видит» и «слышит» то, что генерирует. Поэтому диалоги, эффекты и фоновая музыка синхронизированы с картинкой, а губы героя движутся вместе с речью. Если звук не нужен, можно попросить нейросеть создать видео без него. Когда модель не знает, как выглядит объект из запроса, например, новый персонаж поп-культуры, она ищет референсы и генерирует точный результат. Так можно создавать даже те объекты, которые появились уже после обучения модели.
Kandinsky создаёт натуральный звук в широком диапазоне: от разговора и цифровых эффектов до шагов, шума ветра или звука проезжающей машины. В одном ролике можно разыграть диалог, добавить музыку — от «испанской гитары» до «саундтрека к погоне», «лоу-фая для сонного вечера» или любой другой. Модель создает чистый и детализированный звук, без «шипения» и потери качества: в 44 кГц, стандартном качестве большинства стриминговых сервисов.
Эти возможности пригодятся для самых разных задач: с их помощью можно оживить семейную фотографию, записать видеооткрытку с речью или музыкой для близкого человека, снять ASMR-ролик с шелестом бумаги, потрескиванием дров или скрипом снега, или оживить старый мем или кадр из фильма.
Разработчикам новая модель доступна в опенсорсе под лицензией MIT — её можно бесплатно интегрировать в собственные продукты. Модель также будет доступна в популярных инструментах для запуска и интеграции нейросетей, например, FAL, Diffusers, FastVideo, ComfyUI, SGLang и vLLM-omni. Разработчикам не нужно писать интеграцию с нуля: Kandinsky 6.0 Video можно подключить прямо в существующий продукт.
Качество видео
Kandinsky 6.0 Video создаёт ролики в разрешении до Full HD. В ГигаЧате пользователи смогут выбрать нужное качество прямо в окне ввода перед отправкой запроса: SD для более быстрой генерации, HD или Full HD для более чёткой и детализированной картинки. Kandinsky 6.0 Video точнее передаёт физику реального мира. Движения людей, животных и предметов в роликах выглядят естественнее, а сцены целиком — правдоподобнее. Это особенно заметно в динамичных роликах с быстрым движением или сменой ракурса.
Обновление будет полезно всем, кто создаёт видео — в профессиональных и личных проектах:
- Авторам контента для соцсетей: создать короткий ролик с озвученной репликой персонажа или фоновым звуком без микрофона, актёров и монтажа звука.
- Малому бизнесу: сделать голосовой рекламный ролик о товаре или услуге без съёмочной группы.
- Маркетологам и SMM-специалистам: собрать тестовый ролик с диалогом и фирменной атмосферой — звуком окружения и музыкальной подложкой — для соцсетей и мессенджеров.
- Преподавателям: оживить архивное фото или портрет исторической личности с озвученной репликой — для урока истории или литературы.
- Дизайнерам: собрать черновой ролик со звуком для питча или демонстрации идеи.
Как обучали модель
Kandinsky 6.0 Video состоит из двух связанных модулей, которые отвечают за создание видео и звука. Звуковой модуль обучен более чем на 20 млн разнообразных видео со звуком. Для обучения команда отбирала ролики только с чистым, качественным звуком, а также видео с говорящими людьми крупным планом для более точной синхронизации речи и мимики.
В Kandinsky 6.0 Video Pro качество генерации значительно выросло в общем визуальном качестве, следовании промпту и движении камеры. Новая модель лучше Kandinsky 5.0 в среднем в 71% случаев по всем критериям, также уверенно обходит открытую LTX 2.5. Кроме того, в задаче оживления изображения превосходит и ведущую закрытую модель Veo 3.1 Fast — по визуальному качеству, соответствию исходному изображению и движению камеры.