• 6 октября, 2026

Пользователи ГигаЧата теперь могут создавать видео со звуком

Пользователи ГигаЧата теперь могут создавать видео со звуком

Пользователи ГигаЧата могут создавать видео с речью, музыкой и звуками окружения — в Full HD-качестве и полностью бесплатно. Это стало возможно благодаря новой модели Kandinsky 6.0 Video, которая генерирует ролики с синхронным звуком. Чтобы получить готовый ролик с озвучкой, достаточно описать сцену текстом или загрузить первый кадр и добавить описание звукового ряда. Максимальная длительность ролика со звуком — пять секунд, со временем разработчики планируют её увеличить. Кроме того, модель стала лучше передавать физику реального мира: движения людей, животных и техники в роликах выглядят естественнее и правдоподобнее. Kandinsky стал первой российской нейросетью, способной создавать видео с синхронным звуком.

Антон Фролов, старший вице-президент, руководитель блока «Развитие генеративного ИИ» Сбербанка:

«Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона. Любой человек получает возможность снимать более выразительные личные видео. А для профессионального контента это означает более быстрое и выгодное производство. Модель Kandinsky 6.0 Video мы отдаём разработчикам бесплатно и без ограничений — строить на ней свои сервисы может каждый».

Возможности модели

Kandinsky 6.0 Video — мультимодальная модель, которая одновременно «видит» и «слышит» то, что генерирует. Поэтому диалоги, эффекты и фоновая музыка синхронизированы с картинкой, а губы героя движутся вместе с речью. Если звук не нужен, можно попросить нейросеть создать видео без него. Когда модель не знает, как выглядит объект из запроса, например, новый персонаж поп-культуры, она ищет референсы и генерирует точный результат. Так можно создавать даже те объекты, которые появились уже после обучения модели.

Kandinsky создаёт натуральный звук в широком диапазоне: от разговора и цифровых эффектов до шагов, шума ветра или звука проезжающей машины. В одном ролике можно разыграть диалог, добавить музыку — от «испанской гитары» до «саундтрека к погоне», «лоу-фая для сонного вечера» или любой другой. Модель создает чистый и детализированный звук, без «шипения» и потери качества: в 44 кГц, стандартном качестве большинства стриминговых сервисов.

Эти возможности пригодятся для самых разных задач: с их помощью можно оживить семейную фотографию, записать видеооткрытку с речью или музыкой для близкого человека, снять ASMR-ролик с шелестом бумаги, потрескиванием дров или скрипом снега, или оживить старый мем или кадр из фильма.

Разработчикам новая модель доступна в опенсорсе под лицензией MIT — её можно бесплатно интегрировать в собственные продукты. Модель также будет доступна в популярных инструментах для запуска и интеграции нейросетей, например, FAL, Diffusers, FastVideo, ComfyUI, SGLang и vLLM-omni. Разработчикам не нужно писать интеграцию с нуля: Kandinsky 6.0 Video можно подключить прямо в существующий продукт.

Качество видео

Kandinsky 6.0 Video создаёт ролики в разрешении до Full HD. В ГигаЧате пользователи смогут выбрать нужное качество прямо в окне ввода перед отправкой запроса: SD для более быстрой генерации, HD или Full HD для более чёткой и детализированной картинки. Kandinsky 6.0 Video точнее передаёт физику реального мира. Движения людей, животных и предметов в роликах выглядят естественнее, а сцены целиком — правдоподобнее. Это особенно заметно в динамичных роликах с быстрым движением или сменой ракурса.

Обновление будет полезно всем, кто создаёт видео — в профессиональных и личных проектах:
  • Авторам контента для соцсетей: создать короткий ролик с озвученной репликой персонажа или фоновым звуком без микрофона, актёров и монтажа звука.
  • Малому бизнесу: сделать голосовой рекламный ролик о товаре или услуге без съёмочной группы.
  • Маркетологам и SMM-специалистам: собрать тестовый ролик с диалогом и фирменной атмосферой — звуком окружения и музыкальной подложкой — для соцсетей и мессенджеров.
  • Преподавателям: оживить архивное фото или портрет исторической личности с озвученной репликой — для урока истории или литературы.
  • Дизайнерам: собрать черновой ролик со звуком для питча или демонстрации идеи.

Как обучали модель

Kandinsky 6.0 Video состоит из двух связанных модулей, которые отвечают за создание видео и звука. Звуковой модуль обучен более чем на 20 млн разнообразных видео со звуком. Для обучения команда отбирала ролики только с чистым, качественным звуком, а также видео с говорящими людьми крупным планом для более точной синхронизации речи и мимики.

В Kandinsky 6.0 Video Pro качество генерации значительно выросло в общем визуальном качестве, следовании промпту и движении камеры. Новая модель лучше Kandinsky 5.0 в среднем в 71% случаев по всем критериям, также уверенно обходит открытую LTX 2.5. Кроме того, в задаче оживления изображения превосходит и ведущую закрытую модель Veo 3.1 Fast — по визуальному качеству, соответствию исходному изображению и движению камеры.

Похожие статьи

Сбербанк подал заявление на статус цифрового депозитария

Сегодня Сбербанк подал в Банк России заявление на статус цифрового депозитария. Статус позволит банку оказывать услуги по организации оборота цифровой валюты…

Сбер выпустил ЦФА на базе корпоративного кредита на собственной…

Сбер провёл новый выпуск цифровых финансовых активов (ЦФА) на базе кредита ООО «ИСК «Петроинжиниринг» на собственной платформе «Цифровые активы».

Сбер и АНО «Развитие человеческого капитала» объединят экспертизу для…

На Московском стартап-саммите Сбербанк и АНО «Развитие человеческого капитала» заключили соглашение о сотрудничестве.