Daily MaverickWHAT’S COOKING: Roast butternut soup with roasted garlic, spices and orange zestThe Jerusalem PostIsrael 'in the dark' over flydubai terror hijacker investigation as Mossad probes link to IranPunchAt 70, Alake has made Ekiti proud — OyebanjiBollywood HungamaEggoz onboards Boman Irani as brand ambassadorInquirerGroup hits ‘veiled threats’ to journalists in Sara Duterte’s trialZDF heuteEntdecken Sie das ZDF-NachrichtenstudioUOLTécnico de jiu-jítsu Bruno Formiga é acusado de assédio sexual e estupro por alunas no RJColliderThis Horror Legend's Biggest Bomb Got Better With Its Unrated VersionObservador DesportoHomem aterra avioneta em Serpa e sai de táxiFootball ItaliaLazio linked with move for ex Man Utd and Crystal Palace winger ZahaABC NewsSeeing threats to religious liberty, Alito calls same-sex marriage a 'decisive' turnCNN بالعربيةبرفقة والديها وسروال جينز.. هل تتعمد عارضة أزياء هندية لفت الأنظار في باريس؟
The Daily Newsstand · Free, Always
Tuesday, October 6, 2026

Пользователи «ГигаЧата» теперь могут создавать видео со звуком

Translate

|

Пользователи «ГигаЧата» могут создавать видео с речью, музыкой и звуками окружения — в Full HD-качестве и полностью бесплатно. Это стало возможно благодаря новой модели Kandinsky 6.0 Video, которая генерирует ролики с синхронным звуком. Об этом CNews сообщили представители Сбербанка.

Чтобы получить готовый ролик с озвучкой, достаточно описать сцену текстом или загрузить первый кадр и добавить описание звукового ряда. Максимальная длительность ролика со звуком — пять секунд, со временем разработчики планируют ее увеличить. Кроме того, модель стала лучше передавать физику реального мира: движения людей, животных и техники в роликах выглядят естественнее и правдоподобнее. Kandinsky стал первой российской нейросетью, способной создавать видео с синхронным звуком.

Антон Фролов, старший вице-президент, руководитель блока «Развитие генеративного ИИ» Сбербанка: «Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона. Любой человек получает возможность снимать более выразительные личные видео. А для профессионального контента это означает более быстрое и выгодное производство. Модель Kandinsky 6.0 Video мы отдаем разработчикам бесплатно и без ограничений — строить на ней свои сервисы может каждый».

Возможности модели

Kandinsky 6.0 Video — мультимодальная модель, которая одновременно «видит» и «слышит» то, что генерирует. Поэтому диалоги, эффекты и фоновая музыка синхронизированы с картинкой, а губы героя движутся вместе с речью. Если звук не нужен, можно попросить нейросеть создать видео без него. Когда модель не знает, как выглядит объект из запроса, например, новый персонаж поп-культуры, она ищет референсы и генерирует точный результат. Так можно создавать даже те объекты, которые появились уже после обучения модели.

Kandinsky создает натуральный звук в широком диапазоне: от разговора и цифровых эффектов до шагов, шума ветра или звука проезжающей машины. В одном ролике можно разыграть диалог, добавить музыку — от «испанской гитары» до «саундтрека к погоне», «лоу-фая для сонного вечера» или любой другой. Модель создает чистый и детализированный звук, без «шипения» и потери качества: в 44 кГц, стандартном качестве большинства стриминговых сервисов.

Эти возможности пригодятся для самых разных задач: с их помощью можно оживить семейную фотографию, записать видеооткрытку с речью или музыкой для близкого человека, снять ASMR-ролик с шелестом бумаги, потрескиванием дров или скрипом снега, или оживить старый мем или кадр из фильма.

Разработчикам новая модель доступна в опенсорсе под лицензией MIT — ее можно бесплатно интегрировать в собственные продукты. Модель также будет доступна в популярных инструментах для запуска и интеграции нейросетей, например, FAL, Diffusers, FastVideo, ComfyUI, SGLang и vLLM-omni. Разработчикам не нужно писать интеграцию с нуля: Kandinsky 6.0 Video можно подключить прямо в существующий продукт.

Качество видео

Low/no-code-революция: новая архитектура цифровой независимости

Low/no-code-революция: новая архитектура цифровой независимости Конференция

Kandinsky 6.0 Video создает ролики в разрешении до Full HD. В «ГигаЧате» пользователи смогут выбрать нужное качество прямо в окне ввода перед отправкой запроса: SD для более быстрой генерации, HD или Full HD для более четкой и детализированной картинки. Kandinsky 6.0 Video точнее передает физику реального мира. Движения людей, животных и предметов в роликах выглядят естественнее, а сцены целиком — правдоподобнее. Это особенно заметно в динамичных роликах с быстрым движением или сменой ракурса.

Обновление будет полезно всем, кто создает видео — в профессиональных и личных проектах: авторам контента для соцсетей: создать короткий ролик с озвученной репликой персонажа или фоновым звуком без микрофона, актеров и монтажа звука; малому бизнесу: сделать голосовой рекламный ролик о товаре или услуге без съемочной группы; маркетологам и SMM-специалистам: собрать тестовый ролик с диалогом и фирменной атмосферой — звуком окружения и музыкальной подложкой — для соцсетей и мессенджеров; преподавателям: оживить архивное фото или портрет исторической личности с озвученной репликой — для урока истории или литературы; дизайнерам: собрать черновой ролик со звуком для питча или демонстрации идеи.

Как обучали модель

Kandinsky 6.0 Video состоит из двух связанных модулей, которые отвечают за создание видео и звука. Звуковой модуль обучен более чем на 20 млн разнообразных видео со звуком. Для обучения команда отбирала ролики только с чистым, качественным звуком, а также видео с говорящими людьми крупным планом для более точной синхронизации речи и мимики.

В Kandinsky 6.0 Video Pro качество генерации значительно выросло в общем визуальном качестве, следовании промпту и движении камеры. Новая модель лучше Kandinsky 5.0 в среднем в 71% случаев по всем критериям, также уверенно обходит открытую LTX 2.5. Кроме того, в задаче оживления изображения превосходит и ведущую закрытую модель Veo 3.1 Fast — по визуальному качеству, соответствию исходному изображению и движению камеры.

View the original on CNews →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.