Kandinsky 6.0 Video — новая линейка моделей генерации видео со звуком🤙 Сбер представил новую версию Kandinsky и сразу открыл код и веса под MIT. Модель умеет генерировать не только видео, но и синхронный звук: диалоги, музыку и звуки окружения, а движения губ подстраиваются под речь. Предыдущая версия Kandinsky больше полугода держала первое место среди открытых text-to-video моделей на arena.ai, сравнявшись по качеству с Veo 3. Новая Pro-версия уже на уровне Veo 3.1 Audio. Среди открытых моделей её опережает только MiniMax H3, а с LTX 2.5 она идёт вровень. Веса моделей доступны на Hugging Face, код — на GitHub и на Gitverse. Опубликован подробный технический отчёт. Модель можно использовать через Diffusers, ComfyUI и другие инструменты, а бесплатно попробовать — в ГигаЧате.
- 43
- 27
- 12
- 7
- 5
- 4
- 4