Почему ИИ-видео иногда делает все наоборот

Новости

Если 2022 год стал годом, когда генеративный ИИ завоевал воображение широкой общественности, то 2025 год – это время, когда новая порода генеративных видеоплатформ из Китая, вероятно, сделает то же самое. Видео Hunyuan от Tencent произвело значительное впечатление на сообщество энтузиастов ИИ благодаря открытой выкладке полного мирового видео-диффузионного моделя, который пользователи могут адаптировать под свои нужды. Впервые к этой платформе приложил руку Alibaba, с его более новой создающей версии Wan 2.1, одной из самых мощных решений image-to-video FOSS данного периода – теперь поддерживая кастомизацию через Wan LoRAs.

Внезапное влияние

Согласованность с физическим миром остается одной из сложнейших задач для генерации видео с помощью ИИ. Появились значительные достижения в решении этой проблемы в последнее время. Модель видео-диффузии Hunyuan от Tencent произвела значительное впечатление на сообщество любителей ИИ благодаря открытой версии полного мирового видео-диффузионного моделя, что позволяет каждой стороне настроить ее под свои нужды. Почти следом за ней появилась более недавняя платформа Alibaba Wan 2.1, одна из самых мощных решений image-to-video на данный период – теперь поддерживающая кастомизацию через Wan LoRAs. Кроме того, на момент написания ожидается выпуск всеобъемлющего пакета создания и редактирования видео Alibaba VACE.

На данный момент все системы текст-видео и изображение-видео имеют тенденцию производить физические ошибки, такие как на примере скалы, катящейся вверх по склону, по заданному сценарию ‘Небольшой камень скатывается вниз по крутому склону, перемещая почву и мелкие камни’. Недавнее исследование, проведенное в сотрудничестве между Alibaba и ОАЭ, предполагает, что модели всегда обучаются на отдельных изображениях, даже когда это делается на видео (которые разбиваются на последовательности отдельных кадры для обучения), и они не всегда могут выучить правильный порядок ‘до’ и ‘после’ для кадров.

Временные реверсы

У нас нет свидетельств, что системы Hunyuan Video и Wan 2.1 позволяли произвольно ‘инвертированные’ клипы в процессе обучения модели, но единственной разумной альтернативой в свете множества отчетов (и моего собственного практического опыта) выглядит гипотеза о том, что гипермасштабные наборы данных, питающие эти модели, могут содержать клипы, где движения действительно происходят в обратном направлении.

Методология

Авторы описывают последнюю версию своей работы, VideoPhy-2, используя большой языковой модели (LLM) для генерации 3840 подсказок из этих изначальных действий, которые затем используются для синтеза видео с помощью различных фреймворков, находящихся на этапе испытаний.

Данные и тесты

Используя разработанные методы, авторы протестировали множество генеративных видео-систем как через локальные установки, так и, где это необходимо, через коммерческие API: CogVideoX-5B; VideoCrafter2; HunyuanVideo-13B; Cosmos-Diffusion; Wan2.1-14B. Исследования показали, что существующие модели видео-генерации испытывают трудности с соответствием человеческой оценке, в основном из-за слабого физического мышления и сложности выполнения физических действий. Однако, как показала модель Wan2.1, через обратную связь и улучшение основного обучения возможно увеличение логической согласованности с физической реальностью.


Подписывайтесь на наш telegram-канал

admin
Оцените автора
CheatGPT
Добавить комментарий