01
Текст → видео со звуком
Опишите сцену, действия, монтаж, движение камеры, реплики и звуковую среду. H3 собирает их в один аудиовизуальный клип без исходного медиа.
Входные данные
Промпт · формат кадра · длительность · разрешение
Нейросеть для генерации и редактирования видео, которая понимает текст, изображения, видео и аудио как единый режиссёрский контекст. До 15 секунд, до 2K, с нативным стереозвуком.
Создать видео в MiniMax H3Работает в браузере · интерфейс на русском · оплата в рублях
Текст
Изображения
Видео
Аудио
Фото 12K
максимальное разрешение
15 сек.
максимальная длительность
7
форматов кадра
7 000
символов в промпте
Что такое MiniMax H3
MiniMax H3 — модель генерации видео от MiniMax, также известная как Hailuo 03. Вместо цепочки отдельных инструментов для анимации кадра, переноса движения, работы со звуком и локальной правки она получает все материалы в одном контексте и следует связям, которые вы описали словами.
До H3 такие задачи закрывали разные специализированные модели: одна — под перенос движения из видео (motion reference), другая — под перенос стиля (style reference), третья — под генерацию по объекту-референсу (subject reference), четвёртая — только под звук. H3 объединяет их в одной модели и добавляет нативный стереозвук: голос, музыка и звуковые эффекты формируются вместе, как единая сцена, а не отдельными дорожками, которые потом сводят. Это делает модель полезной не только для эффектного короткого клипа, но и для рекламных роликов, e-commerce, титров, анимированных постеров, интерфейсов и игровых концептов.
В Creative AI вы выбираете MiniMax H3, добавляете нужные референсы и видите стоимость до запуска. Весь процесс — от загрузки материалов до готового ролика — проходит внутри Creative AI.
Три способа начать
Выберите сценарий по тому, какие материалы уже есть. Все три ведут в одну модель — меняется только исходный контекст.
01
Опишите сцену, действия, монтаж, движение камеры, реплики и звуковую среду. H3 собирает их в один аудиовизуальный клип без исходного медиа.
Входные данные
Промпт · формат кадра · длительность · разрешение
02
Загрузите начальный кадр, конечный кадр или оба. Модель строит движение и переход между заданными визуальными состояниями.
Входные данные
1–2 кадра · промпт · длительность · разрешение
Кадр 1
Кадр 203
Соедините изображения, видео и аудио. В тексте назначьте каждому файлу роль: герой, товар, пластика движения, камера, голос, музыка или атмосфера.
Входные данные
До 9 изображений · 3 видео · 3 аудио
Фото 1
Фото 2Единый контекст
Модель не должна угадывать, зачем приложен файл. Короткая подпись к роли каждого источника делает запрос яснее и управляемее.
Фото 1
Лицо и одежда героя
Видео 1
Движение и камера
Аудио 1
Голос и ритм
Промпт связывает источники
«Сохрани лицо, причёску и одежду героини с изображения 1. Перенеси движение и траекторию камеры из видео 1 — только движение, без предметов и фона оттуда. Героиня стоит у микрофона и исполняет песню из аудио 1; голос и движение губ синхронизированы, в паузах она дышит и слегка покачивается в ритм. Новая сцена — пустая театральная сцена с тёплым контровым светом, лёгкая дымка в лучах, тёмный зал. Стереозвук: вокал по центру, отражение зала по краям. Без текста и титров.»
9 изображений, 3 видео и 3 аудио в одном запросе.
Укажите, что заменить — героя, предмет, фон, свет, движение или звук — и отдельно перечислите, что оставить без изменений.
Официальные материалы отмечают работу с читаемым текстом, титрами, интерфейсами и бренд-элементами внутри видео.
Модель умеет строить не один непрерывный дубль, а последовательность монтажных планов внутри одной генерации — герой, свет и локация не «плывут» между склейками.
Что можно сделать
Каждый ролик ниже сгенерирован в MiniMax H3. В углу — файлы, из которых он собран; наведите курсор, чтобы запустить видео.
Реклама и e-commerce
Материалы, упаковка, характеристики и финальный бренд-кадр остаются частью одной истории.
Кино и motion design
Текст, композиция, движение и звуковые акценты развиваются вместе, а не отдельными слоями.
Фото 1Социальные сети
Один ключевой арт превращается в короткую сцену, сохраняя лицо, одежду и графическую иерархию.
Фото 1UI и продуктовые концепты
Структура экрана задаётся референсом, а промпт описывает скролл, состояния и логику переходов.
Фото 1Игры и трейлеры
Концепт-арт персонажа превращается в постановочный ролик с движением камеры, эффектами и озвучкой.
Как писать промпт
Лимит — 7 000 символов. Длинный промпт не обязан быть сложным: важнее разложить замысел по ролям и времени.
Что создаём, для кого и где происходит действие.
Что взять из каждого изображения, видео и аудио.
Планы, действия, переходы и финальный кадр в нужном порядке.
Фокусное расстояние, крупность, движение, глубина резкости, экспозиция.
Реплики, голос, музыка, атмосфера, эффекты и моменты синхронизации.
Лицо, товар, материалы, надписи, цвета, композицию или тайминг.
Проверка перед запуском
Выбор модели
MiniMax H3 закрывает большую часть мультимодальных сценариев. Вот случаи, где её ограничения важнее сильных сторон — в каталоге Creative AI для них есть другие модели.
| Задача | MiniMax H3 | Что взять |
|---|---|---|
| Разрешение выше 2K | До 2K | Kling 3.0 — есть режим 4K |
| Ролик длиннее 15 секунд | До 15 секунд | Seedance 2.5 и Wan 3.0 Prime — до 30 секунд |
| Больше 9 изображений или 3 видео в одном запросе | До 9 изображений, 3 видео и 3 аудио | Seedance 2.5 — до 30 изображений, 10 видео и 10 аудио |
MiniMax H3 — мультимодальная модель генерации и редактирования видео от MiniMax. Она понимает общий контекст из текста, изображений, видео и аудио и создаёт ролики с нативным стереозвуком.
Да. MiniMax H3 также встречается под названием Hailuo 03. В Creative AI модель отображается как MiniMax H3.
Три сценария: генерация по тексту, анимация первого и/или последнего кадра и создание по мультимодальным референсам — изображениям, видео и аудио.
В текущей конфигурации Creative AI доступны ролики от 4 до 15 секунд в 768P и 2K.
H3 строит кадр нужного разрешения заново из исходного контекста — текста, изображений, видео и аудио, — а не увеличивает программно уже готовую картинку. Обычный апскейл может только «угадывать» мелкий текст и тонкие детали; H3 воссоздаёт их из того же контекста, что и всю сцену.
Да. По официальному описанию MiniMax, H3 генерирует нативный стереозвук вместе с видео: голос, музыка и звуковые эффекты не разделены на отдельные дорожки, а формируются как единая сцена, которую можно направлять в промпте.
Да. Режим референсов принимает до 9 изображений, 3 видео и 3 аудиофайлов; каждому источнику лучше явно назначить роль в промпте.
Откройте модель, выберите сценарий, добавьте исходные материалы при необходимости, опишите сцену и запустите генерацию. Стоимость отображается в интерфейсе до запуска.
Начните с текста или добавьте свои кадры, видео и звук. Стоимость будет видна до запуска генерации.
Открыть MiniMax H3