Как писать промпты для MiniMax Hailuo H3: официальный гайд на русском
Адаптировали официальный prompt guide MiniMax H3: разбираем структуру промпта, таймлайн, камеру, диалоги, звук, референсы и частые ошибки. Внутри — готовые шаблоны и fashion-пример.

MiniMax Hailuo H3 генерирует не просто последовательность кадров, а целую аудиовизуальную сцену: движение, монтаж, речь, шумы и музыку. Поэтому привычный набор тегов вроде «cinematic, high quality, slow motion» использует лишь небольшую часть возможностей модели. В этом разборе мы адаптировали официальный гайд MiniMax и превратили его в практическую инструкцию с шаблонами, которые можно сразу использовать.
Что важно знать о MiniMax H3
По официальному model card H3 — омнимодальная система, которая понимает текст, изображения, видео и аудио, а на выходе создаёт видео с нативным стереозвуком. Модель поддерживает ролики продолжительностью от 4 до 15 секунд, частоту 24 кадра в секунду, разные соотношения сторон и русский диалог. Базовый результат создаётся с короткой стороной 768 пикселей, а официальный полный пайплайн позволяет получить 2K.
Официальная страница MiniMax H3 содержит характеристики модели, примеры и два подробных руководства по промптингу. Ниже — не дословный перевод, а адаптация ключевых правил под реальную работу.
Главный принцип H3: описывайте не картинку, а развитие сцены во времени — что происходит, как реагирует окружение, куда движется камера и что слышит зритель.
Четыре режима генерации
T2VA — создание полного видео и звука только из текста.
I2VA — развитие сцены вперёд из заданного первого кадра.
FL2VA — построение непрерывного пути между первым и последним кадрами.
L2VA — модель придумывает правдоподобное начало и постепенно приходит к заданному финальному кадру.
Для первого кадра сначала зафиксируйте внешность персонажа, одежду, композицию, ключевые предметы и их взаимное положение, а уже затем описывайте движение. Если заданы начало и конец, не повторяйте две статичные картинки: объясните, как меняются поза, объекты, камера и свет между ними.
Базовая структура промпта H3
Официальный формат разделяет запрос на три части. Это помогает модели не смешивать действие, естественные звуки сцены и фоновую музыку.
integrated_multimodal_description: [Shot 1] <visual style, initial composition, subject, action, camera movement, dialogue and synchronized sounds> overall_soundscape: <ambient sound, physical action sounds and non-verbal human sounds> non_diegetic_music: <instruments, tempo, rhythm and changes in volume, or N/A>
1. integrated_multimodal_description
Это основная временная линия ролика. В начале первого шота укажите визуальный стиль и исходную композицию: live-action, cinematic, 2D animation, 3D CG, claymation или другой понятный формат. Затем последовательно опишите персонажей, действия, реакции среды, камеру, речь и синхронные звуки.
2. overall_soundscape
Здесь соберите звуковую среду: ветер, дождь, транспорт, шаги, движение ткани, удары, дыхание или смех. Диалог и пение повторять не нужно — они остаются в описании соответствующего шота. Значение N/A используйте только для полной тишины.
3. non_diegetic_music
Это музыка, которую слышит зритель, но не персонажи. Вместо абстрактного «драматично» назовите инструменты, темп, ритм и динамику: например, редкие фортепианные ноты, медленный темп, низкие струнные постепенно усиливаются и затихают в финале. Если музыки быть не должно, напишите N/A.
Как описывать таймлайн и монтаж
Первый план всегда начинается с [Shot 1] без таймкода. Для каждого следующего монтажа используйте новый номер и точное время склейки, например [Shot 2] At 00:04.500. Таймкоды должны последовательно увеличиваться и укладываться в выбранную длительность ролика.
Добавляйте склейку, когда зритель получает новую информацию: меняется пространство, состояние, ракурс или момент времени.
Если нужно лишь приблизиться или немного изменить угол, используйте движение камеры, а не новый шот.
Для короткого ролика выбирайте одно основное действие. Сложный сюжет лучше разбить на несколько генераций.
Управление камерой: движение, амплитуда и скорость
Полезная формула из официального гайда: тип движения + амплитуда + скорость. H3 понимает Zoom In и Zoom Out, Push In и Pull Out, Pan, Truck, Tilt, Pedestal, Arc Shot, Tracking Shot, Static Shot, POV, Roll и разную силу тряски. Амплитуду можно уточнить как small или large, скорость — slow или fast.
The camera pushes in with small amplitude at slow speed toward the folded letter in her hands. The camera pans right with large amplitude at fast speed, revealing the open doorway. The camera holds a static shot as the model turns toward the lens.
Команду камеры лучше вписывать в естественное описание действия, а не складывать несколько несовместимых терминов в конце промпта. Одновременные orbit, whip pan, zoom и dolly в десятисекундной сцене почти неизбежно будут конкурировать друг с другом.
Диалоги, русский язык и ударения
Каждому говорящему персонажу назначается постоянный идентификатор: (S1), (S2) и так далее. При первом появлении полезно указать возраст, тембр, высоту голоса, темп речи и акцент. Саму реплику помещают внутрь блока <d>, а язык обозначают в квадратных скобках.
The calm young man with a clear low voice (S1) speaks Russian at a measured pace, clearly stressing the final syllables in the words “звонит” and “подвезти”: <d>[Russian] Он звони́т вечером и просит тебя его подвезти́.</d>
В официальном гайде нет отдельного SSML-тега или числового параметра для русского ударения. Практический обходной путь — одновременно поставить знак ударения Unicode и словами описать нужное произношение перед <d>. Это мягкая подсказка, а не гарантия, поэтому для важной реплики лучше сделать несколько вариантов.
Для закадровой речи используйте точную формулировку says in an off-screen voiceover и отдельно укажите, что губы персонажа остаются закрытыми. Если реплика продолжается через склейку, официальный формат предусматривает тег <scenetrans>; для фразы, оборванной финалом ролика, — <cutoff>.
Надписи и логотипы в кадре
Любой текст, который действительно должен появиться на вывеске, упаковке, титре или неоновой надписи, заключается в прямые английские кавычки и сохраняется без перевода. Например: A centered title reading "FASHION BEYOND REALITY" fades in beneath the logo.
Даже при точной инструкции генеративное видео может исказить буквы и фирменный знак. Для рекламы надёжнее сгенерировать чистый финальный кадр, а логотип и типографику добавить при монтаже. Если текст всё же создаётся моделью, дайте ему отдельный статичный шот, высокий контраст и достаточно времени на экране.
Готовый fashion-промпт для H3
Ниже — пример, который соединяет движение модели, физику воды и ткани, управляемую камеру, звуковую среду и брендированную заставку. Он рассчитан примерно на десять секунд.
integrated_multimodal_description: [Shot 1] Live-action, cinematic high-fashion editorial. Inside a vast brutalist hall at blue hour, a tall female fashion model stands ankle-deep in mirror-like black water. She wears an architectural ivory gown with a rigid sculptural collar and long translucent silk panels folded behind her. The camera begins with a symmetrical full-body shot and tracks backward at slow speed as she walks directly toward it with a controlled runway stride. Each step sends precise circular ripples across the water. Halfway through the shot, a strong gust releases the silk panels one after another; they unfurl into long crimson ribbons while the ivory structure remains unchanged. The camera transitions into an arc shot with large amplitude at slow speed. She stops, turns toward the lens and raises one hand to the collar. The ribbons spiral behind her without covering her face. [Shot 2] At 00:08.000, the image cuts to a pure black end card. A sharp white Smartluvon logo emerges in the center from a thin horizontal reflection of light. At 00:09.000, the uppercase text "FASHION BEYOND REALITY" fades in beneath the logo in a modern sans-serif typeface with wide letter spacing. The logo and text remain motionless through the final frame. overall_soundscape: Metallic heels strike the submerged floor with evenly spaced impacts, followed by expanding splashes and water echoes. The silk panels release with crisp snaps and sustained fabric flutters. A short polished metallic shimmer accompanies the logo reveal. non_diegetic_music: Sparse industrial percussion at a slow tempo, joined by a sustained distorted cello note. The percussion stops at the final pose. The logo appears with one clean electronic tone that fades out at the end.
Частые ошибки
Перечень объектов вместо действия. Модель знает, что находится в кадре, но не понимает, как сцена должна развиваться.
Слишком много событий. Пять действий, несколько локаций и четыре движения камеры не помещаются в короткий ролик без потери связности.
Противоречивые команды. Одновременные static shot и handheld tracking shot заставляют модель выбирать за автора.
Смешение звуковых слоёв. Шаги, ветер и дыхание относятся к soundscape, а музыка для зрителя — к non_diegetic_music.
Ожидание синтаксиса весов. Форматы вроде (subject:1.3) или ((subject)) официально для H3 не заявлены. Приоритет лучше повторить ясной естественной инструкцией.
Надежда на идеальную типографику. Текст и логотипы стоит считать отдельной задачей и при необходимости добавлять после генерации.
Как использовать H3 в Smartluvon
Интеграция MiniMax H3 в Smartluvon принимает текстовый промпт, начальный и финальный кадры либо мультимодальные референсы. Поддерживаются длительность 4–15 секунд, форматы от 21:9 до 9:16 и разрешения 768P или 2K. В reference-режиме можно передать до девяти изображений, трёх видео и трёх аудиофайлов, но не более двенадцати файлов суммарно.
Начните с одного понятного шота: субъект, действие, камера и звук. Получив удачную основу, меняйте по одному параметру — движение, свет, длительность или финальную позу. Такой подход быстрее приводит к контролируемому результату, чем полная перезапись промпта после каждой попытки.
Коротко
Описывайте развитие сцены, а не набор красивых характеристик.
Разделяйте визуальную временную линию, естественные звуки и фоновую музыку.
Для камеры задавайте тип движения, амплитуду и скорость.
Сохраняйте идентификаторы говорящих и помещайте точный текст реплики внутрь <d>.
Не рассчитывайте на недокументированные веса промпта и безошибочную генерацию логотипов.
Первоисточник: официальный Video Prompt Writing Guide MiniMax H3.

