Skip to main content
У цій статті описано інтеграцію та використання API генерації відео MiniMax H3. Цей інтерфейс підтримує генерацію відео з тексту, керування першим і останнім кадрами та генерацію відео з мультимодальними референсами, використовуючи уніфіковану мультимодальну структуру content V2 для створення завдань.

Процес подання заявки

Щоб використовувати API генерації відео MiniMax H3, спочатку перейдіть до консолі Ace Data Cloud, щоб отримати ваш API Token, і збережіть його для подальшого використання. Якщо ви ще не увійшли або не зареєструвалися, вас автоматично буде перенаправлено на сторінку входу із запрошенням зареєструватися та увійти, після завершення ви автоматично повернетеся на поточну сторінку. Один API Token може викликати всі сервіси платформи, не потрібно окремо подавати заявку для кожного сервісу. Під час першого подання заявки надається безкоштовна квота для безкоштовного ознайомлення; коли квоти недостатньо, ви можете поповнити загальний баланс у консолі.
📘 Повна документація: API генерації відео MiniMax H3 →
Рекомендується зберігати Token як змінну середовища, не записуйте його у вихідний код і не додавайте до репозиторію версій:

Огляд інтерфейсу

  • Base URL:https://api.acedata.cloud
  • Endpoint:POST /minimax/videos
  • Спосіб автентифікації:передавайте authorization: Bearer {token} у HTTP Header
  • Заголовки запиту:
    • accept: application/json
    • content-type: application/json
  • Модель (model):MiniMax-H3
  • Структура введення:текст, зображення, відео та аудіо передаються уніфіковано через content
  • Режим виведення:за замовчуванням синхронно очікує завершення генерації та повертає повний task; при передачі async: true або callback_url негайно повертає task_id і trace_id
  • Запит результату:отримуйте статус і готове відео через API запиту завдань MiniMax H3
  • Асинхронний callback:необов’язково, отримуйте фінальний результат завдання через callback_url
Вам не потрібно передавати action для вибору режиму генерації, інтерфейс автоматично визначить призначення за типом матеріалів і role у content.

Для яких сценаріїв підходить

Процес виклику

Якщо за замовчуванням не передавати async, /minimax/videos очікуватиме завершення генерації та безпосередньо поверне повний task. Коли потрібно негайно звільнити з’єднання, передайте async: true або callback_url:
  1. Збережіть task_id і trace_id з негайної відповіді.
  2. Якщо callback не налаштовано, приблизно кожні 10 секунд викликайте /minimax/tasks для запиту.
  3. Коли task.status зміниться на succeeded, отримайте відео з task.content.url.
  4. Коли статус буде failed або cancelled, припиніть опитування та прочитайте task.error.

Параметри запиту верхнього рівня

Правила для ratio залежать від робочого процесу:
  • Генерація відео з тексту:обов’язковий, і не може бути adaptive.
  • Відео з першим кадром, останнім кадром або першим і останнім кадрами:співвідношення сторін визначається вхідним зображенням, рекомендується пропустити або передати adaptive.
  • Генерація відео з мультимодальними референсами:можна пропустити, за замовчуванням adaptive; також можна явно вказати фіксоване співвідношення.
Інтерфейс не приймає застарілі або сумісні поля, наприклад prompt, image_urls, audio_urls, messages і first_frame_image. У разі отримання помилки таких параметрів видаліть старі поля та перенесіть їх до content; наприклад, змініть "prompt": "一只猫挥手" на "content": [{"type": "text", "text": "一只猫挥手"}]。Не надсилайте одночасно новий і старий формати.

Параметри елементів контенту content

Кожен елемент контенту повинен мати type, інші поля визначаються типом: Адреси медіафайлів підтримують три формати:
  • Загальнодоступний HTTPS URL, рекомендовано для великих файлів.
  • mm_file://{file_id}, посилання на вже завантажений файл або файл із наявним результатом.
  • Base64 data URI відповідного медіатипу. Base64 збільшує розмір приблизно на одну третину, переконайтеся, що весь body запиту не перевищує 64 MB.

Специфікації матеріалів і обмеження кількості

Загалом зображення, відео й аудіо в мультимодальному референсному сценарії можуть містити не більше 12 файлів. Сценарій першого й останнього кадрів та сценарій референсних матеріалів є взаємовиключними: щойно використано reference_image、reference_video або reference_audio, більше не можна використовувати first_frame або last_frame, і навпаки.

Демонстрація можливостей виробничого рівня

Нижче наведено не концепт-арти чи матеріали-заповнювачі, а реальні референсні вхідні дані й фактичні відеовиходи офіційних зразків можливостей виробничого рівня MiniMax H3. Три групи прикладів відповідно охоплюють брендове коротке відео, художню оповідь із реальними людьми та модну електронну комерцію, що підходить для оцінювання найважливіших можливостей моделі в комерційному виробництві. Тут «можливості обличчя» означають узгодженість зовнішності персонажа, деталі обличчя та контроль гри у генерації відео, а не розпізнавання особи, порівняння облич або інтерфейс заміни облич.

Коротке відео преміального бренду: єдність персонажів, продуктів і бренд-активів

Мета виробництва: Брендове відео високої моди 16:9. Створити сувору атмосферу за допомогою пустельної дороги й ретроавтомобіля, зберегти зовнішність головної героїні та структуру чорної сумки, а також природно інтегрувати Logo бренду в завершення. Цей приклад зосереджений на перевірці узгодженості персонажів між кадрами, збереженні товару, кінематографічній якості та здатності завершити відео брендовим акцентом. Безпосередньо відкрити або завантажити брендове коротке відео Відповідний спосіб організації content:

Вертикальна коротка драма з реальними людьми: узгодженість облич і емоційна гра

Мета створення: 15-секундний, 9:16 трейлер темної романтичної короткої драми. За допомогою референсних зображень головних чоловічого та жіночого персонажів зафіксувати зовнішність персонажів, а за допомогою референсного зображення стародавнього замку обмежити простір; використовувати середні крупні плани та крупні плани облич для передачі протистояння поглядів, страху, стриманості та відчуття небезпеки. Цей кейс підходить для спостереження за стабільністю рис обличчя реальних людей, мікровиразами, взаємозв’язком поглядів і безперервною акторською грою. Відкрити або завантажити коротку драму з реальними акторами безпосередньо Промпт має чітко визначати стосунки персонажів, емоції та крупність плану, а не лише описувати «діалог чоловіка й жінки»:

Реклама модних окулярів: збереження деталей обличчя та структури товару

Мета створення: Реклама преміальних модних окулярів у форматі 9:16. Зображення моделі в повний зріст відповідає за статуру та ходу, референс обличчя — за риси обличчя та макіяж, зображення продукту — за вигини оправи, відображення лінз, дужки та контур «котяче око». Цей кейс одночасно перевіряє крупні плани обличчя, узгодженість кількох людей, зв’язок носіння та геометричну структуру товару. Відкрити або завантажити рекламу модних окулярів безпосередньо У рекламі товарів промпт має чітко розділяти ролі референсів персонажів і референсів продукту: матеріали персонажів обмежують обличчя, макіяж, статуру та темперамент; матеріали продукту обмежують контур, матеріал, відображення та положення при носінні. Це стабільніше, ніж узагальнено писати «згенерувати рекламу окулярів».

Генерація відео з тексту

Коли є лише один текстовий елемент, це генерація відео з тексту. Підходить для безпосереднього створення зображення на основі творчої ідеї, сценарію або опису кадру. Промпт можна організувати в порядку «суб’єкт + дія + сцена + камера + освітлення + звук».
Стандартний синхронний режим після завершення генерації повертає повне завдання:
Якщо до запиту додати "async": true, інтерфейс негайно повертає:

Генерація відео із зображення першого кадру

Позначте зображення як first_frame, і модель почне генерацію з цього кадру. Підходить для природного оживлення постерів, зображень товарів, концепт-артів персонажів і фотографічних робіт.

Відео з останнім кадром і початковим та кінцевим кадрами

Надання лише last_frame дозволяє моделі природно генерувати до заданого кадру; одночасне надання first_frame і last_frame дає змогу чітко контролювати початкову та кінцеву точки. Підходить для переходів, змін форми, процесу зростання або порівняння продукту до та після.
Розміри та співвідношення сторін першого й останнього кадрів мають бути якомога більш узгодженими, а відмінності в положенні головного об’єкта, композиції та освітленні не повинні бути надто великими — так легше отримати природний перехід.

Генерація відео за мультимодальними референсами

Референсні матеріали можна комбінувати: референсні зображення контролюють зовнішність персонажа або продукту, референсні відео — рухи й рух камери, а референсне аудіо — тембр діалогів, музику або ритм монтажу. У промпті слід чітко вказати, що має контролювати кожен тип матеріалу, щоб уникнути ситуації, коли матеріали лише завантажуються без зазначення зв’язків між ними.

Сповіщення зворотного виклику

Передавання callback_url автоматично вмикає асинхронний режим: інтерфейс створення негайно повертає task_id і trace_id, а після завершення завдання надсилає остаточний результат методом POST на цю адресу; структура відповідає структурі відповіді на запит стану завдання. Остаточний статус у зворотному виклику буде succeeded, failed або cancelled. Навіть у разі використання зворотного виклику також рекомендується зберігати task_id, щоб мати змогу виконувати активні запити або компенсувати пропущені сповіщення.

Поширені помилки

task.status: succeeded у синхронній відповіді означає, що відео вже згенеровано; асинхронне підтвердження лише означає, що завдання потрапило в чергу. Плата стягується лише за остаточно успішно виконане завдання; самі запити стану завдання безкоштовні та не призводять до повторного списання коштів.

H3 Max

MiniMax-H3-Max підтримує 480P або 768P та цілочисельну тривалість від 5 до 15 секунд. За аудіовхід додаткова плата не стягується, перші 2 зображення безкоштовні, а за кожне понад цей ліміт стягується плата; референсні відео оплачуються відповідно до фактичної тривалості вхідного матеріалу. Ця модель не підтримує 2K.