Skip to main content
本文では、MiniMax H3 動画生成 API の連携と使用方法を紹介します。このインターフェースは、テキストから動画、開始・終了フレーム制御、およびマルチモーダル参照による動画生成をサポートし、統一された V2 マルチモーダル content 構造を使用してタスクを作成します。

申請フロー

MiniMax H3 動画生成 API を使用するには、まず Ace Data Cloud コンソール で API Token を取得し、控えておいてください。 まだログインまたは登録していない場合は、自動的にログインページへ移動して登録とログインを促されます。完了後は自動的に現在のページへ戻ります。 1 つの API Token でプラットフォームのすべてのサービスを呼び出せるため、サービスごとに個別で申請する必要はありません。 初回申請時には無料クレジットが付与され、無料で体験できます。クレジットが不足した場合は、コンソール で共通残高をチャージできます。
📘 完全なドキュメント:MiniMax H3 動画生成 API →
Token は環境変数として保存し、ソースコードに書き込んだりバージョン管理リポジトリにコミットしたりしないことを推奨します。

インターフェース概要

  • Base URL:https://api.acedata.cloud
  • Endpoint:POST /minimax/videos
  • 認証方式:HTTP Header に authorization: Bearer {token} を含める
  • リクエストヘッダー:
    • accept: application/json
    • content-type: application/json
  • モデル(model):MiniMax-H3
  • 入力構造:content を通じてテキスト、画像、動画、音声を統一的に渡す
  • 出力モード:デフォルトでは同期的に生成完了を待機し、完全な task を返す。async: true または callback_url を渡す場合は、直ちに task_id と trace_id を返す
  • 結果照会:MiniMax H3 タスク照会 API を通じてステータスと完成動画を取得
  • 非同期コールバック:任意。callback_url を通じて最終タスク結果を受け取る
生成モードを選択するために action を渡す必要はありません。インターフェースが content 内の素材タイプと role に基づいて用途を自動的に判断します。

どのようなシーンに適しているか

呼び出しフロー

デフォルトで async を渡さない場合、/minimax/videos は生成完了を待機し、完全な task を直接返します。すぐに接続を解放する必要がある場合は、async: true または callback_url を渡します。
  1. 即時レスポンス内の task_id と trace_id を保存します。
  2. コールバックを設定していない場合は、約 10 秒ごとに /minimax/tasks を呼び出して照会します。
  3. task.status が succeeded になったら、task.content.url から動画を取得します。
  4. ステータスが failed または cancelled の場合はポーリングを停止し、task.error を読み取ります。

トップレベルのリクエストパラメーター

ratio のルールはワークフローによって異なります。
  • テキストから動画:必須であり、adaptive は使用できません。
  • 開始フレーム、終了フレーム、または開始・終了フレーム動画:画面比率は入力画像によって決まり、省略するか adaptive を渡すことを推奨します。
  • マルチモーダル参照から動画:省略可能で、デフォルトは adaptive です。固定比率を明示的に指定することもできます。
インターフェースは、prompt、image_urls、audio_urls、messages、first_frame_image などの旧バージョンまたは互換フィールドを受け付けません。このようなパラメーターエラーを受け取った場合は、旧フィールドを削除して content に移行してください。たとえば、"prompt": "猫が手を振る" を "content": [{"type": "text", "text": "猫が手を振る"}] に変更します。新旧両方の形式を同時に送信しないでください。

content コンテンツ項目のパラメーター

各コンテンツ項目には必ず type が必要で、その他のフィールドはタイプによって決まります。 メディアアドレスは次の 3 つの形式をサポートしています。
  • 公開アクセス可能な HTTPS URL。大きなファイルに推奨されます。
  • mm_file://{file_id}。すでにアップロード済みまたは既存の結果ファイルを参照します。
  • 対応するメディアタイプの Base64 data URI。Base64 ではサイズが約 3 分の 1 増加するため、リクエスト本文全体が 64 MB を超えないようにしてください。

素材仕様と数量制限

マルチモーダル参照シーンでは、画像、動画、音声の合計は最大 12 ファイルです。先頭・末尾フレームのシーンと参照素材のシーンは排他的です:reference_image、reference_video、または reference_audio を使用した場合、first_frame または last_frame は使用できません。その逆も同様です。

プロダクション級能力の展示

以下はコンセプト画像やプレースホルダー素材ではなく、MiniMax H3 公式のプロダクション級能力サンプルにおける実際の参照入力と実際の動画出力です。3 組の事例はそれぞれブランド短編、実写ナラティブ、ファッションECをカバーしており、商業制作においてモデルの最も重要な能力を評価するのに適しています。 ここでの「顔の能力」とは、動画生成における人物の外見的一貫性、顔のディテール、演技制御を指しており、本人認証、顔照合、または顔交換インターフェースではありません。

高級ブランド短編:人物、製品、ブランド資産の統一

制作目標: 16:9 の高級ファッションブランド映像。荒漠の道路とヴィンテージカーによってクールな雰囲気を構築し、女性主人公の外見と黒いハンドバッグの構造を維持しながら、ブランド Logo を自然にエンディングへ組み込みます。この事例では、ショットをまたぐ人物の一貫性、商品維持、映画的な質感、ブランドによる締めくくりの能力を重点的に検証します。 ブランド短編を直接開く、またはダウンロードする 対応する content の構成方法:

実写縦型ショートドラマ:顔の一貫性と感情表現

制作目標: 15秒、9:16のダークロマンス短編ドラマ予告。男女主人公の参考画像で人物の外見を固定し、古城の参考画像で空間を制約する;ミドルクローズアップと顔のクローズアップを用いて、視線の対峙、恐怖、抑制、危険な雰囲気を表現する。このケースは、実写の顔立ちの安定性、微表情、視線関係、連続した演技を観察するのに適している。 実写短編ドラマを直接開く、またはダウンロードする プロンプトでは、単に「男女が会話する」と記述するのではなく、人物関係、感情、ショットサイズを明確にすべきです:

ファッション眼鏡広告:顔の細部と商品構造の維持

制作目標: 9:16の高級ファッション眼鏡広告。人物の全身画像は体型とウォーキングを担い、顔の参考画像は顔立ちとメイクを担い、商品画像はカーブ、レンズの反射、テンプル、キャットアイの輪郭を担う。このケースは、顔のクローズアップ、複数人物の一貫性、着用関係、商品幾何構造を同時に試す。 ファッション眼鏡広告を直接開く、またはダウンロードする 商品広告では、プロンプトで人物参考と製品参考の役割を分けて明確に記述すべきです:人物素材は顔、メイク、体型、雰囲気を制約し;製品素材は輪郭、材質、反射、着用位置を制約します。このようにすることで、漠然と「眼鏡広告を生成する」と書くより安定します。

テキストから動画生成

テキスト項目が一つだけの場合は、テキストから動画生成となります。アイデア、脚本、またはショットの説明から直接映像を生成するのに適しています。プロンプトは「主体 + 動作 + シーン + カメラ + 光 + 音声」の順で構成できます。
デフォルトの同期モードでは、生成完了後に完全なタスクが返されます:
リクエストに "async": true を追加すると、インターフェースは直ちに以下を返します:

開始フレーム画像から動画生成

画像を first_frame としてマークすると、モデルはその画面から生成を開始します。ポスター、商品画像、キャラクター設定画像、写真作品を自然に動かすのに適しています。

終了フレームおよび開始・終了フレーム動画

last_frame のみを提供すると、モデルは指定した画面まで自然に生成できます。同時に first_frame と last_frame を提供すると、開始点と終了点を明確に制御できます。トランジション、形態変化、成長過程、または製品のビフォーアフター比較に適しています。
開始フレームと終了フレームのサイズおよびアスペクト比はできるだけ一致させ、主体の位置、構図、光の差異を大きくしすぎないでください。そうすることで、より自然な遷移を得やすくなります。

マルチモーダル参照による動画生成

参照素材は組み合わせて使用できます。参照画像でキャラクターまたは製品の外観を制御し、参照動画で動作とカメラワークを制御し、参照音声でセリフの音色、音楽、または編集テンポを制御します。プロンプトでは、各種類の素材で何を制御するかを明確に説明し、素材だけをアップロードして関連性を示さないことを避けてください。

コールバック通知

callback_url を渡すと非同期モードが自動的に有効になります。作成インターフェースは直ちに task_id と trace_id を返し、タスク完了後にそのアドレスへ最終結果を POST します。構造はタスク照会レスポンスと同一です。 コールバックの最終ステータスは succeeded、failed、または cancelled です。コールバックを使用する場合でも、能動的な照会や見逃した通知の補完のために task_id を保存することを推奨します。

よくあるエラー

同期レスポンス内の task.status: succeeded は、動画が生成済みであることを示します。非同期確認は、タスクがキューに入ったことだけを示します。タスクが最終的に成功した場合にのみ課金され、タスク照会自体は無料で、重複課金されることはありません。

H3 Max

MiniMax-H3-Max は 480P または 768P、5~15 秒の整数の長さをサポートします。音声入力は追加料金なしで、最初の 2 枚の画像は無料、超過分は 1 枚ごとに課金されます。参照動画は実際の入力時間に基づいて課金されます。このモデルは 2K をサポートしていません。