MiniMax H3 : prix, API, Hailuo, local et licence

MiniMax H3

MiniMax H3 n’est plus seulement une annonce de modèle ouvert : ses poids sont publiés dans un dépôt officiel depuis le 2 août 2026. La licence communautaire exclut l’Union européenne, le Royaume-Uni, la Corée du Sud et les États-Unis, tandis que plusieurs briques restent hébergées. La page Hailuo expose un workflow web distinct, avec références multimodales, édition ciblée et sorties annoncées jusqu’à 1440p.

Ce qu’il faut retenir

  • Les poids officiels MiniMax H3 sont publiés, mais « modèle ouvert » ne veut pas dire licence ouverte sans restriction.
  • Le texte de la licence exclut l’Union européenne, donc la disponibilité du dépôt ne crée pas un droit d’usage en France.
  • Le dépôt local couvre surtout H3-Base, avec des checkpoints FL2VA et Ref2VA en BF16. Context-IR et la régénération 2K ne sont pas entièrement publiés ; les exemples MiniMax/SGLang vont de quatre GPU à un cas FL2VA sur deux RTX 5090 avec offload.
  • L’API et Hailuo AI offrent des routes hébergées distinctes du local. Le système officiel documente 4 à 15 secondes, 24 FPS, stéréo 32 kHz et jusqu’à 2K via régénération ; Hailuo expose 5 à 15 secondes et jusqu’à 1440p.
  • Le mode Omni Reference accepte jusqu’à 9 images, 3 clips vidéo et 3 clips audio, avec 12 fichiers au total ; chaque vidéo ou audio de référence doit durer de 2 à 15 secondes.
  • La génération NSFW n’est pas une permission implicite : la modération, la licence, l’Acceptable Use Policy, les droits des personnes et les lois restent applicables, y compris en local.
Démo Minimax

MiniMax H3 : prix, accès et décision d’achat

Pour une recherche de type « générateur vidéo IA prix », MiniMax H3 ne se choisit pas sur un seul tarif. Il faut comparer la route d’accès, la résolution, les données envoyées, le matériel, le territoire autorisé et les conditions du contrat. L’API affiche 0,08 dollar par seconde en 768P et 0,13 dollar par seconde en 2K ; Hailuo affiche une interface de production distincte ; le local demande des GPU et reste soumis à la licence publiée.

Besoin d’achat ou d’intégrationRoute à évaluerCoût ou signal disponibleDécision à prendre avant engagement
Tester rapidement une génération vidéo multimodaleHailuo AICompte, quotas, résolution et conditions affichés par l’interfaceVérifier l’accès du compte, la région, l’export et l’usage client
Produire par lots ou intégrer un pipelineAPI MiniMax0,08 $/s en 768P, 0,13 $/s en 2K, hors Context-IR et conditions de compteComparer coût par plan, conservation des médias, SLA, contrat et droits
Garder les poids et les entrées sur une infrastructure contrôléeH3-Base en localGPU, stockage, orchestration et maintenance à budgéter ; licence territoriale déterminanteConfirmer le territoire autorisé, la version, la VRAM et la reproductibilité
Produire depuis la France sans autorisation adaptéeAucune route H3 recommandée à ce stadeLa licence relue exclut l’Union européenneDemander une validation juridique ou choisir une solution autorisée

La conclusion d’achat est donc conditionnelle : H3 peut être évalué comme une capacité multimodale, mais il ne doit pas être acheté, téléchargé ou intégré pour un projet français tant que le territoire et le contrat ne sont pas validés. Cette réponse vise une décision d’achat informée, pas une promesse de disponibilité.

Text-to-video leaderboard (Arena) = Minimax H3 #6
Text-to-video leaderboard • Arena.ai (23/08/2026)

MiniMax H3 est-il réellement ouvert ?

Trois dates et trois niveaux de réalité

La page de lancement MiniMax H3 est datée du 31 juillet 2026. Elle présente H3 comme un modèle généraliste de génération multimodale, capable de comprendre un contexte unifié de texte, image, vidéo et audio, et de générer une vidéo avec son stéréo natif jusqu’à 15 secondes en 2K : annonce officielle MiniMax H3.

Cette annonce indiquait que les poids seraient ouverts dans les jours suivants. Le dépôt officiel MiniMaxAI/MiniMax-H3 sur Hugging Face est maintenant disponible et sa licence porte la date du 2 août 2026. Le statut n’est donc plus « poids annoncés ». Il est « poids publiés, sous une licence communautaire territorialisée ».

QuestionRéponse vérifiée au 4 août 2026Ce que cela ne permet pas d’affirmer
L’annonce existe-t-elle ?Oui, publiée par MiniMax le 31 juillet.Que toutes les capacités annoncées soient disponibles localement.
Les poids sont-ils publiés ?Oui, dans le dépôt officiel MiniMaxAI/MiniMax-H3.Que leur exécution soit autorisée en France.
Le dépôt est-il open source au sens courant ?Il est téléchargeable et accompagné d’une licence spécifique.Qu’il soit compatible avec les licences libres usuelles ou ouvert dans tous les territoires.
Le modèle complet est-il local ?Non. Le dépôt distingue des modules locaux et des services ou modules non publiés.Que l’installation locale reproduise l’API ou Hailuo AI.
Un test CreativeAI a-t-il été réalisé ?Non. Aucun test d’inférence ou de génération n’est conservé pour ce guide.Une recommandation de qualité ou de performance.
Que montre Hailuo aujourd’hui ?Un workflow web H3 avec Text-to-Video, first/first-and-last frame et Omni Reference, jusqu’à 12 fichiers de référence.Que les mêmes limites, prix ou contrôles s’appliquent à l’API et au local.

La licence est la première limite de production

Le fichier MiniMax H3 Community License Agreement définit l’« Applicable Territory » comme le monde entier à l’exception de l’Union européenne, du Royaume-Uni, de la République de Corée et des États-Unis. La France étant un État membre de l’Union européenne, ce point change immédiatement la décision pour un studio français.

La licence ne doit pas être résumée par « usage commercial gratuit ». Elle prévoit un droit limité et non transférable dans le territoire autorisé, des obligations de distribution, des restrictions d’usage et une autorisation écrite préalable au-delà de 20 millions de dollars de revenus annuels pour certains produits et services. Elle encadre aussi l’utilisation des sorties, les dérivés et la redistribution.

Ce n’est pas un avis juridique. C’est un contrôle de périmètre. Avant tout téléchargement, appel API, intégration, prestation client ou redistribution, faites vérifier le texte actuel par la personne responsable des droits et de la conformité. Une licence future ou une autorisation directe pourrait modifier la situation, mais elle n’est pas supposée ici.

Démo Minimax

Que contient réellement le dépôt officiel ?

H3-Base n’est pas le système complet

La carte du dépôt décrit trois briques :

  1. H3-Context-IR, une couche de compréhension et de préparation du contexte multimodal qui transforme les relations entre textes, images, vidéos et audios en représentation intermédiaire.
  2. H3-Base, le modèle qui génère la vidéo et l’audio, avec une sortie locale présentée comme 768p.
  3. H3-Regenerate-2K, une régénération utilisant le contexte initial pour produire une version 2K.

Le dépôt précise que Context-IR est un système hébergé et qu’il n’est pas inclus dans la publication open source. Il indique également que H3-Regenerate-2K n’est pas encore open source et que l’implémentation de l’attention creuse n’est pas incluse dans la première release. Le mot « open » désigne donc un ensemble publié partiel, pas la copie locale de toute la chaîne en ligne.

Les deux familles de checkpoints

Le dépôt documente deux familles de modèles locaux :

CheckpointEntrées principalesSortie documentéeUsage à distinguer
H3-Base-FL2VATexte, première image, dernière image ou les deuxVidéo et audioText-to-audio-video et first/last-frame-to-audio-video
H3-Base-Ref2VATexte avec images, vidéos et/ou audios de référenceVidéo et audioRéférences multimodales et génération audio-vidéo

La carte indique une durée de sortie de 4 à 15 secondes, une fréquence de 24 images par seconde et un son stéréo à 32 kHz. Elle décrit aussi une sortie par défaut dont le petit côté est de 768 pixels, avec la 2K obtenue par une étape de régénération. La page Hailuo affiche une autre couche produit : 5 à 15 secondes, ratios 21:9, 16:9, 4:3, 1:1, 3:4 et 9:16, et jusqu’à 1440p. Ce sont les spécifications documentées des deux routes, pas les résultats d’un test local réalisé pour cet article.

Le dépôt fournit des indications de téléchargement et renvoie vers Diffusers, SGLang, vLLM et ComfyUI. Une procédure d’installation trouvée dans un tutoriel tiers ne suffit pas à établir que le logiciel, les poids, les checkpoints et la licence sont compatibles avec votre projet. Dans un contexte européen, la question juridique arrive avant la commande de téléchargement.

Démo Minimax

Génération locale : configuration nécessaire et limites

La carte officielle distingue une validation locale de H3-Base en 768p et un workflow complet en 2K qui combine un service SGLang local avec les API H3-Context-IR et H3-Regenerate-2K. « Local » ne signifie donc pas que toute la chaîne H3 est embarquée dans les poids téléchargés.

Démo Minimax

Configuration minimale documentée, pas une promesse de performance

Le dépôt officiel propose deux checkpoints BF16. L’exemple de déploiement SGLang utilise quatre GPU, un degré Ulysses de quatre et deux ports distincts pour FL2VA et Ref2VA. Il ne donne pas une valeur universelle de VRAM, de débit ou de temps par vidéo ; ces chiffres doivent être mesurés sur la machine cible.

ÉlémentConfiguration documentéeÀ contrôler avant installation
Checkpoint FL2VAMiniMax-H3 Base FL2VA, texte avec première et/ou dernière imageT2VA, I2VA, FL2VA, sorties audio-vidéo
Checkpoint Ref2VAMiniMax-H3 Base Ref2VA, texte et références image, vidéo ou audioNombre, durée et poids des références
PrécisionBF16Mémoire GPU réellement disponible et support du framework
Serveur recommandé dans l’exempleSGLang, quatre GPU, --ulysses-degree 4Version SGLang, pilotes, CUDA, réseau et compatibilité exacte
Sortie locale documentéeVidéo et audio à 768pTemps d’inférence, synchronisation, stabilité et stockage
Sortie 2KAppel séparé à Context-IR et Regenerate-2KClé API, transfert du fichier, coût et traitement des données

Le dépôt recommande aussi Diffusers, vLLM et ComfyUI, mais les recettes ne sont pas interchangeables. Choisissez une seule voie pour le premier test et conservez sa version, sa commande, le commit du dépôt, les fichiers d’entrée, les logs et la sortie.

Téléchargement et service SGLang

Les commandes ci-dessous reprennent la procédure publiée par MiniMax. Elles sont documentées, non exécutées par CreativeAI et ne doivent être lancées qu’après validation de la licence et du territoire d’usage.

#Prévoir un environnement de travail dédié et limiter le téléchargement
hf download MiniMaxAI/MiniMax-H3 \
  --include "model_index.json" "FL2VA/*" "Ref2VA/*" \
  --local-dir MiniMax-H3

#Exemple officiel FL2VA
sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30010 \
  --model-variant fl2va

#Exemple officiel Ref2VA, sur un port distinct
sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30011 \
  --model-variant ref2va

La documentation SGLang relue le 22 août 2026 ajoute une configuration FL2VA documentée sur deux RTX 5090 de 32 Go, avec --tp-size 2, --ulysses-degree 1, offload des composants et une machine hôte de classe 384 GiB. Elle est présentée comme un point de fonctionnement mesuré par SGLang, pas comme une configuration minimale garantie ni comme une recette Ref2VA universelle : MiniMax H3 dans la documentation SGLang.

CONFIGURATION FL2VA 2 x RTX 5090 documentée par SGLang ; non exécutée par CreativeAI
sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --model-variant fl2va \
  --num-gpus 2 \
  --tp-size 2 \
  --ulysses-degree 1 \
  --encoder-parallel auto \
  --performance-mode memory \
  --layerwise-offload-components dit,text_encoder,vae \
  --dit-offload-prefetch-size 1 \
  --dit-layerwise-resident-layers 20 \
  --enable-torch-compile false \
  --port 30010

Pour un studio, ajoutez à cette configuration un volume rapide pour les poids et les caches, un espace séparé pour les références client, une journalisation sans secret, un contrôle de somme ou de version, une limite de taille d’entrée et un nettoyage explicite des sorties temporaires. N’exposez pas un service local sur un réseau public sans authentification et filtrage.

Local 768p ou workflow 2K hybride ?

  • Local 768p : H3-Base génère la vidéo et l’audio à partir du texte, des images de départ ou des références compatibles avec le checkpoint.
  • Hybride 2K : la machine locale génère la base ; Context-IR et Regenerate-2K passent par les API MiniMax. Les médias et les prompts sortent alors du périmètre local.
  • API ou Hailuo : ce sont des voies hébergées distinctes, avec leurs comptes, leurs prix, leurs contrôles et leurs conditions.

La bonne fiche de choix indique donc la route exacte, le territoire, la version, les données envoyées, la sortie visée, le coût, la supervision et la personne qui valide. Aucun résultat local ni Hailuo n’a été testé par CreativeAI pour cet article.

Démo Minimax

Génération NSFW : ce qui est possible, autorisé et vérifiable

Le dépôt officiel indique que les textes, images, vidéos et prompts enrichis sont soumis à une modération automatisée et que des contenus suspectés d’être illégaux, pornographiques ou contrefaisants peuvent être bloqués. La licence et l’Acceptable Use Policy interdisent notamment l’exploitation de mineurs, l’usage nuisible, le contournement des garde-fous et l’utilisation sans consentement d’une personne réelle.

Un déploiement local peut ne pas reproduire la modération du service hébergé, mais il ne supprime ni les obligations contractuelles ni les responsabilités sur les sorties. Il ne faut pas utiliser un checkpoint tiers présenté comme « NSFW » pour contourner les contrôles, ni supposer qu’un fork modifie la licence MiniMax. Les liens NSFW présents dans le PDF Drive sont des dépôts tiers et ne constituent pas une validation officielle.

Pour un usage de recherche ou de direction artistique, retenez une définition opérationnelle étroite : personnages explicitement adultes, contexte légal et consensuel, sujet fictif ou autorisation documentée, sexualité non graphique, absence de contrainte, d’exploitation, d’inceste, de violence sexualisée et d’ambiguïté d’âge. Pour une personne réelle, la référence et le consentement doivent être documentés ; une image publique ne vaut pas consentement à la sexualisation.

Garde-fous à ajouter en local

  1. Filtrer la demande avant inférence : âge explicite, consentement, identité, droit sur les références et destination.
  2. Refuser toute demande impliquant un mineur, une personne d’âge incertain, une sexualisation non consentie, une imitation de personne réelle sans autorisation ou un acte illégal.
  3. Conserver les prompts, versions, décisions et sorties dans un espace privé avec accès borné.
  4. Revoir les sorties avant export ; supprimer les éléments identifiants ou non autorisés.
  5. Ajouter la mention de contenu généré par IA lorsque la sortie est publiée dans un environnement public, conformément à l’Acceptable Use Policy relue.
  6. Ne jamais désactiver ou contourner une modération proposée par la route hébergée ou par le workflow de l’équipe.

Cette section ne constitue pas un avis juridique et ne fournit pas de méthode de contournement. La licence H3 exclut actuellement l’Union européenne, le Royaume-Uni, la République de Corée et les États-Unis : pour une équipe en France, la revue juridique et une éventuelle autorisation écrite précèdent tout téléchargement, appel API ou génération.

Prompt : étude adulte non explicite et consensuelle

Statut : documenté, non exécuté. Ce canevas n’est pas une invitation à contourner la modération et ne remplace ni la licence ni la vérification du territoire.

Modèle et mode vérifiés : MiniMax H3, format T2VA ou Ref2VA à confirmer dans la route autorisée ; prompt en langage naturel.

Objectif : cadrer une étude audiovisuelle adulte, fictive, consensuelle et non graphique avant toute génération.

Variables à adapter : décor, personnages clairement adultes, style, durée, mouvement de caméra, son et destination privée.

Pourquoi cette structure : elle rend explicites l’âge, le consentement, l’absence de ressemblance réelle et les exclusions de sécurité.

Limites : elle ne contourne ni la modération, ni la licence territoriale, ni l’Acceptable Use Policy ; elle n’autorise pas la pornographie, l’exploitation ou la sexualisation non consentie.

Validation : documenté, non exécuté.

Generate a cinematic, non-graphic fashion-film scene featuring two clearly adult fictional characters,
with explicit mutual consent and no real-person likeness. The styling is sensual but non-explicit:
fully clothed, no nudity, no sexual activity, no coercion, no violence, no age ambiguity.
Describe the setting, camera movement, lighting, fabric, facial expressions, diegetic sound and
non-diegetic music. Keep the scene suitable for a private creative research review.
Do not add minors, youthful ambiguity, identifiable real people, explicit anatomy, or text that was
not requested. Stop and flag any missing consent, age or rights information.

Bibliothèque de prompts MiniMax H3

Les prompts ci-dessous reprennent la structure officielle integrated_multimodal_description, overall_soundscape et non_diegetic_music, ainsi que les formats T2VA, I2VA, FL2VA et Ref2VA. Ils sont des modèles de travail documentés, non exécutés.

Prompt : T2VA texte vers audio-vidéo

Statut : documenté, non exécuté.

Modèle et mode vérifiés : MiniMax H3-Base-FL2VA, mode T2VA sans image de référence, structure issue du guide officiel de prompting base.

Objectif : décrire une timeline audiovisuelle complète à partir du texte.

Variables à adapter : style, durée, plans, sujet, actions, dialogues autorisés, ambiance, sons et musique.

Pourquoi cette structure : les trois champs officiels séparent la timeline visuelle, le paysage sonore et la musique non diégétique.

Limites : le format ne garantit pas la qualité, la durée réelle, la synchronisation ou l’accès au checkpoint ; aucun test n’est conservé.

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a medium-wide shot frames
[describe the setting, subject, composition and starting state]. The camera [motion type, amplitude
and speed] as [describe observable action and state change]. If there is dialogue, identify the
speaker with (S1) and write the exact words inside <d>[English] ...</d>. [Shot 2] At 00:05.000,
the camera cuts to [new visual information and action].
overall_soundscape: [1–4 sentences describing ambience, physical action sounds and non-verbal sounds.]
non_diegetic_music: [1–3 sentences describing instruments, tempo, rhythm and dynamic change, or N/A.]

Prompt : I2VA avec première image

Statut : documenté, non exécuté.

Modèle et mode vérifiés : MiniMax H3-Base-FL2VA, mode I2VA avec une image de départ, instruction d’alignement officielle.

Objectif : prolonger une image de référence en conservant ses invariants visuels.

Variables à adapter : image, sujet, composition, action de départ, mouvement, durée, son et musique.

Pourquoi cette structure : elle ancre la première image à 0,00 seconde avant de décrire le développement temporel.

Limites : la continuité, les détails et le texte à l’écran doivent être relus ; la 2K et la chaîne complète peuvent nécessiter les services hébergés.

For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.
integrated_multimodal_description: [Shot 1] Preserve the subject, clothing, composition, lighting
and spatial relationships visible in <Picture 1>. Describe the first action that develops forward
from that frame, then the continuous camera movement, subject motion and sound.
overall_soundscape: [ambient and physical sounds across the full video.]
non_diegetic_music: [audience-only score, or N/A.]

Prompt : FL2VA entre première et dernière image

Statut : documenté, non exécuté.

Modèle et mode vérifiés : MiniMax H3-Base-FL2VA, mode FL2VA avec première et dernière image, format d’alignement officiel.

Objectif : décrire le chemin observable entre deux états visuels imposés.

Variables à adapter : images d’ouverture et de fin, durée exacte, actions intermédiaires, caméra, son et musique.

Pourquoi cette structure : elle fixe les deux bornes et demande une évolution continue plutôt qu’une simple juxtaposition d’images.

Limites : un seul plan est souvent plus cohérent, mais aucune performance ou fidélité n’est garantie sans test.

How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 8.00-second mark of the target video.
integrated_multimodal_description: [Shot 1] Describe the starting state established by Picture 1,
then the observable motion path that progressively reaches the pose, objects, lighting and
composition established by Picture 2. Prefer one continuous shot unless a cut is necessary.
overall_soundscape: [ambient and physical sounds across the transition.]
non_diegetic_music: [audience-only score, or N/A.]

Prompt : Ref2VA avec références multimodales

Statut : documenté, non exécuté.

Modèle et mode vérifiés : MiniMax H3-Base-Ref2VA, mode Ref2VA, structure issue du guide officiel Full-Reference.

Objectif : définir clairement le rôle de chaque sujet, image, vidéo et audio de référence.

Variables à adapter : labels des références, sujets, relation de conservation, plans, dialogues et couches sonores.

Pourquoi cette structure : elle sépare la définition des références, leur conservation et la description détaillée du résultat.

Limites : les références doivent être autorisées ; les limites de nombre, durée et mélange des fichiers restent celles du dépôt et de la route choisie.

subject_definitions:
<Subject 1> is [the visible subject and the reference asset that defines it].
<Video 1> is [the source video used for structure, motion or editing].
<Audio 1> is [the audio reference and its role: reused or timbre/style reference].
summary:
[reference generation] The target video uses <Subject 1>, <Video 1> and <Audio 1> for [precise roles].
retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - [what must remain stable].
<Video 1> (structure or motion): reference - [what is transferred, without claiming a copy].
<Audio 1>: reference - [what is referenced, without copying the source signal].
detailed_description:
The target video is [style, lighting and palette]. [Shot 1] Describe the subjects, spatial layout,
actions, camera movement and where each reference takes effect. Use stable subject labels and speaker
IDs; preserve exact dialogue only when it is supplied and authorized.
overall_soundscape: [ambience and physical sounds.]
non_diegetic_music: [audience-only score, or N/A.]

Prompt : protocole de test local reproductible

Statut : documenté, non exécuté.

Modèle et mode vérifiés : MiniMax H3-Base-FL2VA ou Ref2VA, service local et framework à renseigner ; protocole proposé pour la reproductibilité.

Objectif : conserver les informations nécessaires pour distinguer une démonstration d’un test vérifiable.

Variables à adapter : commit, GPU, précision, framework, fichiers, durée, ratio, prompt, métriques et règles d’export.

Pourquoi cette structure : elle relie la sortie à la machine, aux entrées, à la commande et à une relecture humaine.

Limites : elle ne remplace ni la licence, ni le contrôle des contenus, ni un benchmark statistiquement significatif.

Run one authorized MiniMax H3-Base test using [FL2VA or Ref2VA], version [commit],
machine [GPU count and model], precision BF16, framework [SGLang/Diffusers/vLLM/ComfyUI],
input files [paths and checksums], duration [4–15 seconds], aspect ratio [ratio] and prompt [ID].
Save the command, environment, logs, elapsed time, peak memory, generated video and audio,
and a human review covering prompt adherence, temporal continuity, audio synchronization,
text rendering and unintended content. Do not export or publish the result before rights review.

MiniMax H3 : API, Hailuo AI ou génération locale ?

MiniMax sépare dans sa carte de modèle l’API en ligne, l’application Hailuo AI et le déploiement local. Cette séparation est utile, car chaque voie apporte une autre combinaison d’accès, de données, de coûts, de contrôles et de conditions d’utilisation.

Ce que la page Hailuo permet de vérifier

La page produit MiniMax H3 sur Hailuo AI décrit une prise en main en quatre étapes : choisir un mode, ajouter les références multimodales, régler durée/ratio/résolution, puis générer et affiner. Elle mentionne trois routes visibles : Text-to-Video, first frame / first-and-last frame et Omni Reference. Cette page produit ne prouve pas que les mêmes fonctions, limites ou tarifs sont disponibles sur l’API ou dans les checkpoints locaux.

Pour Omni Reference, la page Hailuo indique jusqu’à 9 images, 3 clips vidéo et 3 clips audio, avec une limite de 12 fichiers au total. Les clips vidéo et audio de référence sont annoncés entre 2 et 15 secondes, avec un total de 15 secondes par type. Les références audio doivent être utilisées avec une image ou une vidéo. La page décrit aussi l’édition ciblée de personnes, objets, arrière-plans, lumière, effets, dialogues et voix, ainsi que des sorties de 5 à 15 secondes à 24 FPS avec son stéréo natif.

La résolution mérite une note de méthode : l’annonce MiniMax et la carte du dépôt parlent de 2K via H3-Regenerate-2K, la page de prix API facture une sortie 2K et 768P, tandis que la page Hailuo expose « up to 1440p ». Pour un devis ou une livraison, relevez le mode et la résolution affichés par la route réellement utilisée ; n’assimilez pas automatiquement 1440p, 2K et 768p.

VoieCe qui est documentéCe qu’il faut vérifier avant production
API MiniMaxUne API vidéo H3 et une page de prix existentRégion, compte, conservation des données, droit d’usage et contrat applicable
Hailuo AIUne application en ligne est indiquée par la carte officielleAccès réel du compte, pays, quotas, export et conditions pour un usage client
Déploiement localCheckpoints H3-Base et recettes d’intégration documentésTerritoire autorisé, matériel, dépendances, composant Context-IR et reproductibilité
ComfyUI ou intégration tierceDes liens d’intégration sont référencés par le dépôtProvenance des fichiers, licence, sécurité et absence de modification non documentée

La page de tarification Pay as You Go de MiniMax affiche, au moment de la vérification du 22 août 2026, 0,13 dollar par seconde en 2K et 0,08 dollar par seconde en 768P pour MiniMax-H3. Elle affiche aussi une ligne distincte pour la régénération 768P vers 2K à 0,05 dollar par seconde, ainsi qu’une tarification de Context-IR au million de tokens. Ces montants aident à comparer une route API, mais ils ne remplacent pas la vérification du contrat, de la région et du droit d’utiliser H3 pour un client.

Le coût réel d’un modèle ouvert inclut souvent plus que l’inférence : stockage des poids, GPU, orchestration, prétraitement, contrôles, supervision, export, maintenance et responsabilité. Un prix API bas ne rend pas automatiquement le local plus intéressant, et un dépôt public ne rend pas automatiquement le projet exploitable.


Grille de décision pour un studio créatif

Cas 1 : veille et évaluation documentaire

Vous pouvez suivre le dépôt, la licence, les outils compatibles et les prochaines versions sans lancer de génération. C’est le niveau approprié pour une équipe française tant qu’aucune autorisation adaptée n’est confirmée. Archivez la date, le hash ou la version du dépôt, la licence relue et les composants réellement publiés.

Cas 2 : preuve de concept hors territoire exclu

Dans un territoire autorisé et avec un cadrage juridique confirmé, vous pouvez évaluer les deux familles de checkpoints sur un jeu de tests simple : continuité du sujet, comportement des références, synchronisation du son, stabilité du texte, temps d’inférence, mémoire et reproductibilité. Conservez les entrées, les sorties, la configuration, les versions et les échecs.

Cas 3 : prestation commerciale ou intégration

Ne partez pas d’une démonstration. Établissez une fiche d’autorisation : territoire, statut du client, modèle utilisé, route API ou locale, droits sur les références, restrictions de sortie, obligations d’information et personne qui signe la validation. Vérifiez ensuite la parité entre la capacité promise et la capacité réellement accessible.

Cas 4 : usage en France

La licence publiée exclut l’Union européenne. La recommandation opérationnelle est donc de ne pas déployer H3, ne pas utiliser ses poids, ne pas appeler une voie H3 pour un livrable français et ne pas redistribuer un dérivé sans avis juridique et autorisation écrite appropriée. Cette conclusion peut évoluer si MiniMax publie une nouvelle licence ou accorde une autorisation, mais elle ne doit pas être devinée à partir du terme « open model ».


Comment utiliser cette bibliothèque sans surpromettre

L’angle choisi reste celui du statut d’ouverture, de la disponibilité et de la licence. Les prompts ajoutés servent à préparer un test dans un territoire autorisé ; ils ne prouvent ni l’accès au modèle ni la qualité d’un résultat. Pour chaque essai, conservez le modèle, le mode FL2VA ou Ref2VA, la version du dépôt, le contexte, le nombre de références, la résolution, la route d’inférence, le temps de calcul et les critères de test. Tant qu’un test reproductible n’est pas archivé, chaque prompt reste « documenté, non exécuté ».

Formation : construire une méthode d’évaluation, pas une collection d’outils

La formation L’IA générative pour les créatifs : panorama et expérimentation des outils essentiels permet de comparer des outils et des modèles, tester leurs limites, comprendre les conditions d’accès et décider où ils peuvent entrer dans un workflow. Elle ne vaut pas autorisation d’utiliser MiniMax H3 dans l’Union européenne et ne remplace pas une revue juridique.

Formation : construire une méthode d’évaluation, pas une collection d’outils

La formation L’IA générative pour les créatifs : panorama et expérimentation des outils essentiels permet de comparer des outils et des modèles, tester leurs limites, comprendre les conditions d’accès et décider où ils peuvent entrer dans un workflow. Elle ne vaut pas autorisation d’utiliser MiniMax H3 dans l’Union européenne et ne remplace pas une revue juridique.


Méthodologie et limites

Le guide combine le PDF Drive avec l’annonce officielle MiniMax, la carte de modèle, les guides de prompts et la licence du dépôt officiel relus le 22 août 2026, ainsi que la page produit Hailuo, la documentation de tarification API et le guide de déploiement SGLang. Les capacités, formats, composants, vidéos de démonstration et prix sont rapportés dans le périmètre de ces pages. Aucun test d’inférence, de génération vidéo, de son ou d’installation locale n’a été exécuté par CreativeAI pour cet article. Les prompts sont documentés, non exécutés.

La licence est un texte contractuel susceptible d’évoluer. La conclusion sur l’Union européenne correspond au fichier relu le 22 août 2026. Un accord écrit, une nouvelle licence ou une condition API distincte pourrait changer le périmètre, mais doit être obtenu et archivé. Les performances, benchmarks, compatibilités matérielles et résultats de workflows tiers ne sont pas présentés comme vérifiés. Les MP4 intégrés sont des démonstrations officielles hébergées par les fournisseurs, pas des sorties générées par CreativeAI.


Sources et références

Fondateur de CreativeAI.fr · Expert IA & workflows créatifs · 20+ ans d’expérience en direction créative (Marcel, Leo Burnett). 600+ professionnels formés depuis 2023 aux usages, méthodes et workflows IA. 4,7/5 de satisfaction moyenne.

Résumer cet article :

Guides Pratiques

ChatGPT Work

ChatGPT Work : transformer un brief en mission agentique

ChatGPT Work est conçu pour les tâches longues qui demandent de rassembler du contexte, d’utiliser des applications ou des fichiers, de produire un livrable et de revenir vers l’utilisateur lorsque son arbitrage compte.

Accéder au guide

prompt lumière IA

Piloter la lumière IA comme un chef opérateur

La lumière en IA ne se contrôle pas avec des adjectifs comme « cinematic », « moody » ou « dramatic lighting ». Elle se dirige comme un plan lumière : une source, une direction, une intensité, une température, un contraste et une intention narrative.

Accéder au guide

brand brain IA

Brand Brain : transformer une stratégie de marque en système utilisable par l’IA

Un Brand Brain IA est un référentiel de marque structuré pour être consulté, interprété et vérifié par des assistants d’intelligence artificielle. Il ne s’agit pas de copier un brand book dans une conversation ni d’empiler des prompts.

Lire l’article

formations IA

Google Flow, Veo & Gemini Omni : L’Orchestration Cinématographique IA

Durée : 2 jours (14h). Public : DA, réalisateurs, motion designers, équipes marketing, communication et social media

Réinventer son processus créatif avec l’IA générative

Durée : 5 jours (35h). Public : DA, graphistes, designers

Créer des visuels de marque avec ChatGPT Images et Codex NEW

Social Content Factory : produire et décliner ses contenus avec l’IA NEW

Durée : 2 jours (14h). Public : Responsables marketing et communication, Social media managers et content managers, Agences, studios et équipes éditoriales

IA agentique pour les créatifs : du brief à l’automatisation NEW

Durée : 1 jour (7h). Public : Responsables de production et dirigeants de structures créatives, équipes marketing, communication et contenu, agences et studios créatifs