Gemini Omni Flash : passer du prompt vidéo à la note de mise en scène

prompt Gemini Omni Flash

Gemini Omni Flash devient vraiment intéressant lorsqu’on cesse de lui demander une « belle vidéo » et qu’on lui donne une décision de mise en scène. Le modèle stable gemini-omni-1.1-flash accepte des consignes de génération et d’édition vidéo, tandis que Gemini DeepMind documente le cadrage, le mouvement, l’action, la lumière, le son, le texte et les références.

Ce guide propose une méthode de travail par plan : formuler l’intention, protéger les invariants, générer une première version, puis corriger un seul élément à la fois.

Ce qu’il faut retenir

  • Une note de mise en scène décrit ce que le plan doit faire ressentir et montrer, pas seulement son sujet.
  • Gemini Omni Flash répond aux consignes de cadrage, de mouvement, d’action, de lumière et de lieu documentées par Google.
  • Pour une retouche, une instruction courte et locale, suivie de Keep everything else the same, protège mieux la continuité qu’un nouveau prompt complet.
  • Les images de début et de fin, les références vidéo et l’édition conversationnelle sont des leviers différents : ne les mélangez pas dans la même demande sans raison.
  • Les prompts de ce guide sont documentés, non exécutés. Les dix vidéos intégrées sont des MP4 externes associés à des publications officielles Google, pas des tests réalisés pour cet article.

Ce guide ne refait pas le guide Google Flow

Le guide CreativeAI.fr Google Flow & Gemini Omni : construire un studio créatif IA complet couvre déjà l’architecture du mini-studio : brief, bible visuelle, Agent, personnages, Scene Builder, crédits, provenance et 100 prompts.

Le sujet est différent ici. Il ne s’agit pas de décrire tout l’écosystème Flow, ni d’ajouter une nouvelle liste de recettes. Le point de départ est plus étroit : comment transformer une intention de réalisation en note de mise en scène exploitable par Gemini Omni Flash, puis comment retoucher le plan sans détruire ce qui fonctionnait déjà.

Cette distinction évite une cannibalisation d’intention. Le premier guide répond à « comment organiser une production vidéo IA complète avec Flow ? ». Celui-ci répond à « comment diriger un plan Gemini Omni avec une consigne qui ressemble à une décision de plateau ? ».

les nouveautés annoncées

Actualisation vérifiée le 28 août 2026. Gemini Omni 1.1 Flash entre dans une phase plus intéressante pour la réalisation vidéo : le modèle ne se contente plus de générer un plan, il permet de le reprendre, de le guider par références et de préciser la transition attendue.

Runway : passer d’un prompt, d’une image ou d’une vidéo à une itération de production.
  • Version stable : gemini-omni-1.1-flash, à distinguer de la version preview.
  • Entrées et sorties : texte, image et vidéo en entrée, avec des sorties vidéo documentées de 3 à 10 secondes, en 24 FPS, de 360p à 4K.
  • Édition conversationnelle : une correction locale peut préserver les éléments qui fonctionnent déjà, au lieu de relancer toute la scène.
  • Contrôle des transitions : les première et dernière images peuvent encadrer une interpolation, tandis que l’extension est documentée séparément selon l’interface et le mode utilisé.
  • Annonce Flow : le post officiel fourni pour cette mise à jour annonce l’intégration de Omni 1.1 Flash dans Flow et l’arrivée des images de fin sur ordinateur.
  • Extension : prolonger une vidéo par incréments de dix secondes, avec jusqu’à dix secondes de contexte antérieur analysé et une longueur cumulative annoncée de quarante secondes.
  • Prévisualisation : Google annonce jusqu’à 60 % de gain de vitesse et un coût égal au tiers de la sortie 720p standard en 360p ; il s’agit d’une indication fournisseur, à vérifier dans l’interface et le compte utilisés.
  • Références vidéo : fournir jusqu’à trois secondes de vidéo de référence pour transmettre un mouvement ou une continuité de personnage.

À retenir : ces nouveautés sont documentées par Google et Google DeepMind, mais elles ne doivent pas être confondues avec un test garanti dans chaque compte. Vérifiez l’interface, le modèle actif, la région et les crédits avant de construire un workflow de production.

Démonstration officielle Gemini Omni 1.1 Flash consacrée à l’extension d’une scène.
Extension d’une scène par une intention de caméra.
Démonstration officielle Gemini Omni 1.1 Flash utilisant une vidéo comme référence multimodale.
Démonstration officielle Gemini Omni 1.1 Flash sur le contrôle des première et dernière images.

ce qui est disponible, documenté et réellement testé

La fiche actuelle du modèle Gemini Omni Flash identifie gemini-omni-1.1-flash comme version stable. Elle documente des entrées texte, image et vidéo, une vidéo d’entrée jusqu’à 10 secondes pour l’édition et l’extension, des sorties de 3 à 10 secondes et des résolutions allant de 360p à 4K. Les notes de version Google datées du 27 août 2026 signalent le passage en disponibilité générale de cette version et l’arrivée de l’extension, de l’interpolation première/dernière image et du contrôle de résolution.

GMI Cloud : usage d’Omni Flash pour des contenus éducatifs et explicatifs.
Exemple officiel d’édition conversationnelle Gemini Omni : rendre le violon invisible tout en conservant la scène.
Exemple officiel d’édition conversationnelle Gemini Omni : modifier l’angle de caméra après une première retouche.
Séquence officielle Google Gemini Omni montrant une transformation visuelle autour d’une main et d’orbes.

La documentation de génération et d’édition décrit l’Interactions API et le suivi d’une conversation vidéo avec previous_interaction_id. La page produit Gemini Omni de Google DeepMind présente aussi l’édition en langage naturel, les références image, texte, vidéo et audio, la connaissance du monde et la compréhension intuitive de la physique. Ces formulations restent des affirmations du fournisseur : elles indiquent ce que le système est conçu pour faire, pas une garantie sur chaque plan.

StatutCe que l’on peut direCe qu’il faut éviter d’en déduire
Disponiblegemini-omni-1.1-flash est la version stable exposée par la fiche API vérifiée le 28 août 2026.Que chaque interface ou région expose exactement les mêmes contrôles.
DocumentéL’édition conversationnelle, le cadrage, les mouvements de caméra, le texte, l’audio, les références et l’interpolation sont décrits par Google.Qu’une formulation produira toujours le mouvement ou le texte voulu.
Annoncé dans FlowLe post officiel Flow by Google du 27 août 2026 annonce Omni 1.1 Flash dans Flow et les images de fin sur desktop.Que cette fonction est identique dans l’API, le web et toutes les régions.
Testé pour cet articleLes dix URL MP4 ci-dessous ont répondu avec le type video/mp4 lors d’une vérification HTTP partielle.Que j’ai exécuté Gemini Omni ou validé la qualité créative des vidéos.
RecommandéCommencer par un plan court et une seule intention, puis retoucher localement.Qu’il existe un prompt universel ou un nombre optimal d’itérations.

Une note de mise en scène plutôt qu’un prompt décoratif

Un prompt vidéo classique empile souvent un sujet, une esthétique et quelques adjectifs. Une note de mise en scène commence par la fonction du plan. Elle répond à une question simple : qu’est-ce que le spectateur doit comprendre, sentir ou remarquer pendant ces quelques secondes ?

Les six décisions à prendre

DécisionQuestion de réalisationTrace à conserver
FonctionPourquoi ce plan existe-t-il dans la séquence ?Une phrase d’intention.
InvariantsQu’est-ce qui ne doit pas changer ?Sujet, identité, décor, produit, lumière ou son.
ÉvénementQuel geste ou changement doit réellement se produire ?Un déclencheur et une action observable.
RegardOù est la caméra et comment se déplace-t-elle ?Cadrage, point de vue, mouvement ou caméra fixe.
MatièreQuelle lumière, quelle texture et quel son rendent le plan crédible ?Trois ou quatre indications sensorielles, pas un catalogue.
CorrectionQuel est le seul défaut à corriger à l’itération suivante ?Une phrase de retouche localisée.

Cette grille change la manière d’écrire. « Une femme dans une pièce futuriste » décrit un sujet. « Le plan doit faire sentir l’isolement avant la révélation, avec une caméra fixe qui laisse le silence travailler » donne une intention. Le modèle complète ensuite les détails à partir de cette direction, conformément au conseil de Google DeepMind de préciser l’effet recherché sans surdécrire chaque élément.

Exemple de note

Fonction : installer une attente calme avant l’apparition du produit.

Invariants : visage, costume, table et lumière latérale restent identiques.

Événement : une vibration sonore attire le regard vers le bord du cadre.

Regard : plan rapproché fixe, puis léger push-in au moment du regard.

Matière : poussière visible dans un rayon de lumière, son sourd et court.

Correction suivante : si le produit apparaît trop tôt, retarder sa révélation sans modifier le reste.

Cette note est plus utile qu’une longue collection d’adjectifs. Elle fournit une intention, des éléments protégés, un événement et une prochaine décision de contrôle.


La méthode en quatre passes

1. Écrire la note avant la phrase anglaise

Commencez dans votre langue de travail. Écrivez la fonction du plan, les invariants et le moment important. Ne cherchez pas encore à imiter un prompt cinématographique. La note doit pouvoir être relue par un directeur artistique, un monteur ou un client.

2. Réduire la note à un plan observable

Un plan court ne peut pas démontrer cinq transformations importantes sans risque de confusion. Choisissez une action principale et un mouvement de caméra. Si vous avez besoin d’un récit en plusieurs temps, indiquez explicitement une séquence ou utilisez plusieurs plans. Pour un seul plan, le guide officiel recommande des formulations comme one continuous shot, one unbroken scene ou no scene cuts.

3. Générer une première version avec des garde-fous

Décrivez le sujet, le lieu, le cadrage, l’action, la lumière et le son. Ajoutez les éléments à conserver. Les négations simples comme No dialogue ou No extra sound effects sont documentées dans le guide API, mais elles ne remplacent pas une description positive du résultat attendu.

4. Corriger par delta

Quand le plan est proche, ne réécrivez pas toute la scène. Demandez une seule modification : angle de caméra, timing d’une action, lumière, texte ou objet. La documentation officielle indique que Gemini Omni peut être affiné par conversation et recommande de préserver le reste avec Keep everything else the same. Cette logique transforme la génération en conversation de mise au point.

ListingWalkIn : guider la caméra dans plusieurs pièces sans ajouter de détails absents.

Bibliothèque de prompts : des cartes de décision, pas 100 recettes

Le guide Google Flow de CreativeAI.fr déjà publié propose 100 prompts classés par production. Pour ne pas le reproduire, cette bibliothèque contient trente cartes courtes. Chacune correspond à une décision de mise en scène et conserve un journal de variables : ce que l’on change, ce que l’on protège et ce que l’on doit relire. Les formulations utilisent uniquement les contrôles décrits dans la documentation Google. Elles sont en anglais parce que l’anglais est pleinement supporté dans la documentation API, tandis que les autres langues n’y sont pas évaluées de la même manière.

Figma Weave : attacher des références et faire évoluer plusieurs versions sur un canvas.

Prompt : transformer une note en plan unique

Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo, Interactions API ou Google Flow lorsque le modèle est exposé Objectif : obtenir un premier plan lisible à partir d’une intention de réalisation

Create one unbroken scene for this intention: [FUNCTION OF THE SHOT].
Subject: [SUBJECT].
Action: [ONE OBSERVABLE ACTION].
Location: [LOCATION].
Framing and point of view: [FRAMING AND POV].
Camera: [STATIC OR ONE CAMERA MOVEMENT].
Lighting: [LIGHT SOURCE AND EFFECT].
Sound design: [SOUND OR NO DIALOGUE].
Keep these elements unchanged: [INVARIANTS].
No scene cuts.

Variables à adapter : [FUNCTION OF THE SHOT], [SUBJECT], [ONE OBSERVABLE ACTION], [LOCATION], [FRAMING AND POV], [STATIC OR ONE CAMERA MOVEMENT], [LIGHT SOURCE AND EFFECT], [SOUND OR NO DIALOGUE], [INVARIANTS] Pourquoi cette structure : elle part de la fonction du plan, puis ordonne les éléments que le guide officiel relie au cadrage, au mouvement, au lieu, à la lumière et à l’action. No scene cuts répond au besoin documenté de demander une scène continue. Limites : une scène continue n’empêche pas tous les artefacts ni toutes les variations de rythme. La durée, le ratio et la résolution dépendent de l’interface et des contrôles effectivement exposés.

Prompt : protéger les invariants du plan

Modèle et mode vérifiés : gemini-omni-1.1-flash, édition vidéo conversationnelle, Interactions API ou Flow Objectif : rappeler au modèle ce qui doit rester stable pendant une modification

Edit this video only where specified.
Keep these elements exactly the same: [IDENTITY OR PRODUCT], [LOCATION], [LIGHTING], [CAMERA], [AUDIO].
Change only [ONE ELEMENT TO CHANGE] by [DESIRED CHANGE].
Keep everything else the same.

Variables à adapter : [IDENTITY OR PRODUCT], [LOCATION], [LIGHTING], [CAMERA], [AUDIO], [ONE ELEMENT TO CHANGE], [DESIRED CHANGE] Pourquoi cette structure : les modifications sont séparées en invariants et delta unique. La documentation API indique que les éditions simples et Keep everything else the same aident à préserver la cohérence. Limites : le modèle peut modifier des éléments non cités. Il faut comparer le plan avant et après, notamment le visage, le produit, le décor et la bande sonore.

Prompt : déplacer le regard de la caméra

Modèle et mode vérifiés : gemini-omni-1.1-flash, édition vidéo en langage naturel Objectif : corriger le point de vue sans réécrire la scène

Change only the camera angle to [NEW ANGLE] and use [NEW CAMERA MOVEMENT].
Keep the subject, action, timing, location, lighting, sound and text exactly the same.
Keep everything else the same.

Variables à adapter : [NEW ANGLE], [NEW CAMERA MOVEMENT] Pourquoi cette structure : le guide officiel documente le changement d’angle, de point de vue et de mouvement par conversation. La phrase protège les autres couches de la note. Limites : les termes de caméra sont des consignes en langage naturel, pas des contrôles mécaniques garantis. Relire les raccords, le mouvement du sujet et la stabilité des lignes du décor.

Prompt : déclencher une action à un moment précis

Modèle et mode vérifiés : gemini-omni-1.1-flash, édition vidéo conversationnelle Objectif : ajouter un événement sans reconstruire le plan

Keep everything else the same.
At the moment when [TRIGGER], [NEW ACTION].
Preserve [IDENTITY, CAMERA, LOCATION, LIGHTING AND SOUND].

Variables à adapter : [TRIGGER], [NEW ACTION], [IDENTITY, CAMERA, LOCATION, LIGHTING AND SOUND] Pourquoi cette structure : la documentation DeepMind montre des modifications d’action localisées et explique qu’une action complexe peut être décrite comme une intention appliquée à la vidéo. Limites : un déclencheur temporel en langage naturel n’est pas une timeline image par image. Si le moment est critique, vérifier le raccord et demander une retouche plus simple.

Prompt : faire entrer le son et le texte dans la mise en scène

Modèle et mode vérifiés : gemini-omni-1.1-flash, génération texte vers vidéo ou édition avec entrées multimodales selon l’interface Objectif : utiliser le son et le texte comme événements narratifs, pas comme décoration ajoutée après coup

Create one continuous scene about [SUBJECT AND ACTION].
At [VISUAL EVENT], display the text “[ON-SCREEN TEXT]” at [PLACEMENT] with [ANIMATION OR EXPOSURE].
Synchronize [SOUND OR MUSIC EVENT] with [VISUAL EVENT].
Keep the text readable and keep [INVARIANTS] unchanged.
No dialogue.

Variables à adapter : [SUBJECT AND ACTION], [VISUAL EVENT], [ON-SCREEN TEXT], [PLACEMENT], [ANIMATION OR EXPOSURE], [SOUND OR MUSIC EVENT], [INVARIANTS] Pourquoi cette structure : Google documente le texte synchronisé avec l’action, son placement et son animation, ainsi que la synchronisation d’une action avec une entrée audio. Limites : la lisibilité, la prononciation, le mixage et la justesse d’une information doivent être contrôlés humainement. Ne pas utiliser ce prompt pour valider un fait scientifique ou juridique.

Prompt : guider une transition avec deux images

Modèle et mode vérifiés : gemini-omni-1.1-flash, image vers vidéo avec interpolation première et dernière image, Gemini API ou interface exposant cette fonction Objectif : diriger le début et la fin d’une transformation

Use <FIRST_FRAME> as the starting image and <LAST_FRAME> as the ending image.
Create a smooth transition from the first frame to the last frame.
Preserve the identity of [SUBJECT] and make the camera movement [CAMERA INTENTION].
The transition should express [NARRATIVE CHANGE].

Variables à adapter : <FIRST_FRAME>, <LAST_FRAME>, [SUBJECT], [CAMERA INTENTION], [NARRATIVE CHANGE] Pourquoi cette structure : la documentation API décrit l’interpolation entre deux images, et le post Google Flow annonce les images de fin sur desktop. Le prompt distingue les deux images du mouvement narratif. Limites : la présence du contrôle dans Flow dépend de l’interface et de son déploiement. Deux images ne garantissent pas une continuité parfaite entre les poses, les matières ou le décor.

Prompt : prolonger un plan avec un raccord contrôlé

Modèle et mode vérifiés : gemini-omni-1.1-flash, extension vidéo, Interactions API ou interface qui expose la fonction Objectif : poursuivre une scène en gardant son mouvement et son ambiance

Extend this video.
Continue the scene with [NEXT ACTION] while preserving [CHARACTER, LOCATION, CAMERA, LIGHTING AND SOUND].
The continuation should feel like the next beat of the same shot.
If the scene changes, make the cut intentional and clear.

Variables à adapter : [NEXT ACTION], [CHARACTER, LOCATION, CAMERA, LIGHTING AND SOUND] Pourquoi cette structure : la documentation Google décrit l’extension par prompt et recommande de préciser si la scène continue ou si un nouveau plan commence, avec les éléments à préserver. Limites : l’extension utilise le contexte de la fin du plan et peut modifier quelques images de raccord. Contrôler le dernier mouvement, l’audio et la continuité des personnages.

Prompt : transférer un mouvement vers un personnage de référence

Modèle et mode vérifiés : gemini-omni-1.1-flash, références vidéo et image, génération ou édition multimodale selon l’interface Objectif : conserver un mouvement observé tout en remplaçant le sujet par un personnage ou un produit de référence

Use <MOTION_VIDEO> for the pose and motion.
Use <CHARACTER_IMAGE> for the subject identity.
Apply the visual style from <STYLE_IMAGE>.
Place the subject in [LOCATION] and keep the camera intention [CAMERA INTENTION].

Variables à adapter : <MOTION_VIDEO>, <CHARACTER_IMAGE>, <STYLE_IMAGE>, [LOCATION], [CAMERA INTENTION] Pourquoi cette structure : le guide officiel montre comment combiner une vidéo de mouvement, une image de personnage et une référence de style. Chaque entrée reçoit un rôle lisible, ce qui transforme un assemblage de médias en note de mise en scène. Limites : la référence de mouvement peut déformer l’identité ou les proportions du sujet. Contrôler les mains, le visage, les raccords et les droits sur chaque média.

Prompt : remplacer un objet sans perdre le mouvement

Modèle et mode vérifiés : gemini-omni-1.1-flash, édition vidéo conversationnelle Objectif : tester une variante de décor ou de produit sans refaire la chorégraphie

Change [ORIGINAL OBJECT] into [NEW OBJECT OR MATERIAL].
Keep the subject motion, camera, location, lighting and sound exactly the same.
Keep everything else the same.

Variables à adapter : [ORIGINAL OBJECT], [NEW OBJECT OR MATERIAL] Pourquoi cette structure : le guide officiel illustre des substitutions de sujet ou d’objet tout en demandant de conserver le reste. Le prompt réduit la retouche à un seul changement vérifiable. Limites : la matière, l’échelle ou les interactions physiques peuvent changer. Relire les ombres, les contacts et la logique du mouvement avant de retenir la variante.

Prompt : changer le décor sans réécrire le plan

Modèle et mode vérifiés : gemini-omni-1.1-flash, édition vidéo conversationnelle avec référence d’environnement Objectif : explorer un nouveau lieu en protégeant l’identité et l’action déjà validées

Transport [SUBJECT] to <NEW_ENVIRONMENT>.
Preserve the subject identity, action, timing, camera movement, lighting and sound.
Keep everything else the same.

Variables à adapter : [SUBJECT], <NEW_ENVIRONMENT> Pourquoi cette structure : la documentation officielle présente le changement de contexte et l’édition ciblée comme des opérations conversationnelles. Le décor devient le delta, tandis que les éléments de continuité sont explicitement rappelés. Limites : un nouveau lieu peut modifier les ombres, la perspective et les interactions avec le sujet. Vérifier que le changement reste compatible avec la note de réalisation.

Prompt : transformer un dessin en footage

Modèle et mode vérifiés : gemini-omni-1.1-flash, image ou dessin de référence vers vidéo Objectif : passer d’une intention graphique à un plan exploitable sans exposer le support de travail

Turn this drawing into realistic footage.
Use the drawing as a guide for composition and movement, but do not show the drawing in the final video.
Make [ACTION] clear and use [CAMERA INTENTION].
Keep the lighting [LIGHTING INTENTION] and the location [LOCATION].

Variables à adapter : [ACTION], [CAMERA INTENTION], [LIGHTING INTENTION], [LOCATION] Pourquoi cette structure : la page officielle montre le passage d’un dessin à une vidéo réaliste. Le rôle de la référence est limité à la composition et au mouvement pour éviter de confondre le storyboard avec le rendu final. Limites : « réaliste » est une direction artistique, pas une garantie de précision documentaire. Contrôler les proportions, les détails et la cohérence avec le dessin source.

Prompt : combiner vidéo, image et audio

Modèle et mode vérifiés : gemini-omni-1.1-flash, génération multimodale avec références vidéo, image et audio si l’interface les accepte Objectif : répartir clairement les rôles entre plusieurs médias de référence

Use <MOTION_VIDEO> for the motion and camera context.
Use <CHARACTER_IMAGE> for the subject identity.
Use <AUDIO_REFERENCE> for the rhythm and the main audio event.
Create one continuous scene in [ENVIRONMENT].
Preserve [INVARIANTS] and make the visual action follow the audio event.

Variables à adapter : <MOTION_VIDEO>, <CHARACTER_IMAGE>, <AUDIO_REFERENCE>, [ENVIRONMENT], [INVARIANTS] Pourquoi cette structure : Google présente Gemini Omni comme capable de combiner plusieurs types de médias et montre l’attribution d’un rôle à chaque référence. La carte sert à écrire une intention de montage avant la génération. Limites : l’interface peut limiter les types ou le nombre d’entrées. Le rythme audio n’est pas une timeline de montage : contrôler les synchronisations et les droits sur les voix ou musiques.

Prompt : appliquer une progression de styles

Modèle et mode vérifiés : gemini-omni-1.1-flash, édition vidéo avec changement de style Objectif : transformer une même action en trajectoire visuelle lisible

Apply these visual styles in order to the same continuous action:
1. [STYLE 1]
2. [STYLE 2]
3. [STYLE 3]
Keep the subject motion, camera path and scene timing continuous.
Make each transition visible and intentional.

Variables à adapter : [STYLE 1], [STYLE 2], [STYLE 3] Pourquoi cette structure : le guide officiel documente l’application de nouveaux styles en conservant le mouvement et les détails, ainsi que des progressions en plusieurs étapes. L’ordre devient ici le principe narratif du plan. Limites : les transitions peuvent être inégales ou modifier les détails protégés. Comparer chaque étape et réduire la progression si elle brouille l’action.

Prompt : construire un storyboard lisible

Modèle et mode vérifiés : gemini-omni-1.1-flash, storyboard ou image de référence vers vidéo Objectif : convertir des vignettes de préparation en beats de réalisation contrôlables

Follow the supplied storyboard in reading order.
Reproduce these beats: [BEAT 1], [BEAT 2], [BEAT 3].
Keep the character identity and visual language consistent.
Use one continuous scene only if the storyboard represents one shot; otherwise preserve clear shot changes.

Variables à adapter : [BEAT 1], [BEAT 2], [BEAT 3] Pourquoi cette structure : la documentation officielle décrit la création d’un storyboard à partir d’une référence visuelle. La carte oblige à décider si les vignettes forment un plan unique ou une suite de plans. Limites : le modèle peut réordonner, fusionner ou ignorer des vignettes. Relire l’ordre, la durée relative et les raccords avant d’utiliser le résultat comme référence de production.

Prompt : visualiser un concept scientifique sans inventer les faits

Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo ou génération avec schéma de référence Objectif : produire une métaphore visuelle structurée pour expliquer une idée complexe

Create a visual explainer of [CONCEPT] in [VISUAL STYLE].
Show these steps in order: [STEP 1], [STEP 2], [STEP 3].
Use clear visual metaphors and no on-screen text unless specified.
Treat the supplied facts as the source of truth and leave uncertain details out.

Variables à adapter : [CONCEPT], [VISUAL STYLE], [STEP 1], [STEP 2], [STEP 3] Pourquoi cette structure : le guide officiel propose d’utiliser les connaissances du monde et la compréhension de concepts pour construire des explications visuelles. Le prompt sépare la métaphore de la liste de faits à vérifier. Limites : une image convaincante ne valide pas une explication scientifique. Faire relire les faits par une source compétente et éviter de demander au modèle de trancher une incertitude.

Prompt : rendre une action complexe lisible

Modèle et mode vérifiés : gemini-omni-1.1-flash, édition vidéo avec action ou effet ajouté Objectif : isoler une relation de cause à effet dans une scène déjà cadrée

Edit this video while keeping the subject, location, camera and lighting unchanged.
Add [COMPLEX ACTION OR EFFECT] as one clear cause-and-effect event.
Make the cause happen before the effect.
Keep everything else the same.

Variables à adapter : [COMPLEX ACTION OR EFFECT] Pourquoi cette structure : le guide officiel propose des exemples d’actions complexes et d’effets de mouvement. La carte les ramène à un événement unique, avec une causalité explicitement relue. Limites : une consigne causale ne garantit pas une simulation physique exacte. Contrôler la chronologie, les collisions, les déformations et la lisibilité du point d’attention.

Prompt : composer une grammaire de caméra pour un même plan

Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo ou édition vidéo en langage naturel Objectif : choisir un cadrage et un seul mouvement de caméra avant de détailler le reste

Shoot [SUBJECT] as [SHOT SIZE] from [POINT OF VIEW].
Use [CAMERA TERM] as the only camera movement.
Keep [ACTION], [LOCATION], [LIGHTING] and [SOUND] unchanged.
One continuous shot. No scene cuts.

Variables à adapter : [SUBJECT], [SHOT SIZE], [POINT OF VIEW], [CAMERA TERM], [ACTION], [LOCATION], [LIGHTING], [SOUND] Pourquoi cette structure : le guide officiel sépare cadrage, point de vue et mouvement. Cette carte impose un seul mouvement. Limites : CAMERA TERM reste une consigne en langage naturel. Vérifier le mouvement et les raccords du sujet.

Prompt : passer derrière l’épaule du sujet

Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo ou édition vidéo Objectif : diriger le regard vers une relation entre un sujet et ce qu’il observe

Frame the scene over the shoulder of [SUBJECT].
Begin with [START FRAMING], then use [CAMERA MOVEMENT] toward [FOCUS].
Keep the subject identity, action, location, lighting and sound unchanged.

Variables à adapter : [SUBJECT], [START FRAMING], [CAMERA MOVEMENT], [FOCUS] Pourquoi cette structure : Google documente over the shoulder et sépare le mouvement de l’action. Limites : Ce point de vue peut modifier la visibilité du visage ou du sujet observé. Contrôler proportions, occlusion et regard.

Prompt : choisir une intention de captation

Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo Objectif : faire varier le langage visuel d’une captation sans changer la scène

Capture this scene as [SMARTPHONE, FILM OR WEBCAM] footage.
Keep [SUBJECT], [ACTION] and [LOCATION] unchanged.
Use [CAMERA BEHAVIOR] and [LIGHTING INTENTION].
Do not add a different visual style.

Variables à adapter : [SMARTPHONE, FILM OR WEBCAM], [SUBJECT], [ACTION], [LOCATION], [CAMERA BEHAVIOR], [LIGHTING INTENTION] Pourquoi cette structure : Google cite smartphone, film et webcam. La scène reste fixe pour isoler la captation. Limites : Ces mots ne reproduisent pas mécaniquement un capteur, une optique ou une compression. Comparer l’intention visuelle.

Prompt : verrouiller un plan pendant une action

Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo Objectif : laisser l’action porter le plan sans mouvement de caméra concurrent

Use a static, locked-off camera.
Show [SUBJECT] performing [ACTION] in [LOCATION].
Keep the framing fixed while [TRIGGER] occurs.
No camera movement and no scene cuts.

Variables à adapter : [SUBJECT], [ACTION], [LOCATION], [TRIGGER] Pourquoi cette structure : static et locked off font partie du vocabulaire de caméra documenté par Google. Limites : Une caméra fixe ne stabilise pas automatiquement sujet, décor ou lignes verticales. Relire les déformations.

Prompt : révéler un détail par push-in

Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo ou édition vidéo Objectif : organiser une révélation par le déplacement du regard, pas par un changement de scène

Start with [START FRAMING].
Use a slow push in toward [DETAIL].
At [TRIGGER], reveal [REVELATION].
Keep the subject, location, lighting and sound unchanged.

Variables à adapter : [START FRAMING], [DETAIL], [TRIGGER], [REVELATION] Pourquoi cette structure : Google cite push in, punch in et dolly zoom. Ici, le push-in accompagne une révélation. Limites : Le timing naturel n’est pas une timeline image par image. Vérifier vitesse et moment de révélation.

Prompt : garder un personnage identifiable entre plusieurs références

Modèle et mode vérifiés : gemini-omni-1.1-flash, génération ou édition avec image et vidéo de référence Objectif : préserver une identité visuelle pendant qu’une action ou un décor évolue

Use <CHARACTER_REFERENCE> to preserve the subject identity across the scene.
Show [ACTION] in [LOCATION].
Keep the face, clothing, proportions and key colors consistent.
Change only [ONE PLANNED ELEMENT].

Variables à adapter : <CHARACTER_REFERENCE>, [ACTION], [LOCATION], [ONE PLANNED ELEMENT] Pourquoi cette structure : Google utilise des références pour maintenir un sujet et ses détails. Le delta reste isolé. Limites : Une référence n’assure pas une identité parfaite. Vérifier visage, mains, vêtements et objets tenus.

Prompt : appliquer un style sans déplacer le mouvement

Modèle et mode vérifiés : gemini-omni-1.1-flash, édition vidéo avec image de style ou instruction de style Objectif : modifier la surface visuelle d’un plan déjà lisible

Apply the visual style from <STYLE_REFERENCE> to this video.
Keep the original subject motion, timing, camera path and scene details.
Change only [STYLE ELEMENTS].

Variables à adapter : <STYLE_REFERENCE>, [STYLE ELEMENTS] Pourquoi cette structure : le guide officiel applique un style en conservant mouvement et détails. Limites : Le style peut contaminer textures, visage ou décor. Comparer avant et après.

Prompt : utiliser une image comme décor de continuité

Modèle et mode vérifiés : gemini-omni-1.1-flash, image de référence vers vidéo ou édition vidéo Objectif : imposer un environnement visuel sans réécrire l’action du sujet

Use <ENVIRONMENT_IMAGE> as the visual environment.
Place [SUBJECT] performing [ACTION] in that environment.
Preserve the subject identity and camera intention [CAMERA INTENTION].
Keep the environment layout and lighting cues consistent.

Variables à adapter : <ENVIRONMENT_IMAGE>, [SUBJECT], [ACTION], [CAMERA INTENTION] Pourquoi cette structure : les exemples officiels utilisent des références de contexte. L’image reçoit ici le rôle de décor. Limites : Perspective et ombres peuvent être réinterprétées. Contrôler échelle, profondeur et sources lumineuses.

Prompt : animer une image de produit

Modèle et mode vérifiés : gemini-omni-1.1-flash, image vers vidéo Objectif : passer d’un visuel produit à un plan court sans multiplier les références

Animate the product from <PRODUCT_IMAGE> in one continuous shot.
Show [ONE PRODUCT ACTION] with [CAMERA INTENTION].
Keep the product shape, logo placement and key colors consistent.
Use [LIGHTING] and [SOUND].

Variables à adapter : <PRODUCT_IMAGE>, [ONE PRODUCT ACTION], [CAMERA INTENTION], [LIGHTING], [SOUND] Pourquoi cette structure : Google recommande de décrire action, cadrage, lumière et son autour d’une référence image. Limites : Relire logos, textes et arêtes image par image. Ce prompt ne valide ni marque ni conformité.

Prompt : synchroniser une variation de lumière avec la musique

Modèle et mode vérifiés : gemini-omni-1.1-flash, génération multimodale avec audio ou instruction musicale selon l’interface Objectif : faire de la lumière un événement temporel lié au son

Create one continuous scene of [SUBJECT AND ACTION].
Sync the lighting change [LIGHT CUE] with [MUSIC EVENT].
Keep the subject motion, camera, location and sound timing coherent.
No scene cuts.

Variables à adapter : [SUBJECT AND ACTION], [LIGHT CUE], [MUSIC EVENT] Pourquoi cette structure : Google montre une lumière synchronisée avec la musique et relie l’action à un événement. Limites : Une indication musicale ne remplace ni piste de référence ni montage. Contrôler tempo, mixage et moment lumineux.

Prompt : raconter une action sans dialogue

Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo Objectif : vérifier qu’un plan est compréhensible par le mouvement et la composition seuls

Show [SUBJECT] communicating [INTENTION] through [VISIBLE ACTION] in [LOCATION].
Use [FRAMING] and [CAMERA MOVEMENT].
No dialogue and no narration.
Keep the action readable from beginning to end.

Variables à adapter : [SUBJECT], [INTENTION], [VISIBLE ACTION], [LOCATION], [FRAMING], [CAMERA MOVEMENT] Pourquoi cette structure : le guide API documente No dialogue. Cette carte teste la compréhension par l’image seule. Limites : L’intention peut rester ambiguë. Faire relire le plan par quelqu’un qui n’a pas vu la note.

Prompt : séparer une référence de caméra et une référence de décor

Modèle et mode vérifiés : gemini-omni-1.1-flash, génération multimodale avec vidéo et image de référence Objectif : attribuer un rôle différent à chaque média pour éviter un mélange de contraintes

Use <CAMERA_REFERENCE_VIDEO> only for the camera path and timing.
Use <SCENE_IMAGE> for the environment and composition.
Create [SUBJECT] performing [ACTION] in that environment.
Preserve [IDENTITY OR PRODUCT] and keep the visual language coherent.

Variables à adapter : <CAMERA_REFERENCE_VIDEO>, <SCENE_IMAGE>, [SUBJECT], [ACTION], [IDENTITY OR PRODUCT] Pourquoi cette structure : Google documente la combinaison de références image et vidéo. Chaque entrée reçoit un rôle. Limites : Le modèle peut transférer des détails non souhaités. Vérifier caméra, décor et identité séparément.

Prompt : prolonger une scène par incrément de dix secondes

Modèle et mode vérifiés : gemini-omni-1.1-flash, extension vidéo via l’Interactions API ou une interface qui expose cette fonction Objectif : planifier une extension courte et contrôlable au lieu de demander une longue suite d’un seul coup

Extend this video by one 10-second continuation.
Continue with [NEXT BEAT] while preserving [CHARACTER, LOCATION, CAMERA, LIGHTING AND SOUND].
End on [NEXT EDITABLE MOMENT].
Keep the continuation connected to the last frame.

Variables à adapter : [NEXT BEAT], [CHARACTER, LOCATION, CAMERA, LIGHTING AND SOUND], [NEXT EDITABLE MOMENT] Pourquoi cette structure : Google décrit des extensions par incréments de dix secondes et la continuité avec la fin. Limites : L’extension dépend de l’interface et de la limite du mode utilisé. Contrôler chaque raccord.

Prompt : visualiser un mouvement physique sans surpromesse

Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo ou édition vidéo Objectif : rendre une relation de force ou de mouvement lisible dans un plan pédagogique ou créatif

Show [OBJECT] responding to [FORCE OR CAUSE] in [LOCATION].
Make the sequence clear: first [CAUSE], then [MOTION], then [VISIBLE RESULT].
Use [CAMERA INTENTION] and [LIGHTING].
Keep the scene continuous and leave uncertain physical details out.

Variables à adapter : [OBJECT], [FORCE OR CAUSE], [LOCATION], [CAUSE], [MOTION], [VISIBLE RESULT], [CAMERA INTENTION], [LIGHTING] Pourquoi cette structure : Google présente la physique intuitive et des actions complexes. La carte impose une séquence causale. Limites : Une scène plausible n’est pas une simulation scientifique. Faire vérifier lois, mesures et hypothèses.


Relire un plan comme une équipe de réalisation

Après chaque génération, ne demandez pas seulement si le résultat est « beau ». Utilisez une grille de relecture courte :

  1. Intention : le plan produit-il l’effet annoncé dans la note ?
  2. Lisibilité : comprend-on le sujet, l’action et le point d’attention sans explication orale ?
  3. Caméra : le mouvement sert-il la scène ou attire-t-il l’attention sur lui-même ?
  4. Continuité : le visage, le produit, le décor, la lumière et le son restent-ils cohérents ?
  5. Texte et audio : le texte est-il lisible, le son synchronisé et l’information vérifiable ?
  6. Correction suivante : quel est l’unique défaut à modifier au prochain tour ?

Cette dernière question est la plus importante. Si vous corrigez simultanément le cadrage, la lumière, le texte et l’action, vous ne saurez pas ce qui a réellement amélioré le plan. Une conversation de mise au point doit laisser une trace des décisions, comme le ferait une équipe de réalisation entre deux prises.

Quelle formation prolonge ce travail ?

La formation Google Flow, Veo & Gemini Omni : L’Orchestration Cinématographique IA est le prolongement le plus direct de ce guide. Son programme relie le brief à une bible de production, les prompts de caméra aux plans, Gemini Omni Flash aux retouches conversationnelles, puis les plans au montage et aux exports. Ici, nous avons isolé l’écriture de la note et la correction par delta ; la formation élargit cette pratique à une séquence complète.

Méthodologie et limites

Les capacités, le modèle stable, les durées, les résolutions, l’Interactions API, l’extension et l’interpolation proviennent de la documentation Google vérifiée le 28 août 2026. Les conseils sur la note de mise en scène et la grille de relecture sont une transposition éditoriale de ces contrôles, pas une promesse de comportement automatique.

Comparaison de variantes en brouillon 360p.

Les trente prompts sont documentés, non exécutés. Je n’ai pas utilisé de clé API, de compte Flow ni de session de génération pour cet article. Les vidéos intégrées ont été vérifiées comme ressources MP4 externes accessibles au moment de la rédaction, mais leur contenu créatif n’est pas présenté comme un test reproductible.

Le modèle stable, Flow et l’API peuvent exposer des fonctions différentes. Les termes de caméra et les consignes de conservation sont des instructions en langage naturel. Ils doivent être relus sur le plan obtenu. La disponibilité régionale, les droits sur les références, l’usage de visages ou de voix, la conservation des fichiers et les conditions commerciales doivent être vérifiés dans l’interface et les conditions applicables au projet.

Google indique également que les contenus créés ou modifiés avec Omni dans Gemini, Flow ou YouTube incluent SynthID et C2PA Content Credentials. Ces signaux de provenance ne prouvent pas à eux seuls les droits, la véracité, la qualité ou l’acceptabilité juridique d’un contenu.


Sources et références

Fondateur de CreativeAI.fr · Expert IA & workflows créatifs · 20+ ans d’expérience en direction créative (Marcel, Leo Burnett). 600+ professionnels formés depuis 2023 aux usages, méthodes et workflows IA. 4,7/5 de satisfaction moyenne.

Résumer cet article :

Guides Pratiques & outils

brand brain IA

Brand Brain : transformer une stratégie de marque en système IA

Un Brand Brain IA est un référentiel de marque structuré pour être consulté, interprété et vérifié par des assistants IA. Il ne s’agit pas de copier un brand book dans une conversation ni d’empiler des prompts.

Accéder au guide

Gemini Omni & Google Flow

Google Flow & Gemini : construire un studio créatif IA complet

Workflow, Agent, Tools, crédits et 100 prompts pour produire, éditer et industrialiser des vidéos IA. MAJ

Accéder au guide

ChatGPT Images 2.5

ChatGPT Images 2.5 : du croquis au mini-kit de marque cohérent

On ne prompte plus, on spécifie. L’image devient une structure sémantique que le modèle compose, édite et révise. Le prompt cesse d’être une invocation, il devient une architecture.

Accéder au guide

Pourquoi votre équipe marketing n’a pas besoin de plus d’outils IA, mais d’un système éditorial

Votre équipe marketing n’a pas besoin de plus d’outils IA, mais d’un système éditorial

Le contenu ne manque pas toujours d’idées. Il manque souvent d’un système pour transformer ces idées en publications régulières, utiles et reconnaissables.

Accéder au guide

AI Slop 2026 : pourquoi vos contenus IA deviennent interchangeables

AI Slop : pourquoi vos contenus IA deviennent interchangeables

L’AI slop n’est pas seulement du mauvais contenu généré par intelligence artificielle. C’est le symptôme d’une création sans intention, sans vérification et sans direction humaine.

Accéder au guide

transformer une image en prompt

Promptoscope : transformer une image en prompt JSON

Promptoscope est une extension Chrome qui transforme une image de référence en recette visuelle structurée et en prompt JSON réutilisable.

Découvrir l’outil

formation IA

Google Flow, Veo & Gemini Omni : L’Orchestration Cinématographique IA

Durée : 2 jours (14h). Public : DA, réalisateurs, motion designers, équipes marketing, communication et social media

Réinventer son processus créatif avec l’IA générative

Durée : 5 jours (35h). Public : DA, graphistes, designers

Créer des visuels de marque avec ChatGPT Images et Codex NEW

Social Content Factory : produire et décliner ses contenus avec l’IA NEW

Durée : 2 jours (14h). Public : Responsables marketing et communication, Social media managers et content managers, Agences, studios et équipes éditoriales

IA agentique pour les créatifs : du brief à l’automatisation NEW

Durée : 1 jour (7h). Public : Responsables de production et dirigeants de structures créatives, équipes marketing, communication et contenu, agences et studios créatifs