
Gemini Omni Flash devient vraiment intéressant lorsqu’on cesse de lui demander une « belle vidéo » et qu’on lui donne une décision de mise en scène. Le modèle stable gemini-omni-1.1-flash accepte des consignes de génération et d’édition vidéo, tandis que Gemini DeepMind documente le cadrage, le mouvement, l’action, la lumière, le son, le texte et les références.
Ce guide propose une méthode de travail par plan : formuler l’intention, protéger les invariants, générer une première version, puis corriger un seul élément à la fois.
Ce qu’il faut retenir
- Une note de mise en scène décrit ce que le plan doit faire ressentir et montrer, pas seulement son sujet.
- Gemini Omni Flash répond aux consignes de cadrage, de mouvement, d’action, de lumière et de lieu documentées par Google.
- Pour une retouche, une instruction courte et locale, suivie de
Keep everything else the same, protège mieux la continuité qu’un nouveau prompt complet. - Les images de début et de fin, les références vidéo et l’édition conversationnelle sont des leviers différents : ne les mélangez pas dans la même demande sans raison.
- Les prompts de ce guide sont documentés, non exécutés. Les dix vidéos intégrées sont des MP4 externes associés à des publications officielles Google, pas des tests réalisés pour cet article.
Ce guide ne refait pas le guide Google Flow
Le guide CreativeAI.fr Google Flow & Gemini Omni : construire un studio créatif IA complet couvre déjà l’architecture du mini-studio : brief, bible visuelle, Agent, personnages, Scene Builder, crédits, provenance et 100 prompts.
Le sujet est différent ici. Il ne s’agit pas de décrire tout l’écosystème Flow, ni d’ajouter une nouvelle liste de recettes. Le point de départ est plus étroit : comment transformer une intention de réalisation en note de mise en scène exploitable par Gemini Omni Flash, puis comment retoucher le plan sans détruire ce qui fonctionnait déjà.
Cette distinction évite une cannibalisation d’intention. Le premier guide répond à « comment organiser une production vidéo IA complète avec Flow ? ». Celui-ci répond à « comment diriger un plan Gemini Omni avec une consigne qui ressemble à une décision de plateau ? ».
les nouveautés annoncées
Actualisation vérifiée le 28 août 2026. Gemini Omni 1.1 Flash entre dans une phase plus intéressante pour la réalisation vidéo : le modèle ne se contente plus de générer un plan, il permet de le reprendre, de le guider par références et de préciser la transition attendue.
- Version stable :
gemini-omni-1.1-flash, à distinguer de la version preview. - Entrées et sorties : texte, image et vidéo en entrée, avec des sorties vidéo documentées de 3 à 10 secondes, en 24 FPS, de 360p à 4K.
- Édition conversationnelle : une correction locale peut préserver les éléments qui fonctionnent déjà, au lieu de relancer toute la scène.
- Contrôle des transitions : les première et dernière images peuvent encadrer une interpolation, tandis que l’extension est documentée séparément selon l’interface et le mode utilisé.
- Annonce Flow : le post officiel fourni pour cette mise à jour annonce l’intégration de Omni 1.1 Flash dans Flow et l’arrivée des images de fin sur ordinateur.
- Extension : prolonger une vidéo par incréments de dix secondes, avec jusqu’à dix secondes de contexte antérieur analysé et une longueur cumulative annoncée de quarante secondes.
- Prévisualisation : Google annonce jusqu’à 60 % de gain de vitesse et un coût égal au tiers de la sortie 720p standard en 360p ; il s’agit d’une indication fournisseur, à vérifier dans l’interface et le compte utilisés.
- Références vidéo : fournir jusqu’à trois secondes de vidéo de référence pour transmettre un mouvement ou une continuité de personnage.
À retenir : ces nouveautés sont documentées par Google et Google DeepMind, mais elles ne doivent pas être confondues avec un test garanti dans chaque compte. Vérifiez l’interface, le modèle actif, la région et les crédits avant de construire un workflow de production.
ce qui est disponible, documenté et réellement testé
La fiche actuelle du modèle Gemini Omni Flash identifie gemini-omni-1.1-flash comme version stable. Elle documente des entrées texte, image et vidéo, une vidéo d’entrée jusqu’à 10 secondes pour l’édition et l’extension, des sorties de 3 à 10 secondes et des résolutions allant de 360p à 4K. Les notes de version Google datées du 27 août 2026 signalent le passage en disponibilité générale de cette version et l’arrivée de l’extension, de l’interpolation première/dernière image et du contrôle de résolution.
La documentation de génération et d’édition décrit l’Interactions API et le suivi d’une conversation vidéo avec previous_interaction_id. La page produit Gemini Omni de Google DeepMind présente aussi l’édition en langage naturel, les références image, texte, vidéo et audio, la connaissance du monde et la compréhension intuitive de la physique. Ces formulations restent des affirmations du fournisseur : elles indiquent ce que le système est conçu pour faire, pas une garantie sur chaque plan.
| Statut | Ce que l’on peut dire | Ce qu’il faut éviter d’en déduire |
|---|---|---|
| Disponible | gemini-omni-1.1-flash est la version stable exposée par la fiche API vérifiée le 28 août 2026. | Que chaque interface ou région expose exactement les mêmes contrôles. |
| Documenté | L’édition conversationnelle, le cadrage, les mouvements de caméra, le texte, l’audio, les références et l’interpolation sont décrits par Google. | Qu’une formulation produira toujours le mouvement ou le texte voulu. |
| Annoncé dans Flow | Le post officiel Flow by Google du 27 août 2026 annonce Omni 1.1 Flash dans Flow et les images de fin sur desktop. | Que cette fonction est identique dans l’API, le web et toutes les régions. |
| Testé pour cet article | Les dix URL MP4 ci-dessous ont répondu avec le type video/mp4 lors d’une vérification HTTP partielle. | Que j’ai exécuté Gemini Omni ou validé la qualité créative des vidéos. |
| Recommandé | Commencer par un plan court et une seule intention, puis retoucher localement. | Qu’il existe un prompt universel ou un nombre optimal d’itérations. |
Une note de mise en scène plutôt qu’un prompt décoratif
Un prompt vidéo classique empile souvent un sujet, une esthétique et quelques adjectifs. Une note de mise en scène commence par la fonction du plan. Elle répond à une question simple : qu’est-ce que le spectateur doit comprendre, sentir ou remarquer pendant ces quelques secondes ?
Les six décisions à prendre
| Décision | Question de réalisation | Trace à conserver |
|---|---|---|
| Fonction | Pourquoi ce plan existe-t-il dans la séquence ? | Une phrase d’intention. |
| Invariants | Qu’est-ce qui ne doit pas changer ? | Sujet, identité, décor, produit, lumière ou son. |
| Événement | Quel geste ou changement doit réellement se produire ? | Un déclencheur et une action observable. |
| Regard | Où est la caméra et comment se déplace-t-elle ? | Cadrage, point de vue, mouvement ou caméra fixe. |
| Matière | Quelle lumière, quelle texture et quel son rendent le plan crédible ? | Trois ou quatre indications sensorielles, pas un catalogue. |
| Correction | Quel est le seul défaut à corriger à l’itération suivante ? | Une phrase de retouche localisée. |
Cette grille change la manière d’écrire. « Une femme dans une pièce futuriste » décrit un sujet. « Le plan doit faire sentir l’isolement avant la révélation, avec une caméra fixe qui laisse le silence travailler » donne une intention. Le modèle complète ensuite les détails à partir de cette direction, conformément au conseil de Google DeepMind de préciser l’effet recherché sans surdécrire chaque élément.
Exemple de note
Fonction : installer une attente calme avant l’apparition du produit.
Invariants : visage, costume, table et lumière latérale restent identiques.
Événement : une vibration sonore attire le regard vers le bord du cadre.
Regard : plan rapproché fixe, puis léger push-in au moment du regard.
Matière : poussière visible dans un rayon de lumière, son sourd et court.
Correction suivante : si le produit apparaît trop tôt, retarder sa révélation sans modifier le reste.
Cette note est plus utile qu’une longue collection d’adjectifs. Elle fournit une intention, des éléments protégés, un événement et une prochaine décision de contrôle.
La méthode en quatre passes
1. Écrire la note avant la phrase anglaise
Commencez dans votre langue de travail. Écrivez la fonction du plan, les invariants et le moment important. Ne cherchez pas encore à imiter un prompt cinématographique. La note doit pouvoir être relue par un directeur artistique, un monteur ou un client.
2. Réduire la note à un plan observable
Un plan court ne peut pas démontrer cinq transformations importantes sans risque de confusion. Choisissez une action principale et un mouvement de caméra. Si vous avez besoin d’un récit en plusieurs temps, indiquez explicitement une séquence ou utilisez plusieurs plans. Pour un seul plan, le guide officiel recommande des formulations comme one continuous shot, one unbroken scene ou no scene cuts.
3. Générer une première version avec des garde-fous
Décrivez le sujet, le lieu, le cadrage, l’action, la lumière et le son. Ajoutez les éléments à conserver. Les négations simples comme No dialogue ou No extra sound effects sont documentées dans le guide API, mais elles ne remplacent pas une description positive du résultat attendu.
4. Corriger par delta
Quand le plan est proche, ne réécrivez pas toute la scène. Demandez une seule modification : angle de caméra, timing d’une action, lumière, texte ou objet. La documentation officielle indique que Gemini Omni peut être affiné par conversation et recommande de préserver le reste avec Keep everything else the same. Cette logique transforme la génération en conversation de mise au point.
Bibliothèque de prompts : des cartes de décision, pas 100 recettes
Le guide Google Flow de CreativeAI.fr déjà publié propose 100 prompts classés par production. Pour ne pas le reproduire, cette bibliothèque contient trente cartes courtes. Chacune correspond à une décision de mise en scène et conserve un journal de variables : ce que l’on change, ce que l’on protège et ce que l’on doit relire. Les formulations utilisent uniquement les contrôles décrits dans la documentation Google. Elles sont en anglais parce que l’anglais est pleinement supporté dans la documentation API, tandis que les autres langues n’y sont pas évaluées de la même manière.
Prompt : transformer une note en plan unique
Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo, Interactions API ou Google Flow lorsque le modèle est exposé Objectif : obtenir un premier plan lisible à partir d’une intention de réalisation
Create one unbroken scene for this intention: [FUNCTION OF THE SHOT].
Subject: [SUBJECT].
Action: [ONE OBSERVABLE ACTION].
Location: [LOCATION].
Framing and point of view: [FRAMING AND POV].
Camera: [STATIC OR ONE CAMERA MOVEMENT].
Lighting: [LIGHT SOURCE AND EFFECT].
Sound design: [SOUND OR NO DIALOGUE].
Keep these elements unchanged: [INVARIANTS].
No scene cuts.
Variables à adapter : [FUNCTION OF THE SHOT], [SUBJECT], [ONE OBSERVABLE ACTION], [LOCATION], [FRAMING AND POV], [STATIC OR ONE CAMERA MOVEMENT], [LIGHT SOURCE AND EFFECT], [SOUND OR NO DIALOGUE], [INVARIANTS] Pourquoi cette structure : elle part de la fonction du plan, puis ordonne les éléments que le guide officiel relie au cadrage, au mouvement, au lieu, à la lumière et à l’action. No scene cuts répond au besoin documenté de demander une scène continue. Limites : une scène continue n’empêche pas tous les artefacts ni toutes les variations de rythme. La durée, le ratio et la résolution dépendent de l’interface et des contrôles effectivement exposés.
Prompt : protéger les invariants du plan
Modèle et mode vérifiés : gemini-omni-1.1-flash, édition vidéo conversationnelle, Interactions API ou Flow Objectif : rappeler au modèle ce qui doit rester stable pendant une modification
Edit this video only where specified.
Keep these elements exactly the same: [IDENTITY OR PRODUCT], [LOCATION], [LIGHTING], [CAMERA], [AUDIO].
Change only [ONE ELEMENT TO CHANGE] by [DESIRED CHANGE].
Keep everything else the same.
Variables à adapter : [IDENTITY OR PRODUCT], [LOCATION], [LIGHTING], [CAMERA], [AUDIO], [ONE ELEMENT TO CHANGE], [DESIRED CHANGE] Pourquoi cette structure : les modifications sont séparées en invariants et delta unique. La documentation API indique que les éditions simples et Keep everything else the same aident à préserver la cohérence. Limites : le modèle peut modifier des éléments non cités. Il faut comparer le plan avant et après, notamment le visage, le produit, le décor et la bande sonore.
Prompt : déplacer le regard de la caméra
Modèle et mode vérifiés : gemini-omni-1.1-flash, édition vidéo en langage naturel Objectif : corriger le point de vue sans réécrire la scène
Change only the camera angle to [NEW ANGLE] and use [NEW CAMERA MOVEMENT].
Keep the subject, action, timing, location, lighting, sound and text exactly the same.
Keep everything else the same.
Variables à adapter : [NEW ANGLE], [NEW CAMERA MOVEMENT] Pourquoi cette structure : le guide officiel documente le changement d’angle, de point de vue et de mouvement par conversation. La phrase protège les autres couches de la note. Limites : les termes de caméra sont des consignes en langage naturel, pas des contrôles mécaniques garantis. Relire les raccords, le mouvement du sujet et la stabilité des lignes du décor.
Prompt : déclencher une action à un moment précis
Modèle et mode vérifiés : gemini-omni-1.1-flash, édition vidéo conversationnelle Objectif : ajouter un événement sans reconstruire le plan
Keep everything else the same.
At the moment when [TRIGGER], [NEW ACTION].
Preserve [IDENTITY, CAMERA, LOCATION, LIGHTING AND SOUND].
Variables à adapter : [TRIGGER], [NEW ACTION], [IDENTITY, CAMERA, LOCATION, LIGHTING AND SOUND] Pourquoi cette structure : la documentation DeepMind montre des modifications d’action localisées et explique qu’une action complexe peut être décrite comme une intention appliquée à la vidéo. Limites : un déclencheur temporel en langage naturel n’est pas une timeline image par image. Si le moment est critique, vérifier le raccord et demander une retouche plus simple.
Prompt : faire entrer le son et le texte dans la mise en scène
Modèle et mode vérifiés : gemini-omni-1.1-flash, génération texte vers vidéo ou édition avec entrées multimodales selon l’interface Objectif : utiliser le son et le texte comme événements narratifs, pas comme décoration ajoutée après coup
Create one continuous scene about [SUBJECT AND ACTION].
At [VISUAL EVENT], display the text “[ON-SCREEN TEXT]” at [PLACEMENT] with [ANIMATION OR EXPOSURE].
Synchronize [SOUND OR MUSIC EVENT] with [VISUAL EVENT].
Keep the text readable and keep [INVARIANTS] unchanged.
No dialogue.
Variables à adapter : [SUBJECT AND ACTION], [VISUAL EVENT], [ON-SCREEN TEXT], [PLACEMENT], [ANIMATION OR EXPOSURE], [SOUND OR MUSIC EVENT], [INVARIANTS] Pourquoi cette structure : Google documente le texte synchronisé avec l’action, son placement et son animation, ainsi que la synchronisation d’une action avec une entrée audio. Limites : la lisibilité, la prononciation, le mixage et la justesse d’une information doivent être contrôlés humainement. Ne pas utiliser ce prompt pour valider un fait scientifique ou juridique.
Prompt : guider une transition avec deux images
Modèle et mode vérifiés : gemini-omni-1.1-flash, image vers vidéo avec interpolation première et dernière image, Gemini API ou interface exposant cette fonction Objectif : diriger le début et la fin d’une transformation
Use <FIRST_FRAME> as the starting image and <LAST_FRAME> as the ending image.
Create a smooth transition from the first frame to the last frame.
Preserve the identity of [SUBJECT] and make the camera movement [CAMERA INTENTION].
The transition should express [NARRATIVE CHANGE].
Variables à adapter : <FIRST_FRAME>, <LAST_FRAME>, [SUBJECT], [CAMERA INTENTION], [NARRATIVE CHANGE] Pourquoi cette structure : la documentation API décrit l’interpolation entre deux images, et le post Google Flow annonce les images de fin sur desktop. Le prompt distingue les deux images du mouvement narratif. Limites : la présence du contrôle dans Flow dépend de l’interface et de son déploiement. Deux images ne garantissent pas une continuité parfaite entre les poses, les matières ou le décor.
Prompt : prolonger un plan avec un raccord contrôlé
Modèle et mode vérifiés : gemini-omni-1.1-flash, extension vidéo, Interactions API ou interface qui expose la fonction Objectif : poursuivre une scène en gardant son mouvement et son ambiance
Extend this video.
Continue the scene with [NEXT ACTION] while preserving [CHARACTER, LOCATION, CAMERA, LIGHTING AND SOUND].
The continuation should feel like the next beat of the same shot.
If the scene changes, make the cut intentional and clear.
Variables à adapter : [NEXT ACTION], [CHARACTER, LOCATION, CAMERA, LIGHTING AND SOUND] Pourquoi cette structure : la documentation Google décrit l’extension par prompt et recommande de préciser si la scène continue ou si un nouveau plan commence, avec les éléments à préserver. Limites : l’extension utilise le contexte de la fin du plan et peut modifier quelques images de raccord. Contrôler le dernier mouvement, l’audio et la continuité des personnages.
Prompt : transférer un mouvement vers un personnage de référence
Modèle et mode vérifiés : gemini-omni-1.1-flash, références vidéo et image, génération ou édition multimodale selon l’interface Objectif : conserver un mouvement observé tout en remplaçant le sujet par un personnage ou un produit de référence
Use <MOTION_VIDEO> for the pose and motion.
Use <CHARACTER_IMAGE> for the subject identity.
Apply the visual style from <STYLE_IMAGE>.
Place the subject in [LOCATION] and keep the camera intention [CAMERA INTENTION].
Variables à adapter : <MOTION_VIDEO>, <CHARACTER_IMAGE>, <STYLE_IMAGE>, [LOCATION], [CAMERA INTENTION] Pourquoi cette structure : le guide officiel montre comment combiner une vidéo de mouvement, une image de personnage et une référence de style. Chaque entrée reçoit un rôle lisible, ce qui transforme un assemblage de médias en note de mise en scène. Limites : la référence de mouvement peut déformer l’identité ou les proportions du sujet. Contrôler les mains, le visage, les raccords et les droits sur chaque média.
Prompt : remplacer un objet sans perdre le mouvement
Modèle et mode vérifiés : gemini-omni-1.1-flash, édition vidéo conversationnelle Objectif : tester une variante de décor ou de produit sans refaire la chorégraphie
Change [ORIGINAL OBJECT] into [NEW OBJECT OR MATERIAL].
Keep the subject motion, camera, location, lighting and sound exactly the same.
Keep everything else the same.
Variables à adapter : [ORIGINAL OBJECT], [NEW OBJECT OR MATERIAL] Pourquoi cette structure : le guide officiel illustre des substitutions de sujet ou d’objet tout en demandant de conserver le reste. Le prompt réduit la retouche à un seul changement vérifiable. Limites : la matière, l’échelle ou les interactions physiques peuvent changer. Relire les ombres, les contacts et la logique du mouvement avant de retenir la variante.
Prompt : changer le décor sans réécrire le plan
Modèle et mode vérifiés : gemini-omni-1.1-flash, édition vidéo conversationnelle avec référence d’environnement Objectif : explorer un nouveau lieu en protégeant l’identité et l’action déjà validées
Transport [SUBJECT] to <NEW_ENVIRONMENT>.
Preserve the subject identity, action, timing, camera movement, lighting and sound.
Keep everything else the same.
Variables à adapter : [SUBJECT], <NEW_ENVIRONMENT> Pourquoi cette structure : la documentation officielle présente le changement de contexte et l’édition ciblée comme des opérations conversationnelles. Le décor devient le delta, tandis que les éléments de continuité sont explicitement rappelés. Limites : un nouveau lieu peut modifier les ombres, la perspective et les interactions avec le sujet. Vérifier que le changement reste compatible avec la note de réalisation.
Prompt : transformer un dessin en footage
Modèle et mode vérifiés : gemini-omni-1.1-flash, image ou dessin de référence vers vidéo Objectif : passer d’une intention graphique à un plan exploitable sans exposer le support de travail
Turn this drawing into realistic footage.
Use the drawing as a guide for composition and movement, but do not show the drawing in the final video.
Make [ACTION] clear and use [CAMERA INTENTION].
Keep the lighting [LIGHTING INTENTION] and the location [LOCATION].
Variables à adapter : [ACTION], [CAMERA INTENTION], [LIGHTING INTENTION], [LOCATION] Pourquoi cette structure : la page officielle montre le passage d’un dessin à une vidéo réaliste. Le rôle de la référence est limité à la composition et au mouvement pour éviter de confondre le storyboard avec le rendu final. Limites : « réaliste » est une direction artistique, pas une garantie de précision documentaire. Contrôler les proportions, les détails et la cohérence avec le dessin source.
Prompt : combiner vidéo, image et audio
Modèle et mode vérifiés : gemini-omni-1.1-flash, génération multimodale avec références vidéo, image et audio si l’interface les accepte Objectif : répartir clairement les rôles entre plusieurs médias de référence
Use <MOTION_VIDEO> for the motion and camera context.
Use <CHARACTER_IMAGE> for the subject identity.
Use <AUDIO_REFERENCE> for the rhythm and the main audio event.
Create one continuous scene in [ENVIRONMENT].
Preserve [INVARIANTS] and make the visual action follow the audio event.
Variables à adapter : <MOTION_VIDEO>, <CHARACTER_IMAGE>, <AUDIO_REFERENCE>, [ENVIRONMENT], [INVARIANTS] Pourquoi cette structure : Google présente Gemini Omni comme capable de combiner plusieurs types de médias et montre l’attribution d’un rôle à chaque référence. La carte sert à écrire une intention de montage avant la génération. Limites : l’interface peut limiter les types ou le nombre d’entrées. Le rythme audio n’est pas une timeline de montage : contrôler les synchronisations et les droits sur les voix ou musiques.
Prompt : appliquer une progression de styles
Modèle et mode vérifiés : gemini-omni-1.1-flash, édition vidéo avec changement de style Objectif : transformer une même action en trajectoire visuelle lisible
Apply these visual styles in order to the same continuous action:
1. [STYLE 1]
2. [STYLE 2]
3. [STYLE 3]
Keep the subject motion, camera path and scene timing continuous.
Make each transition visible and intentional.
Variables à adapter : [STYLE 1], [STYLE 2], [STYLE 3] Pourquoi cette structure : le guide officiel documente l’application de nouveaux styles en conservant le mouvement et les détails, ainsi que des progressions en plusieurs étapes. L’ordre devient ici le principe narratif du plan. Limites : les transitions peuvent être inégales ou modifier les détails protégés. Comparer chaque étape et réduire la progression si elle brouille l’action.
Prompt : construire un storyboard lisible
Modèle et mode vérifiés : gemini-omni-1.1-flash, storyboard ou image de référence vers vidéo Objectif : convertir des vignettes de préparation en beats de réalisation contrôlables
Follow the supplied storyboard in reading order.
Reproduce these beats: [BEAT 1], [BEAT 2], [BEAT 3].
Keep the character identity and visual language consistent.
Use one continuous scene only if the storyboard represents one shot; otherwise preserve clear shot changes.
Variables à adapter : [BEAT 1], [BEAT 2], [BEAT 3] Pourquoi cette structure : la documentation officielle décrit la création d’un storyboard à partir d’une référence visuelle. La carte oblige à décider si les vignettes forment un plan unique ou une suite de plans. Limites : le modèle peut réordonner, fusionner ou ignorer des vignettes. Relire l’ordre, la durée relative et les raccords avant d’utiliser le résultat comme référence de production.
Prompt : visualiser un concept scientifique sans inventer les faits
Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo ou génération avec schéma de référence Objectif : produire une métaphore visuelle structurée pour expliquer une idée complexe
Create a visual explainer of [CONCEPT] in [VISUAL STYLE].
Show these steps in order: [STEP 1], [STEP 2], [STEP 3].
Use clear visual metaphors and no on-screen text unless specified.
Treat the supplied facts as the source of truth and leave uncertain details out.
Variables à adapter : [CONCEPT], [VISUAL STYLE], [STEP 1], [STEP 2], [STEP 3] Pourquoi cette structure : le guide officiel propose d’utiliser les connaissances du monde et la compréhension de concepts pour construire des explications visuelles. Le prompt sépare la métaphore de la liste de faits à vérifier. Limites : une image convaincante ne valide pas une explication scientifique. Faire relire les faits par une source compétente et éviter de demander au modèle de trancher une incertitude.
Prompt : rendre une action complexe lisible
Modèle et mode vérifiés : gemini-omni-1.1-flash, édition vidéo avec action ou effet ajouté Objectif : isoler une relation de cause à effet dans une scène déjà cadrée
Edit this video while keeping the subject, location, camera and lighting unchanged.
Add [COMPLEX ACTION OR EFFECT] as one clear cause-and-effect event.
Make the cause happen before the effect.
Keep everything else the same.
Variables à adapter : [COMPLEX ACTION OR EFFECT] Pourquoi cette structure : le guide officiel propose des exemples d’actions complexes et d’effets de mouvement. La carte les ramène à un événement unique, avec une causalité explicitement relue. Limites : une consigne causale ne garantit pas une simulation physique exacte. Contrôler la chronologie, les collisions, les déformations et la lisibilité du point d’attention.
Prompt : composer une grammaire de caméra pour un même plan
Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo ou édition vidéo en langage naturel Objectif : choisir un cadrage et un seul mouvement de caméra avant de détailler le reste
Shoot [SUBJECT] as [SHOT SIZE] from [POINT OF VIEW].
Use [CAMERA TERM] as the only camera movement.
Keep [ACTION], [LOCATION], [LIGHTING] and [SOUND] unchanged.
One continuous shot. No scene cuts.
Variables à adapter : [SUBJECT], [SHOT SIZE], [POINT OF VIEW], [CAMERA TERM], [ACTION], [LOCATION], [LIGHTING], [SOUND] Pourquoi cette structure : le guide officiel sépare cadrage, point de vue et mouvement. Cette carte impose un seul mouvement. Limites : CAMERA TERM reste une consigne en langage naturel. Vérifier le mouvement et les raccords du sujet.
Prompt : passer derrière l’épaule du sujet
Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo ou édition vidéo Objectif : diriger le regard vers une relation entre un sujet et ce qu’il observe
Frame the scene over the shoulder of [SUBJECT].
Begin with [START FRAMING], then use [CAMERA MOVEMENT] toward [FOCUS].
Keep the subject identity, action, location, lighting and sound unchanged.
Variables à adapter : [SUBJECT], [START FRAMING], [CAMERA MOVEMENT], [FOCUS] Pourquoi cette structure : Google documente over the shoulder et sépare le mouvement de l’action. Limites : Ce point de vue peut modifier la visibilité du visage ou du sujet observé. Contrôler proportions, occlusion et regard.
Prompt : choisir une intention de captation
Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo Objectif : faire varier le langage visuel d’une captation sans changer la scène
Capture this scene as [SMARTPHONE, FILM OR WEBCAM] footage.
Keep [SUBJECT], [ACTION] and [LOCATION] unchanged.
Use [CAMERA BEHAVIOR] and [LIGHTING INTENTION].
Do not add a different visual style.
Variables à adapter : [SMARTPHONE, FILM OR WEBCAM], [SUBJECT], [ACTION], [LOCATION], [CAMERA BEHAVIOR], [LIGHTING INTENTION] Pourquoi cette structure : Google cite smartphone, film et webcam. La scène reste fixe pour isoler la captation. Limites : Ces mots ne reproduisent pas mécaniquement un capteur, une optique ou une compression. Comparer l’intention visuelle.
Prompt : verrouiller un plan pendant une action
Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo Objectif : laisser l’action porter le plan sans mouvement de caméra concurrent
Use a static, locked-off camera.
Show [SUBJECT] performing [ACTION] in [LOCATION].
Keep the framing fixed while [TRIGGER] occurs.
No camera movement and no scene cuts.
Variables à adapter : [SUBJECT], [ACTION], [LOCATION], [TRIGGER] Pourquoi cette structure : static et locked off font partie du vocabulaire de caméra documenté par Google. Limites : Une caméra fixe ne stabilise pas automatiquement sujet, décor ou lignes verticales. Relire les déformations.
Prompt : révéler un détail par push-in
Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo ou édition vidéo Objectif : organiser une révélation par le déplacement du regard, pas par un changement de scène
Start with [START FRAMING].
Use a slow push in toward [DETAIL].
At [TRIGGER], reveal [REVELATION].
Keep the subject, location, lighting and sound unchanged.
Variables à adapter : [START FRAMING], [DETAIL], [TRIGGER], [REVELATION] Pourquoi cette structure : Google cite push in, punch in et dolly zoom. Ici, le push-in accompagne une révélation. Limites : Le timing naturel n’est pas une timeline image par image. Vérifier vitesse et moment de révélation.
Prompt : garder un personnage identifiable entre plusieurs références
Modèle et mode vérifiés : gemini-omni-1.1-flash, génération ou édition avec image et vidéo de référence Objectif : préserver une identité visuelle pendant qu’une action ou un décor évolue
Use <CHARACTER_REFERENCE> to preserve the subject identity across the scene.
Show [ACTION] in [LOCATION].
Keep the face, clothing, proportions and key colors consistent.
Change only [ONE PLANNED ELEMENT].
Variables à adapter : <CHARACTER_REFERENCE>, [ACTION], [LOCATION], [ONE PLANNED ELEMENT] Pourquoi cette structure : Google utilise des références pour maintenir un sujet et ses détails. Le delta reste isolé. Limites : Une référence n’assure pas une identité parfaite. Vérifier visage, mains, vêtements et objets tenus.
Prompt : appliquer un style sans déplacer le mouvement
Modèle et mode vérifiés : gemini-omni-1.1-flash, édition vidéo avec image de style ou instruction de style Objectif : modifier la surface visuelle d’un plan déjà lisible
Apply the visual style from <STYLE_REFERENCE> to this video.
Keep the original subject motion, timing, camera path and scene details.
Change only [STYLE ELEMENTS].
Variables à adapter : <STYLE_REFERENCE>, [STYLE ELEMENTS] Pourquoi cette structure : le guide officiel applique un style en conservant mouvement et détails. Limites : Le style peut contaminer textures, visage ou décor. Comparer avant et après.
Prompt : utiliser une image comme décor de continuité
Modèle et mode vérifiés : gemini-omni-1.1-flash, image de référence vers vidéo ou édition vidéo Objectif : imposer un environnement visuel sans réécrire l’action du sujet
Use <ENVIRONMENT_IMAGE> as the visual environment.
Place [SUBJECT] performing [ACTION] in that environment.
Preserve the subject identity and camera intention [CAMERA INTENTION].
Keep the environment layout and lighting cues consistent.
Variables à adapter : <ENVIRONMENT_IMAGE>, [SUBJECT], [ACTION], [CAMERA INTENTION] Pourquoi cette structure : les exemples officiels utilisent des références de contexte. L’image reçoit ici le rôle de décor. Limites : Perspective et ombres peuvent être réinterprétées. Contrôler échelle, profondeur et sources lumineuses.
Prompt : animer une image de produit
Modèle et mode vérifiés : gemini-omni-1.1-flash, image vers vidéo Objectif : passer d’un visuel produit à un plan court sans multiplier les références
Animate the product from <PRODUCT_IMAGE> in one continuous shot.
Show [ONE PRODUCT ACTION] with [CAMERA INTENTION].
Keep the product shape, logo placement and key colors consistent.
Use [LIGHTING] and [SOUND].
Variables à adapter : <PRODUCT_IMAGE>, [ONE PRODUCT ACTION], [CAMERA INTENTION], [LIGHTING], [SOUND] Pourquoi cette structure : Google recommande de décrire action, cadrage, lumière et son autour d’une référence image. Limites : Relire logos, textes et arêtes image par image. Ce prompt ne valide ni marque ni conformité.
Prompt : synchroniser une variation de lumière avec la musique
Modèle et mode vérifiés : gemini-omni-1.1-flash, génération multimodale avec audio ou instruction musicale selon l’interface Objectif : faire de la lumière un événement temporel lié au son
Create one continuous scene of [SUBJECT AND ACTION].
Sync the lighting change [LIGHT CUE] with [MUSIC EVENT].
Keep the subject motion, camera, location and sound timing coherent.
No scene cuts.
Variables à adapter : [SUBJECT AND ACTION], [LIGHT CUE], [MUSIC EVENT] Pourquoi cette structure : Google montre une lumière synchronisée avec la musique et relie l’action à un événement. Limites : Une indication musicale ne remplace ni piste de référence ni montage. Contrôler tempo, mixage et moment lumineux.
Prompt : raconter une action sans dialogue
Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo Objectif : vérifier qu’un plan est compréhensible par le mouvement et la composition seuls
Show [SUBJECT] communicating [INTENTION] through [VISIBLE ACTION] in [LOCATION].
Use [FRAMING] and [CAMERA MOVEMENT].
No dialogue and no narration.
Keep the action readable from beginning to end.
Variables à adapter : [SUBJECT], [INTENTION], [VISIBLE ACTION], [LOCATION], [FRAMING], [CAMERA MOVEMENT] Pourquoi cette structure : le guide API documente No dialogue. Cette carte teste la compréhension par l’image seule. Limites : L’intention peut rester ambiguë. Faire relire le plan par quelqu’un qui n’a pas vu la note.
Prompt : séparer une référence de caméra et une référence de décor
Modèle et mode vérifiés : gemini-omni-1.1-flash, génération multimodale avec vidéo et image de référence Objectif : attribuer un rôle différent à chaque média pour éviter un mélange de contraintes
Use <CAMERA_REFERENCE_VIDEO> only for the camera path and timing.
Use <SCENE_IMAGE> for the environment and composition.
Create [SUBJECT] performing [ACTION] in that environment.
Preserve [IDENTITY OR PRODUCT] and keep the visual language coherent.
Variables à adapter : <CAMERA_REFERENCE_VIDEO>, <SCENE_IMAGE>, [SUBJECT], [ACTION], [IDENTITY OR PRODUCT] Pourquoi cette structure : Google documente la combinaison de références image et vidéo. Chaque entrée reçoit un rôle. Limites : Le modèle peut transférer des détails non souhaités. Vérifier caméra, décor et identité séparément.
Prompt : prolonger une scène par incrément de dix secondes
Modèle et mode vérifiés : gemini-omni-1.1-flash, extension vidéo via l’Interactions API ou une interface qui expose cette fonction Objectif : planifier une extension courte et contrôlable au lieu de demander une longue suite d’un seul coup
Extend this video by one 10-second continuation.
Continue with [NEXT BEAT] while preserving [CHARACTER, LOCATION, CAMERA, LIGHTING AND SOUND].
End on [NEXT EDITABLE MOMENT].
Keep the continuation connected to the last frame.
Variables à adapter : [NEXT BEAT], [CHARACTER, LOCATION, CAMERA, LIGHTING AND SOUND], [NEXT EDITABLE MOMENT] Pourquoi cette structure : Google décrit des extensions par incréments de dix secondes et la continuité avec la fin. Limites : L’extension dépend de l’interface et de la limite du mode utilisé. Contrôler chaque raccord.
Prompt : visualiser un mouvement physique sans surpromesse
Modèle et mode vérifiés : gemini-omni-1.1-flash, texte vers vidéo ou édition vidéo Objectif : rendre une relation de force ou de mouvement lisible dans un plan pédagogique ou créatif
Show [OBJECT] responding to [FORCE OR CAUSE] in [LOCATION].
Make the sequence clear: first [CAUSE], then [MOTION], then [VISIBLE RESULT].
Use [CAMERA INTENTION] and [LIGHTING].
Keep the scene continuous and leave uncertain physical details out.
Variables à adapter : [OBJECT], [FORCE OR CAUSE], [LOCATION], [CAUSE], [MOTION], [VISIBLE RESULT], [CAMERA INTENTION], [LIGHTING] Pourquoi cette structure : Google présente la physique intuitive et des actions complexes. La carte impose une séquence causale. Limites : Une scène plausible n’est pas une simulation scientifique. Faire vérifier lois, mesures et hypothèses.
Relire un plan comme une équipe de réalisation
Après chaque génération, ne demandez pas seulement si le résultat est « beau ». Utilisez une grille de relecture courte :
- Intention : le plan produit-il l’effet annoncé dans la note ?
- Lisibilité : comprend-on le sujet, l’action et le point d’attention sans explication orale ?
- Caméra : le mouvement sert-il la scène ou attire-t-il l’attention sur lui-même ?
- Continuité : le visage, le produit, le décor, la lumière et le son restent-ils cohérents ?
- Texte et audio : le texte est-il lisible, le son synchronisé et l’information vérifiable ?
- Correction suivante : quel est l’unique défaut à modifier au prochain tour ?
Cette dernière question est la plus importante. Si vous corrigez simultanément le cadrage, la lumière, le texte et l’action, vous ne saurez pas ce qui a réellement amélioré le plan. Une conversation de mise au point doit laisser une trace des décisions, comme le ferait une équipe de réalisation entre deux prises.
Quelle formation prolonge ce travail ?
La formation Google Flow, Veo & Gemini Omni : L’Orchestration Cinématographique IA est le prolongement le plus direct de ce guide. Son programme relie le brief à une bible de production, les prompts de caméra aux plans, Gemini Omni Flash aux retouches conversationnelles, puis les plans au montage et aux exports. Ici, nous avons isolé l’écriture de la note et la correction par delta ; la formation élargit cette pratique à une séquence complète.
Méthodologie et limites
Les capacités, le modèle stable, les durées, les résolutions, l’Interactions API, l’extension et l’interpolation proviennent de la documentation Google vérifiée le 28 août 2026. Les conseils sur la note de mise en scène et la grille de relecture sont une transposition éditoriale de ces contrôles, pas une promesse de comportement automatique.
Les trente prompts sont documentés, non exécutés. Je n’ai pas utilisé de clé API, de compte Flow ni de session de génération pour cet article. Les vidéos intégrées ont été vérifiées comme ressources MP4 externes accessibles au moment de la rédaction, mais leur contenu créatif n’est pas présenté comme un test reproductible.
Le modèle stable, Flow et l’API peuvent exposer des fonctions différentes. Les termes de caméra et les consignes de conservation sont des instructions en langage naturel. Ils doivent être relus sur le plan obtenu. La disponibilité régionale, les droits sur les références, l’usage de visages ou de voix, la conservation des fichiers et les conditions commerciales doivent être vérifiés dans l’interface et les conditions applicables au projet.
Google indique également que les contenus créés ou modifiés avec Omni dans Gemini, Flow ou YouTube incluent SynthID et C2PA Content Credentials. Ces signaux de provenance ne prouvent pas à eux seuls les droits, la véracité, la qualité ou l’acceptabilité juridique d’un contenu.
Sources et références
- Gemini Omni Flash : fiche du modèle stable, documentation Google AI vérifiée le 28 août 2026.
- Generate and edit videos with Gemini Omni Flash, documentation Google AI vérifiée le 28 août 2026.
- Release notes Gemini API, entrée du 27 août 2026 consultée le 28 août 2026.
- Gemini Omni, page produit Google DeepMind vérifiée le 28 août 2026.
- How to create effective prompts with Gemini Omni, guide officiel Google DeepMind vérifié le 28 août 2026.
- Omni 1.1 Flash dans Google Flow et end frames sur desktop, publication Google Flow du 27 août 2026 consultée le 28 août 2026.
- 9 demos of Gemini Omni and Gemini 3.5 in action, article officiel Google du 29 mai 2026 consulté le 28 août 2026.
- Build with Gemini Omni 1.1 Flash, article officiel Google du 27 août 2026 consulté le 28 août 2026.
- Guide CreativeAI.fr Google Flow & Gemini Omni, consulté le 28 août 2026 pour le contrôle de cannibalisation.
Fondateur de CreativeAI.fr · Expert IA & workflows créatifs · 20+ ans d’expérience en direction créative (Marcel, Leo Burnett). 600+ professionnels formés depuis 2023 aux usages, méthodes et workflows IA. 4,7/5 de satisfaction moyenne.
Guides Pratiques & outils

Brand Brain : transformer une stratégie de marque en système IA
Un Brand Brain IA est un référentiel de marque structuré pour être consulté, interprété et vérifié par des assistants IA. Il ne s’agit pas de copier un brand book dans une conversation ni d’empiler des prompts.

Google Flow & Gemini : construire un studio créatif IA complet
Workflow, Agent, Tools, crédits et 100 prompts pour produire, éditer et industrialiser des vidéos IA. MAJ

Votre équipe marketing n’a pas besoin de plus d’outils IA, mais d’un système éditorial
Le contenu ne manque pas toujours d’idées. Il manque souvent d’un système pour transformer ces idées en publications régulières, utiles et reconnaissables.

AI Slop : pourquoi vos contenus IA deviennent interchangeables
L’AI slop n’est pas seulement du mauvais contenu généré par intelligence artificielle. C’est le symptôme d’une création sans intention, sans vérification et sans direction humaine.
formation IA
Google Flow, Veo & Gemini Omni : L’Orchestration Cinématographique IA
Durée : 2 jours (14h). Public : DA, réalisateurs, motion designers, équipes marketing, communication et social media
Réinventer son processus créatif avec l’IA générative
Durée : 5 jours (35h). Public : DA, graphistes, designers
Créer des visuels de marque avec ChatGPT Images et Codex NEW
Durée : 1 jour (7h). Public : directeurs artistiques, équipes marketing et communication, agences, studios et équipes de contenu
L’IA générative pour les créatifs : panorama et expérimentation des outils essentiels
Durée : 1 jour (7h). Public : DA, dirigeants, designers
Social Content Factory : produire et décliner ses contenus avec l’IA NEW
Durée : 2 jours (14h). Public : Responsables marketing et communication, Social media managers et content managers, Agences, studios et équipes éditoriales
IA agentique pour les créatifs : du brief à l’automatisation NEW
Durée : 1 jour (7h). Public : Responsables de production et dirigeants de structures créatives, équipes marketing, communication et contenu, agences et studios créatifs

