1Le prompt de départ
Le voici :
Le prompt fixe un rôle (directeur artistique), une équipe (des agents), des outils, un ton, une contrainte visuelle et un objectif mesurable. Sa dernière ligne compte le plus : elle invite l'agent à demander ce qui lui manque avant de produire.
2Huit questions avant la première image
L'agent a posé deux séries de quatre questions, chacune avec des options et une recommandation.
| Question | Réponse |
|---|---|
| D'où vient le visage de Thomas ? | De sa photo, à décliner avec un générateur d'images. |
| Qui parle ? | Une voix off synthétique. |
| Où sera diffusée la vidéo ? | Newsletter, YouTube et LinkedIn. |
| Quel angle ? | Un explainer des neuf gestes de la méthode. |
| Quel humour ? | Pince-sans-rire : un narrateur flegmatique, des gags visuels discrets. |
| Quelle esthétique ? | Les pochettes Blue Note des années 50 et 60 : aplats de couleur, photos découpées, gros titres. |
| Quelle structure ? | Les neuf gestes en trois mouvements, comme un morceau de jazz : l'ouverture, l'improvisation, le retour au thème. |
| Comment finir ? | Sans appel à l'action. |
Le prompt citait Higgsfield. Nous n'avions pas de clé pour son API, payante à l'usage : tout est donc passé par Kie.ai, un revendeur qui donne accès à plusieurs modèles avec une seule clé.
3L'équipe
- Le directeur artistique (Jeff) écrit le script, fixe la charte visuelle, rédige les commandes des deux autres agents, produit la voix, monte la vidéo et contrôle chaque étape.
- L'agent images fabrique vingt images : dix poses de Thomas (impassible, sourire en coin, sourcil levé, main en cornet derrière l'oreille, saxophone, crayon géant, besace, clavier, révérence, index pointé) et dix objets (gramophone, baguette magique, pile de documents, porte entrouverte, pelote de fil, bouton de volume, bande magnétique, loupe, besace, vinyle).
- L'agent musique compose la bande-son avec Suno et produit cinq bruitages : ciseaux, papier qui glisse, disque rayé, cymbale, roulement de caisse claire.
Les deux agents travaillent en parallèle. Chacun reçoit une commande qui se suffit à elle-même : le contexte du film, les outils, les règles et leur raison, un plafond de dépense, une procédure de contrôle et un format de livraison.
Par exemple, la commande d'images explique pourquoi chaque image doit être une photographie noir et blanc sur fond blanc pur : au montage, le blanc disparaît et les gris prennent la couleur de l'aplat posé dessous. On obtient l'effet duotone des pochettes sans retoucher une seule image.
4La fabrication
- Le script. Quinze scènes : le mythe du prompt magique, Thomas qui écrit « ds » au lieu de « dans », la pochette « Jazz Prompting », les trois mouvements et leurs neuf gestes, puis une coda : « le prompt n'est que le déclencheur, la musique, c'est le contexte ».
- Les images. Seedream, en mode retouche, part de la vraie photo de Thomas et garde son visage d'une pose à l'autre. GPT Image 2 se charge des objets. L'agent regarde chaque résultat et régénère jusqu'à deux fois une image si le fond n'est pas blanc, si un texte apparaît ou si Thomas ne se ressemble plus.
- La voix. Gemini 3.1 Flash TTS génère un fichier par scène, avec une direction de jeu écrite comme pour un comédien. Une transcription locale (Whisper) donne l'instant de chaque mot. Elle sert à placer les sous-titres et à déclencher chaque élément visuel sur la phrase qui le concerne.
- Le montage. Remotion compose la vidéo en code React. Le papier découpé est un système de règles plus qu'un filtre : l'animation avance par paliers de deux images, comme en stop motion ; chaque découpe tremble légèrement ; les bords sont des polygones irréguliers ; une palette Blue Note (crème, encre, bordeaux, jaune, bleu canard) et des titres très serrés complètent l'ensemble.
- Le contrôle. L'agent rend des images fixes aux moments clés, les assemble en planche et y repère les défauts : un titre invisible sur un aplat de la même couleur, des étiquettes qui se chevauchent, des débuts de scène vides. Le son est enfin normalisé au niveau d'écoute usuel des plateformes.
La première version durait 3 minutes 21.
5Le retour, puis la version 2
Benoît Raphaël a regardé la vidéo et dicté son retour : la voix est trop grave et pas assez claire, et « on est dans du jazz », donc il faut plus de dynamisme et de virtuosité ; le texte ne dit pas pourquoi Thomas comprend si bien les modèles ; il faut une musique plus vivante, avec des solos. Il a conclu :
plus rythme + make it better
| Retour | Ce qui a changé |
|---|---|
| Voix molle, trop grave | Trois voix essayées sur la même scène et mesurées. La voix retenue est plus haute et plus brillante, et elle module davantage. La direction de jeu est passée de « majordome flegmatique » à « présentateur de club de jazz, vif et malicieux ». |
| Pourquoi Thomas comprend | « Voici Thomas. Ingénieur. Il code, il assemble des algorithmes : il a l'intuition de ce qui se passe dans la machine. » À l'image, des lignes de code s'affichent à côté de son portrait. |
| La source, c'est le web | « Le modèle dit l'avoir lu sur le web ? "Donne-moi les URL." Puis : "La citation exacte." » |
| Le neuvième geste | « Consolider » devient « récolter » : les mots qui ont marché vont dans la besace et resserviront au prochain morceau. |
| Musique plus vivante | Du hard bop à 161 battements par minute, avec des solos. La musique baisse sous la voix et revient en avant dans chaque respiration, comme un orchestre qui relance entre deux chorus. L'image donne un léger à-coup sur les temps forts. |
| Plus de rythme | Des silences plus courts entre les scènes et une voix plus rapide : la vidéo passe à 2 minutes 47. La musique démarre sur un temps fort, 22 secondes après son début, pour que sa vraie fin tombe sur le carton final. |
6Un agent qui n'entend rien
L'agent voit des images fixes, mais il n'entend pas. Pour juger le son, il a remplacé l'oreille par des mesures.
- La voix. Il a mesuré la hauteur médiane, la brillance du timbre et l'amplitude des variations de hauteur. La première voix tournait autour de 82 Hz, ce qui confirmait l'impression d'une voix sourde. Ces mesures orientent le choix ; elles ne disent pas si une voix est agréable.
- Le texte. La transcription de chaque scène a été comparée à la fin du script. Elle a ainsi révélé que le synthétiseur avait coupé la fin d'une phrase (« des choses étonnantes »), sans aucun message d'erreur.
- La musique. Il a mesuré le tempo, l'évolution de l'énergie et la présence d'une vraie fin, et choisi la piste qui attaque franchement dès la première seconde.
Le jugement final reste humain : les deux versions ont été validées à l'écoute.
7Outils et coûts
- Production : Claude Code (un agent directeur artistique et deux agents spécialisés), Remotion 4, ffmpeg, Whisper en local.
- Génération, via Kie.ai : Seedream en retouche pour Thomas, GPT Image 2 pour les objets, Suno V5.5 pour la musique et les bruitages, Gemini 3.1 Flash TTS pour la voix.
- Coût : environ 410 crédits Kie, dont 380 pour la première version et 28 pour la seconde.
8Ce qu'on en retient
- Cadrer avant de produire. Les huit questions ont fixé le ton, le style et la structure avant toute génération. Le prompt de départ ne disait rien de tout cela.
- Une commande autonome par agent. Un sous-agent ne connaît pas la conversation. Sa commande doit porter le contexte, les règles et leur raison, et une procédure de contrôle.
- Des mesures quand on ne peut pas percevoir. Transcrire, mesurer, rendre des images fixes : chaque vérification indirecte a trouvé de vrais défauts.
- La version 2 vient du retour humain. La première version tenait techniquement. C'est l'écoute humaine qui a trouvé ce qui manquait : l'énergie, le pourquoi et le mot juste.