Making-of

Jazz prompting

Une vidéo de 2 minutes 47 en papier découpé, façon pochettes Blue Note, sur la manière dont Thomas Mahier dialogue avec l'IA. Elle a été fabriquée en une journée par Jeff, notre agent Claude Code, dans le rôle de directeur artistique. Au départ, il y avait un prompt de cinq lignes.

1Le prompt de départ

Le voici :

Peux-tu me générer une vidéo sur le jazz prompting ? Tu es le directeur artistique et tu pilotes ton équipe d'agents. Tes outils : tes compétences en motion design, Remotion, Kie AI et Higgsfield pour les voix, images, vidéos et musique (Suno). Un peu d'humour, papier découpé, utilise le visage de Thomas. /goal la vidéo complète prête à diffuser de 3 min Pose-moi autant de questions que nécessaire pour avoir un maximum de contexte.

Le prompt fixe un rôle (directeur artistique), une équipe (des agents), des outils, un ton, une contrainte visuelle et un objectif mesurable. Sa dernière ligne compte le plus : elle invite l'agent à demander ce qui lui manque avant de produire.

2Huit questions avant la première image

L'agent a posé deux séries de quatre questions, chacune avec des options et une recommandation.

QuestionRéponse
D'où vient le visage de Thomas ?De sa photo, à décliner avec un générateur d'images.
Qui parle ?Une voix off synthétique.
Où sera diffusée la vidéo ?Newsletter, YouTube et LinkedIn.
Quel angle ?Un explainer des neuf gestes de la méthode.
Quel humour ?Pince-sans-rire : un narrateur flegmatique, des gags visuels discrets.
Quelle esthétique ?Les pochettes Blue Note des années 50 et 60 : aplats de couleur, photos découpées, gros titres.
Quelle structure ?Les neuf gestes en trois mouvements, comme un morceau de jazz : l'ouverture, l'improvisation, le retour au thème.
Comment finir ?Sans appel à l'action.

Le prompt citait Higgsfield. Nous n'avions pas de clé pour son API, payante à l'usage : tout est donc passé par Kie.ai, un revendeur qui donne accès à plusieurs modèles avec une seule clé.

3L'équipe

Les deux agents travaillent en parallèle. Chacun reçoit une commande qui se suffit à elle-même : le contexte du film, les outils, les règles et leur raison, un plafond de dépense, une procédure de contrôle et un format de livraison.

Par exemple, la commande d'images explique pourquoi chaque image doit être une photographie noir et blanc sur fond blanc pur : au montage, le blanc disparaît et les gris prennent la couleur de l'aplat posé dessous. On obtient l'effet duotone des pochettes sans retoucher une seule image.

4La fabrication

  1. Le script. Quinze scènes : le mythe du prompt magique, Thomas qui écrit « ds » au lieu de « dans », la pochette « Jazz Prompting », les trois mouvements et leurs neuf gestes, puis une coda : « le prompt n'est que le déclencheur, la musique, c'est le contexte ».
  2. Les images. Seedream, en mode retouche, part de la vraie photo de Thomas et garde son visage d'une pose à l'autre. GPT Image 2 se charge des objets. L'agent regarde chaque résultat et régénère jusqu'à deux fois une image si le fond n'est pas blanc, si un texte apparaît ou si Thomas ne se ressemble plus.
  3. La voix. Gemini 3.1 Flash TTS génère un fichier par scène, avec une direction de jeu écrite comme pour un comédien. Une transcription locale (Whisper) donne l'instant de chaque mot. Elle sert à placer les sous-titres et à déclencher chaque élément visuel sur la phrase qui le concerne.
  4. Le montage. Remotion compose la vidéo en code React. Le papier découpé est un système de règles plus qu'un filtre : l'animation avance par paliers de deux images, comme en stop motion ; chaque découpe tremble légèrement ; les bords sont des polygones irréguliers ; une palette Blue Note (crème, encre, bordeaux, jaune, bleu canard) et des titres très serrés complètent l'ensemble.
  5. Le contrôle. L'agent rend des images fixes aux moments clés, les assemble en planche et y repère les défauts : un titre invisible sur un aplat de la même couleur, des étiquettes qui se chevauchent, des débuts de scène vides. Le son est enfin normalisé au niveau d'écoute usuel des plateformes.

La première version durait 3 minutes 21.

5Le retour, puis la version 2

Benoît Raphaël a regardé la vidéo et dicté son retour : la voix est trop grave et pas assez claire, et « on est dans du jazz », donc il faut plus de dynamisme et de virtuosité ; le texte ne dit pas pourquoi Thomas comprend si bien les modèles ; il faut une musique plus vivante, avec des solos. Il a conclu :

plus rythme + make it better
RetourCe qui a changé
Voix molle, trop graveTrois voix essayées sur la même scène et mesurées. La voix retenue est plus haute et plus brillante, et elle module davantage. La direction de jeu est passée de « majordome flegmatique » à « présentateur de club de jazz, vif et malicieux ».
Pourquoi Thomas comprend« Voici Thomas. Ingénieur. Il code, il assemble des algorithmes : il a l'intuition de ce qui se passe dans la machine. » À l'image, des lignes de code s'affichent à côté de son portrait.
La source, c'est le web« Le modèle dit l'avoir lu sur le web ? "Donne-moi les URL." Puis : "La citation exacte." »
Le neuvième geste« Consolider » devient « récolter » : les mots qui ont marché vont dans la besace et resserviront au prochain morceau.
Musique plus vivanteDu hard bop à 161 battements par minute, avec des solos. La musique baisse sous la voix et revient en avant dans chaque respiration, comme un orchestre qui relance entre deux chorus. L'image donne un léger à-coup sur les temps forts.
Plus de rythmeDes silences plus courts entre les scènes et une voix plus rapide : la vidéo passe à 2 minutes 47. La musique démarre sur un temps fort, 22 secondes après son début, pour que sa vraie fin tombe sur le carton final.

6Un agent qui n'entend rien

L'agent voit des images fixes, mais il n'entend pas. Pour juger le son, il a remplacé l'oreille par des mesures.

Le jugement final reste humain : les deux versions ont été validées à l'écoute.

7Outils et coûts

8Ce qu'on en retient