Avant de commencer
Ce tutoriel s'adresse à toi si tu regardes des conférences ou des entretiens en anglais pour ton travail et que tu aimerais en tirer une ressource durable pour ton équipe, tes élèves ou ta communauté. Tu t'es déjà un peu servi d'un agent IA qui lit et écrit des fichiers, mais tu n'as jamais fabriqué de page web.
Ce qu'il te faut :
- un agent capable de lire et d'écrire des fichiers dans un dossier de ton ordinateur et de lancer des commandes : Claude Code, Claude Cowork, Codex ou un équivalent ;
- un dossier de travail vide, réservé à ce projet ;
- un navigateur web ;
- une vidéo YouTube qui a des sous-titres, automatiques ou manuels ;
- une connaissance du sujet de la vidéo. À l'étape 3, c'est toi qui corriges ce que la machine ne peut pas deviner.
Ce que tu n'as pas besoin de savoir :
- coder. L'agent écrit la page web, le petit code qui la fait vivre et les scripts de vérification ; toi, tu décris ce que tu veux et tu regardes ce que tu obtiens ;
- installer Python ou ses bibliothèques. L'agent s'en charge et te demande l'autorisation ;
- connaître l'API de YouTube. Une API, c'est la porte d'entrée qu'un service ouvre aux programmes pour qu'ils lui parlent. Il suffit de savoir que celle de YouTube existe pour la nommer à ton agent.
Un endroit où publier la page est facultatif. Sans hébergement, elle reste utilisable sur ton ordinateur ou se partage comme un fichier.
Le fil et les perles
Une image explique presque tout ce qui suit. Imagine un collier. Presque chaque étape produit un fichier, et ce fichier est une perle : le transcript brut, le transcript nettoyé, la fiche de lecture, les citations choisies, la page finale. Le fil qui traverse toutes les perles, c'est l'horodatage, ce repère du type « 00:12:56 » qui dit à quel moment de la vidéo une phrase est prononcée. Il entre dans le collier à la première étape et en ressort à la dernière, sous la forme d'un petit bouton ▶ à côté de chaque citation.
Deux règles en découlent. D'abord, on n'enfile jamais une perle sans le fil. Un résumé sans repère de temps, une citation sans sa minute, et le collier casse : à la fin, tu ne peux plus relier la phrase lue au moment de la vidéo, ni vérifier la source en un clic. Ensuite, chaque perle sert la suivante. On ne repart jamais de la vidéo, on repart du fichier précédent. C'est ce qui rend le travail vérifiable, puisque tu peux toujours remonter d'une perle à l'autre, et reprenable, puisqu'une nouvelle conversation avec ton agent peut repartir du dernier fichier sans rien savoir de la précédente.
Le collier en action : une phrase suivie de perle en perle
[00:05:15] if it's doing multiple steps in order to [00:05:17] achieve some objective. If the success [00:05:19] rate for any single one of those steps [00:05:20] is let's say 99%. Well, what do you do [00:05:22] if there's 100 steps involved? [00:05:24] >> You you need to have much higher nines
>> au milieu d'une phrase de Noam Brown, une ligne toutes les deux secondes.Noam Brown. [00:04:09] … You have an agent, and if it's doing multiple steps in order to achieve some objective, if the success rate for any single one of those steps is, let's say, 99%, well, what do you do if there's 100 steps involved? …
Noam Brown. [00:04:09] … You have an agent, and if it's doing multiple steps in order to achieve some objective, if the success rate for any single one of those steps is, let's say, 99%, well, what do you do if there's 100 steps involved? …
« Si chaque étape réussit à 99 %, que faites-vous quand il y en a cent ? »
“If the success rate for any single one of those steps is, let's say, 99%, well, what do you do if there's 100 steps involved?”
Si chaque étape réussit à 99 %, que faites-vous quand il y en a cent ?
Pour le début de la chaîne, j'ai appelé trois compétences toutes faites de mon IA : une pour la transcription, une pour le nettoyage du transcript, une pour la fiche de lecture. Tout ce qui concerne la page (le choix des citations, la mise en scène, la construction, la traduction des extraits, le déroulé, les sous-titres, la mise en ligne) s'est fait sans compétence dédiée, par la conversation. Des messages aussi courts suffisent parce que mon IA connaît mon univers : mes règles d'écriture, ma charte graphique, mes méthodes, la procédure de mon dépôt de publication. Elle garde aussi la mémoire du travail en cours, si bien que « go » est une consigne complète.
Mon carnet de travail comptait treize étapes sur deux sessions ; je les ai regroupées ici en huit. Chaque étape se lit comme une partition à trois voix : ce que j'ai dit, ce que mon IA a fait, ce que j'ai décidé ou vérifié. La consigne détaillée, repliée en bas de chaque étape, sert à qui travaille avec un agent qui ne le connaît pas encore.
Étape 1. Récupérer le transcript horodaté
Tout commence par le texte complet de la vidéo, avec pour chaque ligne le moment où elle est prononcée. C'est le nœud du fil. Ce premier fichier, le brut, sert aussi de référence : c'est lui qu'on relira pour trancher un passage douteux ou recaler un bouton à la seconde près, parce que le transcript nettoyé ne gardera que l'heure de début de chaque réplique. Il ne faut donc jamais y toucher.
/transcript + /nettoyage-transcript [lien de la vidéo]. Tu mettras l'interview dans la bibliothèque.
Elle a lu les sous-titres de la vidéo sans la télécharger et les a écrits dans un fichier brut, une ligne par segment, chacune précédée de son horodatage. Elle a ensuite rangé l'entretien dans la bibliothèque de mon second cerveau, parce que ses consignes permanentes le prévoient pour toute source de ce genre.
J'ai choisi la vidéo, et c'est à peu près tout pour cette étape. Si tu veux contrôler, regarde que la dernière ligne correspond à la durée de la vidéo, puis saute à deux ou trois horodatages pour vérifier que la phrase entendue est bien celle du fichier.
Pour mes 55 minutes d'entretien, le brut faisait 1 716 lignes et environ 13 500 mots : un mur de texte sans ponctuation, illisible en l'état. C'est normal, la suite s'en occupe. Autre piège : si ton agent tourne sur un serveur distant plutôt que sur ton ordinateur, YouTube bloque souvent la récupération des sous-titres. Lance donc cette étape en local.
Mon IA fait tout cela sans que j'aie à le préciser. Si ton agent part de zéro, voici la consigne qui le décrit.
Si ton agent part de zéro : la consigne détaillée
Je veux travailler sur cette vidéo YouTube : [URL].
Récupère ses sous-titres sans télécharger la vidéo, par exemple avec la bibliothèque Python youtube-transcript-api. Prends les sous-titres manuels s'il y en a, les automatiques sinon.
Écris-les dans un fichier texte brut, transcript-brut.txt, dans le dossier de travail : une ligne par segment, au format [HH:MM:SS] texte.
Ce fichier est notre référence. Ne le corrige pas, et ne le modifie jamais par la suite, même quand on travaillera sur d'autres fichiers.
Pour finir, dis-moi combien de lignes et de mots il contient, et quelle durée il couvre.Étape 2. Nettoyer le transcript, en morceaux
Les sous-titres automatiques sont une suite de fragments sans ponctuation, pleins d'hésitations, avec des noms propres déformés et des changements de locuteur mal repérés. Cette étape en fait un dialogue lisible, en tours de parole, chacun daté : la deuxième perle, toujours enfilée sur le fil. La difficulté vient de la longueur. Un entretien d'une heure chargé en un seul bloc dans la mémoire de travail de l'agent dégrade son attention, bien avant que cette mémoire soit pleine : c'est ce qu'on appelle le context rot, le pourrissement du contexte. D'où le découpage en morceaux, confiés à des sous-agents. Un sous-agent est une copie de l'agent lancée à part, avec sa propre mémoire vierge, qui traite sa part et ne rend qu'un rapport.
(le même message qu'à l'étape 1)
Elle a coupé le brut en trois morceaux et confié chacun à un sous-agent, qui l'a remis en tours de parole datés, en anglais, sans hésitations ni répétitions. Elle a attribué les répliques d'après le sens, recollé les morceaux, vérifié les jointures et retiré un message publicitaire. Les passages qu'elle ne pouvait pas trancher, elle les a marqués entre crochets au lieu de deviner.
Rien à ce stade : le travail de correction m'attendait à l'étape suivante. Si tu veux contrôler, lis les deux premières minutes en écoutant la vidéo, et assure-toi que la liste des doutes existe. Une liste vide sur une heure d'entretien signifie que l'agent a deviné.
Les marqueurs de changement de locuteur de YouTube se sont révélés souvent faux : seule l'attribution par le sens tenait. Et la reconnaissance vocale massacre les noms : « Noom » pour Noam, « GPD6 » pour GPT-6, « RHF » pour RLHF. À l'arrivée, j'avais environ 10 600 mots en 106 tours de parole, neuf passages marqués comme douteux et un message publicitaire de 37 secondes en moins.
Mon IA fait tout cela sans que j'aie à le préciser. Si ton agent part de zéro, voici la consigne qui le décrit.
Si ton agent part de zéro : la consigne détaillée
Dans le dossier de travail, transcript-brut.txt contient les sous-titres horodatés d'un entretien vidéo, une ligne par segment au format [HH:MM:SS] texte. Ne le modifie pas.
Produis un transcript nettoyé, transcript-nettoye.md, en suivant cette méthode.
1. Découpe le brut en trois morceaux à peu près égaux, en coupant à un changement de locuteur.
2. Si tu sais déléguer à des sous-agents, confie un morceau à chacun, en parallèle. Sinon, traite-les l'un après l'autre.
3. Consignes pour chaque morceau :
- rester en anglais, aucune traduction à ce stade ;
- rendre des tours de parole « Interviewer » / « [nom de l'invité] » ;
- garder l'horodatage du début de chaque tour ;
- retirer hésitations et répétitions sans toucher au sens ;
- corriger les erreurs de reconnaissance vocale quand le contexte les rend évidentes ;
- attribuer chaque réplique d'après le sens, pas d'après les marqueurs de changement de locuteur des sous-titres, souvent faux ;
- marquer entre crochets tout passage incertain et le lister, ne jamais deviner.
4. Recolle les morceaux, vérifie les jointures (aucune réplique coupée ni doublée) et retire les éventuels messages publicitaires.
5. Ajoute en tête du fichier une courte présentation factuelle de la source : titre, émission, invité, URL, durée.
Rends-moi ensuite la liste complète des passages douteux, avec leur horodatage.Étape 3. Lever les doutes avec ton propre savoir
Cette étape est la tienne. Un agent ne peut pas connaître un modèle sorti après son entraînement, ni une expression d'initié prononcée vite. S'il devine, il invente avec aplomb ; s'il marque son doute, il faut quelqu'un pour trancher. Sauter cette étape, c'est publier des citations fausses sous un bouton qui prétend renvoyer à la source : une perle fêlée sur un fil intact, que personne ne remarque. Je la place ici dans l'ordre logique ; dans les faits, j'ai levé ces doutes plus tard, au moment de lancer la page.
Astra est le dernier modèle d'OpenAI (GPT-6 Astra). Quels sont les autres passages douteux ?
1. what is very fast… 2. with these models 3. and years 4. deep research 5. Five Codexes in a trench coat ? 6. GPT 5.6 Sol. C'est un journaliste, pas une journaliste.
Elle m'a listé les passages encore douteux, chacun avec son horodatage et la phrase brute. Après ma réponse, elle a appliqué mes corrections dans le transcript et retiré les marques de doute réglées.
J'ai corrigé des expressions mal reconnues (« deep research », « with these models », « and years »), l'expression « five Codexes in a trench coat », les noms de deux modèles récents, « GPT-6 Astra » et « GPT-5.6 Sol », et le genre de l'intervieweur : l'entretien était mené par un journaliste et non par une journaliste. Cela m'a pris environ une minute. Le modèle, lui, ne pouvait que signaler son doute.
Mon IA fait tout cela sans que j'aie à le préciser. Si ton agent part de zéro, voici la consigne qui le décrit.
Si ton agent part de zéro : la consigne détaillée
Dans le dossier de travail, transcript-nettoye.md est le transcript nettoyé d'un entretien vidéo ; les passages incertains y sont marqués entre crochets. transcript-brut.txt est la version brute horodatée, à ne pas modifier.
Liste les passages encore douteux du transcript nettoyé, classés en trois groupes :
1. ceux que tu peux régler seul en relisant le contexte (règle-les et dis-moi ce que tu as choisi) ;
2. ceux pour lesquels tu as une hypothèse solide (donne-la) ;
3. ceux qu'il faut écouter.
Pour chacun, donne l'horodatage et la phrase brute correspondante.
Je te réponds ensuite. Tu appliques alors mes corrections dans transcript-nettoye.md et tu retires les marques de doute réglées.Étape 4. Digérer l'entretien en mouvements
La fiche de lecture découpe l'entretien en grandes parties thématiques, que j'appelle des mouvements, comme dans un morceau de musique. Pour chacun, elle dégage l'idée centrale, les concepts à expliquer et des citations exactes, datées et traduites. Elle protège aussi d'un contresens précis, qui consiste à prêter à l'invité ce qu'a dit le journaliste. Chaque citation garde sa minute : le fil passe dans cette perle-là comme dans les autres.
Peux-tu faire une /fiche-de-lecture ?
Elle a repéré les mouvements de l'entretien, puis confié deux mouvements à chacun de ses sous-agents. Elle a rédigé la fiche à partir de leurs rapports et vérifié chaque citation contre le transcript par une recherche exacte.
J'ai demandé la fiche, et je l'ai demandée pour moi avant de penser à une page. Si tu veux contrôler, lis la liste des mouvements, puis va écouter deux citations prises au hasard à leur horodatage.
Ici, c'est la vérification qui s'est trompée, pas la fiche. Mon IA a cru qu'une formule (« par une marge assez large ») avait été inventée par un sous-agent, et elle l'a retirée. La formule figurait bien dans l'entretien : la recherche avait échoué parce qu'elle était coupée par un retour à la ligne. Mon IA l'a rétablie à l'étape suivante. Les seize citations de la fiche étaient en réalité exactes.
Mon IA fait tout cela sans que j'aie à le préciser. Si ton agent part de zéro, voici la consigne qui le décrit.
Si ton agent part de zéro : la consigne détaillée
Dans le dossier de travail, transcript-nettoye.md est le transcript d'un entretien, en tours de parole horodatés. Fais-en une fiche de lecture, fiche-de-lecture.md.
1. Repère cinq à sept mouvements thématiques, chacun avec son horodatage de début et de fin.
2. Si tu peux déléguer à des sous-agents, confie deux mouvements à chacun. Sinon, traite-les un par un. Pour chaque mouvement, le format attendu est :
- la thèse centrale ;
- l'idée à emporter ;
- trois à cinq citations exactes, copiées du transcript, avec leur horodatage et leur traduction française ;
- les concepts du passage, expliqués pour un profane cultivé.
Règle absolue : ne jamais attribuer à l'invité une phrase de l'intervieweur.
3. Rédige la fiche à partir de ces rapports.
4. Vérifie chaque citation contre le transcript par une recherche exacte. Si une citation semble introuvable, relis le passage autour avant de conclure qu'elle est inventée : la phrase peut être coupée par un retour à la ligne.Étape 5. Choisir les citations longues
Les citations de la fiche servent à résumer. Celles de cette étape servent à faire entendre la voix de l'invité dans la page : une quinzaine de passages longs, en anglais, avec leur traduction et leur horodatage. C'est un choix éditorial, et c'est à ce moment que tu orientes la page vers ce qui sert ton public.
Peux-tu me sortir 15 longues citations intéressantes, les deux que tu viens de citer + d'autres. Une sur le creative writing, une sur les leçons de l'incident Hugging Face, je te laisse choisir le reste, utilise ta connaissance générale au sens large pour choisir.
Elle a sorti quinze citations, chacune en anglais, traduite et horodatée. Elle a retenu des passages sur la fiabilité qui se cumule sur cent étapes, sur le travail qui se déplace vers les 10 % que l'IA fait mal, sur l'analogie du singe et sur la chaîne de pensée qu'il ne faut pas punir. Elle a aussi relié trois d'entre eux par l'effet Hawthorne, selon lequel on change de conduite quand on se sait observé, et par la loi de Goodhart, selon laquelle une mesure devenue un objectif cesse d'être fiable.
J'ai imposé deux thèmes qui comptent pour mes lecteurs et laissé le reste à son jugement. Je n'avais pas vu le lien entre les trois passages. Relis les traductions à voix haute : une phrase qui sonne anglais en français est un calque, à faire reprendre.
Mon IA fait tout cela sans que j'aie à le préciser. Si ton agent part de zéro, voici la consigne qui le décrit.
Si ton agent part de zéro : la consigne détaillée
Dans le dossier de travail, transcript-nettoye.md est le transcript d'un entretien, en tours de parole horodatés, et fiche-de-lecture.md en est la fiche de lecture.
Lis l'entretien en entier, toi-même, sans déléguer. Sors-moi quinze longues citations, choisies pour leur portée au-delà de l'entretien : des idées qui serviront à mes lecteurs, [décris ton public], dans leur propre travail. Au moins une doit porter sur [thème qui m'intéresse] et une sur [autre thème].
Pour chacune, donne :
- le texte anglais exact, copié du transcript ;
- sa traduction française, fidèle sans être calquée sur l'anglais ;
- son horodatage.
Si certaines citations se répondent entre elles, dis-moi lesquelles et pourquoi.
Écris le tout dans citations.md.Étape 6. Demander des propositions de mise en scène
Si tu dis « fais-moi une page », l'agent produit la page moyenne, celle qu'il a vue mille fois. Demande-lui plutôt des options. Tu restes aux commandes, et tu découvres des formes auxquelles tu n'aurais pas pensé : on explore plusieurs pistes avant de choisir.
Quelle mise en scène pour rendre la lecture plus vivante ? Fais-moi des propositions, utilise ta connaissance générale.
Top. On fait ça.
Elle m'a proposé sept briques : un texte synchronisé avec la vidéo, une architecture d'entretien de magazine (mouvements, intertitres, exergues, sommaire qui reste à l'écran), un glossaire au survol, de petits schémas interactifs sur les idées chiffrées, des encadrés de contexte, un bouton bilingue par réplique et une entrée « en deux minutes ».
J'ai retenu les trois premières. En cours de route se sont ajoutés un calculateur (l'un des petits schémas interactifs sur les idées chiffrées), l'entrée « en deux minutes » et les versions originales dépliables.
Mon IA fait tout cela sans que j'aie à le préciser. Si ton agent part de zéro, voici la consigne qui le décrit.
Si ton agent part de zéro : la consigne détaillée
Dans le dossier de travail, fiche-de-lecture.md découpe un entretien vidéo en mouvements thématiques, avec leurs concepts et leurs citations, et citations.md rassemble les extraits que j'ai retenus, chacun en anglais, en français et avec son horodatage.
Je veux faire de cet entretien une page web de lecture en français pour [ton public], avec la vidéo intégrée. La page ne publiera pas la traduction intégrale de l'entretien : seulement des extraits au service d'un commentaire.
Quelle mise en scène rendrait la lecture plus vivante et ferait mieux comprendre les idées ? Fais-moi six ou sept propositions concrètes, chacune en deux lignes, puis recommande une combinaison de deux ou trois. Pars de ce qu'on a déjà : les mouvements, les citations horodatées, les concepts de la fiche. Ne construis rien pour l'instant.Étape 7. Construire la page et la tester
Voici la perle où le fil ressort sous forme de bouton ; l'étape 8 la complétera. La page est un seul fichier HTML qui s'ouvre dans un navigateur : la vidéo fixée à côté du texte, les extraits traduits avec leur bouton ▶, l'extrait en cours qui s'éclaire pendant la lecture, le glossaire, le résumé d'entrée. Une page jolie dont les boutons pointent au mauvais endroit, ou dont les citations ont dérivé en route, ne vaut rien : les contrôles font partie de l'étape.
go
super interface
Elle a construit la page dans ma charte graphique : six mouvements, seize termes de glossaire et un calculateur à deux curseurs (99 % de réussite par étape sur 100 étapes donnent 37 % de réussite globale). En cours de route se sont ajoutés un encadré de contexte limité à ce que dit l'entretien et un bloc « Notre lecture », qui porte mon commentaire personnel. Elle a vérifié par un script que chaque version originale figurait mot pour mot dans le transcript, fait des captures d'écran en largeur ordinateur et téléphone, puis servi la page sur une adresse locale pour que je l'ouvre.
J'ai ouvert la page et jugé l'interface. Avant de publier, clique sur cinq boutons ▶ et écoute : la phrase entendue doit être celle qui est citée. Rétrécis aussi la fenêtre pour voir la version téléphone.
La mécanique du bouton ▶
- 100:05:17 → 317 secondes
- 2
<button data-t="317"> - 3
Ouverte depuis le disque par un double-clic, la page ne s'identifie pas auprès de YouTube, qui refuse l'intégration. Servie par un petit serveur local ou mise en ligne, elle s'identifie et la vidéo s'affiche.
J'ai d'abord ouvert le fichier par un double-clic, directement depuis le disque. La vidéo affichait « Erreur 153 » : YouTube exige que la page qui intègre la vidéo s'identifie, par l'adresse qu'envoie le navigateur, et une page ouverte depuis le disque ne s'identifie pas. Une fois la page servie par un petit serveur local, la vidéo s'affiche. Pour la mise en ligne, mon IA a ajouté une balise qui empêche le navigateur de retirer cette identification ; elle ne remplace pas le serveur local. Le piège est revenu dans la session suivante. Le contrôle par script a aussi trouvé une version originale qui ne correspondait pas mot pour mot au transcript, et mon IA l'a corrigée.
Mon IA fait tout cela sans que j'aie à le préciser. Si ton agent part de zéro, voici la consigne qui le décrit ; adapte la liste « Mise en page » aux briques retenues à l'étape 6.
Si ton agent part de zéro : la consigne détaillée
Dans le dossier de travail : fiche-de-lecture.md (mouvements, concepts, citations d'un entretien vidéo), citations.md (extraits retenus, en anglais et en français, avec horodatage) et transcript-nettoye.md (le transcript de référence). La vidéo est à cette adresse : [URL].
Construis une page HTML autonome, page.html : un seul fichier, polices et vidéo chargées depuis Internet.
Mise en page :
- la vidéo YouTube fixée à droite sur ordinateur, en haut sur téléphone ; le texte à gauche, organisé par mouvements, avec un sommaire ;
- chaque extrait cité porte sa traduction, sa version originale dépliable et un bouton ▶ avec son horodatage ;
- un clic sur ce bouton fait sauter la vidéo à ce moment, grâce à l'API IFrame de YouTube ; pendant la lecture, l'extrait en cours s'éclaire ;
- une entrée « En deux minutes » en haut de page ;
- un glossaire au survol (au toucher sur téléphone) pour les concepts de la fiche ;
- [l'élément interactif que j'ai choisi].
Style sobre et lisible.
Ensuite, trois contrôles :
1. vérifie par un script que chaque version originale figure mot pour mot dans transcript-nettoye.md, et corrige celles qui ont dérivé ;
2. fais des captures d'écran en largeur ordinateur et en largeur téléphone, et regarde-les ;
3. sers la page avec un petit serveur local et donne-moi l'adresse http://localhost:... pour que je l'ouvre.Étape 8. Compléter pour le lecteur francophone, puis publier
À la fin de l'étape 7, le lecteur francophone a les extraits clés, mais pas le fil complet de l'échange, et la vidéo parle anglais. Cette étape, faite dans une seconde session, lui donne accès à tout l'entretien sans en publier la traduction intégrale : les sous-titres traduits par YouTube pour qui veut tout écouter, et un déroulé résumé en français pour suivre l'échange. Elle recale aussi les boutons trop approximatifs, en revenant au brut : c'est là que sert la première perle, gardée intacte depuis le début.
J'ai besoin que tu ajoutes dans cette page la traduction du transcript en français, donne-moi les options.
Option 1.
Le problème est que la vidéo est sous-titrée en anglais, les Français ne vont pas comprendre.
Essaie l'option 2 alors.
C'est très bien.
Prépare la mise en ligne.
Push.
Plutôt que de traduire tout l'entretien, elle m'a proposé trois options : des citations traduites dans chaque mouvement, un compte rendu détaillé en français, ou un panneau « Écouter la source » par mouvement. J'ai choisi la première, puis je lui ai demandé d'essayer aussi la deuxième, qu'elle a réalisée comme un résumé écrit avec ses mots plutôt que comme une traduction. Après mon objection sur les sous-titres, elle a réglé le lecteur pour afficher par défaut les sous-titres traduits en français par YouTube, avec la marche à suivre manuelle dans la légende. La page a reçu, à la fin de chaque mouvement, un déroulé résumé en français, chaque étape avec son bouton ▶. Avant la mise en ligne, mon IA a vérifié que la page ne contenait ni secret ni donnée personnelle, qu'elle ne dépendait d'aucun fichier de mon ordinateur, et m'a signalé qu'elle serait indexée par les moteurs de recherche faute de balise noindex. Une page non indexée n'est pas pour autant privée : quiconque a le lien peut la lire.
J'ai vu ce que mon IA n'avait pas vu : une vidéo sous-titrée en anglais reste incompréhensible pour un lecteur français. J'ai choisi entre ses options, puis donné le feu vert à la publication. Relis en entier ce qui sera publié en ton nom, le déroulé comme le commentaire.
Le transcript nettoyé ne date que le début de chaque réplique : quand on cite une phrase au milieu d'une longue réponse, le bouton lance la vidéo au début de la réponse. Personne ne l'a vu tout de suite. Sur ma page, deux paires d'extraits partageaient le même horodatage (00:44:43 et 00:50:17), et la solution passait par le brut, horodaté segment par segment. Autre limite : YouTube ne documente pas officiellement le choix de la piste traduite dans un lecteur intégré, et sa traduction reste approximative sur le vocabulaire technique ; les extraits traduits de la page font foi. Enfin, mon IA m'a déconseillé d'aller au-delà de 26 extraits traduits, pour que les citations ne prennent pas le pas sur le commentaire.
J'ai un dépôt de publication où toute page ajoutée est mise en ligne à une adresse fixe, et mon IA en connaît la procédure. Si tu n'en as pas, ta page autonome peut aller sur un hébergement gratuit de pages statiques, comme GitHub Pages (gratuit pour un dépôt public, donc lisible par tous) ou Netlify (offre gratuite avec quota). Je n'ai pas testé cette voie : demande à ton agent de te guider, et fais-lui faire les trois mêmes vérifications avant.
Mon IA fait tout cela sans que j'aie à le préciser. Si ton agent part de zéro, voici les trois consignes qui le décrivent, à envoyer l'une après l'autre : d'abord les sous-titres traduits, puis le déroulé résumé, enfin le recalage des boutons.
Si ton agent part de zéro : la consigne détaillée 1 sur 3
Dans le dossier de travail, page.html est une page de lecture qui intègre une vidéo YouTube par l'API IFrame.
Règle le lecteur YouTube pour qu'il affiche par défaut les sous-titres traduits automatiquement en français par YouTube : paramètres du lecteur, et choix de la piste française par l'API. Indique-le dans la légende sous la vidéo, avec la marche à suivre manuelle si cela ne s'active pas (⚙ › Sous-titres › Traduire automatiquement › Français).Si ton agent part de zéro : la consigne détaillée 2 sur 3
Dans le dossier de travail, page.html est une page de lecture organisée par mouvements, et transcript-nettoye.md est le transcript horodaté de l'entretien qu'elle commente.
À la fin de chaque mouvement de la page, ajoute un bloc dépliable intitulé « Le déroulé de ce passage, résumé en français ». Il suit tout le fil de l'échange, étape par étape ; chaque étape porte un bouton ▶ horodaté et deux ou trois phrases écrites avec tes propres mots. Fais apparaître les questions et les objections de l'intervieweur.
C'est un résumé, pas une transposition réplique par réplique au discours indirect.
Ajoute en pied de page que ce déroulé résume l'entretien sans le traduire.Si ton agent part de zéro : la consigne détaillée 3 sur 3
Dans le dossier de travail, page.html porte des extraits cités avec un bouton ▶ horodaté, et transcript-brut.txt contient les sous-titres d'origine, horodatés segment par segment.
Cherche dans la page les extraits qui partagent le même horodatage, ainsi que les citations prises au milieu d'une longue réponse. Pour chacun, retrouve dans transcript-brut.txt la seconde exacte où la phrase citée commence, et recale le bouton sur cette seconde. Donne-moi la liste des boutons modifiés, avec l'ancien et le nouvel horodatage.Ce que j'en retiens
Partager les rôles.
Mon IA exécute et contrôle : elle récupère, nettoie, découpe, vérifie chaque citation, construit et teste. Moi, je choisis ce qui compte pour mes lecteurs, j'apporte ce qu'elle ne peut pas savoir, et je regarde le résultat avec les yeux de celui qui va le lire. Aucun de ces gestes ne remplace l'autre.
Garder le fil d'un bout à l'autre.
Décide dès la première étape quelle information doit traverser toute la chaîne, ici l'horodatage, et exige-la à chaque perle. Garde aussi la matière brute intacte : c'est elle qui permet, à la fin, de réparer ce que les étapes intermédiaires ont simplifié. Sur un autre projet, le fil peut être un numéro de page, une référence de source ou un identifiant client.
Découper pour ne pas saturer l'agent.
Un long document chargé en un seul bloc dégrade l'attention du modèle bien avant que sa mémoire de travail soit pleine. Coupe la matière en morceaux, confie chacun à un sous-agent, et fais la synthèse à partir de leurs rapports plutôt que du texte entier. Si ton agent ne sait pas déléguer, il traite les morceaux l'un après l'autre ; une conversation neuve par morceau protège encore mieux son attention.
Faire vérifier par la machine, et vérifier la vérification.
Une recherche exacte de chaque citation dans la source attrape les dérives. Mais une recherche mal construite peut accuser à tort, comme celle qui a fait disparaître une formule bien réelle de ma fiche. Quand un contrôle contredit le texte, relis le passage avant de corriger.
Régler avec ton savoir ce que la machine ne peut pas deviner.
Les noms récents, les expressions de métier, l'identité des intervenants échappent à la reconnaissance vocale comme à la mémoire du modèle. Demande à l'agent de marquer ses doutes plutôt que de deviner, puis tranche toi-même. Ma minute de corrections a été la plus rentable de toute la chaîne.
Faire proposer avant de faire construire.
Demander des options de mise en scène donne une meilleure page que « fais-moi une page ». Demander des options plutôt qu'une traduction intégrale m'a évité de publier ce que je n'avais pas le droit de publier. Un désaccord découvert après la construction coûte du temps à tout le monde.
Qui a vu quoi.
Pour être exact sur le partage :
- mon IA a vu seule qu'il fallait vérifier chaque citation contre le transcript, découper le travail entre sous-agents, contrôler la page avant publication et proposer des options plutôt qu'une traduction intégrale ;
- elle a raté puis rattrapé seule la citation qu'elle avait accusée à tort d'être inventée ;
- elle a raté, et c'est moi qui l'ai vu, que des sous-titres anglais resteraient incompréhensibles pour un lecteur français ;
- personne n'a vu tout de suite que des boutons partageaient le même horodatage.
Combien de temps ça prend
Compte une session de travail, plus une seconde pour les finitions. Il m'a fallu environ une heure d'échanges pour aller de la demande de transcript au prototype de page, et le tout a tenu dans la même journée. En tout, j'ai écrit une vingtaine de messages courts sur ces deux sessions, du genre « go » ou « Top. On fait ça », plus ma liste de corrections. Ajoute à ce temps celui de ta propre vérification : écouter les passages douteux, tester les boutons, relire le déroulé écrit en ton nom. Prévois aussi que la chaîne consomme beaucoup de ton quota, parce qu'elle lit l'entretien plusieurs fois et lance plusieurs sous-agents ; sur un abonnement limité, ça se sent.
Pour travailler comme ça
Les consignes détaillées te permettent d'essayer avec un agent vierge. Mais la souplesse que tu as vue dans mes messages vient d'ailleurs : d'une IA qui connaît ton univers, tes règles, ta charte, tes méthodes, et qui garde la mémoire de ce que vous avez déjà fait ensemble. C'est ce que construit le bootcamp IA personnelle : cinq modules, six mois d'accompagnement et un live chaque semaine. Les inscriptions passent pour l'instant par une liste d'attente.
Voir le résultat
La page que mon IA a construite avec cette chaîne est en ligne : Noam Brown : « Ce n'est plus une préoccupation théorique ». Clique sur quelques boutons ▶, déplie un déroulé, survole le glossaire : tu verras chaque perle à sa place sur le fil.
La même chaîne fonctionne pour une conférence, un cours ou n'importe quel entretien. Une fois que tu l'as rodée sur une vidéo, transforme ces consignes en compétences réutilisables de ton agent : la prochaine fois, une ligne suffira.
Ce tutoriel a été fabriqué de la même manière : quelques messages de ma part, une équipe d'agents IA pour la pédagogie, la rédaction, la mise en page et la relecture, puis mon jugement.