La voix éditoriale, ou pourquoi l'IA ne vous fera jamais le dernier kilomètre
Trente scripts plus tard, je peux nommer précisément ce qui sépare un contenu IA insupportable d'un contenu IA qu'on regarde jusqu'au bout. Ce n'est ni le rendu, ni la prosodie, ni les sous-titres. Voici le seul truc qu'on ne peut pas déléguer.
J'ai testé, en mars 2026, de générer intégralement un script WhyFactory avec un LLM, en lui donnant le doc éditorial de la chaîne en contexte. Le résultat était techniquement irréprochable. La structure tenait. Les twists étaient à leur place. Les chiffres étaient sourcés. La longueur correspondait au format.
Et c'était insupportable à regarder.
Pas mauvais — insupportable. Le viewer faisait la différence en huit secondes. Le test était sec : trois épisodes générés au LLM en parallèle de mes scripts manuels, publiés dans la même fenêtre horaire sur trois chaînes comparables. Médiane des trois LLM : taux de complétion à 23%. Médiane des trois manuels : 67%. Trois fois moins.
Le résultat m'a forcé à formaliser ce que je faisais sans m'en rendre compte. Trente scripts plus tard, je peux nommer précisément ce qui sépare un contenu IA insupportable d'un contenu qu'on regarde jusqu'au bout — et ce n'est ni le rendu, ni la prosodie, ni la qualité des sous-titres. C'est ce que j'appelle, faute de meilleur mot, la voix éditoriale. Et c'est, à ma connaissance, le seul aspect d'une production vidéo qu'on ne peut pas déléguer à un agent IA en 2026.
Ce qui suit est ce que j'ai appris.
Le décalage fondamental
Quand un LLM écrit un script court, il écrit comme un narrateur de documentaire. Le ton est posé, neutre, organisé autour de l'information à transmettre. « L'histoire du clavier AZERTY remonte à 1873, époque où les machines à écrire... ». C'est lisible. C'est correct. Et c'est exactement ce que personne ne regarde jusqu'au bout.
Le viewer d'un short ne cherche pas un narrateur. Il cherche un proche qui vient de découvrir quelque chose et qui n'arrive pas à le garder pour lui. La différence est minuscule, et elle pèse plus que tout le reste de la production. Un script qui ouvre par « j'ai appris un truc et j'arrive même pas à m'en remettre » place immédiatement le narrateur au même niveau que le viewer. Tous deux sont en train d'apprendre, ensemble, en temps réel. Le narrateur n'a pas le savoir avant — il l'a en même temps. L'asymétrie est nulle.
L'asymétrie est exactement ce que produit un LLM par défaut. Le LLM, structurellement, sait avant d'écrire. Il a déjà parsé la totalité du sujet, il a déjà choisi quoi mettre en avant, il a déjà classé. Quand il rédige « le clavier AZERTY remonte à 1873 », il transmet une information posée à un viewer qu'il considère ignorant. Cette posture-là, dans le format vidéo court, vaut un swipe immédiat.
Les cinq mécanismes qui font tenir une voix
La voix éditoriale, ce n'est pas du style. C'est un assemblage de cinq mécanismes qu'on peut identifier et reproduire — mais qu'aucun LLM n'opère naturellement parce qu'aucun n'est intuitif pour qui n'a pas écrit trente scripts manuellement.
Premier mécanisme : la découverte synchrone. Le narrateur découvre avec le viewer, pas devant lui. Concrètement, ça se traduit par un « je » affirmé dès la première phrase, et par des marqueurs explicites de découverte : « j'ai appris », « je viens de comprendre », « je suis tombé sur un truc ». Pas « saviez-vous que », qui place immédiatement le narrateur au-dessus. Pas « il faut savoir que », qui sermonne. Le repère pratique : si vous pouvez remplacer la première phrase de votre script par « laissez-moi vous expliquer » sans rien casser, votre script est déjà mort.
Deuxième mécanisme : l'opinion assumée. Un narrateur sans opinion est anonyme, donc oubliable. « Personnellement, je trouve ça lunaire. » « J'ai d'ailleurs ma préférence pour... » « Honnêtement, je vous comprends si vous trouvez ça absurde. » Ces formulations sont absentes des scripts générés par LLM par défaut, parce que le LLM est entraîné à éviter les opinions personnelles non sourcées. Vous devez les remettre manuellement à chaque passe. C'est non négociable.
Troisième mécanisme : le fait comme plot twist. Une information à l'état brut est encyclopédique ; une information précédée d'un « sauf que » devient un retournement. « Le clavier AZERTY a été conçu pour ralentir la frappe » est anecdotique. « Le clavier AZERTY a été conçu pour ralentir la frappe — sauf qu'aujourd'hui personne ne s'en souvient et il survit par pure inertie » est un récit. Le second porte un mouvement narratif, le premier est inerte. La différence est presque toujours dans la conjonction.
Quatrième mécanisme : l'anticipation du viewer. « Pour celles et ceux qui pensent que c'est de l'IA, je vous comprends. » « Je sais ce que vous vous dites en m'entendant. » « Ceux qui sous-estiment ce chiffre, n'oubliez jamais que... » Cette technique-là collapse la distance entre la voix et la personne qui regarde. Le viewer se sent vu, anticipé. Il ne se contente plus de consommer ; il devient interlocuteur. Aucun LLM ne le fait spontanément.
Cinquième mécanisme : le CTA tissé. « D'ailleurs, on est bientôt cent mille », glissé entre deux segments factuels, est un CTA invisible. « Abonnez-vous pour soutenir le contenu », posé en outro, est une sortie de récit. Le premier maintient le viewer dans le flux ; le second l'éjecte. La distinction est petite ; ses effets sur la complétion sont massifs. Un script LLM produit systématiquement le second sans intervention humaine.
Ces cinq mécanismes, mis bout à bout, ne fabriquent pas un script. Ils fabriquent une présence. Une présence qui a un timbre, une opinion, une manière de découvrir, une manière de s'adresser à vous. Cette présence est ce qui vous fait rester jusqu'au bout d'un short, et c'est exactement ce qu'aucune génération automatique ne produit.
Pourquoi le LLM ne s'en sort pas en l'état
Une objection raisonnable : si la voix tient en cinq mécanismes nommables, pourquoi un LLM bien prompté ne pourrait-il pas les appliquer ? J'ai essayé. Les résultats partiels existent — un LLM avec un prompt suffisamment détaillé reproduit certains des cinq mécanismes. Mais il rate systématiquement deux choses, et ces deux choses suffisent à faire baisser la qualité d'au moins 40%.
La première est la justesse du moment où chaque mécanisme s'applique. Un « sauf que » posé au troisième segment fonctionne ; le même « sauf que » posé au sixième tombe à plat, parce que l'arc dramaturgique du script ne le supporte plus. Cette justesse-là demande une lecture du contexte narratif à l'échelle de l'épisode entier, dans une grille de cadence qu'aucun LLM ne maîtrise sans humain dans la boucle. Le LLM applique le mécanisme correctement, mais au mauvais endroit.
La deuxième est la cohérence du timbre sur la durée. Un humain qui écrit dix scripts d'une chaîne porte la même voix tout au long, sans même y penser. Un LLM, même prompté avec un doc éditorial, dérive insensiblement d'un script au suivant. La voix au script 1 est légèrement plus assertive qu'au script 10 ; les opinions sont posées avec une emphase variable ; les marqueurs de découverte glissent vers une formulation plus neutre à mesure que la fenêtre de contexte se remplit. Sur un short isolé, le glissement est invisible. Sur une chaîne entière, l'audience le sent — et ne sait pas le nommer, mais arrête de revenir.
Le rôle réel du LLM dans l'écriture
L'enseignement n'est pas « n'utilisez pas de LLM pour écrire ». C'est : utilisez-le pour les opérations où sa neutralité est un atout, pas un défaut. Trois cas où il fonctionne admirablement bien :
- La recherche factuelle. « Donne-moi trois sources primaires sur l'histoire du tube Pringles, avec dates et noms. » C'est exactement ce que le LLM fait le mieux : compiler du factuel récupérable.
- La reformulation locale. « Cette phrase est lourde, propose-moi trois alternatives qui gardent le sens mais raccourcissent. » Le LLM excelle sur la transformation à l'échelle de la phrase ou du paragraphe.
- La validation structurelle. « Repère les segments où il manque un twist avant la huitième seconde. » Outil de check-list, pas de génération.
Ce que le LLM ne doit jamais faire, dans mon flux : écrire le premier jet d'un script. Le premier jet est l'endroit où la voix s'installe — où la présence se construit. Si la présence n'est pas humaine d'origine, aucune passe de retouche ne la sauvera.
Ce qui se passe quand on ignore tout ça
Trois symptômes que j'observe systématiquement sur les chaînes IA qui produisent en volume sans avoir formalisé leur voix éditoriale.
Symptôme un : les vues moyennes par épisode plafonnent à 30-40% du potentiel théorique de la niche. Pas zéro, donc rien d'alarmant sur les premiers épisodes. Mais le plafond ne casse jamais.
Symptôme deux : les commentaires sont rares et neutres. « Intéressant ». « Sympa la vidéo ». « Merci pour l'info ». Aucun cri du cœur (« attends quoi ?! »), aucune objection (« mais alors... »), aucune correction empressée (« en fait c'est plutôt... »). Le viewer a consommé, il n'a pas été happé.
Symptôme trois : la chaîne croît lentement même quand la prod tourne. Trois épisodes par semaine, six mois plus tard, mille abonnés. Là où des chaînes avec la moitié du volume et la dixième du polish technique passent à dix mille parce que leur voix est nette.
Ces trois symptômes sont, à mon sens, le diagnostic le plus fiable du « je n'ai pas calibré ma voix éditoriale ». Pas le rendu, pas les sous-titres, pas la vignette. La voix.
Ce qu'il faut faire concrètement
L'investissement initial paie sur la durée. Voici la séquence que je recommande à quiconque démarre une chaîne IA en 2026.
Étape un — écrire le doc éditorial avant le premier script. Mille à mille cinq cents mots qui couvrent : la posture du narrateur, les cinq mécanismes appliqués au sujet de la chaîne, des exemples positifs et négatifs (formulations à reproduire, formulations à interdire), les red flags identifiés par des tests gestalts (genre « si je peux substituer X par Y, c'est mort »).
Étape deux — écrire vingt scripts à la main avec le doc en référence. Pas dix. Vingt. Le seuil de calibrage de la voix se situe autour de ce nombre. Vous identifierez en passant des cas que le doc initial ne couvrait pas — vous les ajouterez.
Étape trois — alors seulement, utiliser un LLM pour les opérations où il aide. Recherche, reformulation locale, validation structurelle. Jamais pour générer un premier jet, jamais avant que vingt scripts aient permis de stabiliser la voix.
Étape quatre — relire chaque script à voix haute avant de le verrouiller pour la prod. C'est le seul test fiable. Une phrase qu'on ne peut pas dire au bar à un proche n'a rien à faire dans un short. Si vous butez en relisant, vous bouclez. Si ça coule, vous avancez. Cette relecture prend cinq minutes par script et économise les passes de re-rendu qui auraient sinon été nécessaires.
L'observation qui résume tout
L'IA, en 2026, peut générer le rendu vidéo, la prosodie, les sous-titres, le B-roll, la publication multi-plateforme. Tout cela est délégable, et largement automatisé chez moi. La voix éditoriale ne l'est pas — pas parce que les modèles ne sont pas assez puissants, mais parce qu'elle exige une cohérence humaine sur la durée que la nature même d'un LLM exclut.
C'est aussi pour ça que les chaînes IA qui vont gagner les prochaines années ne seront pas celles qui auront le meilleur pipeline technique. Ce seront celles dont la voix est la plus tenue. Et la voix, ça s'écrit avec un humain au clavier — vingt scripts d'affilée, à voix haute, en relisant.
C'est le seul kilomètre qu'aucun outil ne fera pour vous. Tant mieux ; c'est aussi celui qui détermine si votre chaîne tient ou pas.
Pour la couche que l'IA fait, en revanche — du rendu à la publication multi-plateformes — c'est exactement ce que fait Shortflow. Si vous avez calibré votre voix et qu'il vous manque l'outillage, créer un compte ouvre un essai gratuit de sept jours.