Évaluer un contenu IA : arrêtons de débattre, commençons à mesurer

Un chronomètre posé près d'un ordinateur fermé, pour évaluer un contenu IA par la mesure plutôt que par le débat

Table des matières

Depuis trois ans, je lis à peu près tout ce qui se publie sur l’intelligence artificielle appliquée au contenu. Les débats sont vifs, souvent légitimes, parfois brillants. Mais il me manque quelque chose.

Presque personne ne dit ce qu’un contenu IA sait réellement faire. Précisément. Avec des chiffres, des échecs, un coût.

Un travail publié début août 2026 vient de mettre un nom sur cette impression. Fred Zimmerman a analysé 89 articles de la presse professionnelle de l’édition, en huit langues, parus entre novembre 2025 et août 2026. Chacun codé selon son sujet, sa posture, sa profondeur technique. Le titre de son étude dit déjà tout : le droit d’auteur fait les gros titres, la capacité reste l’angle mort.

Dix articles sur 89 proposaient un examen technique soutenu. Aucun ne donnait la parole à un chercheur travaillant réellement sur ces modèles. Aucun.

Alors je voudrais défendre ici une conviction simple, et un peu inconfortable : évaluer un contenu IA coûte moins cher que d’en débattre, et nous avons collectivement choisi l’inverse. Cet article propose une méthode pour sortir de là. Elle ne vient pas d’un cadre théorique — elle vient d’un réflexe que je pratique depuis 1996, et d’un système que j’ai mesuré palier par palier ces quatre dernières années.

En synthèse

  • Une revue de 89 articles professionnels sur l’IA dans l’édition montre une couverture dominée par les droits, la gouvernance et les annonces produit.
  • Dix articles seulement proposaient un examen technique soutenu ; aucun n’interrogeait un chercheur du domaine.
  • Le déficit n’est pas informationnel : les outils sont accessibles à tous, l’épreuve pratique manque.
  • Documenter une capacité demande de mesurer un coût, un plafond et un mode d’échec — pas de formuler un avis.
  • Une méthode personnelle transformée en système gagne davantage qu’un modèle plus performant.
  • Évaluer prend du temps. Ne pas évaluer coûte plus cher, mais ce coût reste invisible.
  • La question utile n’est pas « l’IA sait-elle faire ? » mais « qu’ai-je vérifié moi-même, et à quel prix ? ».
Un carnet annoté à la main posé près d'un ordinateur, pour documenter ce qu'un contenu IA sait faire

Ce que révèle une revue de 89 articles professionnels

Regardons les chiffres de cette revue, parce qu’ils sont instructifs. Sur les 89 articles étudiés, 30 % adoptaient un cadrage par le risque, 42 % une posture mixte, 28 % un cadrage par l’opportunité. Autrement dit : la profession se répartit assez sagement entre inquiets, prudents et enthousiastes.

Cette répartition ressemble à un débat sain. Elle en a la forme. Elle n’en a pas la matière.

Car les sujets traités se concentrent sur les droits, les licences, la gouvernance, la confiance des lecteurs, l’adoption dans les processus et les annonces de produits. Tous légitimes. Tous discutables sans avoir jamais ouvert l’outil.

Et c’est bien le problème. L’étude relève un chaînon manquant entre l’architecture des modèles, leur évaluation, et les décisions éditoriales que l’on prend en s’appuyant sur eux. On décide beaucoup. On mesure peu.

À savoir

Ce travail est une prépublication, déposée le 2 août 2026 et non encore relue par des pairs. Ses chiffres décrivent une couverture de presse, pas les capacités des modèles. Je le cite comme un symptôme du débat, jamais comme une mesure de l’IA — ce serait reproduire exactement l’erreur qu’il décrit.

Un détail m’a particulièrement retenu : la couverture chinoise s’est révélée plus opérationnelle et plus tournée vers l’usage que les autres. Et les commentaires de spécialistes montraient une profondeur technique nettement supérieure à celle de la presse professionnelle généraliste. La compétence existe donc. Elle circule simplement moins que l’opinion.

1996 : tout le monde avait le CD, presque personne ne l’a essayé

Laissez-moi vous raconter une scène qui date de trente ans, et qui explique pourquoi ce déficit d’évaluation me saute aux yeux.

Au milieu des années 1990, AOL distribue des CD d’accès à Internet dans les boîtes aux lettres françaises. Par millions. La plupart finissent à la poubelle. Quelques-uns servent de sous-verre — je n’invente rien, c’était l’usage le plus courant.

Mes parents venaient d’acheter un PC, un Pentium 75. Ils me l’ont prêté deux ou trois mois. J’ai installé le CD.

Il faut un détail pour comprendre ce que cela coûtait : la connexion était facturée au prix d’une communication téléphonique entre l’endroit où l’on se trouvait et Paris. Pas de forfait. Pas d’illimité. Chaque minute passée en ligne se payait.

Un disque compact posé sur une table près d'un clavier d'ordinateur des années 1990

Ce que j’en ai tiré n’était pas un usage. C’était une conviction. Quand je raconte cette scène aujourd’hui, je la formule ainsi : ça m’a fait réaliser que ça allait être un média ouvert sur lequel on allait pouvoir apprendre énormément, et que ça annonçait une hyperconnexion des maisons pour tout ce qui touchait aux médias.

Je dois être honnête sur un point : cette intuition, je la relis avec trente ans de recul. Aucune trace écrite de l’époque ne l’atteste. Elle est cohérente avec la suite de mon parcours, elle n’est pas une prédiction documentée.

Et surtout, ce n’est pas une histoire de flair. Ce serait confortable, mais faux. Le CD était dans toutes les boîtes aux lettres de France. L’ordinateur n’était même pas le mien. La même information, exactement la même, était disponible pour des millions de personnes.

Ce qui distinguait cette scène n’était pas l’accès. C’était l’intention : essayer tôt, puis se demander ce que la chose sera quand elle sera mûre.

L’information ne manque jamais, l’épreuve si

Vous voyez où je veux en venir.

En 2026, les modèles de langage sont le CD dans la boîte aux lettres. Ils sont partout, gratuits ou presque, et tout le monde en parle. La rareté n’est pas l’accès. Elle n’est pas non plus l’opinion — nous en produisons industriellement.

Ce qui reste rare, c’est de manipuler une technologie pendant qu’elle est encore inconfortable, chère et mal foutue. C’est le seul moment où l’on comprend ce qu’elle deviendra, avant que tout le monde l’explique.

Il y a une raison à cela, et elle n’est pas flatteuse : l’épreuve pratique est risquée. Elle produit des résultats qui contredisent parfois ce qu’on avait envie de penser. Le débat, lui, ne contredit jamais personne. On peut y défendre une position trois ans sans jamais rencontrer un fait.

Cette bascule entre discuter et éprouver, je l’ai explorée sous un autre angle en me demandant ce qu’il nous reste à éprouver nous-mêmes quand l’IA accélère tout. La conclusion est la même, prise par l’autre bout : déléguer l’exécution est une chose, déléguer l’expérience en est une autre.

Documenter une capacité : ce que j’ai mesuré en quatre paliers

Passons du principe à la pratique. Voici ce que donne l’épreuve, chez moi, sur une tâche précise.

Je produis du contenu éditorial pour un cabinet d’expertise comptable. Cela oblige à traverser un territoire immense : fiscalité, audit, ressources humaines, métiers spécialisés. Je ne possède pas ces connaissances. Au départ, un article me demandait quatre à six heures — parcourir cinq ou six sites, vérifier la fiabilité de chacun, puis faire ressortir l’essentiel. Deux articles par semaine, c’était deux jours de rédaction.

La difficulté était identifiée dès mon recrutement. Je l’ai rappelé en réunion à l’un des associés du cabinet récemment :

« Je me souviens, tu m’en avais parlé à mon entretien d’embauche, tu m’avais dit : mais tu as déjà écrit pour un cabinet comptable ? Et j’avais répondu : j’ai écrit pour d’autres secteurs que je ne connaissais pas non plus. Cependant, je dois avouer que je ne mesurais pas la complexité de votre métier à l’époque. »

Quatre paliers ont suivi. Je les donne tels que je les ai vécus.

PalierCe que la machine faisaitCe qui restait à ma charge
Le chatbot seul, environ trois moisRéécriture, reformulationTout le reste — recherche, sources, structure, publication
L’assistant guidé, environ un anThématique, titre, angle, puis section par sectionReport manuel dans le CMS, le SEO, les images
L’automatisation par modules, environ un anRecherche, rédaction, publication enchaînéesImpossible d’intervenir au milieu du processus
Les agents spécialisés, depuis quelques moisVeille, calendrier, production, vérification des sources, visuelsLa supervision, la relecture, la responsabilité
Quatre paliers ascendants représentant les étapes successives d'automatisation éditoriale

Le temps est passé de quatre à six heures à trente ou quarante-cinq minutes, puis à une dizaine de minutes de supervision.

Ces durées demandent une précaution que je tiens à poser franchement, parce qu’elle est précisément ce qui manque au débat ambiant : ce sont des ordres de grandeur déclarés, mesurés à des niveaux d’automatisation et de contrôle différents. Comparer dix minutes de supervision à six heures de travail manuel comme si la tâche était identique serait malhonnête. Ce n’est pas la même tâche. Ce n’est pas le même contrôle. Ce n’est pas la même responsabilité.

Et pourtant, l’enseignement tient.

Le gain ne vient pas du modèle

Voilà le résultat que je n’attendais pas. Aucun palier n’a été raté. À chaque étape, l’outil faisait son travail. Ce qui bougeait, c’était le plafond de ce que les outils permettaient — et ma capacité à le remarquer.

Le gain ne vient pas d’un modèle plus performant. Il vient de la décomposition du travail. Recherche, sources, structure, rédaction, contrôles, visuels, publication : chaque étape devient explicite, orchestrée, et peut gagner en autonomie séparément.

Détail qui a son importance : le gain dont je suis le plus satisfait n’est pas la rédaction. C’est la recherche de sources. La partie que je faisais entièrement à la main, et qui coûtait le plus cher. Personne ne m’aurait dit ça dans un débat sur l’IA rédactionnelle. Il fallait le mesurer.

C’est d’ailleurs pour cette raison que l’IA bloque rarement sur les outils et presque toujours sur l’organisation : le plafond que l’on croit technique est le plus souvent méthodologique.

Cinq questions pour évaluer un contenu IA sans discuter à vide

Vous n’avez pas besoin d’un protocole de laboratoire. Vous avez besoin de cinq questions, posées sur une tâche réelle, avec une réponse écrite.

  1. Quelle tâche précise ? Pas « rédiger », mais « produire un premier jet sourcé de 1 200 mots sur un sujet que je ne maîtrise pas ».
  2. Combien de temps avant, combien après ? Chronométrez une fois. Une seule fois suffit à tuer une conversation de comptoir.
  3. Où est le plafond ? À quel moment l’outil cesse de progresser et où commence votre travail réel.
  4. Quel est le mode d’échec ? Pas « il se trompe parfois », mais comment il se trompe : invention de sources, approximation, confusion, ton plat.
  5. Qui répond du résultat ? La question la plus importante, et la seule qu’aucun gain de productivité ne dispense de trancher.
Des mains notant quelques lignes dans un carnet à côté d'un chronomètre

Notez que ces cinq questions ne demandent aucune compétence technique. Elles demandent de l’honnêteté et un carnet. La cinquième, en particulier, relève d’une décision et non d’une mesure : c’est le terrain de la gouvernance des agents et de la clarification de qui décide quoi.

Le piège du chiffre unique

Un seul chiffre de gain de productivité ne veut rien dire s’il ne précise pas le niveau de contrôle associé. « Dix fois plus vite » sans mentionner ce qui a été supprimé de la chaîne de vérification n’est pas une mesure : c’est un argument commercial.

L’objection honnête : évaluer prend du temps que personne n’a

Je ne vais pas faire semblant. L’objection est solide, et je l’entends chaque fois que je propose cette démarche.

Documenter une capacité coûte du temps que personne n’a budgété. Chronométrer, noter les modes d’échec, refaire l’essai après une mise à jour de modèle : c’est du travail non facturable, invisible, et qui ne produit aucun livrable présentable en réunion. Je comprends parfaitement qu’on y renonce.

Mais comparons les coûts, puisque c’est tout l’objet de cet article.

Le coût de l’évaluation est visible, immédiat, et borné : quelques heures sur une tâche. Le coût de la non-évaluation est invisible, différé, et non borné. Il prend la forme d’un outil acheté pour un usage qu’il ne couvre pas, d’une chaîne automatisée qu’on découvre fragile en production, d’une équipe formée à un plafond qui a bougé depuis. Ces coûts existent. Ils n’apparaissent simplement dans aucune ligne budgétaire.

Et j’ajoute une chose, parce qu’elle m’importe : l’automatisation n’est jamais gratuite. Chacun de mes quatre paliers a eu un prix — du temps de conception, des erreurs, une vigilance nouvelle à installer. Le troisième palier, notamment, m’a coûté ma capacité à intervenir au milieu du processus. C’était un vrai renoncement, et je ne l’avais pas anticipé. Prétendre le contraire serait vous vendre exactement le récit que ce site refuse.

Cette exigence de preuve plutôt que de promesse, je l’avais posée en écrivant que le contenu utile n’est plus une promesse mais une preuve. Elle vaut aussi pour ce que nous affirmons sur nos propres outils.

Ce que je vous propose d’essayer cette semaine

Je ne vais pas vous prédire l’état du métier dans cinq ans. Je n’en sais rien, et ceux qui le savent m’inquiètent.

Voici ce que je fais, concrètement, et ce que vous pouvez faire aussi. Prenez une seule tâche, celle qui vous pèse le plus. Chronométrez-la à la main une fois. Confiez-la à l’outil. Chronométrez à nouveau, en notant précisément ce que vous avez dû reprendre et pourquoi. Écrivez cinq lignes. Datez-les.

Refaites l’exercice dans trois mois. C’est tout. Vous aurez alors quelque chose que presque personne n’a dans cette conversation : une mesure à vous, avec sa date et son périmètre.

En 1996, le CD était dans toutes les boîtes aux lettres. Ce n’est pas de l’avoir reçu qui a compté. C’est de l’avoir installé sur un ordinateur emprunté, avec une connexion facturée à la minute, pour voir.

Trente ans plus tard, la question n’a pas changé d’un mot. Elle n’est pas « l’IA sait-elle faire ? ». Elle est : qu’avez-vous vérifié vous-même, et à quel prix ?

Le débat sur l’IA ne vous coûtera jamais rien. C’est bien pour cela qu’il ne vous apprendra rien. Si vous avez chronométré une tâche, mesuré un plafond ou identifié un mode d’échec précis, racontez-le — ce sont ces retours qui manquent le plus à la conversation.

https://www.linkedin.com/in/storregrosa/

Suivez-moi sur LinkedIn

Références principales

Les données citées dans cet article proviennent de la source suivante, à laquelle s’ajoutent mes propres mesures, signalées comme des ordres de grandeur déclarés :

  • Fred Zimmerman, Copyright Is the Headline; Capability Is the Blind Spot: AI Technology in the Book-Publishing Trade Press, November 2025–August 2026, prépublication déposée le 2 août 2026 — arxiv.org/abs/2608.00964.

Que signifie évaluer un contenu IA ?

Évaluer un contenu IA consiste à mesurer ce que l’outil produit réellement sur une tâche définie, plutôt qu’à porter un jugement général sur la technologie. Cela implique de chronométrer la tâche avant et après, d’identifier où l’outil cesse de progresser, de décrire précisément ses modes d’échec et de désigner qui répond du résultat publié. C’est une démarche documentaire, pas une opinion. Elle ne demande aucune compétence technique particulière, seulement de la rigueur et une trace écrite datée.

Pourquoi le débat public sur l’IA manque-t-il d’évaluation technique ?

Une revue de 89 articles de la presse professionnelle de l’édition, parus entre novembre 2025 et août 2026, montre que la couverture se concentre sur les droits, les licences, la gouvernance et les annonces produit. Dix articles seulement proposaient un examen technique soutenu, et aucun ne donnait la parole à un chercheur du domaine. L’explication est simple : on peut débattre de ces sujets sans avoir jamais ouvert l’outil. L’épreuve pratique, elle, risque de contredire la position que l’on défendait.

Combien de temps faut-il pour évaluer un outil IA sur une tâche ?

Quelques heures suffisent pour une première mesure utile. Il s’agit de chronométrer une tâche réalisée à la main, de la confier à l’outil, de chronométrer à nouveau, puis de noter ce qui a dû être repris et pourquoi. Cinq lignes écrites et datées valent mieux qu’un protocole ambitieux jamais mené. L’exercice gagne à être refait après trois mois, car le plafond des outils se déplace vite et une mesure sans date perd rapidement sa valeur.

Un gain de productivité annoncé est-il une mesure fiable ?

Pas en soi. Un chiffre de gain n’a de sens que s’il précise le niveau de contrôle associé et le périmètre exact de la tâche. Annoncer un temps divisé par dix sans dire ce qui a été retiré de la chaîne de vérification n’est pas une mesure mais un argument commercial. Deux durées mesurées à des niveaux d’automatisation différents ne sont pas comparables comme si la tâche et la responsabilité étaient restées identiques.

Le gain de productivité vient-il du modèle ou de la méthode ?

Dans mon expérience, il vient très largement de la méthode. Quatre paliers successifs d’automatisation m’ont montré que le progrès venait de la décomposition du travail en étapes explicites — recherche, sources, structure, rédaction, contrôles, visuels, publication — chacune pouvant gagner en autonomie séparément. Aucun palier n’a échoué à cause du modèle. Ce qui bougeait, c’était le plafond de ce que les outils permettaient, et la capacité à le remarquer.

L’automatisation éditoriale a-t-elle un coût caché ?

Oui, et il faut le nommer. Chaque palier d’automatisation demande du temps de conception, produit des erreurs et impose une vigilance nouvelle. Un palier fondé sur des modules enchaînés m’a par exemple coûté la possibilité d’intervenir au milieu du processus, ce que je n’avais pas anticipé. Présenter l’automatisation comme sans contrepartie revient à vendre un récit plutôt qu’une méthode. Le coût existe ; il se déplace simplement de la production vers la conception et le contrôle.

Comment savoir si un contenu assisté par IA est publiable ?

La question de la publication se tranche par la responsabilité, pas par la performance. Avant de publier, il faut pouvoir dire qui a vérifié les faits, quelles sources ont été contrôlées et qui répond du texte en cas d’erreur. Un gain de temps, quel qu’il soit, ne dispense jamais de cette décision. C’est le seul point de la chaîne qu’aucune automatisation ne peut absorber sans transférer un risque à quelqu’un d’autre.

Stéphane Torregrosa

Stéphane Torregrosa transforme les idées en moteurs de croissance. Consultant en stratégie digitale, formateur, blogueur et conférencier, il aide les organisations à renforcer leur visibilité, à structurer leurs prises de parole et à automatiser intelligemment leurs processus. Spécialisé en Inbound Marketing et en IA appliquée, il combine l’efficacité des données avec la puissance d’un storytelling sincère. Autodidacte, passionné par la création de contenu et les outils numériques, il conçoit des solutions sur-mesure pour gagner en impact et en cohérence. Il explore aussi d’autres formes d’expression : sous le nom de Stéphan Paul, il écrit et compose des chansons qui racontent l’humain, ses doutes et ses élans. Ce goût du sens et de la transmission traverse tous ses projets, qu’ils soient professionnels ou artistiques.
Stéphane Torregrosa content marketing, IA, communication et identité de marque

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

I accept the Terms and Conditions and the Privacy Policy

Ce site utilise Akismet pour réduire les indésirables. Découvrez comment les données de vos commentaires sont traitées.