Un texte écrit en 1963 peut-il être identifié comme généré par une intelligence artificielle? Pour certains détecteurs, oui. Le célèbre discours «I Have a Dream» de Martin Luther King a été évalué comme étant généré par IA à 87,7% par ZeroGPT.com et à 84,4% par ZeroGPT.net, selon une étude publiée en octobre 2025 dans la revue scientifique Information. Les quatre autres outils testés dans le cadre de l’étude l’ont, eux, classé comme un texte humain.
Le résultat est évidemment impossible à interpréter comme une preuve d’utilisation de l’IA: Martin Luther King a prononcé ce discours le 28 août 1963, soit près de six décennies avant le lancement public de ChatGPT. Les chercheurs s’en servent justement pour mettre en évidence un problème plus large: un score élevé attribué par un détecteur d’IA ne suffit pas à établir qu’un texte a été produit par une machine.
L’étude, menée par Tadesse G. Wakjira et quatre autres chercheurs, a évalué six outils de détection: Undetectable AI, ZeroGPT.com, ZeroGPT.net, Brandwell.ai, Winston AI et Crossplag. Le corpus comprenait des textes dont l’origine humaine pouvait être vérifiée, provenant notamment d’universités, de publications scientifiques antérieures à ChatGPT, de sites gouvernementaux et de médias. Les chercheurs ont également soumis aux outils des textes générés par ChatGPT-4o. Les résultats montrent une forte disparité entre les solutions. Leur taux d’exactitude globale allait de 14,3 à 71,4%. Mais même l’outil affichant le meilleur résultat présentait des performances très faibles sur d’autres indicateurs: sa précision n’atteignait que 11,1% et son rappel 33,3%. Les chercheurs soulignent ainsi le nombre important de faux positifs, c’est-à-dire de textes humains identifiés à tort comme produits par une IA.
Le problème ne concerne d’ailleurs pas uniquement le discours de Martin Luther King. Des contenus provenant de grandes universités, ainsi que des textes scientifiques publiés avant l’arrivée de ChatGPT, ont également été signalés comme artificiels. Cinq des six outils testés ont notamment classé comme généré par IA un célèbre article consacré au deep learning signé Yann LeCun, Yoshua Bengio et Geoffrey Hinton. Plus étonnant encore, les chercheurs ont constaté qu’une modification minime pouvait changer considérablement le verdict. Dans l’un des tests, la suppression d’un seul mot dans un texte de Stanford a fait basculer l’évaluation d’un détecteur de 69,51% de probabilité d’IA à une classification 100% humaine. À l’inverse, certains textes générés par ChatGPT, notamment des textes volontairement absurdes ou comportant des erreurs, ont échappé à la détection.
L’étude appelle donc à ne pas transformer un score algorithmique en verdict. Les chercheurs estiment que les outils évalués ne sont pas suffisamment robustes pour servir seuls dans des décisions à fort enjeu, notamment en matière de recrutement ou d’intégrité académique. Ils recommandent davantage de transparence dans l’évaluation de ces technologies et le maintien d’une vérification humaine. Cela ne signifie pas pour autant que tous les détecteurs d’IA sont inutiles ou qu’aucun progrès n’est possible. La recherche évolue rapidement et de nouveaux systèmes obtiennent de meilleurs résultats dans certaines conditions. Une étude publiée en 2025 dans les actes de l’ACL a par exemple montré que des personnes habituées à utiliser des modèles de langage pouvaient détecter des textes générés par IA avec une grande précision dans le cadre de leur expérimentation. La vraie leçon est donc ailleurs: un détecteur d’IA doit être considéré comme un indicateur, pas comme une preuve. Pour une entreprise ou un recruteur, un score de 80%, 90% ou même 100% ne permet pas, à lui seul, d’établir l’origine d’un texte. Il doit déclencher une vérification supplémentaire: historique des versions, échanges avec l’auteur, cohérence avec ses productions précédentes ou, lorsque c’est pertinent, entretien direct.
Le cas de «I Have a Dream» résume parfaitement le problème. Un texte dont l’auteur et la date sont historiquement établis peut être présenté par certains logiciels comme très probablement généré par une IA. Le risque n’est donc pas seulement que l’IA produise de faux contenus. C’est aussi que des outils conçus pour détecter ces contenus produisent de fausses accusations. L’étude reste toutefois à relativiser: son corpus est limité, avec seulement trois textes générés par IA, et elle porte sur six outils grand public. Ses résultats ne permettent donc pas de conclure que tous les détecteurs actuels présentent exactement les mêmes performances. Ils montrent en revanche clairement qu’un score automatique ne devrait pas, à lui seul, déterminer une décision professionnelle ou académique importante.








