Sciences et société, alimentation, mondes agricoles et environnement


À mots découverts Cerveau circuit imprimé

Publié le 30 septembre 2026 |

0

[Edition scientifique & IA] « Le puits des connaissances est-il déjà empoisonné ? »

Fondamentale pour la consolidation, l’avancée et la diffusion des savoirs, l’édition scientifique, qui repose sur des comités de lecture évaluant le sérieux d’un article, a de tous temps connu des pratiques de fraude, plus ou moins bien repérées. Ici un canular, là un auteur qui « truande » ses résultats… Mais depuis quelques années, l’Intelligence Artificielle (IA) s’est infiltré dans tout cet écosystème – et ce marché… – avec une massification inouïe des arnaques. Ici, un jeune chercheur se voit proposer moyennant finances de figurer parmi les auteurs d’un article publié dans une revue prestigieuse sans y avoir contribué le moins du monde, là, un chercheur affiche éhontément le score de 200 articles publiés en un an, ailleurs encore, l’article ou le livre  est truffé de références joliment dites « hallucinées » et de phrases totalement dénuées de sens. De quoi mettre à mal tout l’édifice garantissant la validité des connaissances produites, mais aussi l’évaluation des chercheurs et des labos, pour partie fondée sur le volume de publications. Prendre la mesure de ce phénomène, en examiner les régulations et les contre-feux possibles, tel est l’objet de ce long entretien avec Didier Torny, directeur de recherche au CNRS, spécialiste de l’économie politique de l’édition scientifique. Un échange garanti sans langue de bois ni robot conversationnel.

Propos recueillis et mis en forme par Valérie Péan, pour le 20ème numéro de la revue Sesame (parution en décembre 2026).

Quelle est l’ampleur de la place prise par l’IA dans les publications scientifiques, qui plus est dans sa version dite « générative », qui la rend apte à créer des contenus inédits ?

Didier Torny : Avant de quantifier, il faut indiquer que les résultats des usages concrets varient énormément. D’un côté, on trouve ce qui relève quasiment de l’« AI slop », littéralement de la « bouillie d’IA », des textes de très mauvaise qualité ou des images délirantes comme celle d’un rat au pénis et aux testicules géantes qui a beaucoup été commentée. De l’autre, on trouve des productions qui ressemblent en tout point à des articles de bonne facture, très travaillés.

 83% de textes écrits avec une assistance IA en anesthésiologie

Ensuite, les estimations varient suivant les études, les détecteurs et les disciplines. En anesthésiologie, une étude1 parue en février 2025 a estimé que 83% des textes étaient écrits avec une « assistance IA ». Une autre a pointé des taux allant de 9% (mathématiques) à 22% (informatique). Par ailleurs, dans une enquête par questionnaire, la revue Nature indiquait en 2023 qu’un tiers des post-doctorants utilisaient des IA dite « LLM », pour « Large Language Model », qui génèrent et utilisent du langage naturel, et qui sont par exemple déployés dans les robots conversationnels tels que ChatGPT ou Claude.

Quelles stratégies sont mises en place pour détecter cet usage frauduleux de l’IA ?

La première consiste à faire appel à des entreprises privées qui vendent de la détection d’IA LLM… à partir d’une autre IA !  C’est un marché. Précisons toutefois que ces solutions, comme tout processus automatisé, génèrent également des questions, controverses et nouveaux problèmes. Certains collègues commencent par exemple à se plaindre du refus direct de leur manuscrit sous prétexte d’usage d’IA, alors qu’ils s’en défendent. Contrairement à la détection de « similarités textuelles » où un logiciel va partager les indices du résultat obtenu, par exemple en surlignant les passages communs entre deux textes, le « détecteur d’IA » demeure une boîte noire.

« Ce texte est trop court pour être réécrit académiquement »

Aussi, ce repérage passe-t-il plutôt par des indices secondaires travaillés par d’autres outils, par exemple bibCheck, développé pour le CNRS par l’Institut de l’information scientifique et technique. Il repère les références dites « hallucinées » dans les biographies, c’est-à-dire fabriquées de toutes pièces. Pour la première fois, en 2023, un article avait ainsi été retiré de ce seul fait. D’autres indices existent, et je renvoie là aux travaux de Guillaume Cabanac2, qui détecte ce qu’il appelle « les phrases torturées », élaborées via des dictionnaires de synonymes, donnant lieu à d’étranges contenus. Un texte par exemple, où la notion de « sugar intolerance » (l’intolérance au sucre) devient « sugar bigotry », « bigotry » désignant certes l’intolérance, mais religieuse… 

De même, très classiquement, l’article frauduleux conserve des morceaux oubliés de « prompts », c’est à dire de requêtes faites à l’IA, ou de leurs réponses. Par exemple : « Ce texte est trop court pour être réécrit académiquement ». Ces traces sont nombreuses, car les barrières à la publication qu’opèrent les éditeurs et les relecteurs sont trop poreuses et laissent passer des phénomènes qui, parfois, se repèrent au premier coup d’œil, surtout pour les images générées.  

« Une corruption à ciel ouvert »

Mais c’est le fait surtout des éditeurs dits « prédateurs » et de leur politique d’auteur-payeur…

Définition : Sont qualifiées de prédatrices les revues qui font payer des droits importants aux auteurs pour qu’ils soient publiés en accès libre (lecture gratuite) et qui se passent généralement d’une évaluation sérieuse en amont par un comité de lecture.

La situation est aujourd’hui beaucoup moins manichéenne. Il n’y a pas d’un côté des éditeurs qui ne produisent que des textes « pourris » et de l’autre, de « bons » éditeurs qui mènent une évaluation rigoureuse. En fonction des détecteurs, même dans les revues étiquetées comme prestigieuses, on trouve des traces d’usage d’IA à des fréquences très variables, qui peuvent aller jusqu’à un article sur quatre ou sur six. 

Au-delà de ces traces plus ou moins détectées, l’augmentation massive des articles scientifiques publiés ces dernières années n’est-elle pas un marqueur flagrant du recours à l’IA ?

Oui. Quand, d’une année sur l’autre, les principaux éditeurs scientifiques, tels Springer et Elsevier, voient leur volume d’articles publiés augmenter de 8 et 10 %, sachant que l’accroissement du nombre de manuscrits soumis est encore plus important, cela constitue un indicateur indirect3. Ce sujet de préoccupation fait certes débat depuis les années 1950 mais une nette inflexion a eu lieu brutalement à partir du milieu des années 20104. Il faut dire aussi que la généralisation du modèle « auteur-payeur » incite l’opérateur économique à la publication de l’article. De fait, finir par rejeter un manuscrit soumis, qui a subi des coûts de traitement et d’évaluation, c’est perdre de l’argent.

Et puis, du côté des auteurs, il y a désormais de véritables usines à faux articles, qui les sollicitent même parfois directement, moyennant finances…

En effet, une foule d’acteurs intermédiaires. Des sociétés qui vendent des articles frauduleux, des citations5, des fausses données, une place dans la liste des auteurs d’un article, et même des reviewers fantômes. Ce sont les fameux « mills » [ndlr : « moulins » en français], d’où l’expression « papermills », autrement dit des « moulins à articles », qui se sont considérablement professionnalisés et peuvent être mêmes éditeurs, ou en relation avec des revues légitimes. C’est une compromission voire une corruption à ciel ouvert, qui touche des éditeurs, des revues, des rédacteurs en chef, des auteurs…

Mais tout ce système préexiste à l’IA générative…

« Ecrire un article peut désormais prendre 15 minutes seulement ! »

Didier Torny

Sauf que cette dernière y ajoute deux effets majeurs. D’abord, elle abaisse les coûts de ces services. Par exemple l’écriture d’un article peut désormais prendre 15 minutes seulement ! Evidemment, le fond ne vaut rien. Ensuite, cela « démocratise » l’usage de la fraude : au lieu de faire appel à un acteur tiers, les fameux mills, des auteurs produisent en « circuit-court » des références hallucinées et autres données fausses. Entre cette production qu’on pourrait qualifier d’artisanale, et l’acteur économique illégal qui vend des prestations, on se retrouve avec des traces d’IA générative moins faciles à repérer.

Surveiller et punir ?

Ces pratiques jettent un sacré discrédit sur la qualité des connaissances scientifiques produites. Quels intérêts les pilotent ?

Du côté des opérateurs économiques, l’intérêt est évidemment monétaire. Elles génèrent des circulations d’argent qui alimentent des comptes. Du côté des auteurs, le profit tient à la question du crédit scientifique qui repose sur le nombre de citations, de publications, de première place dans la liste des auteurs, d’articles parus dans telle ou telle revue prestigieuse, du moins jusqu’à un certain point. En effet, on voit monter depuis quelques années la critique des auteurs « hyperprolifiques », comprenez ceux qui publient au moins 60 articles par an, soit un tous les six jours. Or leur nombre ne cesse d’augmenter6.

Au-delà de la détection, quels contre-feux sont possibles ?

Parer à ces fraudes tient d’une part aux modèles de régulation – des chartes, des engagements déontologiques –, dont l’effet est très variable et peu significatif, d’autant qu’en cas de collaboration internationale, les systèmes diffèrent. D’autre part, le recours à des sanctions, comme le retrait de l’article. Apparaissent également des systèmes de fermeture des dispositifs ouverts – des plateformes telles que HAL où les articles et données scientifiques sont mis à disposition sans limites pour les lecteurs et lectrices.  Par exemple, on va interdire le dépôt d’article d’un chercheur inconnu ou via une adresse de courrier électronique tout aussi nouvelle, à moins qu’il soit parrainé ou que son appartenance institutionnelle ait été vérifiée. D’autres barrières portent sur le type de contenu, en proscrivant les revues de synthèse, très faciles à générer par IA. Cela freine la saturation de ces dispositifs. 

Enfin, il existe des punitions plus directes qui consistent à bannir le ou les auteurs pendant un an dès lors qu’ont été détectées des références hallucinées ou des traces évidentes de prompts, etc. C’est ce que pratique désormais arXiv, une célèbre archive ouverte de prépublications scientifiques notammant en physique, mathématiques et informatique.

« De briques et de trous »

Et puis, la réforme de l’évaluation du chercheur peut aussi réfréner la course aux publications, le fameux « Publish or Perish » ?

Oui, Inrae et le CNRS, avec près d’un millier d’autres institutions, sont signataires de la Coalition pour l’avancement de l’évaluation de la recherche (CoARA) qui vise justement à faire évoluer ces évaluations à l’échelle internationale. Non plus en se basant sur le volume mais, par exemple, en choisissant un certain nombre de leurs productions pour lesquels les autrices et auteurs doivent expliquer leur contribution et en quoi pour eux cette production est importante, novatrice ou exemplaire. C’est une désincitation à publier, plus forte en France qu’ailleurs, à rebours par exemple de l’Italie qui a largement continué à privilégier la quantité.

L’édition scientifique a-t-elle déjà connue des crises aussi fortes ou est-ce là un tournant ?

« Plus de 15 000 auteurs pour un même article »

Historiquement, la critique des volumes grandissants, la redondance, l’absence de nouveautés, a quasiment toujours existé depuis au moins la fin du XIXe. Elle a été très forte dans l’entre-deux-guerres. Celle sur les listes à rallonges d’auteurs pour un seul  article existe au moins depuis les années 1950. A l’époque, on estimait qu’il n’était pas possible de concevoir un article signé par plus de six auteurs. Aujourd’hui, on peut en compter plus de 15 000, la liste occupant littéralement plus de place que le texte de l’article.

L’une des crises les plus intenses s’est déroulée aux États-Unis, dans les années 1970, dans le domaine des sciences de la vie. Les scandales successifs ont été tels que l’enquête diligentée par la Chambre des Représentants a proposé que l’évaluation ne soit plus faite par les pairs mais par les politiques. C’est ce que relate, entre autres, le livre « La souris truquée. Enquête sur la fraude scientifique » de William Broad et Nicholas Wade [ndlr : paru en 1987, Points Sciences].

Un autre épisode critique a eu lieu dans les années 1990 sur l’inflation du nombre d’auteurs, puis certaines disciplines ont vécu la crise de la reproductibilité des résultats : en clair, la très grande difficulté, voire l’impossibilité de reproduire de nombreux résultats publiés dans des revues scientifiques à travers d’autres études qui refont la même expérience.

Quant à ces dix dernières années, elles se caractérisent par le mouvement de science ouverte, qui diffuse donc au-delà de la sphère académique. Dans un modèle de régulation interne, ce peut être problématique. Mais dans le cadre d’une régulation démocratique, c’est plutôt positif. Un exemple. Le 22 mai 2020, la prestigieuse revue The Lancet publie un article sur les effets délétères de l’hydroxychloroquine dans le cas du Covid-19, basée sur des données du monde entier. Une étude dans laquelle était impliquée la start-up Surgisphere Corp., spécialiste du big data médical. Le 3 juin, après des enquêtes de scientifiques et de journalistes, l’article se voyait adjoindre une « expression of concern », un avis officiel indiquant des doutes sérieux sur sa fiabilité et, deux jours plus tard, la revue a retiré l’article ! Là où, en régime de régulation interne, l’article frauduleux du Dr Wakefield sur le pseudo-lien entre le vaccin ROR et l’autisme, publié en 1998 n’a été retiré par The Lancet que douze ans après… Voilà pour le meilleur. Pour le pire, évidemment, cela alimente les sites complotistes. Entre les deux, disons que cela donne lieu à une somme de connaissances faite de briques et de « trous » laissés par les articles rétractés, selon la métaphore de Guillaume Cabanac.

Peut-on en conclure que la réponse n’est pas du côté du solutionnisme technologique ?

En sociologie de la fraude, on sait que tout détecteur va générer de nouveaux usages pour le contourner. Le texte est trop court ? Il est rallongé. Des passages sont redondants ? Je le modifie de manière automatique. Donc on ne peut résoudre ces problèmes par les seules technologies.

« Si quelques données ouvertes sont frelatées, elles vont s’infiltrer dans une foule d’articles »

Didier Torny

Ce qui est à craindre aujourd’hui, c’est une « contamination » des connaissances à l’image des pollutions environnementales : même une quantité limitée de pesticides peut dégrader la qualité de l’eau des nappes phréatiques. Dans notre cas, si quelques données ouvertes sont frelatées, elles vont s’infiltrer dans une foule d’articles. Comment préserver les sources de connaissances scientifiques à l’échelle globale ? Les sanctions individuelles, les systèmes de contrôles à l’entrée ne peuvent sans doute rien contre cette contamination, où quelques papiers rétractés continuent de figurer, ne serait-ce que dans des méta-études, qui sont elles-mêmes citées… Le puits des connaissances est-il déjà empoisonné ? Et comment filtrer ses ressources ? La réponse est sans doute d’abord préventive : agir contre les incitations au volume, à l’instar des incitations à réduire les usages des phytosanitaires, aura un effet, certes indirect et lent, mais qui peut s’avérer efficace à long terme.

Lire aussi

  1. Examining the frequency of artificial intelligence generated content in anesthesiology and intensive care journal publications: A cross sectional study, Medecine journal, 2025 : https://www.ovid.com/jnls/md-journal/fulltext/10.1097/md.0000000000041594~examining-the-frequency-of-artificial-intelligence-generated
  2. Professeur à l’Institut de recherche en informatique de Toulouse (CNRS/Toulouse INP/Université de Toulouse).
  3. How did the largest academic publishing companies perform in 2025?, Journalology, 2026. https://newsletter.journalology.com/p/how-did-the-largest-academic-publishing
  4. Une surpublication que montre une étude parue en mars 2024 dans la revue Quantitative Sciences Studies.
  5. Les citations désignent les reprises d’un article par d’autres publications. Leur nombre plus ou moins élevé signale le degré d’intérêt de cet article dans la communauté scientifique.
  6. C’est ce qu’atteste une étude de mars 2026 publiée dans la revue Scientometrics : https://link.springer.com/article/10.1007/s11192-026-05563-8

Tags: , ,




Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Ce site utilise Akismet pour réduire les indésirables. Découvrez comment les données de vos commentaires sont traitées.

Retour en haut ↑