Près de 35 % des pages web apparues après le lancement de ChatGPT en novembre 2022 présentent des caractéristiques suggérant qu’elles ont été rédigées ou éditées à l’aide d’intelligence artificielle. C’est ce que révèle une étude menée par le Pew Research Center, un think tank américain, et rapportée par Journal du Geek.
Cette enquête, basée sur l’analyse de près d’un demi-million de pages web en anglais issues du référentiel Common Crawl et couvrant les cinq dernières années, utilise une technologie de détection baptisée Open Pangram pour identifier les textes générés par IA. Les résultats, bien que partiels, dessinent un paysage où l’IA occupe une place croissante dans la production de contenus en ligne.
Ce qu'il faut retenir
- 35 % des pages web publiées après novembre 2022 montrent des signes indiquant une possible génération ou édition par IA, selon une étude du Pew Research Center relayée par Journal du Geek.
- Cette estimation repose sur l’analyse de 480 000 pages en anglais issues de l’archive Common Crawl, couvrant la période 2020-2025.
- La technologie Open Pangram, utilisée pour détecter ces textes, ne fournit pas de certitude absolue mais identifie des « signaux » caractéristiques.
- L’Union européenne a déjà anticipé ce phénomène en encadrant, via de nouvelles règles de transparence, l’utilisation de l’IA dans la production de contenus.
- Anthropic, développeur du modèle d’IA Claude, a annoncé l’ajout d’un filigrane invisible sur les textes générés par ses futurs outils pour faciliter leur identification.
- Ce filigrane, imperceptible pour un humain, permet à des logiciels spécialisés de repérer les contenus issus de l’IA sans altérer leur qualité.
Une étude limitée mais révélatrice
L’étude du Pew Research Center, comme le précise Journal du Geek, ne prétend pas fournir un chiffre absolu sur le volume total de textes générés par IA sur le web. En effet, son champ d’analyse se limite à un échantillon de pages en anglais, extraites de l’archive Common Crawl — un référentiel open source regroupant des milliards de pages web.
Les chercheurs ont appliqué l’outil Open Pangram, développé pour détecter les « signatures » typiques des textes produits par des modèles d’IA. Ces signatures incluent des tournures de phrases récurrentes, une structure syntaxique inhabituelle ou encore des répétitions de formulations. « La méthode ne garantit pas une détection infaillible, mais elle permet d’identifier des profils textuels suspects », explique un porte-parole du Pew Research Center cité par Journal du Geek.
Autant dire que les résultats, bien que partiels, donnent un aperçu concret de la pénétration de l’IA dans la rédaction en ligne. Ils suggèrent que près d’un tiers des contenus publiés après 2022 pourraient avoir été influencés par ces outils — une proportion qui interroge sur la fiabilité et l’authenticité de l’information disponible sur internet.
L’Europe en première ligne face à la prolifération des contenus générés par IA
Face à cette tendance, l’Union européenne a d’ores et déjà pris des mesures pour encadrer l’usage de l’IA dans la production de contenus. Depuis l’entrée en vigueur de l’AI Act, en août 2024, les plateformes et éditeurs doivent se conformer à de nouvelles obligations de transparence.
Ces règles imposent notamment de signaler clairement lorsque du contenu a été généré ou modifié par une IA. « L’objectif n’est pas d’interdire ces outils, mais de garantir que les utilisateurs puissent distinguer l’humain de la machine », précise un communiqué de la Commission européenne, relayé par Journal du Geek. En réponse à ces exigences, plusieurs acteurs du secteur technologique ont commencé à intégrer des mécanismes de traçabilité dans leurs modèles.
C’est le cas d’Anthropic, l’entreprise derrière le modèle d’IA Claude. Dès 2026, ses futurs textes générés par IA seront dotés d’un filigrane invisible — une innovation technique qui ne modifie en rien la qualité ou la lisibilité des contenus, mais permet leur identification par des logiciels dédiés.
Un filigrane technologique pour traquer l’IA
Contrairement aux méthodes traditionnelles de watermarking, qui ajoutent des caractères ou des métadonnées visibles, le système mis au point par Anthropic repose sur une approche plus subtile. « Nous avons travaillé sur un mécanisme qui ajuste discrètement le choix des mots ou la structure des phrases pour créer une signature unique, détectable uniquement par des algorithmes », détaille un porte-parole de l’entreprise.
Cette technologie, encore en phase de test, pourrait devenir un standard pour les modèles génératifs. Son avantage ? Elle ne nécessite pas de modifier le contenu final, préservant ainsi l’expérience de lecture de l’utilisateur. « Pour un humain, un texte avec ou sans filigrane reste identique. En revanche, des outils de vérification comme Originality.ai ou GPTZero pourront repérer la signature et alerter sur une possible génération automatisée », explique Journal du Geek.
Reste à savoir si cette solution sera adoptée à grande échelle. Anthropic a annoncé que le filigrane serait progressivement déployé sur Claude 3.5, la prochaine version de son modèle, prévue pour début 2027.
En attendant, la question de l’impact réel de l’IA sur la qualité de l’information en ligne reste entière. Comment concilier innovation technologique et préservation de l’authenticité des contenus ? La réponse pourrait bien se jouer dans les mois qui viennent, alors que les règles européennes commenceront à s’appliquer pleinement et que de nouvelles solutions de traçabilité feront leur apparition.
Le filigrane repose sur une modification discrète du texte généré par IA. Plutôt que d’ajouter des métadonnées ou des caractères visibles, l’algorithme ajuste le choix de certains mots ou la structure des phrases pour créer un schéma unique. Ce schéma est détectable uniquement par des logiciels spécialisés, sans altérer la qualité ou la lisibilité du contenu pour un humain.
Non. L’enquête s’est concentrée sur des pages en anglais issues de l’archive Common Crawl. Les chercheurs n’ont pas analysé de contenus francophones, ce qui limite la portée géographique des résultats. Il est donc impossible d’extrapoler ces chiffres à l’ensemble du web, y compris aux sites en français.