La plateforme git.kernel.org, qui héberge le code source du noyau Linux, subit une pression croissante depuis plusieurs mois. D'après Numerama, cette situation s'explique moins par la présence de robots aspirant des données que par leur comportement systématique et intensif. Ces programmes automatisés, utilisés pour nourrir des intelligences artificielles, consomment une part disproportionnée des ressources des serveurs, au point de perturber le fonctionnement normal de l'infrastructure.

Ce qu'il faut retenir

  • git.kernel.org, hébergeant le code source de Linux, subit une pression accrue en raison de robots collectant massivement des données pour entraîner des IA
  • Le problème réside dans leur méthode de collecte, systématique et gourmande en ressources, plutôt que dans leur simple présence
  • Un ingénieur Linux a décrit cette situation comme « une dégradation réelle » pour les serveurs du noyau
  • Les scrapers d'IA, souvent appelés « bestioles » par les développeurs, sont pointés du doigt pour leur impact sur les performances

Des robots aux méthodes agressives

Selon Numerama, les robots utilisés pour scraper le contenu des sites web et alimenter les bases de données d'entraînement des IA ne se contentent plus de consulter les pages de manière ponctuelle. Ces programmes automatisés enchaînent les requêtes à un rythme soutenu, saturant les serveurs de git.kernel.org. « La situation a vraiment dégénéré », a expliqué un ingénieur travaillant sur le projet Linux, soulignant que ces robots, surnommés « bestioles » par la communauté, agissent sans discernement et épuisent les ressources disponibles.

Le phénomène n'est pas nouveau, mais il s'est intensifié ces derniers mois. Les développeurs du noyau Linux ont observé une augmentation significative du trafic généré par ces scrapers, au point de compromettre l'accès des utilisateurs légitimes. « On parle de machines qui envoient des requêtes en continu, sans respecter les bonnes pratiques ni les limites imposées », a précisé l'ingénieur.

Un impact mesurable sur l'infrastructure

Le noyau Linux est une infrastructure critique pour des millions de systèmes à travers le monde, des serveurs aux appareils embarqués. Toute perturbation de git.kernel.org a donc des répercussions directes sur les développeurs et les entreprises dépendant de ce code source. D'après Numerama, les administrateurs du site ont dû mettre en place des contre-mesures pour limiter l'impact de ces robots, mais la tâche reste complexe. « Les scrapers d'IA sont conçus pour contourner les protections classiques », a indiqué un administrateur système, évoquant des techniques de contournement comme le changement fréquent d'adresses IP ou l'utilisation de faux en-têtes de navigateur.

Les statistiques partagées par l'équipe de git.kernel.org révèlent une hausse de 30 % du trafic non humain ces six derniers mois. Cette augmentation coïncide avec l'essor des modèles d'IA générative, dont les besoins en données d'entraînement n'ont cessé de croître.

Une réponse encore en discussion

Face à cette situation, la communauté Linux explore plusieurs pistes pour atténuer le problème. Parmi les solutions envisagées, on trouve le blocage pur et simple des adresses IP suspectes, l'imposition de quotas de requêtes ou encore l'utilisation de CAPTCHA pour filtrer les accès automatisés. « On teste différentes approches, mais aucune n'est parfaite », a déclaré un responsable technique. « Le risque est de bloquer par erreur des utilisateurs légitimes ou de créer des failles de sécurité. »

Certains membres de la communauté suggèrent également de négocier avec les entreprises derrière ces scrapers pour les inciter à adopter des pratiques plus responsables. « L'idée serait de leur rappeler que le code de Linux est ouvert, mais que son infrastructure a des limites », a expliqué un développeur sous couvert d'anonymat. Cependant, cette approche dépendra de la bonne volonté des acteurs concernés, ce qui n'est pas toujours garanti.

Et maintenant ?

D'après les informations recueillies par Numerama, la communauté Linux devrait poursuivre ses discussions dans les semaines à venir pour finaliser une stratégie commune. Une réunion est prévue le 15 septembre 2026 lors du Linux Plumbers Conference, où les administrateurs de git.kernel.org devraient présenter leurs propositions. Si aucune solution radicale n'est attendue à court terme, les acteurs concernés pourraient être amenés à revoir leurs pratiques pour préserver l'intégrité du projet.

En attendant, les développeurs appellent les utilisateurs à signaler tout comportement suspect via les canaux officiels de git.kernel.org, afin d'aider à identifier et bloquer les scrapers les plus agressifs. Une collaboration accrue entre les différents acteurs du web pourrait s'avérer nécessaire pour concilier les besoins des IA et la stabilité des infrastructures open source.