Doom loop de l'IA : pourquoi le web tel qu'on le connaît est en danger
La vérité gênante sur la boucle infernale de l'IA — et ce qu'elle signifie pour l'avenir du web
Le web a toujours fonctionné sur un contrat tacite : les créateurs produisent du contenu, les plateformes l'indexent, les utilisateurs le consultent, et tout le monde y trouve son compte. Google envoie du trafic vers les éditeurs. On clique sur les liens. C'était imparfait, certes, mais ça faisait vivre des millions de créateurs indépendants, de médias et d'entreprises.
Mais que se passe-t-il quand l'intermédiaire decide qu'il n'a plus besoin de vous envoyer nulle part ?
C'est la question inconfortable au cœur des documents judiciaires rendus publics dans le cadre du procès du New York Times contre OpenAI et Microsoft — et les réponses sont accablantes.
Ils savaient. C'est ça le plus grave.
Le plus frappant, ce n'est pas que l'entraînement de l'IA puisse enfreindre le droit d'auteur ou que les grands modèles de langage aient des relations compliquées avec leurs sources. Le plus grave, c'est que ces entreprises savaient parfaitement ce qu'elles faisaient.
Des documents internes à Microsoft décrivent explicitement leur stratégie de contenu IA comme la création d'une boucle infernale qui « nuirait aux performances de nos modèles et à l'ensemble du web en même temps ». Ils reconnaissaient que leurs produits menaçaient « les fondements économiques de ses fournisseurs essentiels », autrement dit toute la chaîne de production de contenu qui rend ces systèmes possibles.
En clair : ils ont vu le précipice, ont mis le cap dessus, et ont accéléré.
Brent Hecht, Directeur de la Science Appliquée chez Microsoft, a été encore plus cash dans ses communications internes, qualifiant ces pratiques de collecte de données de « plus grand vol de travail de l'histoire humaine » et notant que la défense juridique de Microsoft réduisait « complètement en ridicule l'idée même d'usage loyal ».
Évidemment, Microsoft a tenté de prendre ses distances avec ces propos, un porte-parole les qualifiant de « perspective individuelle d'un seul employé ». Mais quand vos propres documents internes disent fondamentalement la même chose, cette distinction devient sacrément difficile à maintenir.
Le problème de la chaîne d'approvisionnement que personne ne veut aborder
Voici la contradiction fondamentale au cœur du développement de l'IA moderne : les grands modèles de langage ont besoin d'énormes quantités de contenu créé par des humains pour fonctionner. Mais ces mêmes modèles sont conçus pour éliminer le besoin pour les humains d'accéder à ce contenu directement.
Les propres documents de Microsoft reconnaissaient ce paradoxe. Les LLMs sont, selon leurs propres termes, « un produit qui détruit sa propre chaîne d'approvisionnement » parce qu'ils se substituent aux données d'entraînement qui les rendent utiles.
Prenez un moment pour réfléchir à ce que ça implique. Chaque fois que ChatGPT ou Copilot répond à une question au lieu de vous orienter vers une source, c'est un lecteur potentiel qui ne clique jamais. C'est des revenus publicitaires qui ne se matérialisent jamais. C'est un créateur qui pourrait décider que produire du contenu n'en vaut plus la peine.
Et quand le puits est à sec — quand il y a moins de créateurs qui produisent moins de choses intéressante à apprendre — qu'est-ce qui arrive aux modèles entraînés sur ce contenu ?
Les chiffres sont sans appel
Les analystes d'OpenAI eux-mêmes estiment que le trafic de référence vers les éditeurs a pu chuter de 60% à cause des résumés IA et des chatbots qui gardent les utilisateurs sur leurs plateformes. Le Google Zero — ce phénomène où les sites ne reçoivent plus aucun trafic des recherches Google — est passé du cauchemar théorique à la réalité vécue pour de nombreux éditeurs.
Satya Nadella lui-même a admis dans sa déposition que les chatbots ont « fondamentalement remplacé la recherche et supprimé le besoin d'aller directement à la source pour obtenir des informations ». Ce n'est pas un bug du système ; c'est la fonctionnalité qui rend ces produits précieux pour les utilisateurs.
Nick Turley d'OpenAI aurait été encore plus direct : une fois que vous avez obtenu une réponse de ChatGPT, il n'y a « aucune bonne raison de cliquer » sur un lien vers la source.
Ce que ça signifie pour les développeurs et les startups
Voilà où ça devient pertinent pour vous, développeurs ou fondateurs de startups qui construisent la prochaine génération de produits web.
Les entreprises d'IA essentiellement soutiennent que les anciennes règles ne s'appliquent plus — que le patrimoine commun de la connaissance humaine doit être exploité pour construire des systèmes propriétaires qui remplacent ensuite le besoin d'accéder à cette connaissance. Et ils le font en pleine conscience des dégâts qu'ils causent.
Ça a des implications qui dépassent le spectacle juridique du procès du NYT :
Compter sur les API d'IA, c'est risqué. Si les entreprises qui fournissent ces modèles se livrent à des pratiques douteuses sur le plan juridique et éthique, les fondations de votre produit pourraient être plus précaires que vous ne le pensez.
Les partenariats avec les éditeurs comptent. Les éditeurs ne sont plus disposés à laisser scraper leur contenu sans compensation. Le paysage juridique et économique évolue vers l'exigence de licences.
L'économie du trafic de référence change. Si vous bâtissez un business basé sur le contenu, vous ne pouvez plus supposer que le trafic de recherche ou les partages sociaux vous maintiendront à flot. Les résumés IA peuvent répondre aux questions des utilisateurs avant même qu'ils n'atteignent votre site.
Le web ouvert a de la valeur. Les principes qui ont rendu internet utile — l'interconnexion, les citations, le trafic qui circule vers les sources — créent l'écosystème qui rend l'IA possible en premier lieu. Traiter cet écosystème comme une ressource inépuisable à exploiter sans vergogne est, à terme, contre-productif.
L'ironie est presque parfaite
L'aspect peut-être le plus ironique de tout ça, c'est que Microsoft, Google et OpenAI se précipitent maintenant pour établir des accords de licence avec les éditeurs qu'ils ont endommagés. Nadella lui-même a dit que « tout ce qui est derrière un paywall devrait être concédé sous licence » — un sentiment qui serait plus convaincant si les produits Microsoft n'avaient pas passé des années à considérer le contenu paywalled comme un食材 gratuit pour leurs données d'entraînement.
Les représentants d'OpenAI ont admis dans leurs dépôts qu'ils n'avaient « aucune connaissance » d'efforts systématiques pour détecter ou supprimer le contenu paywalled de leurs données d'entraînement. Donc l'IA qui était censée être entraînée sur des informations publiquement disponibles semble avoir eu pas mal de difficultés à faire la distinction entre ce qui est gratuit et ce qui est derrière un paywall.
Vers l'avenir
La boucle infernale n'est plus théorique. Elle se déroule en ce moment même, pour de vrais créateurs, pour de vrais éditeurs qui essaie de financer leur journalisme et leur production de contenu dans un environnement de plus en plus hostile.
Pour l'industrie tech, prétendre que l'IA « démocratise l'information » tout en détruisant simultanément le modèle économique qui rend la création d'information possible — ce n'est pas de l'innovation. C'est une industrie extractive déguisée en langage de la Silicon Valley.
La question pour les développeurs et les entreprises qui construisent sur l'IA n'est pas simplement « comment utiliser ces outils ? » C'est « comment construire des systèmes qui ne consomment pas leurs propres fondations ? »
Au bout du compte, le web reste la source. Les API et les chatbots ne sont qu'une couche posée dessus. Et si nous décidons collectivement que cette couche est plus précieuse que la fondation sur laquelle elle repose, toute la pile s'effondre.
La boucle infernale est réelle. Reste à savoir si l'industrie a la sagesse d'en sortir avant qu'il ne soit trop tard.
Qu'en pensez-vous ? L'industrie de l'IA crée-t-elle un écosystème non durable, ou ces préoccupations sont-elles exagérées ? Partagez votre point de vue dans les commentaires.