![]()
Mise en perspective
1 000 milliards de pages web sont stockées dans la Wayback Machine. L’Internet Archive a reconnu le 15 septembre que les protections posées autour de ce fonds, destinées à absorber « des vagues de trafic automatisé à haut volume », attrapent aussi « de vraies personnes par erreur ».
| Repère | Valeur |
|---|---|
| Pages stockées par la Wayback Machine | 1 000 milliards |
| Pages collectées chaque année par la BnF | 2 milliards |
| Années de collecte BnF pour égaler ce fonds | 500, soit cinq siècles |
Concrètement : si vous cherchez une page disparue et que le site vous renvoie une erreur 429, vous n’avez rien fait de travers. Ce code signifie « trop de requêtes » : le serveur juge que votre adresse IP en demande trop, trop vite, et il coupe. Le RFC 6585 qui le définit laisse au serveur le soin de décider comment il compte ces requêtes. Aucune règle commune ne fixe le volume à partir duquel un visiteur devient suspect.
Le fait
Le billet du 15 septembre, signé Mark Graham, directeur de la Wayback Machine, s’ouvre sur un aveu de réception : « On vous a entendus : Réparez la Wayback Machine ! » Suivent trois informations. Le service encaisse des vagues de trafic automatisé. Des protections ont été installées pour le garder en fonctionnement. Le message affiché quand une requête est bloquée par une erreur 429 a été réécrit.

Puis l’admission : « Ces protections attrapent parfois de vraies personnes par erreur. Si cela vous est arrivé, nous en sommes désolés. » Une sortie de secours est proposée : écrire à info@archive.org en précisant son système d’exploitation, son navigateur et son adresse IP, pour que le blocage soit examiné. L’organisation affirme progresser dans sa capacité à distinguer les bots abusifs des personnes qui dépendent du service chaque jour.
Notre regard
Un fonds d’archives ne vaut que par la porte qui y donne accès. La Wayback Machine a franchi les 1 000 milliards de pages archivées en octobre 2025, quand la BnF en collecte 2 milliards par an pour le seul internet français. Le cap américain a été fêté le 22 octobre ; le chiffre français vient du dépôt légal numérique, qui ratisse plus de 4 millions de sites chaque année. Au rythme actuel, cinq siècles sépareraient la collecte française du fonds déjà constitué outre-Atlantique.
La différence de nature compte autant que l’écart de volume. Le fonds américain est un stock mondial consultable en un clic depuis n’importe quel navigateur ; la collecte française est un flux annuel, cadré par la loi, pensé pour la conservation avant la consultation. Les deux ne se remplacent pas, et c’est ce qui rend un blocage coûteux : il n’existe pas de guichet de secours ouvert au même endroit, au même moment.
Un plafond de requêtes sur archive.org n’est donc pas un réglage technique anodin. Il arbitre, requête par requête, l’accès à la trace des pages supprimées : une déclaration effacée d’un site officiel, un service en ligne fermé, une promesse commerciale retirée d’une page d’accueil. Quand cet accès devient intermittent, le réflexe de sauvegarde personnelle cesse d’être une coquetterie de geek.
La nuance
Le billet ne prononce pas les mots « intelligence artificielle ». Il parle de trafic automatisé et de bots abusifs, sans nommer de responsable, sans chiffrer la charge, sans annoncer d’échéance. Lui prêter une croisade contre les robots d’entraînement des modèles, c’est lire ce qu’il n’écrit pas.
Le contexte, lui, est documenté ailleurs. En avril 2025, la Wikimedia Foundation détaillait une hausse de 50 % de la bande passante consommée par le téléchargement de médias depuis janvier 2024, et attribuait « au moins 65 % » du trafic le plus coûteux pour ses centres de données à des robots, avec blocages et limitations de débit en réponse. Les grands communs numériques encaissent la même pression et sortent les mêmes outils. Un wiki allemand en a fait l’expérience avec des agents d’IA autonomes.
Enfin, limiter le débit n’est pas fermer la porte : c’est le geste ordinaire de tout service qui veut rester debout sous une charge anormale. Le problème tient au faux positif. Le filtre ne sait pas encore trancher à coup sûr entre un robot et un lecteur pressé, et c’est le lecteur qui reçoit le message d’erreur.
À surveiller
Trois points. La fréquence des blocages d’abord : l’Internet Archive promet de mieux trier, sans dire à quelle échéance ni jusqu’où. Le canal de signalement ensuite : une adresse e-mail reste, pour l’instant, le seul recours offert à un internaute bloqué à tort. La question de fond enfin, que ce billet laisse ouverte : un fonds financé par des dons, devenu l’infrastructure de preuve du web, doit-il rationner l’accès pour tenir, ou absorber la charge et la payer ?
Côté français, le repli existe mais il a ses murs. Le dépôt légal de l’internet a été officiellement instauré par la loi DADVSI en 2006, et la BnF archive depuis le web national. Ses collections ne se consultent pourtant pas depuis chez soi : « par respect du droit de propriété intellectuelle », elles s’ouvrent dans les salles de recherche de la BnF, sur accréditation, et dans une partie des bibliothèques de dépôt légal imprimeur en région. Un lien mort trouvé un dimanche soir ne s’y résout pas.
Votre réaction :
Article créé en collaboration avec l’IA.
Les plus lus
- 1
Taratata 600 : la date d’enregistrement et celle de diffusion - 2
Mondiaux de cyclisme : le maillot arc-en-ciel rapporte 8 000 euros, moins qu’une étape du Tour - 3
Prix du roman Fnac 2026 : « C’était ça ou mourir » lauréat - 4
Résultats des évaluations nationales 2026, dès le 21 septembre - 5
Résultat du Super Loto du 18 septembre : 13 millions gagnés
Nos dossiers
- France395
- Science273
- Culture193
- Consommation173
- Patrimoine165
- Santé publique164
- IA162
- Sport159
Recevez notre sélection dans votre boîte mail
Le meilleur d’Actu Alt Plus : décryptages, chiffres et panoramas. Désinscription en 1 clic, zéro spam.

