Wayback Machine Downloader : une machine à voyager dans le temps pour les développeurs web
Imaginez ceci : vous avez urgentement besoin d'une ancienne version d'un site web, mais celui-ci a depuis longtemps changé ou a complètement disparu. Ou peut-être souhaitez-vous analyser comment une ressource a évolué au fil des ans. Copier manuellement des centaines de pages via l'archive web est fastidieux. Heureusement, il existe un outil qui fait tout le travail pour vous.
Qu'est-ce que ce projet ?
Wayback Machine Downloader est un utilitaire Ruby qui peut télécharger des sites web entiers depuis l'archive Wayback Machine. Contrairement à la copie manuelle, il :
- Télécharge non seulement le HTML, mais aussi toutes les ressources associées (CSS, JS, images)
- Conserve la structure de répertoires originale
- Crée automatiquement des index.html pour un affichage correct
- Permet de sélectionner des versions spécifiques par date
Qui en a besoin ?
- Archivistes et historiens d'Internet — pour préserver le patrimoine numérique
- Développeurs web — pour restaurer des versions perdues de sites web
- Chercheurs — pour analyser l'évolution des ressources web
- Professionnels du droit — pour documenter le contenu à une date précise
Top 5 des fonctionnalités qui vous surprendront
1. Téléchargement par horodatages
Pas besoin de fouiller dans l'archive — spécifiez une plage de dates au format YYYYMMDDHHMMSS, et l'utilitaire trouvera les versions dont vous avez besoin :
wayback_machine_downloader http://example.com --from 20150101 --to 20161231
2. Filtrage par type de contenu
Vous voulez seulement des documents PDF ou des images ? Voici comment faire :
wayback_machine_downloader http://example.com --only "/\.(pdf|jpg)$/i"
3. Téléchargement parallèle
Nous accélérons le processus 20 fois (le téléchargement est séquentiel par défaut) :
wayback_machine_downloader http://example.com --concurrency 20
4. Utilisation via Docker
Vous ne voulez pas installer Ruby ? Il y a un conteneur :
docker run --rm -it -v $PWD/websites:/websites hartator/wayback-machine-downloader http://example.com
5. Export JSON
Vous pouvez obtenir une liste de toutes les versions disponibles sans télécharger :
wayback_machine_downloader http://example.com --list
Comment ça fonctionne en coulisses ?
- L'utilitaire demande un index des instantanés à archive.org
- Filtre les résultats selon vos critères
- Télécharge les fichiers originaux (non réécrits par Wayback Machine)
- Recrée la structure de répertoires
- Génère des index.html pour un affichage correct
Quand cela sera-t-il vraiment utile ?
- Restauration de site web après une défaillance critique
- Migration de contenu depuis une ancienne ressource
- Preuve juridique — la version archivée a une date exacte
- Recherche académique sur l'évolution du design web
- Préserver la mémoire de sites populaires qui ont fermé
Conclusion : vaut-il la peine d'essayer ?
Wayback Machine Downloader est un outil indispensable pour :
- Les développeurs web travaillant avec du contenu hérité
- Les équipes d'archivage des grandes organisations
- Les journalistes et chercheurs en culture numérique
Le projet est activement maintenu (dernière mise à jour — février 2024), compte 5,6k étoiles sur GitHub et fonctionne de manière stable. Si vous avez déjà dû fouiller dans les archives web — cet utilitaire vous fera gagner des jours de travail.
Conseil : Commencez petit — essayez de télécharger une seule page avec l'option --exact-url pour évaluer les capacités de l'outil.
Projets similaires