>_ DevTrendsnl

Taal

Home

Talen

Secties

Frontend Backend Mobiel DevOps AI / ML GameDev Blockchain Embedded Beveiliging
Ruby

Wayback Machine Downloader: Een tijdmachine voor webontwikkelaars

Stel je dit voor: je hebt dringend een oude versie van een website nodig, maar deze is allang veranderd of helemaal verdwenen. Of misschien wil je analyseren hoe een bron zich door de jaren heen heeft ontwikkeld. Handmatig honderden pagina's kopiëren via het webarchief is vervelend. Gelukkig is er een tool die al het werk voor je doet.

Wat is dit project?

Wayback Machine Downloader is een Ruby-hulpprogramma dat hele websites uit het Wayback Machine-archief kan downloaden. In tegenstelling tot handmatig kopiëren:

  • Downloadt niet alleen HTML, maar ook alle bijbehorende bronnen (CSS, JS, afbeeldingen)
  • Bewaart de oorspronkelijke mappenstructuur
  • Maakt automatisch index.html aan voor correcte weergave
  • Hiermee kun je specifieke versies selecteren op datum

Badge

Wie heeft dit nodig?

  1. Archivarissen en internet-historici — voor het behouden van digitaal erfgoed
  2. Webontwikkelaars — om verloren versies van websites te herstellen
  3. Onderzoekers — voor het analyseren van de evolutie van webbronnen
  4. Juridische professionals — om inhoud te documenteren op een specifieke datum

Top 5 functies die je zullen verrassen

1. Downloaden op tijdstippen

Geen gedoe met zoeken door het archief — geef een datumbereik op in YYYYMMDDHHMMSS-formaat, en het hulpprogramma vindt de versies die je nodig hebt:

wayback_machine_downloader http://example.com --from 20150101 --to 20161231

2. Filteren op inhoudstype

Wil je alleen PDF-documenten of afbeeldingen? Hier heb je ze:

wayback_machine_downloader http://example.com --only "/\.(pdf|jpg)$/i"

3. Parallelle download

We versnellen het proces 20 keer (downloaden is standaard sequentieel):

wayback_machine_downloader http://example.com --concurrency 20

4. Werken via Docker

Wil je Ruby niet installeren? Er is een container:

docker run --rm -it -v $PWD/websites:/websites hartator/wayback-machine-downloader http://example.com

5. JSON-export

Je kunt een lijst van alle beschikbare versies krijgen zonder te downloaden:

wayback_machine_downloader http://example.com --list

Hoe werkt het onder de motorkap?

  1. Het hulpprogramma vraagt een snapshot-index aan van archive.org
  2. Filtert resultaten volgens je criteria
  3. Downloadt originele bestanden (niet herschreven door Wayback Machine)
  4. Herstelt de mappenstructuur
  5. Genereert index.html voor correcte weergave

Wanneer komt dit eigenlijk van pas?

  • Websiteherstel na een kritieke storing
  • Inhoudmigratie vanaf een oude bron
  • Juridisch bewijs — de gearchiveerde versie heeft een exacte datum
  • Academisch onderzoek naar de evolutie van webdesign
  • Het behouden van de herinnering aan populaire sites die zijn stopgezet

Conclusie: Is het de moeite waard om te proberen?

Wayback Machine Downloader is een onmisbare tool voor:

  • Webontwikkelaars die werken met legacy-inhoud
  • Archiefteams van grote organisaties
  • Journalisten en onderzoekers van digitale cultuur

Het project wordt actief onderhouden (laatste update — februari 2024), heeft 5,6k sterren op GitHub en werkt stabiel. Als je ooit door webarchieven hebt moeten graven — dit hulpprogramma bespaart je dagen werk.

Tip: Begin klein — probeer een enkele pagina te downloaden met de --exact-url optie om de mogelijkheden van het hulpprogramma te evalueren.

Gerelateerde projecten