>_ DevTrendszh

语言

首页

语言

板块

前端 后端 移动端 DevOps AI / ML 游戏开发 区块链 嵌入式 安全
Ruby

Wayback Machine Downloader:Web 开发者的时光机

想象一下这个场景:你急需一个旧版网站,但它早已更新或完全消失了。又或者你想分析某个资源多年来的演变历程。手动通过 Web 存档复制数百个页面实在繁琐。幸好,有一款工具可以帮你完成所有工作。

这个项目是什么?

Wayback Machine Downloader 是一款 Ruby 工具,可以从 Wayback Machine 存档下载完整网站。与手动复制不同,它能够:

  • 不仅下载 HTML,还下载所有相关资源(CSS、JS、图片)
  • 保存原始目录结构
  • 自动创建 index.html 以确保正确显示
  • 允许你按日期选择特定版本

Badge

谁需要这个?

  1. 档案管理员和互联网历史研究者 — 用于保存数字遗产
  2. Web 开发者 — 恢复丢失的网站版本
  3. 研究人员 — 分析网络资源的演变
  4. 法律专业人士 — 记录特定日期的内容

令人惊叹的五大功能

1. 按时间戳下载

无需在存档中翻找 — 以 YYYYMMDDHHMMSS 格式指定日期范围,工具就会找到你需要的版本:

wayback_machine_downloader http://example.com --from 20150101 --to 20161231

2. 按内容类型过滤

只需要 PDF 文档或图片?没问题:

wayback_machine_downloader http://example.com --only "/\.(pdf|jpg)$/i"

3. 并行下载

我们把速度提升了 20 倍(默认情况下下载是串行的):

wayback_machine_downloader http://example.com --concurrency 20

4. 通过 Docker 运行

不想安装 Ruby?可以用容器:

docker run --rm -it -v $PWD/websites:/websites hartator/wayback-machine-downloader http://example.com

5. JSON 导出

你可以获取所有可用版本列表而无需下载:

wayback_machine_downloader http://example.com --list

它是如何工作的?

  1. 工具向 archive.org 请求快照索引
  2. 根据你的条件过滤结果
  3. 下载原始文件(不是 Wayback Machine 重写过的)
  4. 重建目录结构
  5. 生成 index.html 以确保正确显示

什么时候真正派上用场?

  • 网站恢复 — 关键故障后的恢复
  • 内容迁移 — 从旧资源迁移内容
  • 法律证据 — 存档版本有确切日期
  • 学术研究 — Web 设计演变研究
  • 保存记忆 — 已关闭的热门网站

结论:值得一试吗?

Wayback Machine Downloader 对于以下人群来说是不可或缺的工具:

  • 处理旧版内容的 Web 开发者
  • 大型组织的存档团队
  • 记者和数字文化研究者

该项目维护活跃(最近更新于 2024 年 2 月),在 GitHub 上有 5.6k 星,运行稳定。如果你曾经需要在 Web 存档中翻找资料 — 这个工具会为你节省数天的工作。

提示:从小处开始 — 尝试用 --exact-url 选项下载单个页面,以评估工具的能力。

相关项目