想克隆一个网站,搜出来的工具几十个,名字都差不多——整站下载器、网站复制器、网页克隆工具、仿站软件。真用起来发现差距巨大:有的只能下载首页,有的卡在JavaScript渲染,有的下载了500页但链接全是死的。
问题不在工具本身,在于用错了场景。静态HTML站用HTTrack十分钟搞定,React/Vue做的SPA站用HTTrack大概率只能下载一个空壳。WordPress站用HTTrack只能复制前端HTML,数据库里的文章和设置完全拿不到——得用Duplicator这类专用插件。这篇文章按四种克隆场景把对应的工具和操作方法一次说清楚。
四种克隆场景对应四种工具:别用错了
| 你的场景 | 你需要什么 | 该用的工具 | 不该用的工具 |
| 静态网站整站克隆 (HTML/CSS/JS) | 完整下载所有页面、图片、CSS、JS,保留目录结构和内部链接 | HTTrack (Windows/Mac/Linux) | wget(对新手不友好) 在线扒站(大站会超时) |
| 轻量快速下载 (几个页面或小站) | 快速抓取指定页面及其资源,不需要图形界面 | wget (命令行) | HTTrack(太重了) 在线工具(批量不行) |
| 在线快速扒站 (临时使用、不装软件) | 粘贴网址就能下载,不安装任何软件 | WebClone (在线免费) | HTTrack(需要安装) wget(需要命令行) |
| WordPress整站克隆 (含数据库) | 完整复制网站前端+数据库+插件+主题+设置 | Duplicator (WordPress插件) | HTTrack(只能拿HTML,拿不到数据库) wget(同上) |
一、HTTrack:静态网站整站克隆的王牌工具,2026年仍然能打
HTTrack是开源的离线浏览器工具,免费、跨平台(Windows版叫WinHTTrack,Mac/Linux有对应版本)。它的工作原理是:给定一个起始URL,递归跟踪页面上的所有链接,把HTML、CSS、JS、图片、PDF等所有资源下载到本地,并自动重写链接为本地相对路径——最终你可以在本地直接打开index.html,像浏览在线网站一样浏览整个克隆版本。
HTTrack能做什么:文档站、博客、企业官网、静态产品展示站、HTML模板站——只要是服务端渲染的静态或半静态网站,HTTrack基本能完整克隆。下载速度快,支持断点续传(下载中断了下次继续,不用从头来),支持代理设置(爬墙用),支持多线程并发下载。
HTTrack不能做什么:React/Vue/Angular等前端渲染的SPA应用(它只能拿到初始HTML骨架,拿不到JavaScript渲染后的内容);需要登录才能访问的页面;后端动态生成的内容(PHP/数据库驱动的页面,HTTrack拿到的只是那个时刻的HTML快照)。
关键设置(大多数人克隆失败是因为这四项设错了):

| 设置项 | 建议值 | 为什么 |
| 递归深度 | 3-5层(不要选"无限制") | 选无限制会把整个互联网爬一遍(链接到外部站会无限追踪),硬盘很快爆满 |
| 域名限制 | 勾选"Stay on the same domain" | 只下载目标域名的内容,不追踪外链到其他网站 |
| 文件类型过滤 | 根据需要排除.zip/.exe/.mp4等大文件 | 不排除的话,网站上的视频和压缩包会全部下载,一个站可能几十GB |
| 并发连接数 | 3-5个(不要太激进) | 太高会被目标服务器当作攻击封IP,太低下载太慢。3-5个是安全区间 |
操作步骤:打开HTTrack → 下一步 → 输入项目名称和保存路径 → 下一步 → "添加URL"输入目标网站地址 → 点"设置选项"调上面四项参数 → 下一步 → 完成。等它跑完就行,一个100页左右的静态站大约5-10分钟。
二、wget:一行命令搞定轻量下载,适合技术用户
如果你只是想快速下载一个网站或几个页面,不想装HTTrack这种带图形界面的工具,wget是最轻量的选择。Windows(通过WSL或Git Bash)、Mac、Linux都自带或可以安装wget。
一行命令克隆整站:
wget --mirror --convert-links --adjust-extension --page-requisites --no-parent --wait=1 --limit-rate=500K https://example.com/
参数解释:--mirror镜像模式(递归下载+保留时间戳)、--convert-links把链接转成本地相对路径(让你离线能点)、--adjust-extension给无后缀的URL自动加.html、--page-requisites下载页面依赖的CSS/JS/图片、--no-parent不往上级目录爬、--wait=1每次请求间隔1秒(礼貌爬取,不触发反爬)、--limit-rate=500K限速500KB/s(进一步降低被ban风险)。
wget vs HTTrack怎么选:
wget适合轻量下载(几十页的小站、指定目录、定时任务自动化抓取)。HTTrack适合重型任务(几百到几千页的大站、需要图形界面调参数、需要断点续传)。wget的优势是极简、可脚本化、服务器上也能跑。HTTrack的优势是参数可视化、下载状态直观、出错了好排查。
三、WebClone:在线扒站,不装任何软件
不想装HTTrack、不会用wget命令行、就是临时想扒一个站看看源码——在线工具是最省事的方案。
WebClone(github.com/hackbyteSec/WebClone):2026年GitHub上的免费在线扒站工具。粘贴目标网址,自动打包HTML、CSS、JS、图片等所有静态资源,生成一个zip下载包。无需安装、无需注册、完全免费。
在线工具的共同局限:
· 有超时限制(通常2-5分钟),大站还没爬完就中断了
· 递归深度通常只有2-3层,深层页面下载不到
· 并发能力弱,下载速度远不如HTTrack
· 目标网站有反爬措施时基本抓不下来
· 有些在线工具会把你的目标URL记录到服务器日志——敏感网站不要用在线工具
在线工具适合"快速看看"的场景——看竞品首页用了什么结构、研究某个页面的CSS写法、临时保存一个马上要下线的页面。正经的整站克隆还得用HTTrack。
其他在线工具备选:
· SitePuller(codernav.com):在线整站下载,支持数据抓取
· 国内整站下载器Pro:适配中文场景,全中文界面,对百度系网站兼容性好

· Cyotek WebCopy(桌面端):Windows专用的免费整站下载器,HTTrack的轻量替代,界面更现代
四、WordPress用Duplicator:连数据库一起搬走
前面三个工具(HTTrack、wget、WebClone)都是"前端克隆"——它们只能拿到浏览器能看到的HTML/CSS/JS/图片。WordPress网站的文章内容、用户数据、插件设置、主题配置全在MySQL数据库里,前端克隆拿不到。
要完整克隆一个WordPress站(包括数据库),必须用WordPress专用的迁移/克隆工具。
Duplicator(免费版够用):
· 在源站安装Duplicator插件 → 创建"Package"(打包整个网站的所有文件+数据库)→ 下载两个文件(zip压缩包 + installer.php安装脚本)
· 在新服务器上创建空数据库 → 把两个文件上传到网站根目录 → 浏览器访问 installer.php → 按向导填入新数据库信息 → 自动完成克隆
· 整个过程10-30分钟,取决于网站大小。Duplicator免费版支持最大500MB的网站,Pro版支持100GB+的大站。
All-in-One WP Migration(更简单的替代):
操作更傻瓜:安装插件 → 点"Export"导出整个站 → 在新站安装插件 → 点"Import"导入。免费版限制512MB。超过512MB需要付费版。
NS Cloner(多站点站群专用):
如果你用的是WordPress Multisite(多站点网络),NS Cloner可以一键克隆子站点。适合做站群的场景——做好一个模板站,一键克隆出N个子站,每个子站独立管理。
WordPress克隆的注意事项:
克隆完成后,新站的URL和源站不一样。Duplicator和All-in-One WP Migration都会自动替换数据库中的URL。但如果主题或插件里硬编码了URL(写在PHP文件里的绝对路径),需要手动查找替换。
另外,克隆别人的WordPress站涉及版权问题。插件和主题如果是商业付费版,克隆到新站后可能需要重新激活授权。GPL协议的免费插件可以随意使用。
五、2026年克隆网站的三个新变化
1. SPA站越来越多,传统工具抓不动了。React、Vue、Next.js做的网站,内容全靠JavaScript动态渲染。HTTrack和wget拿到的只是一个空HTML骨架。要克隆这类站,目前没有完美的免费方案——需要用到带JavaScript渲染能力的爬虫工具(如Puppeteer/Playwright写脚本),或者直接用浏览器的"另存为"保存单个页面。
2. Cloudflare等CDN的反爬越来越严格。很多网站前面挂了Cloudflare的Bot Fight Mode或5秒盾,HTTrack和wget的请求会被拦截。绕过方法:降低并发连接数到1、增加请求间隔到3-5秒、设置User-Agent模拟正常浏览器、使用代理IP轮换。但即使这样,强反爬的站也可能完全抓不下来。
3. AI辅助克隆开始出现。2026年出现了一些AI驱动的网站克隆工具——不是直接下载HTML,而是用AI分析目标网站的布局和设计,然后自动生成一个外观相似的网站。这种方式不存在版权争议(生成的是"风格相似"而非"代码相同"),但目前还比较早期,还原度有限。
克隆网站这件事,工具选对比参数调好更重要。静态HTML站用HTTrack,把递归深度、域名限制、文件类型过滤、并发连接数四项参数设好,十分钟搞定。轻量下载用wget一行命令。临时看看用WebClone在线扒。WordPress站用Duplicator连数据库一起搬。
克隆之前想清楚目的:如果是学习前端代码,HTTrack够了。如果是备份自己的网站,WordPress用Duplicator、静态站用HTTrack。如果是批量建站群,WordPress Multisite + NS Cloner是最优解。如果是扒别人站来商用,先确认版权——直接复制别人的HTML/CSS/图片发布到自己网站,属于侵权。学习、研究、备份自己的网站才是这些工具的正当用途。
