XML 网站地图生成器

把网址粘进来 — 从表格里、从控制台里,怎么来的都行 — 就能得到搜索引擎接受的文件。重复和无法识别的行会被报出来,而不是悄悄丢掉。

Google 只读取 lastmod,忽略 changefreq 和 priority;保留它们是为了其他爬虫。

使用方法

  1. 粘贴网址清单,每行一个;填了网站地址后,相对路径也可以用。
  2. 如果有修改日期就填上 — Google 会读取这个字段。
  3. 复制 XML 或下载 sitemap.xml,上传到网站根目录。
  4. 要检测现有文件,切到「检测」并粘贴进去。

实用说明

一个 & 就能毁掉整个文件

带参数的网址 —— /?a=1&b=2 —— 再普通不过,但在 XML 里 & 必须转义成 &。否则解析器会在第一条这样的行上失败,并且拒绝整个文件,而不只是那一条。这个工具会转义它写出的每一个网址,所以查询串永远不会让你损失整张站点地图。

Google 到底读哪些字段

四个字段里只有 lastmod 会被使用,而且必须诚实:每次部署都变的日期只会教会爬虫忽略它。changefreq 和 priority 已被 Google 忽略多年;保留它们是因为别的爬虫和一些内部工具仍在读,但别指望它们对排名有任何影响。

常见问题

一个文件能放多少网址?

五万条,且未压缩不超过五十兆字节。超过就把清单拆成多个文件,并在站点地图索引里列出它们。检测时若粘贴的文件超限,会给出提示。

哪些页面不该进站点地图?

任何你不希望出现在搜索结果里的页面:被 robots.txt 或 noindex 关闭的、canonical 指向别处的重复页、跳转页和错误页。站点地图里这类网址一多,整个文件的可信度都会下降。

生成的文件放在哪儿?

放到网站根目录,和 robots.txt 并排,并在 robots.txt 里加上一行「Sitemap: https://example.com/sitemap.xml」。之后是否在 Search Console 提交是可选的,但提交能加快首次抓取。

能用这个工具抓取我的网站吗?

不能,任何浏览器工具都做不到 — 出于安全限制,脚本读不了别的域名的页面。这个工具是用你给的清单生成文件;清单来自你的 CMS、你的构建流程,或者桌面爬虫软件。

相关工具