网站改版迁移
公司官网从旧域名迁到新域名,3000 多个产品页 URL 全变了。运营小张需要在 2 天内把新站所有页面生成一份 XML 地图提交给百度,同时还要把旧站 301 跳转对应的旧 URL 从旧的 sitemap 里筛出来。本工具直接把 URL 列表批量转成标准 XML,还支持按域名过滤和分片导出,小张只花了 15 分钟就拿到了两份干净的地图文件,不用手动改一个标签。
https://example.com/ freq=daily prio=1.0 mod=2026-06-01。
loc 中的 & < > " ' 会自动 XML 转义。手动编辑 sitemap.xml 时,一个未转义的 & 号或漏掉的闭合标签就能让搜索引擎爬虫报错。把 URL 列表贴进去,工具逐行解析、自动转义特殊字符,并生成标准 XML 结构,同时校验每个标签的合法性。处理完的 sitemap 支持按 50,000 条上限分片导出。解析与校验在后端完成,URL 内容仅用于本次处理,不会持久化存储。
公司官网从旧域名迁到新域名,3000 多个产品页 URL 全变了。运营小张需要在 2 天内把新站所有页面生成一份 XML 地图提交给百度,同时还要把旧站 301 跳转对应的旧 URL 从旧的 sitemap 里筛出来。本工具直接把 URL 列表批量转成标准 XML,还支持按域名过滤和分片导出,小张只花了 15 分钟就拿到了两份干净的地图文件,不用手动改一个标签。
甲方换了 SEO 服务商,新顾问要求前任提供完整的 sitemap 清单。前任只给了一个乱序的 TXT 文件,里面混着 404 页面、重复 URL 和带中文参数的地址。新顾问把这份列表导入本工具,先用校验功能筛出格式错误和无效条目,再用分片功能按 5000 条一组拆成多个 XML,最后统一导出。整个过程不到 10 分钟,交接报告里的数据有了依据。
双十一前夜,运营临时上线了 200 个秒杀活动页,每个页面的 URL 都带不同促销参数。技术说第二天才能更新 sitemap,但搜索引擎当天就要抓取。运营把 200 个链接粘贴进本工具,勾选「排除参数重复项」后生成了一份干净的 XML,直接用 FTP 覆盖了服务器上的旧文件。第二天百度站长后台显示新页面在 3 小时内被全部收录。
一家出海工具站有中、英、日三种语言版本,每个页面对应三条 URL(例如 /zh/product、/en/product、/ja/product)。之前手动维护 sitemap 经常漏掉某个语言版本。运营把三个语言的 URL 列表分别导入本工具,利用「分片」功能为每种语言生成独立的 sitemap 文件,再统一提交到 Google Search Console。工具自动校验了每条 URL 的 XML 语法,没有出现标签闭合错误。
独立博主写了半年,累积了 80 篇长文,想提交 sitemap 让 Google 收录。但他不知道 XML 格式怎么写,手动用记事本拼标签拼到第 20 条就乱了。他把所有文章 URL 按行粘贴到本工具,点击生成就得到了一个完整的 XML 文件,包含 <lastmod> 和 <changefreq> 字段。上传到网站根目录后,Google Search Console 提示「已发现 80 个网址,其中 76 个已编入索引」。
| 输入 | 输出 | 说明 |
|---|---|---|
| https://example.com/page1 https://example.com/page2 https://example.com/page3 | <?xml version="1.0" encoding="UTF-8"?> <urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"> <url><loc>https://example.com/page1</loc></url> <url><loc>https://example.com/page2</loc></url> <url><loc>https://example.com/page3</loc></url> </urlset> | 常规:3条URL生成标准XML,验证基本列表→XML转换功能 |
| https://example.com/ | <?xml version="1.0" encoding="UTF-8"?> <urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"> <url><loc>https://example.com/</loc></url> </urlset> | 常规:单条URL(首页),验证最小输入也能正常输出 |
| 错误:输入列表为空,请至少输入一条URL | 边界:空输入,验证工具对无数据情况的错误提示 | |
| https://example.com/page1 https://example.com/page2 (空行) https://example.com/page3 | <?xml version="1.0" encoding="UTF-8"?> <urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"> <url><loc>https://example.com/page1</loc></url> <url><loc>https://example.com/page2</loc></url> <url><loc>https://example.com/page3</loc></url> </urlset> | 边界:输入含空行,验证工具是否自动忽略空行 |
| https://example.com/page1 https://example.com/page2 https://example.com/page3 https://example.com/page4 https://example.com/page5 https://example.com/page6 https://example.com/page7 https://example.com/page8 https://example.com/page9 https://example.com/page10 https://example.com/page11 | <?xml version="1.0" encoding="UTF-8"?> <urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"> <url><loc>https://example.com/page1</loc></url> <url><loc>https://example.com/page2</loc></url> <url><loc>https://example.com/page3</loc></url> <url><loc>https://example.com/page4</loc></url> <url><loc>https://example.com/page5</loc></url> <url><loc>https://example.com/page6</loc></url> <url><loc>https://example.com/page7</loc></url> <url><loc>https://example.com/page8</loc></url> <url><loc>https://example.com/page9</loc></url> <url><loc>https://example.com/page10</loc></url> </urlset> 分片提示:已生成第1个文件(10条),剩余1条将生成第2个文件 | 边界:超过10条URL触发分片,验证分片逻辑正确性 |
| not-a-url https://example.com/page1 | <?xml version="1.0" encoding="UTF-8"?> <urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"> <url><loc>https://example.com/page1</loc></url> </urlset> 警告:已忽略1条无效URL(not-a-url),请检查输入 | 易错:输入含非法URL格式,验证工具是否自动过滤并给出警告 |
| https://example.com/中文路径 https://example.com/page2 | <?xml version="1.0" encoding="UTF-8"?> <urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"> <url><loc>https://example.com/%E4%B8%AD%E6%96%87%E8%B7%AF%E5%BE%84</loc></url> <url><loc>https://example.com/page2</loc></url> </urlset> | 易错:URL含中文,验证工具是否自动进行百分比编码 |
1.URL 列表包含非标准协议或相对路径
//example.com/page
ftp://files.example.com/doc.pdf
../about.htmlhttps://example.com/page
https://files.example.com/doc.pdf
https://example.com/about.htmlSitemap 协议要求所有 URL 使用绝对路径且协议必须是 http/https。相对路径或 ftp 协议会被校验器直接拒绝,导致整个 sitemap 无效。
2.XML 标签大小写错误或属性顺序混淆
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<Url>
<Loc>https://example.com</Loc>
</Url>
</urlset><urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://example.com</loc>
</url>
</urlset>Sitemap 标签名严格区分大小写,必须全小写(urlset、url、loc)。属性顺序不影响解析,但标签名大小写错误会导致 XML 校验失败。
3.URL 中包含未转义的特殊字符
<loc>https://example.com/path?query=1&sort=desc</loc><loc>https://example.com/path?query=1&sort=desc</loc>XML 中 & 字符必须转义为 &,否则解析器会将其视为实体引用开始符。其他需转义字符包括 <(<)、>(>)、'(')、"(")。
4.单文件 URL 数量超过 50,000 条上限
一个 sitemap.xml 里放了 60,000 条 URL拆分为两个 sitemap 文件:sitemap-1.xml(50,000 条)、sitemap-2.xml(10,000 条),再用 sitemapindex 索引Sitemap 协议规定单个文件最多 50,000 个 URL 且未压缩时不超过 50MB。超出后搜索引擎会忽略超出的条目,必须使用 sitemapindex 分片。
5.lastmod 日期格式不符合 W3C Datetime 规范
<lastmod>2024-1-5</lastmod>
<lastmod>2024/01/05</lastmod><lastmod>2024-01-05</lastmod>
<lastmod>2024-01-05T14:30:00+08:00</lastmod>Sitemap 要求 lastmod 使用 W3C Datetime 格式(YYYY-MM-DD 或 YYYY-MM-DDThh:mm:ss±hh:mm)。非标准格式会被搜索引擎忽略或解析错误,影响抓取优先级判断。
6.changefreq 和 priority 值超出协议定义范围
<changefreq>weekly</changefreq>
<priority>1.5</priority><changefreq>weekly</changefreq>
<priority>0.8</priority>changefreq 仅允许 always/hourly/daily/weekly/monthly/yearly/never 七个值;priority 必须是 0.0~1.0 之间的浮点数。超出范围的值会被搜索引擎忽略,使用默认值。
7.sitemapindex 中直接包含 URL 条目而非 sitemap 引用
<sitemapindex xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://example.com/page</loc>
</url>
</sitemapindex><sitemapindex xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<sitemap>
<loc>https://example.com/sitemap-1.xml</loc>
</sitemap>
</sitemapindex>sitemapindex 是索引文件,内部只能包含 <sitemap> 标签引用子 sitemap 文件,不能直接放 <url> 条目。搜索引擎解析索引文件时只识别 <sitemap> 子元素。
sitemap_size = Σ(URL_len_i + 20) + 512
sitemap_sizesitemap 文件总字节数URL_len_i第 i 个 URL 的字符串长度20每个 URL 的 XML 标签开销字节512XML 头部与根标签固定开销字节某站点有 3 个 URL:/page1(8 字符)、/page2(8 字符)、/about(6 字符)。sitemap_size = (8+20)+(8+20)+(6+20)+512 = 28+28+26+512 = 594 字节。该值小于 50 MB 限制,无需分片。
可以。本工具支持直接粘贴纯文本 URL 列表(每行一个链接),自动将其转换为标准 XML Sitemap 格式。不需要手动编写 XML 标签。输入区接受 http/https 开头的完整 URL,也接受相对路径(如 /about),工具会自动补全为绝对 URL。如果列表里混了非 URL 文本,工具会跳过并标记出来,不会中断生成。
本工具内置分片(Sitemap Index)功能。当生成的 XML 文件超过 50MB 或包含超过 5 万个 URL 时,工具会自动拆分为多个子文件,并生成一个 Sitemap Index 文件指向它们。你也可以手动设置每个分片的 URL 数量上限(如 1 万条)。分片文件会以 sitemap-1.xml、sitemap-2.xml 命名,Index 文件为 sitemap-index.xml。
常见原因有三:1)XML 标签大小写错误,本工具生成的标签是全小写标准格式,但如果手动修改过需检查;2)URL 中包含未转义的特殊字符(如 &、<、>),本工具会自动转义,但粘贴来源的 URL 如果已含这些字符需先处理;3)文件编码非 UTF-8,本工具输出固定为 UTF-8 无 BOM。如果仍报错,用工具底部的「校验」功能先检查一次,会直接标出具体错误行。
本工具采用后端处理(BE),数据会经过服务器进行 XML 生成和分片。处理完成后,服务器不会保留你的 URL 列表或生成的 sitemap 文件。建议不要在列表里包含敏感信息(如带密码的临时链接)。如果对隐私要求极高,可以考虑使用纯前端实现的同类工具,数据完全在浏览器本地处理。
不会。本工具自动将 URL 中的非 ASCII 字符(如中文、日文、特殊符号)进行百分号编码(Percent-encoding),生成符合 RFC 3986 标准的 URL。例如「/产品/详情」会转为「/%E4%BA%A7%E5%93%81/%E8%AF%A6%E6%83%85」。搜索引擎(百度、Google)均能正常识别这种编码。
本工具默认生成包含 `<loc>`、`<lastmod>`、`<changefreq>`、`<priority>` 四个标签的完整 Sitemap。`<lastmod>` 默认使用当前生成时间(你也可以在输入时手动指定每个 URL 的最后修改时间);`<changefreq>` 默认为 weekly;`<priority>` 默认为 0.5。如果搜索引擎只需要 `<loc>`,可以在生成前勾选「精简模式」,只输出 `<loc>` 标签,文件体积更小。
本工具适合已有 URL 列表的场景。如果你有几千个 URL 的列表(比如从数据库导出、CMS 后台导出),直接粘贴即可秒级生成。如果连列表都没有,需要先通过爬虫获取网站所有链接,那应该先用爬虫工具(如 Screaming Frog、Xenu)抓取,导出 URL 列表后再用本工具转换。本工具不提供爬虫功能,专注在「列表→XML」转换这一步。
提示「无法抓取」通常意味着搜索引擎无法下载你的 sitemap 文件。检查三点:1)sitemap 文件是否放在网站根目录(如 example.com/sitemap.xml),本工具生成的是文件内容,需要手动上传到服务器;2)服务器是否返回 200 状态码,且内容类型(Content-Type)为 application/xml;3)文件是否被 robots.txt 禁止爬取。如果文件上传路径不对或服务器配置问题,工具本身无法解决。
有必要。即使只有少量页面,提交 sitemap 也能帮助搜索引擎更快发现这些页面,尤其是新站或页面结构较深(需要多次点击才能到达)的情况。本工具对少量 URL 同样适用,生成速度不受影响。如果页面数少于 50,建议把 changefreq 设为 daily、priority 设为 0.8 以上,让搜索引擎更重视。
隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。