适用场景
技术 SEO 的价值是「让搜索引擎能顺利读懂并收录」。顺序很重要:先保证能抓、能索引,再谈内容与权重。很多站点内容不错却没流量,问题就出在抓取和索引环节。
配置步骤(结构化数据与站点地图)
# 1) 校验结构化数据(用 Search Console 或在线校验工具)
# 常见类型:Organization / WebSite / NewsArticle / FAQPage / BreadcrumbList
# 2) 站点地图健康检查
curl -sS https://example.com/sitemap.xml -o /tmp/sitemap.xml
xmllint --noout /tmp/sitemap.xml && echo 'XML OK'
grep -c '<loc>' /tmp/sitemap.xml
# 抽查前 20 条是否都返回 200
grep -o '<loc>[^<]*' /tmp/sitemap.xml | sed 's/<loc>//' | head -20 | while read -r u; do
code=$(curl -sS -o /dev/null -w '%{http_code}' "$u")
[ "$code" = '200' ] || echo "BAD $code $u"
done
# 3) robots.txt 与 sitemap 关系
curl -sS https://example.com/robots.txt | grep -i sitemap
关键参数与建议
- 抓取基础:robots.txt 放行、sitemap 提交、页面无强制登录
- 索引基础:每页唯一 title/description、canonical 正确、无重复内容
- 结构化数据:Organization / WebSite / NewsArticle / FAQPage / BreadcrumbList 按页面类型使用
- 内链:主导航 + 面包屑 + 相关文章,避免孤岛页面
- 内容架构:栏目层级不超过 3 层,URL 语义清晰且稳定
- 移动与速度:移动端可读、首屏加载达标(详见站点性能优化)
- 监测:搜索资源平台看抓取、索引、覆盖报告,按月处理异常
- 避免作弊:不做隐藏文字、关键词堆砌、批量垃圾外链
容易踩的坑
- sitemap 里塞了成千上万条 404 或重定向地址
- 结构化数据字段造假(评分、作者),被判为作弊
- 同一页面既输出 NewsArticle 又输出 FAQPage 且内容不符
- robots.txt 禁止了整个目录,sitemap 又提交该目录
- sitemap 从未更新,新文章根本不进去
- canonical 指向错误页面,权重分散
验证与巡检
curl -sS https://example.com/sitemap.xml | grep -c '<loc>'
curl -sS -o /dev/null -w 'sitemap http=%{http_code}\n' https://example.com/sitemap.xml
curl -sS -o /dev/null -w 'robots http=%{http_code}\n' https://example.com/robots.txt
# 抽查 20 条 sitemap 链接,全部 200
- 巡检:sitemap 可访问且链接全部 200、结构化数据校验通过、robots 与 sitemap 无冲突
小结
技术 SEO 验收:新文章发布后 24 小时内被 sitemap 收录并进入抓取队列,页面结构化数据校验通过,无重复 title 与 canonical 冲突。
> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。