用shell找出网站的空页面和404错误页面

很早之前记的一个笔记了，之前只是记录了两句代码，放出来的话也是一个低质量的页面，于是设置为了仅自己可见，今晚抽空补充一下。

记得当的情景应该是提交sitemap时百度老提示有错误的URL，导致sitemap不能正常被抓取，于是在想办法解决这个问题，所以才有下面这些笔记：用shell批量找出网站空页面和404错误页面。

废话不多说，直接上shell代码：

time cat sitemap.txt|while read line;do curl -l $line -m 5 --connect-timeout 5 -o /dev/null -s -w "$line "%{http_code}" "%{size_download}"\n";done

前面加了一个time是为了看看代码执行所花的时间

%{http_code}意思是返回HTTP状态码，通过这个状态码我们就能知道该链接是正常的200链接，还是404错误链接；

%{size_download}意思是返回当前页面的大小，如果值太小的话，说明这些页面很有可能是低质量的空页面，得想办法剔除掉。

版权声明：除非注明，本博客均为北京SEO方法的原创文章，转载或引用请以超链接形式标明本文地址，否则会在SEO圈内公开此种不尊重版权的行为，谢谢合作！本文地址：https://seofangfa.com/shell/find-out-404-pages.html
转载请注明：用shell找出网站的空页面和404错误页面_ 【方法SEO顾问】