爬虫小偏方系列:robots.txt 快速抓取网站的小窍门

2019 年 1 月 21 日 人工智能头条

文章来源 | 猿人学 Python

作者王平,一个 IT 老码农,写 Python 十年有余,喜欢专研通过爬虫技术来挣钱。

在我抓取网站遇到瓶颈,想剑走偏锋去解决时,常常会先去看下该网站的 robots.txt 文件,有时会给你打开另一扇抓取之门。

写爬虫有很多苦恼的事情,比如:

1. 访问频次太高被限制;

2. 如何大量发现该网站的 URL;

3. 如何抓取一个网站新产生的 URL,等等;



这些问题都困扰着爬虫选手,如果有大量离散IP和账号,这些都不是问题,但是绝大部分公司都不具备这个条件的。


我们在工作中写的爬虫大多是一次性和临时性的任务,需要你快速完成工作就好,当遇到上面情况,试着看下robots.txt文件。


举个栗子:

老板给你布置一个任务,把豆瓣每天新产生的影评,书评,小组帖子,同城帖子,个人日志抓取下来。


初想一下,这任务得有多大,豆瓣有1.6亿注册用户,光是抓取个人日志这一项任务,每个人的主页你至少每天要访问一次。


这每天就得访问1.6亿次,小组/同城帖子等那些还没算在内。


设计一个常规爬虫,靠着那几十个IP是完不成任务的。


初窥 robots.txt


当老板给你了上面的任务,靠着你这一两杆枪,你怎么完成,别给老板讲技术,他不懂,他只想要结果。



我们来看下豆瓣的 robots.txt

https://www.douban.com/robots.txt


看图片上面红框处,是两个 sitemap 文件

打开 sitemap_updated_index 文件看一下:


里面是一个个压缩文件,文件里面是豆瓣头一天新产生的影评,书评,帖子等等,感兴趣的可以去打开压缩文件看一下。


也就是说每天你只需要访问这个 robots.txt 里的 sitemap 文件就可以知道有哪些新产生的 URL。


不用去遍历豆瓣网站上那几亿个链接,极大节约了你的抓取时间和爬虫设计复杂度,也降低了豆瓣网站的带宽消耗,这是双赢啊,哈哈。


上面通过 robots.txt 的 sitemap 文件找到了抓取一个网站新产生 URL 的偏方。沿着该思路也能解决发现网站大量 URL 的问题。


再举个栗子:

老板又给你一个任务,老板说上次抓豆瓣你说要大量 IP 才能搞定抓豆瓣每天新产生的帖子,这次给你1000个 IP 把天眼查上的几千万家企业工商信息抓取下来。


看着这么多 IP 你正留着口水,但是分析网站后发现这类网站的抓取入口很少(抓取入口是指频道页,聚合了很多链接的那种页面)


很容易就把储备的 URL 抓完了,干看着这么多 IP 工作不饱满。


如果一次性能找到这个网站几万乃至几十万个 URL 放进待抓队列里,就可以让这么多IP工作饱满起来,不会偷懒了。


我们来看他的 robots.txt 文件:

https://www.tianyancha.com/robots.txt



打开红框处的 sitemap,里面有3万个公司的URL,上图是1月3号生成的,那个URL是根据年月日生成的,你把 URL 改成1月2号,又能看到2号的 sitemap 里的几万个公司 URL,这样就能发现十几万个种子 URL 供你抓取了。


PS:上面的 sitemap 其实也能解决抓取天眼查最近更新的,新产生 URL 的问题。


小小的一个取巧,既降低了爬虫设计的复杂度,又降低了对方的带宽消耗。


这在工作中非常适用,工作中不会在意你用的框架多好,只在意你做事的快慢和好坏。


善于看 robots.txt 文件你会发现一些别有洞天的东西。


登录查看更多
0

相关内容

Python地理数据处理,362页pdf,Geoprocessing with Python
专知会员服务
113+阅读 · 2020年5月24日
【实用书】Python爬虫Web抓取数据,第二版,306页pdf
专知会员服务
117+阅读 · 2020年5月10日
【资源】100+本免费数据科学书
专知会员服务
107+阅读 · 2020年3月17日
【初学者系列】tensorboard学习笔记
专知
7+阅读 · 2019年10月4日
手把手教你用Python做一个哄女友神器,小白可上手
网易智能菌
5+阅读 · 2019年6月15日
GitHub 热门:各大网站的 Python 爬虫登录汇总
机器学习算法与Python学习
9+阅读 · 2019年3月20日
Python用法速查网站
Python程序员
17+阅读 · 2018年12月16日
Python | Jupyter导出PDF,自定义脚本告别G安装包
程序人生
7+阅读 · 2018年7月17日
我是一个爬虫
码农翻身
12+阅读 · 2018年6月4日
设计和实现一款轻量级的爬虫框架
架构文摘
13+阅读 · 2018年1月17日
Arxiv
4+阅读 · 2019年12月2日
Arxiv
35+阅读 · 2019年11月7日
Image Captioning: Transforming Objects into Words
Arxiv
7+阅读 · 2019年6月14日
Arxiv
6+阅读 · 2018年4月21日
VIP会员
相关资讯
【初学者系列】tensorboard学习笔记
专知
7+阅读 · 2019年10月4日
手把手教你用Python做一个哄女友神器,小白可上手
网易智能菌
5+阅读 · 2019年6月15日
GitHub 热门:各大网站的 Python 爬虫登录汇总
机器学习算法与Python学习
9+阅读 · 2019年3月20日
Python用法速查网站
Python程序员
17+阅读 · 2018年12月16日
Python | Jupyter导出PDF,自定义脚本告别G安装包
程序人生
7+阅读 · 2018年7月17日
我是一个爬虫
码农翻身
12+阅读 · 2018年6月4日
设计和实现一款轻量级的爬虫框架
架构文摘
13+阅读 · 2018年1月17日
Top
微信扫码咨询专知VIP会员