我们爬取数据的目的肯定不是单纯地为爬而爬,终极目标还是需要把这些数据用起来。不过鄙人在安装时,遇到报错信息:plugin caching_sha2_password could not be loaded,这个问题的处理可参阅:见原文链接 。
目前,我国现行的法律法规并没有对爬虫行为作出明确定义,2012年中国互联网协会曾于出台的《互联网搜索引擎服务自律公约》中将其简单定义为“自动爬行网络的程序”,而在国家互联网信息办公室于2019年5月出台的《数据安全管理办法》中,首次对爬虫行为进行明确规制,即“网络运营者采取自动化手段访问收集网站数据,不得妨碍网站正常运行;此类行为严重影响网站运行,如自动化访问收集流量超过网站日均流量三分之一,网站要求停止自动化访问收集时,应当停止”。