|方方编辑部
Blog · 2018/7/8

学习笔记

20180708学习笔记

学习报告

论文一 基于社交网络信息爬虫的设计与实现研究

获取社交网络信息过程终中的问题

设计与实现

各个模块的设计与实现

小结

社交网络平台因为其开放性,因而在数据库手段和网页爬取的方法上与传统爬虫区别。主要在数据库要使用非关系数据库,使用爬取动态网页的处理方法以及对于反爬网站的处理上。

论文二 网络爬虫针对反爬网站的爬取策略研究

爬虫的基本组成

爬虫的搜索策略

应对网站反爬虫机制

一般网站会

解决方法

论文三 基于网络爬虫的导航深度服务信息自动采集

深度服务信息定义以结构

根据信息关注点以及网络信息,根据POI,将网络信息与POI进行匹配

深度服务信息自动采集

爬虫设计

总结

在之前的爬虫项目中,对于爬虫的细致的框架以及爬虫的模块的设计没有很好的理解。 还有在数据的关联性以及对网页的结构没有完整的了解 但是在第二篇论文中,在对于一些大型购物网站,如京东,如果访问时间间隔一定,也是会被ban的,可以使用随机时间访问页面。 而且在广度优先爬取中,按页码顺序访问页面也会被ban,因此可以将等待爬取URL中的顺序进行打乱,再进行爬取。 第一篇论文中少提了很多在社交网络中爬取信息遇到的问题,比如账号,ip,账号信息完整度(手机注册存活率高)等等 第三篇论文是基于地位位置信息的,广度优先的爬虫,并做了数据清晰以及处理。

生活