java crawler framework
java实现的爬虫框架
从头开始, 一步一步的实现一个可用的爬虫框架,每个地方加一个里程碑的tag,主要用于记录这个工程的诞生过程
实现了一个最简单,最基础的爬虫, 处于能用的阶段
利用HttpClient来替代jdk的http请求;新增http参数配置
实现深度爬网页
实现爬取队列
实现Job任务中爬取 + 结果解析的分离; 完成任务结束的标识设定
添加日志埋点
新增动态配置信息支持
对象池的实现
一灰灰Blog地址: https://blog.hhui.top/
所有QuickCrawel相关博文汇总: QuickCrawel java爬虫归档