WebMagic中文版功能
WebMagic是一个简单灵活的Java爬虫框架。基于WebMagic,你可以快速开发出一个高效、易维护的爬虫。webmagic采用完全模块化的设计,功能覆盖整个爬虫的生命周期(链接提取、页面下载、内容抽取、持久化),支持多线程抓取,分布式抓取,并支持自动重试、自定义UA/cookie等功能。
WebMagic是java上面经常的需要的一款爬虫类型的工具了,现在就可以试试最新的0.7.3版本,功能以及使用上面都是完全的免费的,欢迎大家试试!
WebMagic常见问题
(1)由于我这个爬虫的抓取有分页,而且它的分页通过js跳转的,抽取出来感觉有点麻烦,我想直接得到所有的信息,发现可以通过输入url地址请求得到所有的信息(这是网站的一个小问题,它没有设置每页数据记录条数的范围),但是需要登录才可以进行url地址的访问,就要使用cookie模拟登录。
(2)下面分析有关登录信息的cookie,我使用的是chrome,点击如图位置,会看到此网站的cookie,(如果已经访问了一段时间了,可以清除所有cookie然后重新登录再访问,否则可能会有很多的cookie,分析起来不方便),由于只有5个cookie,直接加上就可以访问了
WebMagic0.7.3更新内容
本次更新增加了Downloader模块的一些功能。
#609修复HttpRequestBody没有默认构造函数导致无法反序列化的bug。
#631HttpRequestBody的静态构造函数不再抛出UnsupportedEncodingException受检异常。
#571Page对象增加bytes属性,用于获取二进制数据。下载纯二进制页面时,请设置request.setBinarayContent(true),这样对于二进制内容不会尝试转换为String,减小开销。
#629在HttpUriRequestConverter中会自动对一些导致URI异常的字符进行转移或过滤。
#610自动识别编码时,可以识别Content-Type中charset为大写的情况。
#627支持为Request单独设置页面编码,兼容同一站点多种编码方式的情况。
#613Page对象增加charset属性,其值为request/site中设置的charset,或者为自动检测的charset(未定义时)。
#606升级jsonpath到2.4.0
#608升级jsoup到1.10.3
数苑邮件免费最新版下载-数苑邮件官方客户端1.0.2.3官方版
展开

2014篮球比赛计时计分系统下载-2014篮球比赛计时计分系统1.2 绿色版
浓情惠中秋促销海报psd免费模板素材
任我行求购信息搜索通下载-任我行求购信息搜索通1.8.0 最新免费版
win7桌面记事本软件下载-电脑记事本软件(秋天记事本)2.5 绿色免费版
FCG文档监控软件下载-2017FCG文档管理监控工具1.0 免费电脑版
蒸汽朋克辛迪加修改器电脑版下载-蒸汽朋克辛迪加五项修改器绿色免费版
安慰人的熊本熊表情包大全下载-安慰人的熊本熊表情包高清无水印
微润格子秒表免费下载-微润格子秒表软件1.0绿色版
双十一logo psd-2015年天猫双十一logopsd格式免费下载【logo标签设计】
唱吧歌曲下载-一只红烛唱吧免积分下载歌曲软件20151.0 绿色最新版
淘宝店铺图片批量下载器1.0.2.5 官方最新版
modbus crc计算工具(Modbus CRC校验工具)1.01 中文免费版
重庆开学第一课珍爱生命观后感大全-2018王俊凯开学第一课观后感心得体会【200+300+400+500+600+800字】
艺术签名设计软件免费版-Xy艺术签名设计大师2.0 Pro 绿色免费版
文本自动摘要工具-超级自动摘要1.2 绿色免费版
WinRAR5.0破解版-WinRAR免费版(32位)5.00 beta6 单文件免费版
微信公众号长链接转短连接pc下载-微信公众号短链接生成器1.0.0.0免费版
扣钉盖截屏取图2.1.0.8432 绿色版
ik123破解下载-ik123歌曲下载工具(ik123推荐夜场超好听dj极品house试听软件)1.0 独家特制破解版
跟班尼特福迪一起渡过难关游戏下载-一个人下半身在罐子里拿着一个锤子的游戏免费版