作者:互联网 时间: 2026-09-03 19:58:00
爬虫讲解不能只看功能名称,更要看它在什么场景下能解决问题。把web、爬虫讲解、怎么做等信息拆开来看,判断会更直接。


先看原文给出的关键信息:xpath表达式 //x表示向下查找n层指定标签;如://div 表示查找所有div标签 /x表示向下查找一层指定的标签 /@x表示查找指定属性的值;能连缀如:@id @src [@属性名称="属性值"]表示查找指定属性等于指定值的标签。继续往下处理时,重点放在这些条件上:如查找class名称等于指定名称的标签 /text()获取标签文本类容 [x]通过索引获取集合里的指定一个元素 1、将xpath表达式过滤出来的结果完成正则匹配;用正则取最终内容收尾时.re('正则') xpath('//div[@class="showlist"]/li//img')[0].re('alt="(w )') 2、在选取器规则;必须继承scrapy.Item类 scrapy.Field()做法。收尾检查时,再把这些细节对上:必须继承scrapy.Spider name设定爬虫名称allowed_domains设定爬取域名start_urls设定爬取网址parse(response)爬虫回调;response里是获取到的html数据对象xpath()过滤器;参数是xpath表达式extract()获取html数据对象里的数据yield item接收了数据的容器对象。
