scrapy爬虫时如何利用xpath爬取某个div里所有p的内容

2023年9月26日 609次阅读来源: yuanxiaolan

当我们想爬取div class=”articlebody”下p中所有文本的时候，如果这样写

item[‘body’] = (response.xpath(‘//div[@class=”articleBody”]/ptext()’).extract()[0])

会发现仅仅是第一个p中的内容，而不是所有的，此时应该利用的是for循环。

divs=response.xpath(‘//div[@class=”articleBody”]’)

body=””

for p in divs.xpath(‘.//p/text()’):

body=body+ p.extract().strip()

item[‘body’]=body

    原文作者：yuanxiaolan
    原文地址: https://www.jianshu.com/p/f5dc9499097e
    本文转自网络文章，转载此文章仅为分享知识，如有侵权，请联系博主进行删除。