亚洲免费在线视频-亚洲啊v-久久免费精品视频-国产精品va-看片地址-成人在线视频网

您的位置:首頁技術文章
文章詳情頁

python - Scrapy ItemLoader數據清洗疑問

瀏覽:138日期:2022-06-30 08:28:51

問題描述

在使用scrapy抓取數據時,利用itemloader這個類,使用selector取出的值為空時,進入scrapy.Field()里調用filter(),selector取值不為空的確返回'有值',如果selector取出[]或'',那么value進入filter()之后,并不會返回'無值'

def filter(value): if value:return '有值' else:return '無值' # 下面就簡寫了,熟悉的應該能看的懂 scrapy.Field(filter())

有什么辦法將抓取為空的值,經過filyer()之后變成'無值'

問題解答

回答1:

謝邀~不太了解Scrapy,所以題主這個我不太好說我用PHP自己寫的爬蟲大體思路是:1.先是根據正則和一些循環,把要收集的頁面放到隊列里,按類別分類,例如分頁的列表頁一個隊列,列表里的數據內容頁一個隊列。2.然后利用xpath來爬取相關內容頁的數據,爬取的過程中對一些爬取到的數據進行如題主所需的那樣進行處理。3.組裝數據,按照自己所需的標準保存數據。

大體就是這樣,我絕對大部分爬蟲框架也大概都是這種思路吧,無非是在此基礎上增加了,反爬機制,多線程,多進程,增量爬取等等功能。所以,題主找到你這個框架的爬取數據那里進行處理或組裝數據的地方進行處理都行。

標簽: Python 編程
相關文章:
主站蜘蛛池模板: 国产一级aaaaa毛片欧美 | 欧美性性性性性色大片免费的 | 亚州一级毛片在线 | a级毛片高清免费视频 | 和老外3p爽粗大免费视频 | 国产三级精品三级 | 国产精品一区二区免费 | 久久精品国产99久久 | 国产亚洲欧美在线播放网站 | 日本国产在线 | 国产成人一区二区三区在线播放 | 国产精品热久久毛片 | 特级做a爰片毛片免费看一区 | 午夜爽爽| 国产亚洲一区二区三区在线 | 老外一级毛片免费看 | 69性欧美高清影院 | 久久香蕉国产线看观看精品yw | 成人免费毛片一区二区三区 | 亚州a| 国产亚洲精品成人久久网站 | 久久婷五月天 | 欧美亚洲国产精品久久久 | 亚洲国产欧美日韩精品一区二区三区 | 亚洲欧美一区二区三区综合 | 亚洲加勒比久久88色综合 | 91青草久久久久久清纯 | 欧美一级毛片无遮无挡 | 日本免费a级片 | 一本色综合 | 俄罗斯黄色一级片 | 国产成人高清精品免费软件 | 久视频免费精品6 | 国产精品青草久久 | 亚洲国产成人久久综合区 | www.日本高清视频.com | 欧美在线观看视频一区 | 国产女人伦码一区二区三区不卡 | 中国成人在线视频 | 亚洲国产一区二区三区四区五区 | 久久成年视频 |