一篇文章教會(huì)你利用Python網(wǎng)絡(luò)爬蟲(chóng)獲取分類圖片
【四、涉及的庫(kù)和網(wǎng)站】
1、網(wǎng)址如下:
https://www.doutula.com/photo/list/?page={}
2、涉及的庫(kù):requests、lxml、fake_useragent、time、os
3、軟件:PyCharm
【五、項(xiàng)目實(shí)施】
1、我們定義一個(gè)class類繼承object,然后定義init方法繼承self,再定義一個(gè)主函數(shù)main繼承self。導(dǎo)入需要的庫(kù)和網(wǎng)址,創(chuàng)建保存文件夾。import requests, osfrom lxml import etreefrom fake_useragent import UserAgentimport timeclass bnotiank(object): def __init__(self): os.mkdir("圖片") # 在創(chuàng)建文件夾 記住只有第一次運(yùn)行加上,如果多次運(yùn)行請(qǐng)注釋掉本行。 def main(self): passif __name__ == '__main__': Siper=bnotiank() Siper.main()
2、隨機(jī)UserAgent ,構(gòu)造請(qǐng)求頭,防止反爬。 ua = UserAgent(verify_ssl=False) for i in range(1, 50): self.headers = { 'User-Agent': ua.random }
3、發(fā)送請(qǐng)求 ,獲取響應(yīng),頁(yè)面回調(diào),方便下次請(qǐng)求。 '''發(fā)送請(qǐng)求 獲取響應(yīng)''' def get_page(self, url): res = requests.get(url=url, headers=self.headers) html = res.content.decode("utf-8") return html
4、定義parse_page函數(shù),獲取二級(jí)頁(yè)面地址,for遍歷獲取需要的字段。
def parse_page(self, html): parse_h(yuǎn)tml = etree.HTML(html) image_src_list = parse_h(yuǎn)tml.xpath('//p/a/@href') # print(image_src_list)
5、對(duì)二級(jí)頁(yè)面發(fā)生請(qǐng)求,xpath解析數(shù)據(jù),獲取大圖片鏈接。
reo = parse_h(yuǎn)tml1.xpath('//div//div[@class="content"]') #父結(jié)點(diǎn) for j in reo: d = j.xpath('.//article[@class="article-content"]//p/img/@src')[0] text = parse_h(yuǎn)tml1.xpath('//h1[@class ="article-title"] //a/text()')[0].strip()
6、請(qǐng)求圖片地址,寫入文檔。
html2 = requests.get(url=d, headers=self.headers).content dirname = "./d/" + text + ".jpg" #定義圖命名 with open(dirname, 'wb') as f: f.write(html2) print("%s 【下載成功。。!】" % text)
7、調(diào)用方法,實(shí)現(xiàn)功能。 url = self.url.format(page) print(url) html = self.get_page(url) self.parse_page(html)
8、設(shè)置延時(shí)。(防止ip被封)。
time.sleep(1) """時(shí)間延時(shí)"""
【六、效果展示】
1、點(diǎn)擊綠色小三角運(yùn)行輸入起始頁(yè),終止頁(yè)。
2、將下載成功信息顯示在控制臺(tái)。

發(fā)表評(píng)論
請(qǐng)輸入評(píng)論內(nèi)容...
請(qǐng)輸入評(píng)論/評(píng)論長(zhǎng)度6~500個(gè)字
圖片新聞
-
馬云重返一線督戰(zhàn),阿里重啟創(chuàng)始人模式
-
機(jī)器人奧運(yùn)會(huì)戰(zhàn)報(bào):宇樹(shù)機(jī)器人摘下首金,天工Ultra搶走首位“百米飛人”
-
存儲(chǔ)圈掐架!江波龍起訴佰維,索賠121萬(wàn)
-
長(zhǎng)安汽車母公司突然更名:從“中國(guó)長(zhǎng)安”到“辰致科技”
-
豆包前負(fù)責(zé)人喬木出軌BP后續(xù):均被辭退
-
字節(jié)AI Lab負(fù)責(zé)人李航卸任后返聘,Seed進(jìn)入調(diào)整期
-
員工持股爆雷?廣汽埃安緊急回應(yīng)
-
中國(guó)“智造”背后的「關(guān)鍵力量」
最新活動(dòng)更多
-
10月23日火熱報(bào)名中>> 2025是德科技創(chuàng)新技術(shù)峰會(huì)
-
10月23日立即報(bào)名>> Works With 開(kāi)發(fā)者大會(huì)深圳站
-
11月7日立即參評(píng)>> 【評(píng)選】維科杯·OFweek 2025(第十屆)物聯(lián)網(wǎng)行業(yè)年度評(píng)選
-
即日-11.25立即下載>>> 費(fèi)斯托白皮書《柔性:汽車生產(chǎn)未來(lái)的關(guān)鍵》
-
11月27日立即報(bào)名>> 【工程師系列】汽車電子技術(shù)在線大會(huì)
-
11月28日立即下載>> 【白皮書】精準(zhǔn)洞察 無(wú)線掌控——283FC智能自檢萬(wàn)用表
推薦專題
-
8 每日AI全球觀察
- 1 特斯拉工人被故障機(jī)器人打成重傷,索賠3.6億
- 2 【行業(yè)深度研究】退居幕后四年后,張一鳴終于把算法公司變成AI公司?
- 3 AI 時(shí)代,阿里云想當(dāng)“安卓” ,那誰(shuí)是“蘋果”?
- 4 拐點(diǎn)已至!匯川領(lǐng)跑工控、埃斯頓份額第一、新時(shí)達(dá)海爾賦能扭虧為盈
- 5 硬剛英偉達(dá)!華為發(fā)布全球最強(qiáng)算力超節(jié)點(diǎn)和集群
- 6 隱退4年后,張一鳴久違現(xiàn)身!互聯(lián)網(wǎng)大佬正集體殺回
- 7 L3自動(dòng)駕駛延期,逼出車企技術(shù)自我淘汰
- 8 谷歌“香蕉”爆火啟示:國(guó)產(chǎn)垂類AI的危機(jī)還是轉(zhuǎn)機(jī)?
- 9 00后華裔女生靠?jī)刹緼I電影狂賺7.8億人民幣,AI正式進(jìn)軍好萊塢
- 10 機(jī)器人9月大事件|3家國(guó)產(chǎn)機(jī)器人沖刺IPO,行業(yè)交付與融資再創(chuàng)新高!
- 高級(jí)軟件工程師 廣東省/深圳市
- 自動(dòng)化高級(jí)工程師 廣東省/深圳市
- 光器件研發(fā)工程師 福建省/福州市
- 銷售總監(jiān)(光器件) 北京市/海淀區(qū)
- 激光器高級(jí)銷售經(jīng)理 上海市/虹口區(qū)
- 光器件物理工程師 北京市/海淀區(qū)
- 激光研發(fā)工程師 北京市/昌平區(qū)
- 技術(shù)專家 廣東省/江門市
- 封裝工程師 北京市/海淀區(qū)
- 結(jié)構(gòu)工程師 廣東省/深圳市