成人怡红院-成人怡红院视频在线观看-成人影视大全-成人影院203nnxyz-美女毛片在线看-美女免费黄

站長資訊網
最全最豐富的資訊網站

Python之Spider

今天python視頻教程欄目為大家介紹Python的Spider (爬蟲)相關知識。

Python之Spider

一、網絡爬蟲

網絡爬蟲又被稱為網絡蜘蛛,我們可以把互聯網想象成一個蜘蛛網,每一個網站都是一個節點,我們可以使用一只蜘蛛去各個網頁抓取我們想要的資源。舉一個最簡單的例子,你在百度和谷歌中輸入‘Python',會有大量和Python相關的網頁被檢索出來,百度和谷歌是如何從海量的網頁中檢索出你想要的資源,他們靠的就是派出大量蜘蛛去網頁上爬取,檢索關鍵字,建立索引數據庫,經過復雜的排序算法,結果按照搜索關鍵字相關度的高低展現給你。

千里之行,始于足下,我們從最基礎的開始學習如何寫一個網絡爬蟲,實現語言使用Python。

二、Python如何訪問互聯網

想要寫網絡爬蟲,第一步是訪問互聯網,Python如何訪問互聯網呢?

在Python中,我們使用urllib包訪問互聯網。(在Python3中,對這個模塊做了比較大的調整,以前有urllib和urllib2,在3中對這兩個模塊做了統一合并,稱為urllib包。包下面包含了四個模塊,urllib.request,urllib.error,urllib.parse,urllib.robotparser),目前主要使用的是urllib.request。

我們首先舉一個最簡單的例子,如何獲取獲取網頁的源碼:

import urllib.request response = urllib.request.urlopen('https://docs.python.org/3/') html = response.read()print(html.decode('utf-8'))

三、Python網絡簡單使用

首先我們用兩個小demo練一下手,一個是使用python代碼下載一張圖片到本地,另一個是調用有道翻譯寫一個翻譯小軟件。

3.1根據圖片鏈接下載圖片,代碼如下:

import urllib.request  response = urllib.request.urlopen('http://www.3lian.com/e/ViewImg/index.html?url=http://img16.3lian.com/gif2016/w1/3/d/61.jpg') image = response.read()  with open('123.jpg','wb') as f:     f.write(image)

其中response是一個對象

輸入:response.geturl()

->'http://www.3lian.com/e/ViewImg/index.html?url=http://img16.3lian.com/gif2016/w1/3/d/61.jpg'
輸入:response.info()

-><http.client.HTTPMessage object at 0x10591c0b8>

輸入:print(response.info())

->Content-Type: text/html
Last-Modified: Mon, 27 Sep 2004 01:23:20 GMT
Accept-Ranges: bytes
ETag: "0f4b59230a4c41:0"
Server: Microsoft-IIS/8.0
Date: Sun, 14 Aug 2016 07:16:01 GMT
Connection: close

Content-Length: 2827

輸入:response.getcode()

->200

3.1使用有道詞典實現翻譯功能

我們想實現翻譯功能,我們需要拿到請求鏈接。首先我們需要進入有道首頁,點擊翻譯,在翻譯界面輸入要翻譯的內容,點擊翻譯按鈕,就會向服務器發起一個請求,我們需要做的就是拿到請求地址和請求參數。

我在此使用谷歌瀏覽器實現拿到請求地址和請求參數。首先點擊右鍵,點擊檢查(不同瀏覽器點擊的選項可能不同,同一瀏覽器的不同版本也可能不同),進入圖一所示,從中我們可以拿到請求請求地址和請求參數,在Header中的Form Data中我們可以拿到請求參數。

Python之Spider

(圖一)

代碼段如下:

import urllib.requestimport urllib.parse  url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'data = {} data['type'] = 'AUTO'data['i'] = 'i love you'data['doctype'] = 'json'data['xmlVersion'] = '1.8'data['keyfrom'] = 'fanyi.web'data['ue'] = 'UTF-8'data['action'] = 'FY_BY_CLICKBUTTON'data['typoResult'] = 'true'data = urllib.parse.urlencode(data).encode('utf-8') response = urllib.request.urlopen(url,data) html = response.read().decode('utf-8')print(html)

上述代碼執行如下:

{"type":"EN2ZH_CN","errorCode":0,"elapsedTime":0,"translateResult":[[{"src":"i love you","tgt":"我愛你"}]],"smartResult":{"type":1,"entries":["","我愛你。"]}}

對于上述結果,我們可以看到是一個json串,我們可以對此解析一下,并且對代碼進行完善一下:

import urllib.requestimport urllib.parseimport json  url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'data = {} data['type'] = 'AUTO'data['i'] = 'i love you'data['doctype'] = 'json'data['xmlVersion'] = '1.8'data['keyfrom'] = 'fanyi.web'data['ue'] = 'UTF-8'data['action'] = 'FY_BY_CLICKBUTTON'data['typoResult'] = 'true'data = urllib.parse.urlencode(data).encode('utf-8') response = urllib.request.urlopen(url,data) html = response.read().decode('utf-8') target = json.loads(html)print(target['translateResult'][0][0]['tgt'])

四、規避風險

服務器檢測出請求不是來自瀏覽器,可能會屏蔽掉請求,服務器判斷的依據是使用‘User-Agent',我們可以修改改字段的值,來隱藏自己。代碼如下:

import urllib.requestimport urllib.parseimport json  url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'data = {} data['type'] = 'AUTO'data['i'] = 'i love you'data['doctype'] = 'json'data['xmlVersion'] = '1.8'data['keyfrom'] = 'fanyi.web'data['ue'] = 'UTF-8'data['action'] = 'FY_BY_CLICKBUTTON'data['typoResult'] = 'true'data = urllib.parse.urlencode(data).encode('utf-8') req = urllib.request.Request(url, data) req.add_header('User-Agent','Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36') response = urllib.request.urlopen(url, data) html = response.read().decode('utf-8') target = json.loads(html)print(target['translateResult'][0][0]['tgt'])

View Code

上述做法雖然可以隱藏自己,但是還有很大問題,例如一個網絡爬蟲下載圖片軟件,在短時間內大量下載圖片,服務器可以可以根據IP訪問次數判斷是否是正常訪問。所有上述做法還有很大的問題。我們可以通過兩種做法解決辦法,一是使用延遲,例如5秒內訪問一次。另一種辦法是使用代理。

延遲訪問(休眠5秒,缺點是訪問效率低下):

import urllib.requestimport urllib.parseimport jsonimport timewhile True:     content = input('please input content(input q exit program):')    if content == 'q':        break;      url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'     data = {}     data['type'] = 'AUTO'     data['i'] = content     data['doctype'] = 'json'     data['xmlVersion'] = '1.8'     data['keyfrom'] = 'fanyi.web'     data['ue'] = 'UTF-8'     data['action'] = 'FY_BY_CLICKBUTTON'     data['typoResult'] = 'true'     data = urllib.parse.urlencode(data).encode('utf-8')     req = urllib.request.Request(url, data)     req.add_header('User-Agent','Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36')     response = urllib.request.urlopen(url, data)     html = response.read().decode('utf-8')     target = json.loads(html)    print(target['translateResult'][0][0]['tgt'])     time.sleep(5)

View Code

代理訪問:讓代理訪問資源,然后講訪問到的資源返回。服務器看到的是代理的IP地址,不是自己地址,服務器就沒有辦法對你做限制。

步驟:

1,參數是一個字典{'類型' : '代理IP:端口號' } //類型是http,https等

proxy_support = urllib.request.ProxyHandler({})

2,定制、創建一個opener

opener = urllib.request.build_opener(proxy_support)

3,安裝opener(永久安裝,一勞永逸)

urllib.request.install_opener(opener)

3,調用opener(調用的時候使用)

opener.open(url)

五、批量下載網絡圖片

圖片下載來源為煎蛋網(http://jandan.net)

圖片下載的關鍵是找到圖片的規律,如找到當前頁,每一頁的圖片鏈接,然后使用循環下載圖片。下面是程序代碼(待優化,正則表達式匹配,IP代理):

import urllib.requestimport osdef url_open(url):     req = urllib.request.Request(url)     req.add_header('User-Agent','Mozilla/5.0')     response = urllib.request.urlopen(req)     html = response.read()    return htmldef get_page(url):     html = url_open(url).decode('utf-8')     a = html.find('current-comment-page') + 23     b = html.find(']',a)    return html[a:b]def find_image(url):     html = url_open(url).decode('utf-8')     image_addrs = []     a = html.find('img src=')    while a != -1:         b = html.find('.jpg',a,a + 150)        if b != -1:             image_addrs.append(html[a+9:b+4])        else:             b = a + 9         a = html.find('img src=',b)    for each in image_addrs:        print(each)    return image_addrsdef save_image(folder,image_addrs):    for each in image_addrs:         filename = each.split('/')[-1]         with open(filename,'wb') as f:             img = url_open(each)             f.write(img)def download_girls(folder = 'girlimage',pages = 20):     os.mkdir(folder)     os.chdir(folder)     url = 'http://jandan.net/ooxx/'     page_num = int(get_page(url))    for i in range(pages):         page_num -= i         page_url = url + 'page-' + str(page_num) + '#comments'         image_addrs = find_image(page_url)         save_image(folder,image_addrs)if __name__ == '__main__':     download_girls()

代碼運行效果如下:Python之Spider

贊(0)
分享到: 更多 (0)
?
網站地圖   滬ICP備18035694號-2    滬公網安備31011702889846號
色欲蜜臀AV在线播放| 国产清纯在线一区二区WWW| 欧美一区二区三区性视频野战| 午夜成人无码片在线观看影院| 国产无遮挡18禁网站免费| 久久无码中文字幕免费影院| 丰满少妇奶水一区二区三区 | 亚洲色偷偷综合亚洲av伊人| 久久夜色精品国产噜噜亚洲SV| 国内少妇偷人精品免费| 亚洲午夜无码极品久久| 沈陽43歲熟女高潮視頻| 国产丝袜无码一区二区三区视频| 亚洲乱码国产乱码精品精| 欧美午夜性春猛交ⅩXXX| 国产黄 色 网 站 成 人免费| 亚洲精品成AV人片天堂无码| JAVASCRIPT的成熟分类| 破了亲妺妺的处免费视频国产| 亚洲国色天香卡2卡3卡4| 窝窝人体色WWW聚色窝| 草莓榴莲秋葵绿丝污免费版18| 亚洲AV高清在线观看一区二区| 色欲AV无码一区二区人妻| 无码成人黄动漫在线观看| 色久综合网精品一区二区| 19782美国农场主的三个女儿| 色在线 | 国产| 漂亮人妻沦陷精油按摩| 娇小性XXXXX极品娇小| 被俩个黑人前后破苞的女人| 亚洲最新无码中文字幕久久| 亚洲AV无码国产精品色午夜字幕| 日本中文字幕一区二区高清在线| 国产成人无码3000部| AV永久免费网站入口| 亚洲人成无码网站在线观看野花 | 99国内精品久久久久久久漫画| 熟妇高潮一区二区三区 | 亚洲欧洲无卡二区视頻| 亚洲AV六月丁香七月婷婷| 亚洲AV永久无码精品无码一区二区| 五月天天爽天天狠久久久综合| 日本三级黄色视频| 欧美妆和日韩妆区别777CCC| 蜜臀久久AV无码牛牛影视| 玩弄三个高大的熟妇| 免费无码又爽又刺激高潮的动态图 | 久久久亚洲欧洲日产国码二区| 国产成人AV乱码免费观看| 美女下部裸体张开腿视频 | 全免费A敌肛交毛片免费| 久久久久蜜桃精品成人片公司| 成熟丰满熟妇自慰XXXXX| 人妻夜夜爽天天爽三区丁香花| 免费AV片在线观看无需播放器 | 十八款夜间禁用APP| 年轻老师的滋味3在观整有限中字 年轻夫妻把小孩哄睡后开监控 | 顶级RAPPER潮水日本| 亚洲孕妇精品无码av| 亚洲成人在线观看av| 亚洲国产精品一区二区成人片不卡| 熟妇人妻精品一区二区三区颏 | 亚洲久热无码中文字幕人妖| 羞羞漫画AⅤ漫画AV漫画视频| 少妇把腿扒开让我添69动态图 | 亚洲熟妇少妇任你躁在线观看无码 | 当着老公的面被别人欺负该怎么办| 精品一区二区久久久久久久网站| 日韩精品无码一区二区三区AV| 亚洲综合欧美在线一区在线播放| 国产AⅤ无码一区二区三区| 久久亚洲欧美日本精品| 嫩草院一区二区乱码| 蜜桃Av噜噜一区二区三区绯色| 久久精品国产亚洲AV影院| 国产美女遭强高潮网站| 人人澡人人澡人人澡| 女邻居的大乳中文字幕理论| 色欲AⅤ蜜臀AV在线播放| 婷婷色婷婷开心五月| 亚洲一本之道高清乱码| 亚洲乱色熟女一区二区三区麻豆| 性色欲情网站IWWW九文堂| 性欧美XXⅩXXOO护士HD| 亚洲AV无码乱码国产麻豆| 一女被两男吃奶玩乳尖| 亚州AV自慰白浆喷出少妇网站| 亚洲AV永久爆乳无码5区| 亚洲一线二线三线品牌精华液 | 国产成人亚洲综合无码精品| 成·人免费午夜无码不卡| 国产中国男男GayGay| 蜜桃中文字日产乱幕4区| 青青青伊人色综合久久| 久久精品露脸对白国产| 欧美黑人又大又粗XXXXX吞精| 日本三级强乳伦姧| 琪琪网三级伦锂电影| 人妻被修空调在夫面侵犯| 亚洲AV成人一区国产精品小说| 亚洲桃色AV无码| 99在线精品视频高潮喷吹| 非洲黑人最猛性XXXX交| 亚洲AV无码专区在线电影成| 性色AV极品无码专区亚洲AV| 我的妺妺H伦浴室无码视频| 亚洲色偷拍区另类无码专区| 狠狠色噜噜狠狠狠狠7777| 91人妻中文字幕在线精品| 岛国精品一区免费视频在线| 蜜桃久久精品成人无码AV| 亚洲欧美一区二区成人片婷婷| ASIAN日本裸体PICS| 国产蜜芽尤物在线一区| 哦┅┅快┅┅用力啊┅┅动态图| 无码国内精品久久人妻| 抽出含了一整夜的性器液体流出| 免费A级毛片无码韩国| 久久久噜噜噜久噜久久| 亚洲欧美偷拍另类A∨色屁股| 极品熟妇大蝴蝶20P| 亚洲AV永久无码精品主页丝瓜| 国产亚洲精品美女久久久久| 小雪你的奶好大把腿张开| 国产免费永久精品无码| 午夜射精日本三级| 国产亚洲精品A第一页| 亚洲AV成人一区二区三区观看在 | 内射后入在线观看一区| 最新国产精品久久精品| 老外免费CSGO交易网站下载 | 亚洲AV永久无码精品尤物在线| 国国产自偷自偷免费一区| 亚洲AV深夜高潮无码成人| 狠狠躁夜夜躁人妻蜜臂AV| 亚洲国产精品一区二区成人片| 久久不见久久见免费视频3| 亚洲一区二区三区乱码AⅤ| 老师趴讲台屁股撅起来作文| 撞击到最深处她抽搐喷水| 欧美成人看片黄A免费看| JZZJZZ免费观看视频| 日产精品1区2区3区| 国产SUV精品一区二区69| 五十路レンタのおばさん| 野花日本中文免费完整版4| 久久国产精品无码HDAV| 欧美日韩国产码高清综合人成| 亚洲AV永久精品无码桃色| 久久国产色AV免费看| 在线精品动漫一区二区无码| 12孩岁女A处破娇小| 天堂M和天堂2M区别| 亚洲国产成人AV人片久久| 久久99精品久久久久久2021| 真实国产乱子伦沙发睡午觉| 啪啪无码人妻丰满熟妇| 国产A在亚洲线播放| 国产美女被遭强高潮网站免费| 色鬼7777久久| 精品人妻少妇AV一区二区三区| 亚洲色欲色欲欲WWW在线| 免费网站看V片在线18禁无码| H无码动漫在线观看网站| 可以差差差的视频无掩盖| 国产丰满麻豆HDXVIDEOS| 天天摸天天碰天天添| 妓女妓女影院妓女影库妓女网| 影音先锋男人资源站| 人妻无码ΑV中文字幕久久琪琪布 人妻无码ΑV中文字幕久久 | 国产成A人亚洲精V品无码| 亚洲日本一线产区二线产区 | 天天槽夜夜槽槽不停| 韩国青草自慰喷水无码直播间| 又黄又爽又无遮挡免费的网站| 亚洲深深色噜噜狠狠网站| 裸体丰满白嫩大尺度尤物| 午夜熟女插插XX免费视频| 成人乱码一区二区三区四区| 久久精品夜色国产亚洲AV| 无人区码一码二码三码是什么意思| 97超碰人人人人人人少妇| 欧美亚洲日韩国产区三| 国产99久久九九精品无码| 亚洲国产成人精品福利在线观看| 免费夜色污私人网站在线观看| 肥胖孕妇BBWBBWBBW| 亚洲国产成人久久综合人| 色悠久久久久综合先锋影音下载| 国产传媒精品1区2区3区| 无码被窝影院午夜看片爽爽JK | 五月综合激情婷婷六月色窝| 久久久国产精品ⅤA麻豆百度| JAPANESEⅩⅩⅩHD69| 亚洲AⅤ永久无码无人区电影| 男阳茎进女阳道啪啪| 国产蜜桃AV秘 区一区二区三区| 中文字幕日产乱码国内自| 久久精品伊人一区二区三区|