Python Spider

?一、網(wǎng)絡爬蟲

????? 網(wǎng)絡爬蟲又被稱為網(wǎng)絡蜘蛛(???),我們可以把互聯(lián)網(wǎng)想象成一個蜘蛛網(wǎng),每一個網(wǎng)站都是一個節(jié)點,我們可以使用一只蜘蛛去各個網(wǎng)頁抓取我們想要的資源。舉一個最簡單的例子,你在百度和谷歌中輸入‘Python',會有大量和Python相關的網(wǎng)頁被檢索出來,百度和谷歌是如何從海量的網(wǎng)頁中檢索出你想要的資源,他們靠的就是派出大量蜘蛛去網(wǎng)頁上爬取,檢索關鍵字,建立索引數(shù)據(jù)庫,經(jīng)過復雜的排序算法,結果按照搜索關鍵字相關度的高低展現(xiàn)給你。

???? 千里之行,始于足下,我們從最基礎的開始學習如何寫一個網(wǎng)絡爬蟲,實現(xiàn)語言使用Python。

二、Python如何訪問互聯(lián)網(wǎng)

????? 想要寫網(wǎng)絡爬蟲,第一步是訪問互聯(lián)網(wǎng),Python如何訪問互聯(lián)網(wǎng)呢?

????? 在Python中,我們使用urllib包訪問互聯(lián)網(wǎng)。(在Python3中,對這個模塊做了比較大的調(diào)整,以前有urllib和urllib2,在3中對這兩個模塊做了統(tǒng)一合并,稱為urllib包。包下面包含了四個模塊,urllib.request,urllib.error,urllib.parse,urllib.robotparser),目前主要使用的是urllib.request。

????? 我們首先舉一個最簡單的例子,如何獲取獲取網(wǎng)頁的源碼:

import urllib.request

response = urllib.request.urlopen('https://docs.python.org/3/')

html = response.read()

print(html.decode('utf-8'))

三、Python網(wǎng)絡簡單使用

?????? 首先我們用兩個小demo練一下手,一個是使用python代碼下載一張圖片到本地,另一個是調(diào)用有道翻譯寫一個翻譯小軟件。

?????? 3.1根據(jù)圖片鏈接下載圖片,代碼如下:

編輯

import urllib.request

response = urllib.request.urlopen('http://www.3lian.com/e/ViewImg/index.html?url=http://img16.3lian.com/gif2016/w1/3/d/61.jpg')

image = response.read()

with open('123.jpg','wb') as f:

? ? f.write(image)

編輯

?????? 其中response是一個對象

?????? 輸入:response.geturl()

->'http://www.3lian.com/e/ViewImg/index.html?url=http://img16.3lian.com/gif2016/w1/3/d/61.jpg'

輸入:response.info()

?????? -><http.client.HTTPMessage object at 0x10591c0b8>

?????? 輸入:print(response.info())

->Content-Type: text/html

Last-Modified: Mon, 27 Sep 2004 01:23:20 GMT

Accept-Ranges: bytes

ETag: "0f4b59230a4c41:0"

Server: Microsoft-IIS/8.0

Date: Sun, 14 Aug 2016 07:16:01 GMT

Connection: close

?????????? Content-Length: 2827

???????輸入:response.getcode()

?????? ->200

?????? 3.1使用有道詞典實現(xiàn)翻譯功能

??????????? 我們想實現(xiàn)翻譯功能,我們需要拿到請求鏈接。首先我們需要進入有道首頁,點擊翻譯,在翻譯界面輸入要翻譯的內(nèi)容,點擊翻譯按鈕,就會向服務器發(fā)起一個請求,我們需要做的就是拿到請求地址和請求參數(shù)。

??????????? 我在此使用谷歌瀏覽器實現(xiàn)拿到請求地址和請求參數(shù)。首先點擊右鍵,點擊檢查(不同瀏覽器點擊的選項可能不同,同一瀏覽器的不同版本也可能不同),進入圖一所示,從中我們可以拿到請求請求地址和請求參數(shù),在Header中的Form Data中我們可以拿到請求參數(shù)。

編輯

?(圖一)

代碼段如下:

編輯

import urllib.request

import urllib.parse

url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'

data = {}

data['type'] = 'AUTO'

data['i'] = 'i love you'

data['doctype'] = 'json'

data['xmlVersion'] = '1.8'

data['keyfrom'] = 'fanyi.web'

data['ue'] = 'UTF-8'

data['action'] = 'FY_BY_CLICKBUTTON'

data['typoResult'] = 'true'

data = urllib.parse.urlencode(data).encode('utf-8')

response = urllib.request.urlopen(url,data)

html = response.read().decode('utf-8')

print(html)

編輯

????? 上述代碼執(zhí)行如下:

???????? {"type":"EN2ZH_CN","errorCode":0,"elapsedTime":0,"translateResult":[[{"src":"i love you","tgt":"我愛你"}]],"smartResult":{"type":1,"entries":["","我愛你。"]}}

????? 對于上述結果,我們可以看到是一個json串,我們可以對此解析一下,并且對代碼進行完善一下:

編輯

import urllib.request

import urllib.parse

import json

url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'

data = {}

data['type'] = 'AUTO'

data['i'] = 'i love you'

data['doctype'] = 'json'

data['xmlVersion'] = '1.8'

data['keyfrom'] = 'fanyi.web'

data['ue'] = 'UTF-8'

data['action'] = 'FY_BY_CLICKBUTTON'

data['typoResult'] = 'true'

data = urllib.parse.urlencode(data).encode('utf-8')

response = urllib.request.urlopen(url,data)

html = response.read().decode('utf-8')

target = json.loads(html)

print(target['translateResult'][0][0]['tgt'])

編輯

四、規(guī)避風險

?????? 服務器檢測出請求不是來自瀏覽器,可能會屏蔽掉請求,服務器判斷的依據(jù)是使用‘User-Agent',我們可以修改改字段的值,來隱藏自己。代碼如下:

編輯

?View Code

?????? 上述做法雖然可以隱藏自己,但是還有很大問題,例如一個網(wǎng)絡爬蟲下載圖片軟件,在短時間內(nèi)大量下載圖片,服務器可以可以根據(jù)IP訪問次數(shù)判斷是否是正常訪問。所有上述做法還有很大的問題。我們可以通過兩種做法解決辦法,一是使用延遲,例如5秒內(nèi)訪問一次。另一種辦法是使用代理。

????? 延遲訪問(休眠5秒,缺點是訪問效率低下):

編輯

?View Code

????? 代理訪問:讓代理訪問資源,然后講訪問到的資源返回。服務器看到的是代理的IP地址,不是自己地址,服務器就沒有辦法對你做限制。

????? 步驟:

????? 1,參數(shù)是一個字典{'類型' : '代理IP:端口號' } //類型是http,https等

?????? proxy_support = urllib.request.ProxyHandler({})

????? 2,定制、創(chuàng)建一個opener

?????? opener = urllib.request.build_opener(proxy_support)

????? 3,安裝opener(永久安裝,一勞永逸)

?????? urllib.request.install_opener(opener)

????? 3,調(diào)用opener(調(diào)用的時候使用)

??????? opener.open(url)

五、批量下載網(wǎng)絡圖片

?????? 圖片下載來源為煎蛋網(wǎng)(http://jandan.net)

?????? 圖片下載的關鍵是找到圖片的規(guī)律,如找到當前頁,每一頁的圖片鏈接,然后使用循環(huán)下載圖片。下面是程序代碼(待優(yōu)化,正則表達式匹配,IP代理):

編輯

import urllib.request

import os

def url_open(url):

? ? req = urllib.request.Request(url)

? ? req.add_header('User-Agent','Mozilla/5.0')

? ? response = urllib.request.urlopen(req)

? ? html = response.read()

? ? return html

def get_page(url):

? ? html = url_open(url).decode('utf-8')

? ? a = html.find('current-comment-page') + 23

? ? b = html.find(']',a)

? ? return html[a:b]

def find_image(url):

? ? html = url_open(url).decode('utf-8')

? ? image_addrs = []

? ? a = html.find('img src=')

? ? while a != -1:

? ? ? ? b = html.find('.jpg',a,a + 150)

? ? ? ? if b != -1:

? ? ? ? ? ? image_addrs.append(html[a+9:b+4])

? ? ? ? else:

? ? ? ? ? ? b = a + 9

? ? ? ? a = html.find('img src=',b)

? ? for each in image_addrs:

? ? ? ? print(each)

? ? return image_addrs

def save_image(folder,image_addrs):

? ? for each in image_addrs:

? ? ? ? filename = each.split('/')[-1]

? ? ? ? with open(filename,'wb') as f:

? ? ? ? ? ? img = url_open(each)

? ? ? ? ? ? f.write(img)

def download_girls(folder = 'girlimage',pages = 20):

? ? os.mkdir(folder)

? ? os.chdir(folder)

? ? url = 'http://jandan.net/ooxx/'

? ? page_num = int(get_page(url))

? ? for i in range(pages):

? ? ? ? page_num -= i

? ? ? ? page_url = url + 'page-' + str(page_num) + '#comments'

? ? ? ? image_addrs = find_image(page_url)

? ? ? ? save_image(folder,image_addrs)

if __name__ == '__main__':

? ? download_girls()


編輯

?代碼運行效果如下:

編輯

?著作權歸作者所有,轉載或內(nèi)容合作請聯(lián)系作者
【社區(qū)內(nèi)容提示】社區(qū)部分內(nèi)容疑似由AI輔助生成,瀏覽時請結合常識與多方信息審慎甄別。
平臺聲明:文章內(nèi)容(如有圖片或視頻亦包括在內(nèi))由作者上傳并發(fā)布,文章內(nèi)容僅代表作者本人觀點,簡書系信息發(fā)布平臺,僅提供信息存儲服務。

相關閱讀更多精彩內(nèi)容

友情鏈接更多精彩內(nèi)容