Python爬蟲庫urllib的使用教程詳解

Python urllib庫

Python urllib庫用於操作網頁URL,並對網頁的內容進行抓取處理。

urllib包 包含以下幾個模塊:

  • urllib.request – 打開和讀取URL
  • urllib.error – 包含urllib.request拋出的異常。
  • urllib.parse – 解析URL
  • urllib.robotparser – 解析robots.txt文件。

需要用的就是每個模塊的內置方法和函數。大概方法如下圖:

urllib.request模塊

urllib.request定義瞭一些打開URL的函數和類,包含授權驗證、重定向、瀏覽器cookies等。

urllib.request可以模擬瀏覽器的一個請求發起過程。

這裡主要介紹兩個常用方法,urlopenRequest

urlopen函數

語法格式如下:

urllib.request.urlopen(url, data=None, [timeout, ]*, cafile=None, capath=None, cadefault=False, context=None)
  • urlurl地址。
  • data:發送到服務器的其他數據對象,默認為None
  • timeout:設置訪問超時時間。
  • cafile 和 capathcafileCA證書,capathCA證書的路徑,使用HTTPS需要用到。
  • cadefault:已經被棄用。
  • contextssl.SSLContext類型,用來指定SSL設置。

示例:

import urllib.request
#導入urllib.request模塊
url=urllib.request.urlopen("https://www.baidu.com")
#打開讀取baidu信息
print(url.read().decode('utf-8'))
#read獲取所有信息,並decode()命令將網頁的信息進行解碼

運行結果

<!DOCTYPE html><!–STATUS OK–><html><head><meta http-equiv="Content-Type" content="text/html;charset=utf-8"><meta http-equiv="X-UA-Compatible" content="IE=edge,chrome=1"><meta content="always" name="
html{color:#000;overflow-y:scroll;overflow:-moz-scrollbars}
body,button,input,select,textarea{font-size:12px;font-family:Arial,sans-serif}  
h1,h2,h3,h4,h5,h6{font-size:100%}                  
em{font-style:normal}
small{font-size:12px}
ol,ul{list-style:none}
a{text-decoration:none}
a:hover{text-decoration:underline}
legend{color:#000}
fieldset,img{border:0}
button,input,select,textarea{font-size:100%} 

response對象是http.client.HTTPResponse類型,主要包含readreadintogetheadergetheadersfileno等方法,以及msgversionstatusreasondebuglevelclosed等屬性。

常用方法:

  • read():是讀取整個網頁內容,也可以指定讀取的長度,如read(300)。獲取到的是二進制的亂碼,所以需要用到decode()命令將網頁的信息進行解碼。
  • readline(): 讀取文件的一行內容。
  • readlines(): 讀取文件的全部內容,它會把讀取的內容賦值給一個列表變量。
  • info():返回HTTPMessage對象,表示遠程服務器返回的頭信息。
  • getcode():返回Http狀態碼。如果是http請求,200請求成功完成;404網址未找到。
  • geturl():返回請求的鏈接。

Request 類

我們抓取網頁一般需要對headers(網頁頭信息)進行模擬,否則網頁很容易判定程序為爬蟲,從而禁止訪問。這時候需要使用到urllib.request.Request類:

class urllib.request.Request(url, data=None, headers={}, origin_req_host=None, unverifiable=False, method=None)
  • urlurl地址。
  • data:發送到服務器的其他數據對象,默認為None
  • headersHTTP請求的頭部信息,字典格式。
  • origin_req_host:請求的主機地址,IP或域名。
  • unverifiable:很少用整個參數,用於設置網頁是否需要驗證,默認是False
  • method:請求方法, 如 GETPOSTDELETEPUT等。

示例:

import urllib.request
#導入模塊
url = "https://www.baidu.com"
#網頁連接
headers = {
"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.122 Safari/537.36"
}
#定義headers,模擬瀏覽器訪問
req = urllib.request.Request(url=url,headers=headers)
#模擬瀏覽器發送,訪問網頁
response = urllib.request.urlopen(req)
#獲取頁面信息
print(response.read().decode("utf-8"))

urllib.error模塊

urllib.error模塊為urllib.request所引發的異常定義瞭異常類,基礎異常類是URLError

urllib.error包含瞭兩個方法,URLErrorHTTPError

URLErrorOSError的一個子類,用於處理程序在遇到問題時會引發此異常(或其派生的異常),包含的屬性reason為引發異常的原因。

HTTPErrorURLError的一個子類,用於處理特殊HTTP錯誤例如作為認證請求的時候,包含的屬性codeHTTP的狀態碼,reason為引發異常的原因,headers為導致HTTPError的特定HTTP請求的HTTP響應頭。

區別:

  • URLError封裝的錯誤信息一般是由網絡引起的,包括url錯誤。
  • HTTPError封裝的錯誤信息一般是服務器返回瞭錯誤狀態碼。

關系:

URLErrorOSERROR的子類,HTTPErrorURLError的子類。

URLError 示例

from urllib import request
from urllib import error

if __name__ == "__main__":
    #一個不存在的連接
    url = "http://www.baiiiduuuu.com/"
    req = request.Request(url)
    try:
        response = request.urlopen(req)
        html = response.read().decode('utf-8')
        print(html)
    except error.URLError as e:
        print(e.reason)

返回結果

[Errno -2] Name or service not known

此錯誤的原因。它可以是一個消息字符串或另一個異常實例。

HTTPError示例

from urllib import request
from urllib import error

if __name__ == "__main__":
    #網站服務器上不存在資源
    url = "http://www.baidu.com/no.html"
    req = request.Request(url)
    try:
        response = request.urlopen(req)
        html = response.read().decode('utf-8')
        print(html)
    except error.HTTPError as e:
        print(e.code)

output

404

URLError和HTTPError混合使用

註意:由於HTTPErrorURLError的子類,所以捕獲的時候HTTPError要放在URLError的上面。

示例:

from urllib import request
from urllib import error

if __name__ == "__main__":
    #網站服務器上不存在資源
    url = "http://www.baidu.com/no.html"
    req = request.Request(url)
    try:
        response = request.urlopen(req)
 #       html = response.read().decode('utf-8')
    except error.HTTPError as e:
        print(e.code)
    except error.URLError as e:
        print(e.code)

如果不用上面的方法,可以直接用判斷的形式

from urllib import request
from urllib import error

if __name__ == "__main__":
    #網站服務器上不存在資源
    url = "http://www.baidu.com/no.html"
    req = request.Request(url)
    try:
        response = request.urlopen(req)
 #       html = response.read().decode('utf-8')
    except error.URLError as e:
        if hasattr(e, 'code'):
            print("HTTPError")
            print(e.code)
        elif hasattr(e, 'reason'):
            print("URLError")
            print(e.reason)

output

HTTPError
404

urllib.parse模塊

模塊定義的函數可分為兩個主要門類:URL解析和URL轉碼。

urlparse()

urllib.parse用於解析URL,格式如下:

urllib.parse.urlparse(urlstring, scheme='', allow_fragments=True)

urlstring為字符串的url地址,scheme為協議類型。

allow_fragments參數為false,則無法識別片段標識符。相反,它們被解析為路徑,參數或查詢組件的一部分,並fragment在返回值中設置為空字符串。

標準鏈接格式為:

scheme://netloc/path;params?query#fragment

對象中包含瞭六個元素,分別為:協議(scheme)、域名(netloc)、路徑(path)、路徑參數(params)、查詢參數(query)、片段(fragment)。

示例:

from urllib.parse import urlparse

o = urlparse("https://docs.python.org/zh-cn/3/library/urllib.parse.html#module-urllib.parse")

print('scheme  :', o.scheme)
print('netloc  :', o.netloc)
print('path    :', o.path)
print('params  :', o.params)
print('query   :', o.query)
print('fragment:', o.fragment)
print('hostname:', o.hostname)

output

scheme  : https
netloc  : docs.python.org
path    : /zh-cn/3/library/urllib.parse.html
params  :
query   :
fragment: module-urllib.parse
hostname: docs.python.org

以上還可以通過索引獲取,如通過

print(o[0])
...
print(o[5])

urlunparse()

urlunparse()可以實現URL的構造。(構造URL

urlunparse()接收一個是一個長度為6的可迭代對象,將URL的多個部分組合為一個URL。若可迭代對象長度不等於6,則拋出異常。

示例:

from urllib.parse import urlunparse
url_compos = ['http','www.baidu.com','index.html','user= test','a=6','comment']
print(urlunparse(url_compos))

output

http://www.baidu.com/index.html;user= test?a=6#comment

urlsplit()

urlsplit()函數也能對 URL進行拆分,所不同的是,urlsplit()並不會把 路徑參數(params) 從 路徑(path) 中分離出來。

URL中路徑部分包含多個參數時,使用urlparse()解析是有問題的,這時可以使用urlsplit()來解析.

urlunsplit()urlunparse()類似,(構造URL),傳入對象必須是可迭代對象,且長度必須是5。

示例:

from urllib.parse import urlunsplit
url_compos = ['http','www.baidu.com','index.html','user= test','a = 2']
print(urlunsplit(url_compos))urlunsplit()

output

http://www.baidu.com/index.html?user= test#a = 2

urljoin()

同樣可以構造URL

傳遞一個基礎鏈接,根據基礎鏈接可以將某一個不完整的鏈接拼接為一個完整鏈接.

註:連接兩個參數的url, 將第二個參數中缺的部分用第一個參數的補齊,如果第二個有完整的路徑,則以第二個為主。

URL 轉碼

python中提供urllib.parse模塊用來編碼和解碼,分別是urlencode()unquote()

編碼quote(string)

URL轉碼函數的功能是接收程序數據並通過對特殊字符進行轉碼並正確編碼非ASCII文本來將其轉為可以安全地用作URL組成部分的形式。它們還支持逆轉此操作以便從作為URL組成部分的內容中重建原始數據,如果上述的URL解析函數還未覆蓋此功能的話

語法:

urllib.parse.quote(string, safe='/', encoding=None, errors=None)

使用%xx轉義符替換string中的特殊字符。字母、數字和 '_.-~' 等字符一定不會被轉碼。在默認情況下,此函數隻對URL的路徑部分進行轉碼。可選的safe形參額外指定不應被轉碼的ASCII字符 — 其默認值為 '/'。

string可以是strbytes對象。

示例:

from urllib import parse

url = "http://www.baidu.com/s?wd={}"
words = "爬蟲"

#quote()隻能對字符串進行編碼
query_string = parse.quote(words)
url = url.format(query_string)
print(url)

執行結果:

http://www.baidu.com/s?wd=%E7%88%AC%E8%99%AB

編碼urlencode()

quote()隻能對字符串編碼,而urlencode()可以對查詢字符串進行編碼。

# 導入parse模塊
from urllib import parse

#調用parse模塊的urlencode()進行編碼
query_string = {'wd':'爬蟲'}
result = parse.urlencode(query_string)

# format函數格式化字符串,進行url拼接
url = 'http://www.baidu.com/s?{}'.format(result)
print(url)

output

http://www.baidu.com/s?wd=%E7%88%AC%E8%99%AB

解碼 unquote(string)

解碼就是對編碼後的url進行還原。

示例:

from urllib import parse
string = '%E7%88%AC%E8%99%AB'
result = parse.unquote(string)
print(result)

執行結果:

爬蟲

urllib.robotparser模塊

(在網絡爬蟲中基本不會用到,使用較少,僅作瞭解)

urllib.robotparser用於解析robots.txt文件。

robots.txt(統一小寫)是一種存放於網站根目錄下的robots協議,它通常用於告訴搜索引擎對網站的抓取規則。

Robots協議也稱作爬蟲協議,機器人協議,網絡爬蟲排除協議,用來告訴爬蟲哪些頁面是可以爬取的,哪些頁面是不可爬取的。它通常是一個robots.txt的文本文件,一般放在網站的根目錄上。

當爬蟲訪問一個站點的時候,會首先檢查這個站點目錄是否存在robots.txt文件,如果存在,搜索爬蟲會根據其中定義的爬取范圍進行爬取。如果沒有找到這個文件,搜索爬蟲會訪問所有可直接訪問的頁面。

urllib.robotparser提供瞭RobotFileParser類,語法如下:

class urllib.robotparser.RobotFileParser(url='')

這個類提供瞭一些可以讀取、解析robots.txt文件的方法:

  • set_url(url) – 設置robots.txt文件的URL
  • read() – 讀取robots.txt URL並將其輸入解析器。
  • parse(lines) – 解析行參數。
  • can_fetch(useragent, url) – 如果允許useragent按照被解析robots.txt文件中的規則來獲取url則返回True
  • mtime() – 返回最近一次獲取robots.txt文件的時間。這適用於需要定期檢查robots.txt文件更新情況的長時間運行的網頁爬蟲。
  • modified() – 將最近一次獲取robots.txt文件的時間設置為當前時間。
  • crawl_delay(useragent) – 為指定的useragentrobots.txt 返回Crawl-delay形參。如果此形參不存在或不適用於指定的useragent 或者此形參的robots.txt條目存在語法錯誤,則返回None
  • request_rate(useragent) -以 named tuple RequestRate(requests, seconds)的形式從robots.txt返回Request-rate形參的內容。如果此形參不存在或不適用於指定的useragent或者此形參的robots.txt條目存在語法錯誤,則返回None
  • site_maps() – 以list()的形式從robots.txt返回Sitemap形參的內容。如果此形參不存在或者此形參的robots.txt條目存在語法錯誤,則返回None

以上就是Python爬蟲庫urllib的使用教程詳解的詳細內容,更多關於Python爬蟲庫urllib的資料請關註WalkonNet其它相關文章!

推薦閱讀: