一、概述

? ? urllib2是Python的一個針對URLs的庫。他以urlopen函數的形式提供了一個非常簡單的接口，這是具有利用不同協議獲取URLs的能力，他同樣提供了一個比較復雜的接口來處理一般情況，例如：基礎驗證，cookies,代理和其他。它們通過handlers和openers的對象提供。

? ? urllib2支持獲取不同格式的URLs(在URL的":"前定義的字串,例如："ftp"是"ftp:python.ort/"的前綴),它們利用它們相關網絡協議(例如FTP,HTTP)進行獲取。這篇教程關注最廣泛的應用--HTTP。

對于簡單的應用，urlopen是非常容易使用的。但當你在打開HTTP的URLs時遇到錯誤或異常，你將需要一些超文本傳輸協議(HTTP)的理解。

二、快速上手

最簡單的使用urllib2

代碼實例：

import urllib2

response=urllib2.urlopen('http://python.org/')

html=response.read()

urllib2的很多應用就是那么簡單(記住，除了"http:",URL同樣可以使用"ftp:","file:"等等來替代)。但這篇文章是教授HTTP的更復雜的應用。

HTTP是基于請求和應答機制的--客戶端提出請求，服務端提供應答。urllib2用一個Request對象來映射你提出的HTTP請求,在它最簡單的使用形式中你將用你要請求的地址創建一個Request對象，通過調用urlopen并傳入Request對象，將返回一個相關請求response對象，這個應答對象如同一個文件對象，所以你可以在Response中調用.read()。

import urllib2

req=urllib2.Request('http://www.pythontab.com')

response=urllib2.urlopen(req)

the_page=response.read()

記得urllib2使用相同的接口處理所有的URL頭。例如你可以像下面那樣創建一個ftp請求。

req = urllib2.Request('ftp://example.com/')

在HTTP請求時，允許你做額外的兩件事。首先是你能夠發送data表單數據，其次你能夠傳送額外的關于數據或發送本身的信息("metadata")到服務器，此數據作為HTTP的"headers"來發送。

接下來讓我們看看這些如何發送的吧。

三、Data數據

? ? 有時候你希望發送一些數據到URL(通常URL與CGI[通用網關接口]腳本，或其他WEB應用程序掛接)。在HTTP中,這個經常使用熟知的POST請求發送。這個通常在你提交一個HTML表單時由你的瀏覽器來做。

? ? 并不是所有的POSTs都來源于表單，你能夠使用POST提交任意的數據到你自己的程序。一般的HTML表單，data需要編碼成標準形式。然后做為data參數傳到Request對象。編碼工作使用urllib的函數而非urllib2。

代碼實例：

import urllib

import urllib2

url='http://www.pythontab.com'

values={

? ? ? ? ? ? ?'name':'Michael?Foord',

? ? ? ? ? ? ?'location':'pythontab',

? ? ? ? ? ? ?'language':'Python'

?}

data=urllib.urlencode(values)

req=urllib2.Request(url,?data)

response=urllib2.urlopen(req)

the_page=response.read()

? ? 記住有時需要別的編碼(例如從HTML上傳文件--看http://www.w3.org/TR/REC-html40/interact/forms.html#h-17.13 HTML Specification, Form Submission的詳細說明)。

? ? 如ugoni沒有傳送data參數，urllib2使用GET方式的請求。GET和POST請求的不同之處是POST請求通常有"副作用"，它們會由于某種途徑改變系統狀態(例如提交成堆垃圾到你的門口)。

? ? 盡管HTTP標準說的很清楚POSTs通常會產生副作用，GET請求不會產生副作用，但沒有什么可以阻止GET請求產生副作用，同樣POST請求也可能不產生副作用。Data同樣可以通過在Get請求的URL本身上面編碼來傳送。

代碼實例：

>>>import urllib2

>>>import urllib

>>>?data={}

>>>?data['name']='Somebody?Here'

>>>?data['location']='pythontab'

>>>?data['language']='Python'

>>>?url_values=urllib.urlencode(data)

>>>printurl_values

name=blueelwang+Here&language=Python&location=pythontab

>>>?url='http://www.pythontab.com'

>>>?full_url=url+'?'+url_values

>>>?data=urllib2.open(full_url)

四、Headers

? ? 我們將在這里討論特定的HTTP頭，來說明怎樣添加headers到你的HTTP請求。

? ? 有一些站點不喜歡被程序（非人為訪問）訪問，或者發送不同版本的內容到不同的瀏覽器。默認的urllib2把自己作為“Python-urllib/x.y”(x和y是Python主版本和次版本號,例如Python-urllib/2.5)，這個身份可能會讓站點迷惑，或者干脆不工作。瀏覽器確認自己身份是通過User-Agent頭，當你創建了一個請求對象，你可以給他一個包含頭數據的字典。下面的例子發送跟上面一樣的內容，但把自身模擬成Internet Explorer。

import ?urllib

import ?urllib2

url='http://www.pythontab.com'

user_agent='Mozilla/4.0?(compatible;?MSIE?5.5;?Windows?NT)'

values={'name':'Michael?Foord',

'location':'pythontab',

'language':'Python'}

headers={'User-Agent':?user_agent?}

data=urllib.urlencode(values)

req=urllib2.Request(url,?data,?headers)

response=urllib2.urlopen(req)

the_page=response.read()

? response應答對象同樣有兩個很有用的方法。看下面的節info and geturl，我們將看到當發生錯誤時會發生什么。

五、Handle Exceptions處理異常

? ? 當urlopen不能夠處理一個response時，產生urlError（不過通常的Python APIs異常如ValueError,TypeError等也會同時產生）。

? ? HTTPError是urlError的子類，通常在特定HTTP URLs中產生。

六、URLError

? ? 通常，URLError在沒有網絡連接(沒有路由到特定服務器),或者服務器不存在的情況下產生。這種情況下，異常同樣會帶有"reason"屬性，它是一個tuple，包含了一個錯誤號和一個錯誤信息。

例如

>>>?req=urllib2.Request('http://www.pythontab.com')

>>>try:?urllib2.urlopen(req)

>>>exceptURLError,?e:

>>>printe.reason

>>>

(4, 'getaddrinfo failed')

七、HTTPError

? ? 服務器上每一個HTTP 應答對象response包含一個數字"狀態碼"。有時狀態碼指出服務器無法完成請求。默認的處理器會為你處理一部分這種應答(例如:假如response是一個"重定向"，需要客戶端從別的地址獲取文檔，urllib2將為你處理)。其他不能處理的，urlopen會產生一個HTTPError。典型的錯誤包含"404"(頁面無法找到)，"403"(請求禁止)，和"401"(帶驗證請求)。

請看RFC 2616 第十節有所有的HTTP錯誤碼

HTTPError實例產生后會有一個整型'code'屬性，是服務器發送的相關錯誤號。

Error Codes錯誤碼

因為默認的處理器處理了重定向(300以外號碼)，并且100-299范圍的號碼指示成功，所以你只能看到400-599的錯誤號碼。

BaseHTTPServer.BaseHTTPRequestHandler.response是一個很有用的應答號碼字典，顯示了RFC 2616使用的所有的應答號。這里為了方便重新展示該字典。

當一個錯誤號產生后，服務器返回一個HTTP錯誤號，和一個錯誤頁面。你可以使用HTTPError實例作為頁面返回的應答對象response。這表示和錯誤屬性一樣，它同樣包含了read,geturl,和info方法。

>>>?req=urllib2.Request('http://www.python.org/fish.html')

>>>try:

>>>?????urllib2.urlopen(req)

>>>exceptURLError,?e:

>>>printe.code

>>>printe.read()

>>>

4404

Error?404:?File?Not?Found

......?etc...

八、Wrapping it Up包裝

所以如果你想為HTTPError或URLError做準備，將有兩個基本的辦法。我則比較喜歡第二種。

第一個：

from urllib2 import Request,?urlopen,?URLError,?HTTPError

req=Request(someurl)

try:

? ? response=urlopen(req)

except HTTPError,?e:

? ? print'The?server?couldn/'t?fulfill?the?request.'

? ? print'Error?code:?',?e.code

exceptURLError,?e:

? ? print'We?failed?to?reach?a?server.'

? ? print'Reason:?',?e.reason

else:

? ? #?everything?is?fine

注意：except HTTPError 必須在第一個，否則except URLError將同樣接受到HTTPError。

第二個：

from urllib2 import Request,?urlopen,?URLError

req=Request(someurl)

try:

? ? response=urlopen(req)

exceptURLError,?e:

? ? if hasattr(e,'reason'):

? ? ? ? print'We?failed?to?reach?a?server.'

? ? ? ? print'Reason:?',?e.reason

? ?elif hasattr(e,'code'):

? ? ? ? print'The?server?couldn/'t?fulfill?the?request.'

? ? ? ? print'Error?code:?',?e.code

else:

? ? #?everything?is?fine

九、info and geturl

? ? urlopen返回的應答對象response(或者HTTPError實例)有兩個很有用的方法info()和geturl()

? ? geturl -- 這個返回獲取的真實的URL，這個很有用，因為urlopen(或者opener對象使用的)或許會有重定向。獲取的URL或許跟請求URL不同。

info -- 這個返回對象的字典對象，該字典描述了獲取的頁面情況。通常是服務器發送的特定頭headers。目前是httplib.HTTPMessage 實例。

經典的headers包含"Content-length"，"Content-type"，和其他。查看Quick Reference to HTTP Headers(http://www.cs.tut.fi/~jkorpela/http.html)獲取有用的HTTP頭列表，以及它們的解釋意義。

十、Openers和Handlers

? ? 當你獲取一個URL你使用一個opener(一個urllib2.OpenerDirector的實例，urllib2.OpenerDirector可能名字可能有點讓人混淆。)正常情況下，我們使用默認opener -- 通過urlopen,但你能夠創建個性的openers，Openers使用處理器handlers，所有的“繁重”工作由handlers處理。每個handlers知道如何通過特定協議打開URLs，或者如何處理URL打開時的各個方面，例如HTTP重定向或者HTTP cookies。

如果你希望用特定處理器獲取URLs你會想創建一個openers，例如獲取一個能處理cookie的opener，或者獲取一個不重定向的opener。

要創建一個 opener,實例化一個OpenerDirector，然后調用不斷調用.add_handler(some_handler_instance).

同樣，可以使用build_opener，這是一個更加方便的函數，用來創建opener對象，他只需要一次函數調用。

build_opener默認添加幾個處理器，但提供快捷的方法來添加或更新默認處理器。

其他的處理器handlers你或許會希望處理代理，驗證，和其他常用但有點特殊的情況。

install_opener 用來創建（全局）默認opener。這個表示調用urlopen將使用你安裝的opener。

Opener對象有一個open方法，該方法可以像urlopen函數那樣直接用來獲取urls：通常不必調用install_opener，除了為了方便。

十一、Basic Authentication 基本驗證

? ? 為了展示創建和安裝一個handler，我們將使用HTTPBasicAuthHandler，為了更加細節的描述本主題--包含一個基礎驗證的工作原理。

請看Basic Authentication Tutorial（http://www.voidspace.org.uk/python/articles/authentication.shtml）

當需要基礎驗證時，服務器發送一個header(401錯誤碼) 請求驗證。這個指定了scheme 和一個‘realm’，看起來像這樣：Www-authenticate: SCHEME realm="REALM".

例如

Www-authenticate: Basic realm="cPanel Users"

客戶端必須使用新的請求，并在請求頭里包含正確的姓名和密碼。這是“基礎驗證”，為了簡化這個過程，我們可以創建一個HTTPBasicAuthHandler的實例，并讓opener使用這個handler。

HTTPBasicAuthHandler使用一個密碼管理的對象來處理URLs和realms來映射用戶名和密碼。如果你知道realm(從服務器發送來的頭里)是什么，你就能使用HTTPPasswordMgr。

通常人們不關心realm是什么。那樣的話，就能用方便的HTTPPasswordMgrWithDefaultRealm。這個將在你為URL指定一個默認的用戶名和密碼。這將在你為特定realm提供一個其他組合時得到提供。我們通過給realm參數指定None提供給add_password來指示這種情況。

最高層次的URL是第一個要求驗證的URL。你傳給.add_password()更深層次的URLs將同樣合適。

#?創建一個密碼管理者

password_mgr=urllib2.HTTPPasswordMgrWithDefaultRealm()

#?添加用戶名和密碼

#?如果知道?realm,?我們可以使用他代替?``None``.

top_level_url="http://example.com/foo/"

password_mgr.add_password(None,?top_level_url,?username,?password)

handler=urllib2.HTTPBasicAuthHandler(password_mgr)

#?創建?"opener"?(OpenerDirector?實例)

opener=urllib2.build_opener(handler)

#?使用?opener?獲取一個URL

opener.open(a_url)

#?安裝?opener.

#?現在所有調用?urllib2.urlopen?將用我們的?opener.

urllib2.install_opener(opener)

注意：以上的例子我們僅僅提供我們的HHTPBasicAuthHandler給build_opener。默認的openers有正常狀況的handlers--ProxyHandler,UnknownHandler,HTTPHandler,HTTPDefaultErrorHandler, HTTPRedirectHandler, FTPHandler, FileHandler, HTTPErrorProcessor。

top_level_url 實際上可以是完整URL(包含"http:",以及主機名及可選的端口號)例如：http://example.com/，也可以是一個“authority”(即主機名和可選的包含端口號)例如：“example.com” or “example.com:8080”(后者包含了端口號)。權限驗證，如果遞交的話不能包含"用戶信息"部分,例如:“joe@password:example.com”是錯誤的。

Proxies代理urllib 將自動監測你的代理設置并使用他們。這個通過ProxyHandler這個在正常處理器鏈中的對象來處理。通常，那工作的很好。但有時不起作用。其中一個方法便是安裝我們自己的代理處理器ProxyHandler，并不定義代理。這個跟使用Basic Authentication 處理器很相似。

>>>?proxy_support=urllib.request.ProxyHandler({})

>>>?opener=urllib.request.build_opener(proxy_support)

>>>?urllib.request.install_opener(opener)

注意：

此時urllib.request不支持通過代理獲取https地址。但，這個可以通過擴展urllib.request達到目的。

Sockets and Layers

Python支持獲取網絡資源是分層結構。urllib 使用http.client庫，再調用socket庫實現。

在Python2.3你可以指定socket的等待回應超時時間。這個在需要獲取網頁的應用程序里很有用。默認的socket模型沒有超時和掛起。現在，socket超時沒有暴露給http.client或者urllib.request層。但你可以給所有的sockets設置全局的超時。

補充一句：python3中將urllib2改成了urllib，大部分功能在rullib.request下

原文參考：python urllib2詳解及實例

三个男躁一个女,国精产品一区一手机的秘密,麦子交换系列最经典十句话,欧美国产综合欧美视频

python urllib2篇

python urllib2篇

一、概述

二、快速上手

三、Data數據

四、Headers

五、Handle Exceptions處理異常

六、URLError

七、HTTPError

八、Wrapping it Up包裝

九、info and geturl

十、Openers和Handlers

十一、Basic Authentication 基本驗證

推薦閱讀更多精彩內容

三个男躁一个女,国精产品一区一手机的秘密,麦子交换系列最经典十句话,欧美 国产 综合 欧美 视频

python urllib2篇

一、概述

二、快速上手

三、Data數據

四、Headers

五、Handle Exceptions處理異常

六、URLError

七、HTTPError

八、Wrapping it Up包裝

九、info and geturl

十、Openers和Handlers

十一、Basic Authentication 基本驗證

推薦閱讀更多精彩內容

三个男躁一个女,国精产品一区一手机的秘密,麦子交换系列最经典十句话,欧美国产综合欧美视频