Python-爬虫03:urllib.request模块的运用_玖富娱乐主


玖富娱乐是一家为代理招商,直属主管信息发布为主的资讯网站,同时也兼顾玖富娱乐代理注册登录地址。

目次

  • 1. urllib.request的基础运用
    • 1.1 urlopen
    • 1.2. 用urlopen来猎取收集源代码
    • 1.3. urllib.request.Request的运用
  • 2. User-Ageng的运用-模仿浏览器发送要求
    • 2.1) 为何要用User-Agent?
    • 2.2) 怎样增添User-Agent信息到要求中去?
    • 2.3) 增添更多的User-Ageng和Header的信息
    • 1.5. Response的其他用法

1. urllib.request的基础运用

所谓网页抓取,就是把URL地点中指定的收集资源从收集流中抓取出来。在Python中有许多库能够用来抓取网页,我们先进修urllib.request。

Python模块源代码: C:UsershaochAnaconda3Lib

urllib.request源代码:C:UsershaochAnaconda3Liburllibrequest.py

1.1 urlopen

我们先来看源代码

# data没写-> get要求,否则是Post要求 
def urlopen(url, data=None, timeout=socket._GLOBAL_DEFAULT_TIMEOUT,
            *, cafile=None, capath=None, cadefault=False, context=None):

    global _opener
    if cafile or capath or cadefault:
        import warnings
        warnings.warn("cafile, cpath and cadefault are deprecated, use a "
                      "custom context instead.", DeprecationWarning, 2)
        if context is not None:
            raise ValueError(
                "You can't pass both context and any of cafile, capath, and "
                "cadefault"
            )
        if not _have_ssl:
            raise ValueError('SSL support not available')
            # 知识点1: 做SSL认证
        context = ssl.create_default_context(ssl.Purpose.SERVER_AUTH,
                                             cafile=cafile,
                                             capath=capath)
        # 知识点2: 经由过程HTTPS处理器建立处理器对象                                  
        https_handler = HTTPSHandler(context=context)
        # 知识点3: 将处理器对象包进去
        opener = build_opener(https_handler)
    elif context:
        https_handler = HTTPSHandler(context=context)
        opener = build_opener(https_handler)
    elif _opener is None:
        _opener = opener = build_opener()
    else:
        opener = _opener
        # 知识点4: 自定义的open要领
    return opener.open(url, data, timeout)

1.2. 用urlopen来猎取收集源代码

# 导入urllib2 库
import urllib.request
# 向指定的url发送要求,并返回服务器相应的类文件对象
response = urllib.request.urlopen("http://www.baidu.com/")
# 类文件对象支撑 文件对象的操纵要领,如read()要领读取文件悉数内容,返回字符串
html = response.read()
print(html)

实际上,若是我们在浏览器上翻开百度主页, 右键挑选“检察源代码”,你会发明,跟我们适才打印出来的是如出一辙。也就是说,上面的4行代码就已帮我们把百度的首页的悉数代码爬了下来。

1.3. urllib.request.Request的运用

若是须要实行更庞杂的操纵,好比增添HTTP报头,必需建立一个 Request 实例来作为urlopen()的参数;而须要接见的url地点则作为 Request 实例的参数。

-玖富娱乐是一家为代理招商,直属主管信息发布为主的资讯网站,同时也兼顾玖富娱乐代理注册登录地址。-
import urllib.request
# url 作为Request()要领的参数,组织并返回一个Request对象
request = urllib.request.Request("http://www.baidu.com")
# Request对象作为urlopen()要领的参数,发送给服务器并吸收相应
response = urllib.request.urlopen(request)
html = response.read()
print html

不加user-agent-要求信息

GET http://www.baidu.com/ HTTP/1.1
Accept-Encoding: identity
Host: www.baidu.com
User-Agent: Python-urllib/3.7
Connection: close

2. User-Ageng的运用-模仿浏览器发送要求

上面的例子中有一个最大瑕玷是不克不及给要求增添head,不克不及变动User-Agent的默许值,那末urlopen中User-Agent的值是什么呢,让我们来看源代码

class OpenerDirector:
    def __init__(self):
       # __version__ = '%d.%d' % sys.version_info[:2]--->sys.version[:3] = 3.7
        client_version = "Python-urllib/%s" % __version__
        # client_version = Python-urllib 3.7
        self.addheaders = [('User-agent', client_version)]
        # self.handlers is retained only for backward compatibility
        self.handlers = []
        # manage the individual handlers
        self.handle_open = {}
        self.handle_error = {}
        self.process_response = {}
        self.process_request = {}

urllib2默许的 User-Agent:Python-urllib 3.7,被管理员看到后,轻易被封IP,应当重构我们的User-Agent

2.1) 为何要用User-Agent?

我们用一个正当的身份去要求他人网站,明显人家就是迎接的,以是我们就应当给我们的这个代码加上一个身份,就是所谓的User-Agent头。

  • 浏览器 就是互联网世界上公认被许可的身份,若是我们愿望我们的爬虫顺序更像一个实在用户,那我们第一步就是须要伪装成一个被浏览器。用分歧的浏览器在发送要求的时刻,会有分歧的 User-Agent 报头。
  • urllib.request默许的User-Agent头为:Python-urllib/x.y (x和y 是Python 主.次 版本号,比方 Python-urllib/3.7)

2.2) 怎样增添User-Agent信息到要求中去?

起首我们用抓包对象抓取要求,在个中猎取User-Agent的值

GET https://www.baidu.com/ HTTP/1.1
Host: www.baidu.com
Connection: keep-alive
Pragma: no-cache
Cache-Control: no-cache
Upgrade-Insecure-Requests: 1

# User-Agent 最主要的器械,必需写的器械
User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.98 Safari/537.36

# 猎取的数据类型
Accept: text/html,application/xhtml xml,application/xml;q=0.9,image/webp,image/apng,*/*;q=0.8
# 紧缩体式格局(肯定不克不及写的,贫苦)
Accept-Encoding: gzip, deflate, br
Accept-Language: zh-CN,zh;q=0.9,en-US;q=0.8,en;q=0.7,en-CA;q=0.6
Cookie: BAIDUID=4F583A04A0193EBE0C9849C551B9305C:FG=1; BIDUPSID=4F583A04A0193EBE0C9849C551B9305C; PSTM=1545978093; BD_UPN=12314753; BDORZ=B490B5EBF6F3CD402E515D22BCDA1598; __cfduid=d7aafabcd6ccc970c2d47e9e205fc3c851546334654; cflag=13:3; delPer=0; BD_HOME=0; H_PS_PSSID=1440_21082_28205_28132_27245_27509
x-hd-token: rent-your-own-vps

我们只须要复制User-Agent的值便可,代码以下:

# IE 9.0 的 User-Agent,包含在 user_agent里
ua_headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.98 Safari/537.36"}
#  url 连同 headers,一同组织Request要求,这个要求将附带 IE9.0 浏览器的User-Agent
request = urllib.request.Request("http://www.baidu.com", headers = ua_headers)
# 向服务器发送这个要求
response = urllib.request.urlopen(request)
html = response.read()
html

加user-agent-要求信息

GET http://www.baidu.com/ HTTP/1.1
Accept-Encoding: identity
Host: www.baidu.com
User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.98 Safari/537.36
Connection: close

2.3) 增添更多的User-Ageng和Header的信息

  • 增添一个特定的header
import urllib2

url = "http://www.itcast.cn"
#IE 9.0 的 User-Agent
user_agent = {"User-Agent" : "Mozilla/5.0 (compatible; MSIE 9.0; Windows NT 6.1; Trident/5.0)"} 
request = urllib2.Request(url, headers = user_agent)
#也能够经由过程挪用Request.add_header() 增添/修正一个特定的header
request.add_header("Connection", "keep-alive")
# 也能够经由过程挪用Request.get_header()来检察header信息
# request.get_header(header_name="Connection")
response = urllib2.urlopen(request)
print response.code     #能够检察相应状况码
html = response.read()
print html
  • 随机增添/修正User-Agent
import urllib2
import random

url = "http://www.itcast.cn"

ua_list = [
    "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.1 (KHTML, like Gecko) Chrome/22.0.1207.1 Safari/537.1",
    "Mozilla/5.0 (X11; CrOS i686 2268.111.0) AppleWebKit/536.11 (KHTML, like Gecko) Chrome/20.0.1132.57 Safari/536.11",
    "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/536.6 (KHTML, like Gecko) Chrome/20.0.1092.0 Safari/536.6",
    "Mozilla/5.0 (Windows NT 6.1) AppleWebKit/536.6 (KHTML, like Gecko) Chrome/20.0.1090.0 Safari/536.6"
]

user_agent = random.choice(ua_list)
request = urllib2.Request(url)
#也能够经由过程挪用Request.add_header() 增添/修正一个特定的header
request.add_header("User-Agent", user_agent)
# get_header()的字符串参数,第一个字母大写,背面的悉数小写
request.get_header("User-agent")
response = urllib2.urlopen(request)
html = response.read()
print html

1.5. Response的其他用法

response.read()     # 读取爬取的内容
response.getcode()  # 返回HTTP的相应码,                       200=OK
response.geturl()   # 返回数据的是详细哪一个URL, 防备重定向      'http://www.baidu.com'
response.info()     # 返回服务器相应的捧头信息
-玖富娱乐是一家为代理招商,直属主管信息发布为主的资讯网站,同时也兼顾玖富娱乐代理注册登录地址。