爬蟲筆記(一) - 各種Request請求的對比(Scrapy Resquest Postman)

關于Cookie的分析我在爬蟲筆記(六) - 關于 Cookie 的分析(Postman Request Selenium)中說明了,本次的目標網站也是同一個

本文主要包含一個要點,在分析完請求后,使用不同的方法構造同一個HTTP請求,方法包括:

  • Scrapy框架
  • Request庫
  • Chrome的Postman插件

Scrapy中一段讓我揪心的代碼

在分析前,我說一個自己遇到過的SB問題,在最開始我只放代碼~~~

Scrapy中的spider

# -*- coding: utf-8 -*-
import scrapy
from scrapy.http import Request


class JobSpider(scrapy.Spider):
    name = "job"

    def start_requests(self):
        base_url = "https://www.lagou.com/jobs/positionAjax.json"

        querystring = {"city": "廣州", "needAddtionalResult": "false", "kd": "python", "pn": "1"}

        headers = {
            'user-agent': "Mozilla/5.0 (Windows NT 6.1; WOW64; rv:53.0) Gecko/20100101 Firefox/53.0",
            'cookie': "user_trace_token=20170502200739-07d687303c1e44fa9c7f0259097266d6;"
        }
        yield Request(url=base_url, method="GET", headers=headers)

    def parse(self, response):
        print response

從Postman中獲取到的Request請求

#!/usr/bin/env python
# -*- coding: utf-8 -*-
"""
# @Time    : 2017/5/2 20:24
# @Author  : Spareribs
# @File    : test_lagou.py
"""

import requests
import json

url = "https://www.lagou.com/jobs/positionAjax.json"

querystring = {"city":"廣州","needAddtionalResult":"false","kd":"python","pn":"1"}

headers = {
    'user-agent': "Mozilla/5.0 (Windows NT 6.1; WOW64; rv:53.0) Gecko/20100101 Firefox/53.0",
    'cookie': "user_trace_token=20170502200739-07d687303c1e44fa9c7f0259097266d6;"
    }

response = requests.request("GET", url, headers=headers, params=querystring)

print(response.text)

如果看完這兩段代碼你看懂了關鍵點,本文最想突出的核心要點你也看懂了。
看不懂也不急,先看下基礎分析

Scrapy框架中的Request請求分析

首先是Request對象中文文檔

class scrapy.http.Request(url[, callback, method='GET', headers, body, cookies, meta, encoding='utf-8', priority=0, dont_filter=False, errback])

參數要點:

  • url(必填):請求的URL,所說的目標網站
  • method='GET'
  • headers
  • body
  • cookies

Scrapy特有:

  • encoding='utf-8'
  • priority=0
  • dont_filter=False
  • meta:
  • callback:
  • errback:

(占位---待繼續更新)

Request庫中的Request請求分析

中文文檔

requests庫中requests的方法

def request(method, url, **kwargs):
    with sessions.Session() as session:
        return session.request(method=method, url=url, **kwargs)

def get(url, params=None, **kwargs):
    kwargs.setdefault('allow_redirects', True)
    return request('get', url, params=params, **kwargs)

def post(url, data=None, json=None, **kwargs):
    return request('post', url, data=data, json=json, **kwargs)

(占位---待繼續更新)

Chrome的Postman插件中的Request請求分析

對于Postman的請求,我這里分兩種Method分析(其他的爬蟲中很少用到)

  • Get請求
  • Post請求

首先是get請求

Postman中Get請求

要點:

  1. 請求的方法:Get
  2. 請求的URL
  3. 請求的Params參數
  4. 請求的Headers頭部

然后是Post請求


Postman中Post請求

要點:

  1. 請求的方法:Post
  2. 請求的URL
  3. 請求的Params參數
  4. 請求的Headers頭部
  5. Request Body(提供了4中編輯方式)
    然而,在Post中的4種編輯方式分別為:
  • form-data
  • x-www-form-urlencoded
  • raw
  • binary

(占位---待繼續更新)

總結:其實我想了很久,一直沒想明白,為什么同一個請求放Request庫中成功了,而在scrapy中失敗了,對于這個問題,其實就是不是很難,就是越簡單越害人。Request庫的請求的Cookies是可以放到headers中可以辨別的,而Scrapy的Cookies有一個獨立的cookies參數來處理Cookie,放在headers中不生效

以上都是我的跟人觀點,如果有不對,或者有更好的方法,歡迎留言指正~~~(持續更新中)

最后編輯于
?著作權歸作者所有,轉載或內容合作請聯系作者
平臺聲明:文章內容(如有圖片或視頻亦包括在內)由作者上傳并發布,文章內容僅代表作者本人觀點,簡書系信息發布平臺,僅提供信息存儲服務。
  • 序言:七十年代末,一起剝皮案震驚了整個濱河市,隨后出現的幾起案子,更是在濱河造成了極大的恐慌,老刑警劉巖,帶你破解...
    沈念sama閱讀 229,963評論 6 542
  • 序言:濱河連續發生了三起死亡事件,死亡現場離奇詭異,居然都是意外死亡,警方通過查閱死者的電腦和手機,發現死者居然都...
    沈念sama閱讀 99,348評論 3 429
  • 文/潘曉璐 我一進店門,熙熙樓的掌柜王于貴愁眉苦臉地迎上來,“玉大人,你說我怎么就攤上這事。” “怎么了?”我有些...
    開封第一講書人閱讀 178,083評論 0 383
  • 文/不壞的土叔 我叫張陵,是天一觀的道長。 經常有香客問我,道長,這世上最難降的妖魔是什么? 我笑而不...
    開封第一講書人閱讀 63,706評論 1 317
  • 正文 為了忘掉前任,我火速辦了婚禮,結果婚禮上,老公的妹妹穿的比我還像新娘。我一直安慰自己,他們只是感情好,可當我...
    茶點故事閱讀 72,442評論 6 412
  • 文/花漫 我一把揭開白布。 她就那樣靜靜地躺著,像睡著了一般。 火紅的嫁衣襯著肌膚如雪。 梳的紋絲不亂的頭發上,一...
    開封第一講書人閱讀 55,802評論 1 328
  • 那天,我揣著相機與錄音,去河邊找鬼。 笑死,一個胖子當著我的面吹牛,可吹牛的內容都是我干的。 我是一名探鬼主播,決...
    沈念sama閱讀 43,795評論 3 446
  • 文/蒼蘭香墨 我猛地睜開眼,長吁一口氣:“原來是場噩夢啊……” “哼!你這毒婦竟也來了?” 一聲冷哼從身側響起,我...
    開封第一講書人閱讀 42,983評論 0 290
  • 序言:老撾萬榮一對情侶失蹤,失蹤者是張志新(化名)和其女友劉穎,沒想到半個月后,有當地人在樹林里發現了一具尸體,經...
    沈念sama閱讀 49,542評論 1 335
  • 正文 獨居荒郊野嶺守林人離奇死亡,尸身上長有42處帶血的膿包…… 初始之章·張勛 以下內容為張勛視角 年9月15日...
    茶點故事閱讀 41,287評論 3 358
  • 正文 我和宋清朗相戀三年,在試婚紗的時候發現自己被綠了。 大學時的朋友給我發了我未婚夫和他白月光在一起吃飯的照片。...
    茶點故事閱讀 43,486評論 1 374
  • 序言:一個原本活蹦亂跳的男人離奇死亡,死狀恐怖,靈堂內的尸體忽然破棺而出,到底是詐尸還是另有隱情,我是刑警寧澤,帶...
    沈念sama閱讀 39,030評論 5 363
  • 正文 年R本政府宣布,位于F島的核電站,受9級特大地震影響,放射性物質發生泄漏。R本人自食惡果不足惜,卻給世界環境...
    茶點故事閱讀 44,710評論 3 348
  • 文/蒙蒙 一、第九天 我趴在偏房一處隱蔽的房頂上張望。 院中可真熱鬧,春花似錦、人聲如沸。這莊子的主人今日做“春日...
    開封第一講書人閱讀 35,116評論 0 28
  • 文/蒼蘭香墨 我抬頭看了看天上的太陽。三九已至,卻和暖如春,著一層夾襖步出監牢的瞬間,已是汗流浹背。 一陣腳步聲響...
    開封第一講書人閱讀 36,412評論 1 294
  • 我被黑心中介騙來泰國打工, 沒想到剛下飛機就差點兒被人妖公主榨干…… 1. 我叫王不留,地道東北人。 一個月前我還...
    沈念sama閱讀 52,224評論 3 398
  • 正文 我出身青樓,卻偏偏與公主長得像,于是被迫代替她去往敵國和親。 傳聞我的和親對象是個殘疾皇子,可洞房花燭夜當晚...
    茶點故事閱讀 48,462評論 2 378

推薦閱讀更多精彩內容