iOS程序員如何使用python寫網路爬蟲(一點更新)

原文鏈接: iOS程序員如何使用python寫網路爬蟲
以前看到葉孤城寫的iOS程序員如何使用python寫網路爬蟲一文,就寫了一個爬蟲練練手,
最近發現原文章的用的Beautiful Soup 3 目前已經停止開發,推薦在現在的項目中使用Beautiful Soup 4
爬的網站連接都不能用了,寫下我這邊修改的一些東西,僅供參考

歡迎大家來吐槽

<pre>
$sudo pip install beautifulsoup4 或
$sudo easy_install beautifulsoup4 </p>
需要注意的是初始化的時候要使用 BeautifulSoup(html, "html.parser")
</pre>

使用的主網站連接:千圖網
頁面結構布局如下圖,主要是<div class='show-area-pic'
然后拿到其中的img即可了

千圖網頁結構.jpg
具體的一些操作細節可以參考iOS程序員如何使用python寫網路爬蟲一文,我就不多贅述了,默認是保存在桌面上新建了一個58pic的文件夾里,也可以修改一下存到sqlite里,也很簡單的,以后再更新

詳細代碼如下:
<pre>

--coding:utf-8--

! /usr/bin/python

import math
import urllib
import urllib2
import os

import request

import sqliteManager
import sys
from bs4 import BeautifulSoup;
def getAllImageLink(start,end):
i = start
path = os.path.expanduser(r'~/Desktop/')
folder = '58pic'
fullPath = path + folder
os.chdir(path)
if os.path.exists(fullPath) == False :
os.mkdir(folder)
else:
# print (unicode('已經存在文件夾: rosi','utf-8'))
print ('has exist')
os.chdir(fullPath)
mainPath = os.getcwd()
while (i < end):
os.chdir(mainPath)
url = 'http://www.58pic.com/yuanchuang/%d.html' % i
try:
response=urllib2.urlopen(url,data=None,timeout=120)
# response=.get(url)
except urllib2.URLError as e:
print ('%s : %s' % (url,e.reason))
i += 1
continue
print (url)
html = response.read()
if html.strip()=='':
print ('not exist URL: %s',url)
continue
soup = BeautifulSoup(html, "html.parser")
liResult = soup.findAll('div',attrs={"class":"show-area-pic"})
for li in liResult:
imageEntityArray = li.findAll('img')
for image in imageEntityArray:
title = image.get('title')
href = image.get('src')
splitList = href.split('/')
fileSavePath = mainPath + '/' + str(splitList[len(splitList) - 1])
urllib.urlretrieve(href,fileSavePath)
print (fileSavePath)
i = i + 1
if __name__ == '__main__':
start = 19840500
getAllImageLink(start,start + 100)
</pre>

最后編輯于
?著作權歸作者所有,轉載或內容合作請聯系作者
平臺聲明:文章內容(如有圖片或視頻亦包括在內)由作者上傳并發布,文章內容僅代表作者本人觀點,簡書系信息發布平臺,僅提供信息存儲服務。
  • 序言:七十年代末,一起剝皮案震驚了整個濱河市,隨后出現的幾起案子,更是在濱河造成了極大的恐慌,老刑警劉巖,帶你破解...
    沈念sama閱讀 229,406評論 6 538
  • 序言:濱河連續發生了三起死亡事件,死亡現場離奇詭異,居然都是意外死亡,警方通過查閱死者的電腦和手機,發現死者居然都...
    沈念sama閱讀 99,034評論 3 423
  • 文/潘曉璐 我一進店門,熙熙樓的掌柜王于貴愁眉苦臉地迎上來,“玉大人,你說我怎么就攤上這事。” “怎么了?”我有些...
    開封第一講書人閱讀 177,413評論 0 382
  • 文/不壞的土叔 我叫張陵,是天一觀的道長。 經常有香客問我,道長,這世上最難降的妖魔是什么? 我笑而不...
    開封第一講書人閱讀 63,449評論 1 316
  • 正文 為了忘掉前任,我火速辦了婚禮,結果婚禮上,老公的妹妹穿的比我還像新娘。我一直安慰自己,他們只是感情好,可當我...
    茶點故事閱讀 72,165評論 6 410
  • 文/花漫 我一把揭開白布。 她就那樣靜靜地躺著,像睡著了一般。 火紅的嫁衣襯著肌膚如雪。 梳的紋絲不亂的頭發上,一...
    開封第一講書人閱讀 55,559評論 1 325
  • 那天,我揣著相機與錄音,去河邊找鬼。 笑死,一個胖子當著我的面吹牛,可吹牛的內容都是我干的。 我是一名探鬼主播,決...
    沈念sama閱讀 43,606評論 3 444
  • 文/蒼蘭香墨 我猛地睜開眼,長吁一口氣:“原來是場噩夢啊……” “哼!你這毒婦竟也來了?” 一聲冷哼從身側響起,我...
    開封第一講書人閱讀 42,781評論 0 289
  • 序言:老撾萬榮一對情侶失蹤,失蹤者是張志新(化名)和其女友劉穎,沒想到半個月后,有當地人在樹林里發現了一具尸體,經...
    沈念sama閱讀 49,327評論 1 335
  • 正文 獨居荒郊野嶺守林人離奇死亡,尸身上長有42處帶血的膿包…… 初始之章·張勛 以下內容為張勛視角 年9月15日...
    茶點故事閱讀 41,084評論 3 356
  • 正文 我和宋清朗相戀三年,在試婚紗的時候發現自己被綠了。 大學時的朋友給我發了我未婚夫和他白月光在一起吃飯的照片。...
    茶點故事閱讀 43,278評論 1 371
  • 序言:一個原本活蹦亂跳的男人離奇死亡,死狀恐怖,靈堂內的尸體忽然破棺而出,到底是詐尸還是另有隱情,我是刑警寧澤,帶...
    沈念sama閱讀 38,849評論 5 362
  • 正文 年R本政府宣布,位于F島的核電站,受9級特大地震影響,放射性物質發生泄漏。R本人自食惡果不足惜,卻給世界環境...
    茶點故事閱讀 44,495評論 3 348
  • 文/蒙蒙 一、第九天 我趴在偏房一處隱蔽的房頂上張望。 院中可真熱鬧,春花似錦、人聲如沸。這莊子的主人今日做“春日...
    開封第一講書人閱讀 34,927評論 0 28
  • 文/蒼蘭香墨 我抬頭看了看天上的太陽。三九已至,卻和暖如春,著一層夾襖步出監牢的瞬間,已是汗流浹背。 一陣腳步聲響...
    開封第一講書人閱讀 36,172評論 1 291
  • 我被黑心中介騙來泰國打工, 沒想到剛下飛機就差點兒被人妖公主榨干…… 1. 我叫王不留,地道東北人。 一個月前我還...
    沈念sama閱讀 52,010評論 3 396
  • 正文 我出身青樓,卻偏偏與公主長得像,于是被迫代替她去往敵國和親。 傳聞我的和親對象是個殘疾皇子,可洞房花燭夜當晚...
    茶點故事閱讀 48,241評論 2 375

推薦閱讀更多精彩內容

  • 我上一篇blog說過,iOS開發如果之前沒接觸過除了c和c++(c++太難了,不花個十來年基本不可能精通)的語言,...
    danielss閱讀 771評論 1 1
  • 爬蟲文章 in 簡書程序員專題: like:128-Python 爬取落網音樂 like:127-【圖文詳解】py...
    喜歡吃栗子閱讀 21,891評論 4 411
  • 浮點數存儲的是近似值而不是確切的值;所以double的值存在不確定情況在mysql中:使用DECIMAL,在jav...
    白敏鳶閱讀 496評論 0 0
  • 瑋蓮 家鄉的母親河 呻吟著斷了弦 沒有了旋律 啞然著失了聲 河床泛著白光 沙化著荒涼 天也沒了色彩 云皺巴巴干癟著...
    驕陽下的一朵蓮閱讀 270評論 3 8
  • 在一個陽光明媚的下午,我和我的“秘密花園”相見了。 說是“秘密花園”,但其實它一點也不隱蔽,不像陶淵明筆下的桃花源...
    Emily要加油閱讀 1,809評論 0 1