• 欢迎访问搞代码网站,推荐使用最新版火狐浏览器和Chrome浏览器访问本网站!
  • 如果您觉得本站非常有看点,那么赶紧使用Ctrl+D 收藏搞代码吧

Python如实现爬虫图片的简单实例分析

python 搞代码 4年前 (2022-01-09) 25次浏览 已收录 0个评论

这篇文章主要介绍了Python 爬虫图片简单实现的相关资料,需要的朋友可以参考下

Python 爬虫图片简单实现

经常在逛知乎,有时候希望把一些问题的图片集中保存起来。于是就有了这个程序。这是一个非常简单的图片爬虫程序,只能爬取已经刷出来的部分的图片。由于对这一部分内容不太熟悉,所以只是简单说几句然后记录代码,不做过多的讲解。感兴趣的可以直接拿去用。亲测对于知乎等网站是可用的。

上一篇分享了通过url打开图片的方法,目的就是先看看爬取到的图片时什么样,然后再筛选一下保存。

这里用到了requests库来获取页面信息,需要注意的是,获取页面信息的时候需要一个header,用以把程序伪装成浏览器去访问服务器,不然可能会被服务器拒绝。然后用BeautifulSoup来过滤多余信息得到图片地址。得到图片后,根据图片的大小过滤掉一些头像、表情包之类的小图片。最后打开或者保存图片的时候选择就比较多了,OpenCV,skimage,PIL等都可以。

程序如下:

# -*- coding=utf-8 -*-import requests as reqfrom bs4 import BeautifulSoupfrom PIL import Imagefrom io import BytesIOimport osfrom skimage import iourl = "https://www.zhihu.com/question/37787176"headers = {'User-Agent' : 'Mozilla/5.0 (Linux; Android 6.0; Nexus 5 Build/MRA58N) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.96 Mobile Safari/537.36'}response = req.get(url,headers=headers)content = str(response.content)#print contentsoup = BeautifulSoup(content,'lxml')images = soup.find_all('img')print u"共有%d张图片" % len(images)if not os.path.exists("images"):  os.mkdir("images")for i in range(len(images)):  img = images[i]  print u"正在处理第%d张图片..." % (i+1)  img_src = img.get('src')  if img_src.startswith("http"):    ## use PIL    '''    print img_src    response = req.get(img_src,headers=headers)    image = Image.open(BytesIO(response.content))    w,h = image.size    print w,h    img_path = "images/" + str(i+1) + ".jpg"    if w>=500 and h>500:      #image.show()      image.save(img_path)    '''    ## use OpenCV    import numpy as np    import urllib    import cv2    resp = urllib.urlopen(img_src)    image = np.asarray(bytearray(resp.read()), dtype="uint8")    image = cv2.imdecode(image, cv2.IMREAD_COLOR)    w,h = image.shape[:2]    print w,h    img_path = "images/" + str(i+1) + ".jpg"    if w>=400 and h>400:      cv2.imshow("Image", image)      cv2.waitKey(3000)      ##cv2.imwrite(img_path,image)    ## use skimage    ## image = io.imread(img_src)    ## w,h = image.shape[:2]    ## print w,h    #io.imshow(image)    #io.show()    ## img_path = "images/" + str(i+1) + ".jpg"    ## if w>=500 and h>500:      ## image.show()      ## image.save(img_path)      #<span style="color:transparent">本文来源gaodai#ma#com搞*!代#%^码网%</span># io.imsave(img_path,image)print u"处理完成!"

以上就是Python如实现爬虫图片的简单实例分析的详细内容,更多请关注搞代码gaodaima其它相关文章!


搞代码网(gaodaima.com)提供的所有资源部分来自互联网,如果有侵犯您的版权或其他权益,请说明详细缘由并提供版权或权益证明然后发送到邮箱[email protected],我们会在看到邮件的第一时间内为您处理,或直接联系QQ:872152909。本网站采用BY-NC-SA协议进行授权
转载请注明原文链接:Python如实现爬虫图片的简单实例分析
喜欢 (0)
[搞代码]
分享 (0)
发表我的评论
取消评论

表情 贴图 加粗 删除线 居中 斜体 签到

Hi,您需要填写昵称和邮箱!

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址