• 欢迎访问搞代码网站,推荐使用最新版火狐浏览器和Chrome浏览器访问本网站!
  • 如果您觉得本站非常有看点,那么赶紧使用Ctrl+D 收藏搞代码吧

python爬虫中Beautiful Soup有哪些种类?

python 搞java代码 3年前 (2022-05-21) 19次浏览 已收录 0个评论

作为python中优秀获取数据的工具,Beautiful Soup种类也比较多。每一个种类对应着不同的知识点,小伙伴们学习的时候要用心记忆。当然知识不是一天就能学会的,就像罗马也不是一天就建成的。勤学勤练才是进阶python大神的唯一路径。接下来就开始我们今天对于Beautiful Soup的学习吧。


一、Tag

Tag 是什么?通俗点讲就是 HTML 中的一个个标签,例如

<title>The Dormouse's story</title>
<a href="http://example.com/elsie" id="link1">Elsie</a>

www#gaodaima.com来源gao($daima.com搞@代@#码(网搞代码

二、NavigableString

既然我们已经得到了标签的内容,那么问题来了,我们要想获取标签内部的文字怎么办呢?很简单,用 .string 即可,例如

print <a href="https://www.gaodaima.com/tag/soup" title="查看更多关于soup的文章" target="_blank">soup</a>.p.string
#The Dormouse's story

三、BeautifulSoup

BeautifulSoup 对象表示的是一个文档的全部内容。大部分时候,可以把它当作 Tag 对象,是一个特殊的 Tag,我们可以分别获取它的类型,名称,以及属性来感受一下

print type(soup.name)
#<type 'unicode'>
print soup.name
# [document]
print soup.attrs
#{} 空字典

四、Comment

Comment 对象是一个特殊类型的 NavigableString 对象,其实输出的内容仍然不包括注释符号,但是如果不好好处理它,可能会对我们的文本处理造成意想不到的麻烦。 我们找一个带注释的标签

print soup.a
print soup.a.string
print type(soup.a.string)

以上就是python爬虫中Beautiful Soup的4个种类。更多Python学习推荐:云海天Python教程网

来源:搞代码网:原文地址:https://www.gaodaima.com


搞代码网(gaodaima.com)提供的所有资源部分来自互联网,如果有侵犯您的版权或其他权益,请说明详细缘由并提供版权或权益证明然后发送到邮箱[email protected],我们会在看到邮件的第一时间内为您处理,或直接联系QQ:872152909。本网站采用BY-NC-SA协议进行授权
转载请注明原文链接:python爬虫中Beautiful Soup有哪些种类?
喜欢 (0)
[搞代码]
分享 (0)
发表我的评论
取消评论

表情 贴图 加粗 删除线 居中 斜体 签到

Hi,您需要填写昵称和邮箱!

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址