文章来源于网络收集而来，版权归原创者所有，如有侵权请及时联系！

第2章数据抓取

发布于 2024-02-05 23:37:18 字数 296 浏览 0 评论 0 收藏 0

在上一章中，我们构建了一个爬虫，可以通过跟踪链接的方式下载我们所需的网页。虽然这个例子很有意思，却不够实用，因为爬虫在下载网页之后又将结果丢弃掉了。现在，我们需要让这个爬虫从每个网页中抽取一些数据，然后实现某些事情，这种做法也被称为抓取（scraping） 。

首先，我们会介绍一个叫做Firebug Lite 的浏览器扩展，用于检查网页内容，如果你有一些网络开发背景的话，可能已经对该扩展十分熟悉了。然后，我们会介绍三种抽取网页数据的方法，分别是正则表达式、Beautiful Soup和lxml。最后，我们将对比这三种数据抓取方法。

需要登录才能够评论，你可以免费注册一个本站的账号。

列表为空，暂无数据

第2章 数据抓取