《Python网络爬虫权威指南(第2版)》（美）瑞安·米切尔（Ryan Mitchell）电子书txt下载、在线阅读、内容简介、评论读后感-当当读书

Python网络爬虫权威指南(第2版)

（美）瑞安·米切尔（Ryan Mitchell）

内容简介

本书采用简洁强大的Python 语言，介绍了网页抓取，并为抓取新式网络中的各种数据类型提供了全面的指导。*部分重介绍网页抓取的基本原理：如何用Python 从网络服务器请求信息，如何对服务器的响应行基本处理，以及如何以自动化手段与网站行交互。第二部分介绍如何用网络爬虫测试网站，自动化处理，以及如何通过更多的方式网络。
【推荐语】
作为一种采集和理解网络上海量信息的方式，网页抓取技术变得越来越重要。而编写简单的自动化程序（网络爬虫），一次就可以自动抓取上百万个网页中的信息，实现高效的数据采集和处理，满足大量数据需求应用场景。本书采用简洁强大的Python语言，全面介绍网页抓取技术，解答诸多常见问题，是掌握从数据爬取到数据清洗全流程的系统实践指南。书中内容分为两部分。*部分深讲解网页抓取的基础知识，重介绍BeautifulSoup、Scrapy等Python库的应用。第二部分介绍网络爬虫编写相关的主题，以及各种数据抓取工具和应用程序，帮你深互联网的每个角落，分析原始数据，获取数据背后的故事，轻松解决遇到的各类网页抓取问题。第2版全面更新，新增网络爬虫模型、Scrapy和并行网页抓取相关章节。 - 解析复杂的HTML页面 - 使用Scrapy框架发爬虫 - 学习存储数据的方法 - 从文档中读取和提取数据 - 清洗格式糟糕的数据 - 自然语言处理 - 通过表单和登录窗口抓取数据 - 抓取JavaScript及利用API抓取数据 - 图像识别与文字处理 - 避免抓取陷阱和反爬虫策略 - 使用爬虫测试网站
【作者】
瑞安·米切尔（Ryan Mitchell）数据科学家、软件工程师，有丰富的网络爬虫和数据分析实战经验，目前就职于美国格理集团，经常为网页数据采集项目提供咨询服务，并在美国东北大学和美国欧林工程学院任教。

展开