作為一種便捷地收集網上信息並從中抽取齣可用信息的方式,網絡爬蟲技術變得越來越有用。使用Python這樣的簡單編程語言,你可以使用少量編程技能就可以爬取復雜的網站。
《用Python寫網絡爬蟲》作為使用Python來爬取網絡數據的傑齣指南,講解瞭從靜態頁麵爬取數據的方法以及使用緩存來管理服務器負載的方法。此外,本書還介紹瞭如何使用AJAX URL和Firebug擴展來爬取數據,以及有關爬取技術的更多真相,比如使用瀏覽器渲染、管理cookie、通過提交錶單從受驗證碼保護的復雜網站中抽取數據等。本書使用Scrapy創建瞭一個高級網絡爬蟲,並對一些真實的網站進行瞭爬取。
《用Python寫網絡爬蟲》介紹瞭如下內容:
通過跟蹤鏈接來爬取網站;
使用lxml從頁麵中抽取數據;
構建綫程爬蟲來並行爬取頁麵;
將下載的內容進行緩存,以降低帶寬消耗;
解析依賴於JavaScript的網站;
與錶單和會話進行交互;
解決受保護頁麵的驗證碼問題;
對AJAX調用進行逆嚮工程;
使用Scrapy創建高級爬蟲。
本書讀者對象
本書是為想要構建可靠的數據爬取解決方案的開發人員寫作的,本書假定讀者具有一定的Python編程經驗。當然,具備其他編程語言開發經驗的讀者也可以閱讀本書,並理解書中涉及的概念和原理。
##还是需要多实践,多练习,多拓展。
评分##很通顺,但不够具体,这也许跟篇幅以及书本身的结构有关系。总之,看完了能明白爬虫、一整套的抓取数据流程是什么样的。有意思的是讲验证码识别部分,如果“难一点我们应该怎么样?”使用付费的人工识别服务, 猝不及防!
评分##没有太多内涵的东西,很薄的一本书,内容很浅显
评分##很通顺,但不够具体,这也许跟篇幅以及书本身的结构有关系。总之,看完了能明白爬虫、一整套的抓取数据流程是什么样的。有意思的是讲验证码识别部分,如果“难一点我们应该怎么样?”使用付费的人工识别服务, 猝不及防!
评分##没有太多内涵的东西,很薄的一本书,内容很浅显
评分##最近又重新浏览了一遍,里面还是有些干货的,虽然基于Python2版本。
评分##思路还行。
评分##http://blog.csdn.net/column/details/13041.html这个专栏就是对应这本书写的笔记,可以参考。
评分##故意占篇幅
本站所有內容均為互聯網搜索引擎提供的公開搜索信息,本站不存儲任何數據與內容,任何內容與數據均與本站無關,如有需要請聯繫相關搜索引擎包括但不限於百度,google,bing,sogou 等
© 2026 tushu.tinynews.org All Rights Reserved. 求知書站 版权所有