python爬虫常用的库

03-02 1874阅读

Python爬虫常用的库包括但不限于以下几种:

python爬虫常用的库
(图片来源网络,侵删)
  1. 请求库:
    • `urllib`:Python3自带的库,用于发送HTTP请求,但现在可能被`requests`替代。1
  • `requests`:第三方库,功能强大,使用简单,是当前最常用的请求库。2
    • `Selenium`:自动化测试工具,用于模拟用户操作浏览器,适用于复杂页面。
      1. 解析库:

        • `lxml`:第三方库,支持HTML和XML的解析,支持XPath的解析方式。
        • `Beautiful Soup`:第三方库,API强大,使用方便。
        • `pyquery`:类似jQuery的库,用于解析HTML文档,支持CSS选择器。
      2. 存储库:

        • `PyMySQL`:MySQL的Python接口,用于存储数据。
        • `PyMongo`:MongoDB的Python接口。
        • `redis-py`:Redis的Python接口。
      3. 图像识别库:

        • `tesserocr`:Python使用的OCR技术来识别图像。
      4. 爬虫框架:

        • `pyspider`:国产的网络爬虫系统,具有丰富的WebUI、脚本编辑器、任务监控器、项目管理以及结果处理器。
        • `Scrapy`:功能强大,依赖库较多。

      此外,还有其他一些常用的库,如`unirest for Python`、`hyper`、`PySocks`、`treq`、`aiohttp`等。

VPS购买请点击我

文章版权声明:除非注明,否则均为主机测评原创文章,转载或复制请以超链接形式并注明出处。

目录[+]