百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

Pydoll:更流畅可靠的浏览器自动化

myzbx 2025-09-18 05:00 53 浏览

无论是数据抓取,还是自动化 AI 助手,或是网页测试,浏览器自动化技术都是能在其中发挥关键作用的一环。然而,传统的浏览器自动化工具往往依赖于复杂的 WebDriver 配置,这不仅增加了使用的难度,还可能导致稳定性问题。Pydoll 这一浏览器自动化工具,摆脱了对 WebDriver 的依赖,并提供了更为流畅和可靠的实现。


简介

Pydoll 是一个 Chromium 浏览器自动化工具,其代码仓库位于
https://github.com/thalissonvs/pydoll 。该项目的主要目标是为开发者提供一种更加简单、流畅和可靠的方式来实现浏览器的自动化操作。

与其他传统的浏览器自动化解决方案不同,Pydoll 最大的特色在于它完全消除了对 WebDriver 的依赖。这意味着开发者在使用 Pydoll 时,无需再为繁琐的 WebDriver 配置而烦恼,大大降低了使用门槛,提高了开发效率。同时,Pydoll 还支持异步操作,利用 Python 的异步编程特性,能够更高效地处理多个浏览器任务,提升整体性能。

Pydoll 还提供了强大人类行为模拟功能,能够绕过 Cloudflare Turnstile 和 reCAPTCHA v3 验证码,实现逼真的网页浏览和操作性能,更不容易触发反爬机制。

此外,Pydoll 还具备丰富的功能,如强大的网络请求管理、DOM 操作、事件监听等。通过这些功能,开发者可以轻松地实现网页元素的查找、点击、输入等操作,还可以监听网络请求和响应,获取网页的各种数据。

使用

Pydoll 是一个 Python 库,使用 pip 直接安装:

pip install pydoll-python

安装后无需额外配置浏览器 WebDriver,就能开始使用了。Pydoll 主要使用异步编程,以下是一个简单的例子:

import asyncio
from pydoll.browser.chrome import Chrome
from pydoll.constants import By

async def main():
    # Start the browser with no additional webdriver configuration!
    async with Chrome() as browser:
        await browser.start()
        page = await browser.get_page()
        
        # Navigate through captcha-protected sites without worry
        await page.go_to('https://example-with-cloudflare.com')
        button = await page.find_element(By.CSS_SELECTOR, 'button')
        await button.click()

asyncio.run(main())

在这个例子中,首先启动 Chrome 浏览器,然后访问特定的网站,并在网页上找到一个按钮,最后进行按钮的点击,各个操作简单直观。

Pydoll 封装了几个抽象,首先是浏览器 Browser,能够控制浏览器的配置和参数:

async def browser_examples():
    async with Chrome() as browser:
        await browser.start()
        # Control multiple pages with incredible ease
        pages = [await browser.get_page() for _ in range(3)]
        
        # Advanced settings with a simple command
        await browser.set_window_maximized()

在以上代码中,浏览器启动了3个标签页,并控制浏览器的窗口最大化。

Pydoll 还提供了页面 Page,用来表达单个浏览器页面,以下例子中,通过 Page 完成了网站的访问,以及网页截图:

async def page_examples():
    page = await browser.get_page()
    
    # Smooth navigation, even on protected sites
    await page.go_to('https://site-with-recaptcha.com')
    
    # Capture perfect screenshots
    await page.get_screenshot('/screenshots/evidence.png')

网页元素 WebElement 则被用来表示页面中的各个 HTML 元素,能够更细粒度地访问和操控单独的控件和元素:

async def element_examples():
    # Natural and precise interactions
    input_field = await page.find_element(By.CSS_SELECTOR, 'input')
    await input_field.type_keys('Hello World')  # Realistic typing!
    
    # Intuitive chained operations
    dropdown = await page.find_element(By.CSS_SELECTOR, 'select')
    await dropdown.select_option('value')

    # Realistic clicks with offset
    button = await page.find_element(By.CSS_SELECTOR, 'button')
    await button.click(x_offset=5, y_offset=10)

Pydoll 还提供了事件系统,能够监听网站页面事件,然后调用回调:

from pydoll.events.page import PageEvents

async def event_example():
    await page.enable_page_events()
    # React to events in real-time!
    await page.on(PageEvents.PAGE_LOADED, 
                  lambda e: print('Page loaded successfully!'))

在这个例子中就监听了 PAGE_LOADED 加载完成事件,然后打印输出。

总结

Pydoll 作为一款 Python 浏览器自动化工具,提供了一种体验更好地解决方案。其通过消除对 WebDriver 的依赖,简化了开发流程,提高了开发效率。同时,其丰富的功能和对异步编程的支持,使得开发者能够更高效地处理各种浏览器自动化任务。

Pydoll 功能丰富,可以在很多场景中替代其他的浏览器自动化工具,且使用门槛低,方便开发者入门学习。Pydoll 能被广泛应用于数据采集、自动化测试、网页监控等领域,开发者可以使用 Pydoll 快速、稳定地获取网页上的数据;也可以模拟用户的各种操作,对网页进行全面的测试;还可以实时监听网页的变化,及时发现问题并进行处理。

相关推荐

如何设计一个优秀的电子商务产品详情页

加入人人都是产品经理【起点学院】产品经理实战训练营,BAT产品总监手把手带你学产品电子商务网站的产品详情页面无疑是设计师和开发人员关注的最重要的网页之一。产品详情页面是客户作出“加入购物车”决定的页面...

怎么在JS中使用Ajax进行异步请求?

大家好,今天我来分享一项JavaScript的实战技巧,即如何在JS中使用Ajax进行异步请求,让你的网页速度瞬间提升。Ajax是一种在不刷新整个网页的情况下与服务器进行数据交互的技术,可以实现异步加...

中小企业如何组建,管理团队_中小企业应当如何开展组织结构设计变革

前言写了太多关于产品的东西觉得应该换换口味.从码农到架构师,从前端到平面再到UI、UE,最后走向了产品这条不归路,其实以前一直再给你们讲.产品经理跟项目经理区别没有特别大,两个岗位之间有很...

前端监控 SDK 开发分享_前端监控系统 开源

一、前言随着前端的发展和被重视,慢慢的行业内对于前端监控系统的重视程度也在增加。这里不对为什么需要监控再做解释。那我们先直接说说需求。对于中小型公司来说,可以直接使用三方的监控,比如自己搭建一套免费的...

Ajax 会被 fetch 取代吗?Axios 怎么办?

大家好,很高兴又见面了,我是"高级前端进阶",由我带着大家一起关注前端前沿、深入前端底层技术,大家一起进步,也欢迎大家关注、点赞、收藏、转发!今天给大家带来的主题是ajax、fetch...

前端面试题《AJAX》_前端面试ajax考点汇总

1.什么是ajax?ajax作用是什么?AJAX=异步JavaScript和XML。AJAX是一种用于创建快速动态网页的技术。通过在后台与服务器进行少量数据交换,AJAX可以使网页实...

Ajax 详细介绍_ajax

1、ajax是什么?asynchronousjavascriptandxml:异步的javascript和xml。ajax是用来改善用户体验的一种技术,其本质是利用浏览器内置的一个特殊的...

6款可替代dreamweaver的工具_替代powerdesigner的工具

dreamweaver对一个web前端工作者来说,再熟悉不过了,像我07年接触web前端开发就是用的dreamweaver,一直用到现在,身边的朋友有跟我推荐过各种更好用的可替代dreamweaver...

我敢保证,全网没有再比这更详细的Java知识点总结了,送你啊

接下来你看到的将是全网最详细的Java知识点总结,全文分为三大部分:Java基础、Java框架、Java+云数据小编将为大家仔细讲解每大部分里面的详细知识点,别眨眼,从小白到大佬、零基础到精通,你绝...

福斯《死侍》发布新剧照 "小贱贱"韦德被改造前造型曝光

时光网讯福斯出品的科幻片《死侍》今天发布新剧照,其中一张是较为罕见的死侍在被改造之前的剧照,其余两张剧照都是死侍在执行任务中的状态。据外媒推测,片方此时发布剧照,预计是为了给不久之后影片发布首款正式预...

2021年超详细的java学习路线总结—纯干货分享

本文整理了java开发的学习路线和相关的学习资源,非常适合零基础入门java的同学,希望大家在学习的时候,能够节省时间。纯干货,良心推荐!第一阶段:Java基础重点知识点:数据类型、核心语法、面向对象...

不用海淘,真黑五来到你身边:亚马逊15件热卖爆款推荐!

Fujifilm富士instaxMini8小黄人拍立得相机(黄色/蓝色)扫二维码进入购物页面黑五是入手一个轻巧可爱的拍立得相机的好时机,此款是mini8的小黄人特别版,除了颜色涂装成小黄人...

2025 年 Python 爬虫四大前沿技术:从异步到 AI

作为互联网大厂的后端Python爬虫开发,你是否也曾遇到过这些痛点:面对海量目标URL,单线程爬虫爬取一周还没完成任务;动态渲染的SPA页面,requests库返回的全是空白代码;好不容易...

最贱超级英雄《死侍》来了!_死侍超燃

死侍Deadpool(2016)导演:蒂姆·米勒编剧:略特·里斯/保罗·沃尼克主演:瑞恩·雷诺兹/莫蕾娜·巴卡林/吉娜·卡拉诺/艾德·斯克林/T·J·米勒类型:动作/...

停止javascript的ajax请求,取消axios请求,取消reactfetch请求

一、Ajax原生里可以通过XMLHttpRequest对象上的abort方法来中断ajax。注意abort方法不能阻止向服务器发送请求,只能停止当前ajax请求。停止javascript的ajax请求...