Phantomjs抓取渲染JS后的网页（Python代码）

脚本专栏 2026/5/30 佚名

3 2 1

最近需要爬取某网站，无奈页面都是JS渲染后生成的，普通的爬虫框架搞不定，于是想到用Phantomjs搭一个代理。

Python调用Phantomjs貌似没有现成的第三方库（如果有，请告知小编），漫步了一圈，发现只有pyspider提供了现成的方案。

简单试用了一下，感觉pyspider更像一个为新手打造的爬虫工具，好比一个老妈子，有时无微不至，有时喋喋不休。轻巧的小工具应该更受人喜爱，我也怀着一点私心，可以带着我最爱的BeautifulSoup一块儿用，而不用再学PyQuery（pyspider用来解析HTML），更不用忍受浏览器写Python的糟糕体验（偷笑）。

所以花了一个下午的时间，把pyspider当中实现Phantomjs代理的部分拆了出来，独立成一个小的爬虫模块，希望大家会喜欢（感谢binux！）。

准备工作

你当然要有Phantomjs，废话！（Linux下最好用supervisord守护，必须保持抓取的时候Phantomjs一直处于开启状态）
用项目路径下的phantomjs_fetcher.js启动：phantomjs phantomjs_fetcher.js [port]
安装tornado依赖（使用了tornado的httpclient模块）

调用是超级简单的

from tornado_fetcher import Fetcher

# 创建一个爬虫
> fetcher=Fetcher(
  user_agent='phantomjs', # 模拟浏览器的User-Agent
  phantomjs_proxy='http://localhost:12306', # phantomjs的地址
  poolsize=10, # 最大的httpclient数量
  async=False # 同步还是异步
  )
# 开始连接Phantomjs的代码，可以渲染JS！
> fetcher.fetch(url)
# 渲染成功后执行额外的JS脚本（注意用function包起来！）
> fetcher.fetch(url, js_script='function(){setTimeout("window.scrollTo(0,100000)}", 1000)')

代码 https://github.com/2shou/PhantomjsFetcher

Phantomjs抓取渲染JS后的网页（Python代码）

标签：

Phantomjs抓取渲染JS后的网页（Python代码）

免责声明：本站文章均来自网站采集或用户投稿，网站不提供任何软件下载或自行开发的软件！如有用户或公司发现本站内容信息存在侵权行为，请邮件告知！ 858582#qq.com

评论“Phantomjs抓取渲染JS后的网页（Python代码）”

Phantomjs抓取渲染JS后的网页（Python代码）

暂无“Phantomjs抓取渲染JS后的网页（Python代码）”评论...

www.imxmx.com 杰晶网络

8,675无损音乐

1,324高清电影

213破解软件

120,141站长资源

最新文章

群星《奔赴！万人现场第2期》[FLAC/分轨][5

2026/5/30

群星《奇妙浪一夏 (上海迪士尼度假区音乐)》

2026/5/30

群星《奇妙浪一夏 (上海迪士尼度假区音乐)》

2026/5/30

【古典音乐】詹姆斯·高威《季节》1993[WAV+

2026/5/30

贝拉芳蒂《卡里普索之王》SACD[WAV+CUE]

2026/5/30

一句话新闻

苹果官宣WWDC 2024！预计会有大批AI功能 - 2026/5/30

3月27日消息，苹果宣布2024年全球开发者大会（WWDC）将于6月10日至6月14日举行，巧合的是，这次大会与端午假期重合。

苹果官方表示：

在线参加 Apple 每年规模最大的开发者盛会。亲眼见证 Apple 最新平台、技术和工具的发布。了解如何创建和改进你的 App 和游戏。与 Apple 设计师和工程师互动交流，与全球开发者社区建立联系。以上活动均免费在线举行。

探索各种新的工具、框架和功能，助力你打造出理想的 App 和游戏。通过视频讲座学习新技能，与 Apple 专家进行一对一会面，以推进你的项目，完善你的构思。

Swift Student Challenge 旨在支持和鼓舞下一代开发者、创作者和企业家。太平洋时间 3 月 28 日，我们将公布今年的获奖者名单。获奖者将有资格参加在 Apple Park 举办的特别活动。我们还会选出 50 名杰出获胜者，他们将受邀前往库比提诺，获得为期三天的非凡体验，包括参加 Apple Park 的特别活动。

Phantomjs抓取渲染JS后的网页（Python代码）

Phantomjs抓取渲染JS后的网页（Python代码）

Python使用lxml模块和Requests模块抓取HTML页面的教程

python操作字典类型的常用方法(推荐)

评论“Phantomjs抓取渲染JS后的网页（Python代码）”

RTX 5090要首发性能要翻倍！三星展示GDDR7显存

更新动态

友情链接

Phantomjs抓取渲染JS后的网页（Python代码）

Phantomjs抓取渲染JS后的网页（Python代码）

Python使用lxml模块和Requests模块抓取HTML页面的教程

python操作字典类型的常用方法(推荐)

评论“Phantomjs抓取渲染JS后的网页（Python代码）”

RTX 5090要首发 性能要翻倍！三星展示GDDR7显存

更新动态

友情链接

RTX 5090要首发性能要翻倍！三星展示GDDR7显存