8 min

Scrapfly API 文档:网页抓取、云浏览器与截图

全面了解 Scrapfly 的网页抓取、云浏览器和截图 API 文档。学习设置、反机器人绕过、积分系统,以及 AdsCrawl 如何融入浏览器自动化工作流。

AAnonymous

Scrapfly API 文档:网页抓取、云浏览器和截图 API 完整指南

Scrapfly 提供统一的数据平台,只需一个 API 密钥即可处理反机器人绕过、隐身浏览器会话和视觉捕获。无论您需要原始 HTML、通过 CDP 控制的真实 Chromium 浏览器,还是像素级完美的截图,文档都涵盖了每个端点。本指南将带您了解从首次 API 调用到高级工作流的所有要点,让您自信地提取数据。

Scrapfly API 入门

Scrapfly API 文档:网页抓取、云浏览器与截图产品界面和功能概览。

在深入了解端点之前,请先设置您的账户并获取 API 密钥。Scrapfly 登录流程 很简单:注册、验证,然后从仪表板获取密钥。一旦通过身份验证,每个请求都会将您的密钥作为查询参数或请求头包含在内,平台会立即开始跟踪使用情况。

一个最简单的网页抓取 API 调用如下:

curl "https://api.scrapfly.io/scrape?key=YOUR_KEY&url=https://example.com"

响应是一个干净的 JSON 信封,告诉您抓取是否成功、使用了哪个代理以及完整的 HTML 内容。Scrapfly 仅在成功时收费——失败的反机器人挑战不会消耗积分。

Scrapfly 网页抓取 API

Scrapfly API 文档:网页抓取、云浏览器与截图产品界面和功能概览。

网页抓取 API 是主力。它通过反机器人绕过、自动代理轮换和可选的 JavaScript 渲染来获取任何 URL。您可以直接获得结构化数据:

  • url – 目标页面
  • render_js – 切换无头 Chromium 渲染以支持 SPA
  • asp – 启用反机器人绕过(处理 Cloudflare、DataDome、Akamai 等)
  • country – 地理定位出口 IP
  • format – 接收原始 HTML、干净的 Markdown 或 JSON

响应包含 result.contentresult.status_coderesult.antibot("bypassed" 或 "blocked")。如果挑战失败,不会向您收费——Scrapfly 定价 遵循“成功付费”模式,因此您的充值仅用于交付的数据。

反机器人绕过的工作原理

Scrapfly 在内部构建了每一层绕过机制。该平台使用两个隐身引擎:专有的 HTTP 客户端(Curlium)和隐身 Chromium 浏览器(Scrapium)。当您设置 asp=true 时,请求会经过一个管道,该管道匹配 JA4 指纹、H2 帧设置和 QUIC 对齐,同时在 190 多个国家/地区轮换住宅或数据中心代理。结果是,根据 Scrapeway 基准测试,受保护网站的成功率达到 98%

Scrapfly 云浏览器

对于需要真实、交互式浏览器会话的工作流,云浏览器通过 CDP 公开隐身 Chromium 实例。它与 Playwright 和 Puppeteer 完全兼容,因此您可以在提取数据或截图之前驱动点击、填写和导航。

# 通过 WebSocket 连接
wss://browser.scrapfly.io/cdp?key=YOUR_KEY

与自托管浏览器相比的优势:

  • 无需维护基础设施
  • 内置反机器人和指纹随机化
  • 会话持久化,支持多步骤流程
  • 仅对成功操作付费

云浏览器非常适合登录墙保护、复杂表单提交以及简单 HTTP 请求无法满足的场景。它通过提供完整的 CDP 控制来补充网页抓取 API。

Scrapfly 截图 API

截图 API 可将任何页面(或特定元素)捕获为 PNG、JPEG、WebP、GIF 或 PDF。它运行在真实的 Chromium 上,并使用与抓取端点相同的反机器人绕过引擎。一个简单的 GET 请求:

https://api.scrapfly.io/screenshot?url=https%3A%2F%2Fexample.com&key=YOUR_KEY

捕获管道

每个截图都流经一个可组合的管道:

  1. 反机器人绕过 – 在页面加载前解决
  2. 广告拦截和横幅关闭options=block_banners 移除 Cookie 弹窗和覆盖层
  3. JS 场景 – 点击、填写、滚动,并等待选择器或网络空闲
  4. 捕获 – 整页、视口或 CSS/XPath 定位的元素
  5. 优化 – 服务器端压缩;格式和质量调整
  6. 交付 – 响应体中的二进制图像或通过 log_url 提供的缓存 URL

等待条件和视口控制

时机至关重要。使用 wait_for_selectorwait_untilnetworkidledomcontentloaded)或固定的 rendering_wait 在正确时刻触发快门。结合自定义视口(resolutiondpr)和 auto_scroll=true 强制懒加载内容进入视图。

定时捕获和视觉差异

除了单次捕获,截图 API 还支持按 cron 计划进行定期快照。每次运行都会存储并与前一次进行像素差异比较,非常适合视觉回归测试、竞争监控和 AI 训练数据集。失败的捕获不消耗积分,您可以设置 cost_budget 来限制支出。

一次调用同时获取截图和数据

如果您同时需要图像和结构化数据,您不仅限于截图 API。网页抓取 API 支持 screenshots[name]=fullpage 参数,在单个请求中同时提供 HTML 提取和快照。

组合 API 实现复杂工作流

Scrapfly 的产品套件旨在组合使用。例如:

  • 使用 Crawler API 遍历网站,然后将每个发现的 URL 提供给网页抓取 API 以获取结构化内容。
  • 启动 云浏览器 会话登录仪表板,然后对同一会话调用截图 API 以获取像素级完美的报告。
  • 将抓取的 HTML 输入 Extraction API,该 API 使用 LLM 驱动的提示返回类型化数据。

官方 Scrapfly 文档 详细介绍了每个参数,并提供了 Python、Node.js 和 curl 的代码示例。

Scrapfly 与浏览器自动化和截图的替代方案对比

Scrapfly API 文档:网页抓取、云浏览器与截图产品界面和功能概览。

虽然 Scrapfly 提供了广泛的抓取和捕获平台,但一些团队需要更专注的反检测浏览器自动化解决方案。AdsCrawl 就是这样一个替代方案——它是一个专为 AI 时代构建的浏览器自动化和数据提取 API。与 Scrapfly 的统一抓取优先设计不同,AdsCrawl 将真实的云浏览器会话转化为简单的 API,输出截图、HTML 和 Markdown,并在需要时提供远程 CDP 控制。

主要区别:

  • 反检测配置文件:AdsCrawl 直接与 AdsPower 集成,用于指纹配置文件(用户代理、时区、WebGL、WebRTC),无需管理多个服务即可实现精细隐身。有关指导,请参阅 AdsCrawl 指纹设置指南
  • 开发者友好的简洁性:AdsCrawl 的 API 设计为可组合;您可以管理并发会话、透明地监控使用情况,并从免费层开始。AdsCrawl API 概述 介绍了典型工作流。
  • 用例:如果您的主要目标是 SEO 审计、价格监控或潜在客户研究,并且需要开箱即用的不可检测浏览器会话,AdsCrawl 可能感觉更专业。另一方面,当您需要完整的抓取管道(包括爬取、提取和广泛的反机器人覆盖)时,Scrapfly 表现出色。

两个平台都提供基于积分的定价,但 AdsCrawl 的模式针对浏览器会话时长和输出多样性进行了定制,而 Scrapfly 则随请求复杂性扩展。有关并排比较,请查看 顶级反检测平台对比,我们将 AdsCrawl 评为第一名。

来自 Scrapfly 文档的常见故障排除技巧

即使是最可靠的 API 也会遇到问题。以下是文档告诉您要注意的事项:

  • HTTP 422 错误:请求有效但失败——检查 X-Scrapfly-Reject-CodeX-Scrapfly-Reject-Description 请求头以获取详细信息。通常是目标网站的临时问题。
  • 并发限制:如果您遇到 429 Too Many Requests,说明您已达到计划的并发上限。响应头 X-Scrapfly-Account-Concurrent-UsageX-Scrapfly-Account-Remaining-Concurrent-Usage 会告诉您当前状态。
  • 预算控制:使用 cost_budget 参数限制每个请求的支出,避免意外消耗高成本目标的积分。
  • 仪表板透明度:每个请求都会生成一个 log_url,您可以在 Web 仪表板中重放完整时间线——包括重定向、加载时间和渲染后的 HTML。

相关阅读

来源和进一步阅读

常见问题解答

如何获取我的 Scrapfly API 密钥?

在 scrapfly.io 注册,验证您的电子邮件,然后从仪表板获取密钥。该密钥用于 key 查询参数或 Authorization 请求头。

网页抓取 API 和截图 API 有什么区别?

网页抓取 API 返回 HTML/文本内容,并可选择附加截图。截图 API 则纯粹针对图像捕获进行了优化,具有更简单的基于 GET 的界面,并内置广告拦截、整页滚动和格式选项。如果您需要数据,请从网页抓取 API 开始;如果您只需要图片,截图 API 更快更便宜。

积分系统如何运作?

积分按每个成功请求消耗。失败的绕过是免费的。每个请求的成本取决于复杂性——例如,代理类型、JavaScript 渲染和反机器人通过。您可以通过响应头(X-Scrapfly-Api-Cost)监控成本。有关详细分解,请查看 Scrapfly 定价指南

我可以将 Scrapfly 与 Playwright 或 Puppeteer 一起使用吗?

可以——云浏览器公开了一个 CDP WebSocket 端点。您可以通过指向 wss://browser.scrapfly.io/cdp?key=... 连接任何 Playwright 或 Puppeteer 脚本。这为您提供了完整的浏览器控制,并带有 Scrapfly 的隐身和代理基础设施。

是否有专注于反检测自动化的替代方案?

AdsCrawl 提供了一个专用的反检测浏览器 API,集成了 AdsPower 指纹配置文件、远程 CDP 和多格式输出。如果您需要纯粹的浏览器自动化而不是完整的抓取平台,值得探索。请参阅 AdsCrawl 定价和计划 进行评估。

总结

Scrapfly API 文档:网页抓取、云浏览器与截图产品界面和功能概览。

Scrapfly 的文档涵盖了一系列丰富的功能——从基本的 URL 获取到完整的云浏览器会话和定时截图监控。通过了解网页抓取 API、云浏览器和截图 API,您可以构建能够应对现代网络挑战的弹性数据管道。对于更倾向于不可检测浏览器自动化的团队,AdsCrawl 提供了一种补充方法,具有深度指纹管理和开发者优先的 API。探索两者,测试它们的免费层,并为您的技术栈选择正确的工具。