10 min

Scrapfly API 设置:网页抓取、云浏览器与截图

了解如何设置 Scrapfly 的网页抓取、云浏览器和截图 API。逐步配置、代码示例,以及与 AdsCrawl 真实浏览器基础设施的对比。

AAnonymous

Scrapfly API 设置:网页抓取、云浏览器与截图

Scrapfly 将自己定位为一个统一的网页数据平台,将反机器人绕过、隐身浏览器会话、住宅代理和结构化提取整合在一个 API 密钥后面。对于开发者和 AI 团队来说,其承诺很简单:调用一个端点,即可获得干净的 HTML、渲染后的 JavaScript 或整页截图,而无需管理无头浏览器集群或轮换代理列表。本指南将逐步介绍 Scrapfly 三大核心产品——网页抓取 API、云浏览器和截图 API——的实际设置,然后探讨像 AdsCrawl 这样的平台如何以不同的架构理念应对同样的挑战。

了解 Scrapfly 的产品架构

Scrapfly API 设置:网页抓取、云浏览器与截图 - 了解 Scrapfly 的产品架构

Scrapfly API 设置:网页抓取、云浏览器与截图 - 了解 Scrapfly 的产品架构.

Scrapfly API 设置:网页抓取、云浏览器与截图 - 了解 Scrapfly 的产品架构。

Scrapfly 将其功能组织为五个不同的 API 端点,它们共享相同的信用池和认证模型。其中最常用的三个是:

  • 网页抓取 APIPOST api.scrapfly.io/scrape):获取 URL,支持可配置的反机器人绕过、代理轮换和可选的 JavaScript 渲染。返回 HTML、Markdown 或结构化 JSON。
  • 云浏览器wss://browser.scrapfly.io/cdp):通过 Chrome DevTools 协议(CDP)暴露一个隐身 Chromium 实例,兼容 Playwright 和 Puppeteer。浏览器是托管的、可扩展的,并带有指纹以避免检测。
  • 截图 APIPOST api.scrapfly.io/screenshot):以 PNG、JPEG 或 WebP 格式捕获整页、视口或元素级别的截图。支持广告拦截、cookie 横幅关闭和自定义视口尺寸。

这三个产品共享一个基于信用的计费模型,其中因反机器人阻止而失败的请求不收费。该平台还提供提取 API、爬虫 API、AI 浏览器代理,以及用于连接 Claude、Cursor 和其他 AI 工具的 MCP 服务器。

初始设置:API 密钥和认证

Scrapfly API 设置:网页抓取、云浏览器与截图 - 初始设置:API 密钥和认证

Scrapfly API 设置:网页抓取、云浏览器与截图 - 初始设置:API 密钥和认证.

Scrapfly API 设置:网页抓取、云浏览器与截图 - 初始设置:API 密钥和认证。

每个 Scrapfly 请求都通过 API 密钥进行认证,该密钥可以作为查询参数或 HTTP 头传递。注册后,您将获得 1,000 个免费信用点,没有时间限制,也不需要信用卡。

第 1 步:获取您的密钥 在 scrapfly.io 注册,并从仪表板复制密钥。该密钥可立即用于所有产品。

第 2 步:选择您的认证方法 对于基于 GET 的端点(如截图 API),将密钥作为查询参数传递:

https://api.scrapfly.io/screenshot?url=https://example.com&key=YOUR_KEY

对于基于 POST 的端点(如网页抓取 API),将其包含在 JSON 主体中或作为 x-api-key 头:

curl -X POST https://api.scrapfly.io/scrape \
  -H "Content-Type: application/json" \
  -d '{"key": "YOUR_KEY", "url": "https://example.com"}'

第 3 步:验证连接 运行一个最小的抓取请求。成功的响应返回一个 JSON 信封,其中包含 success: true、页面内容、状态代码和元数据头(如 X-Scrapfly-Api-Cost),指示信用消耗。

配置网页抓取 API

Scrapfly API 设置:网页抓取、云浏览器与截图 - 配置网页抓取 API

Scrapfly API 设置:网页抓取、云浏览器与截图 - 配置网页抓取 API.

Scrapfly API 设置:网页抓取、云浏览器与截图 - 配置网页抓取 API。

网页抓取 API 是数据提取的主力。一个基本调用会获取 URL 并返回原始 HTML,但其真正价值在于其渲染和解锁参数。

启用 JavaScript 渲染

许多现代网站动态加载内容。设置 render_js: true 以在返回 HTML 之前执行 JavaScript:

import requests

response = requests.post(
    "https://api.scrapfly.io/scrape",
    json={
        "key": "YOUR_KEY",
        "url": "https://dynamic-site.com",
        "render_js": True
    }
)
data = response.json()
print(data["result"]["content"])

反机器人绕过和代理选择

Scrapfly 的反机器人引擎通过一个参数激活。添加 "asp": True 以通过隐身堆栈路由。将其与代理选择结合以实现地理定位:

{
  "key": "YOUR_KEY",
  "url": "https://protected-site.com",
  "asp": True,
  "proxy_pool": "public_residential_pool",
  "country": "us"
}

结构化提取

无需手动解析 HTML,而是使用提取 API 和 JSON 模式或自然语言提示。这将返回产品、文章、评论或自定义实体的类型化数据:

response = requests.post(
    "https://api.scrapfly.io/extraction",
    json={
        "key": "YOUR_KEY",
        "url": "https://ecommerce-site.com/product/1",
        "extraction_prompt": "提取产品名称、价格和描述。"
    }
)

设置云浏览器

Scrapfly API 设置:网页抓取、云浏览器与截图 - 设置云浏览器。

对于需要完整浏览器交互的工作流程——点击、表单填写或会话持久化——Scrapfly 的云浏览器提供了一个可通过 CDP 访问的远程 Chromium 实例。

使用 Playwright 连接

安装 Playwright 并将其指向云浏览器的 WebSocket 端点:

pip install playwright
playwright install
from playwright.sync_api import sync_playwright

with sync_playwright() as p:
    browser = p.chromium.connect_over_cdp(
        "wss://browser.scrapfly.io/cdp?key=YOUR_KEY"
    )
    page = browser.new_page()
    page.goto("https://example.com")
    page.click("button#load-more")
    content = page.content()
    browser.close()

云浏览器在后台处理指纹随机化、头部对齐和代理出口。团队将其用于复杂的登录流程、单页应用爬取以及需要确定性控制的 AI 代理循环。

会话持久化

通过存储和引用会话 ID,在多个请求之间重用浏览器上下文。这可以保持 cookie、本地存储和认证状态,而无需重新登录。

截图 API 配置

截图 API 设计为简单易用,接受带有 URL 编码参数的 GET 请求。它非常适合监控仪表板、视觉回归测试以及捕获渲染状态以供审计。

基本整页捕获

https://api.scrapfly.io/screenshot?url=https://example.com&key=YOUR_KEY&format=png&full_page=true

高级选项

添加参数以控制输出和页面行为:

  • viewport_widthviewport_height:设置浏览器窗口大小。
  • auto_scroll:滚动到底部以触发懒加载图像。
  • block_banners:关闭 cookie 同意弹窗和广告。
  • js:在捕获前执行自定义 JavaScript。
  • format:选择 pngjpgwebpgif

包含多个选项的示例:

https://api.scrapfly.io/screenshot?url=https://example.com&key=YOUR_KEY&format=webp&full_page=true&auto_scroll=true&block_banners=true

检索截图

响应主体是图像二进制。或者,X-Scrapfly-Screenshot-Url 头提供了一个托管 URL,供以后检索,适用于异步工作流程。

监控和可观测性

Scrapfly 包括一个 Web 仪表板,跟踪每个项目的成功率、延迟和信用消耗。每个响应都带有 X-Scrapfly-Api-CostX-Scrapfly-Remaining-Api-Credit 等头,支持在生产管道中进行实时预算监控。该平台还提供实时遥测视图和用于正常运行时间跟踪的状态页面。

AdsCrawl 在浏览器 API 领域中的定位

虽然 Scrapfly 将抓取、浏览器和截图功能捆绑到一个信用系统中,但 AdsCrawl 采取了不同的方法:它被构建为面向 AI 时代的浏览器基础设施。AdsCrawl 没有将浏览器抽象为简化的抓取端点,而是暴露了具有完整 CDP 控制、指纹配置文件和并发执行的真实浏览器会话——专为需要将可重复的网页操作包装成可靠 API 的团队而设计。

真实浏览器会话与托管端点

Scrapfly 的云浏览器提供 CDP 访问,但其主要价值主张是托管抓取管道——反机器人绕过、代理轮换和提取模板。AdsCrawl 专注于为开发者提供原始的浏览器能力:您直接控制 Chrome DevTools 协议,定义自定义指纹配置文件,并在不管理基础设施的情况下运行并发会话。这使其特别适合需要实时导航、点击和提取的 AI 代理,而不是提交单个 URL 并等待结果。

有关云浏览器平台的更深入比较,请参阅 AdsCrawl vs Browserless:2026 年哪个浏览器 API 胜出?

信用模型和定价理念

Scrapfly 使用信用系统,请求成本随复杂性扩展——简单 HTTP 抓取 1 个信用点,JavaScript 渲染 5 个信用点,住宅代理 25 个信用点,整页截图 60 个信用点。AdsCrawl 也采用基于信用的免费增值模式,但将消耗与浏览器会话持续时间和并发性挂钩,而不是按请求功能。两个平台都提供免费层级:Scrapfly 提供 1,000 个永久信用点,而 AdsCrawl 包括一个用于原型设计的免费层级。

何时选择每个平台

  • 选择 Scrapfly 如果您的核心工作流程是高容量 URL 获取,并带有托管反机器人绕过,并且您希望在一个 API 密钥下使用提取模板和截图捕获。在受保护网站上的 98% 成功率和零成本失败使其成为抓取密集型团队的强大选择。
  • 选择 AdsCrawl 如果您需要持久浏览器会话、自定义 CDP 命令、指纹管理以及专为 AI 代理和自动化工作流程设计的基础设施。该平台的真实浏览器能力支持超越单请求抓取的复杂交互序列。

要更广泛地了解这些工具与 Playwright 和 Selenium 等框架的比较,请阅读 AdsCrawl vs ScrapingBee vs Playwright:哪个工具胜出?AdsCrawl vs Selenium:2026 年云 API 与框架

实际集成:结合 Scrapfly 和 AdsCrawl

在生产管道中,团队通常在不同阶段使用两个平台。Scrapfly 处理批量数据提取和截图监控,而 AdsCrawl 管理需要状态导航的交互式浏览器会话。例如:

  1. 使用 Scrapfly 的网页抓取 API 从列表页面收集产品 URL。
  2. 将这些 URL 传递给 AdsCrawl 浏览器会话,该会话登录零售商门户,将商品添加到购物车,并捕获结账流程。
  3. 使用 Scrapfly 的截图 API 每天拍摄竞争对手着陆页的视觉快照,用于监控仪表板。

这种关注点分离——托管抓取与交互式浏览器自动化——让每个工具在其优势领域运作。

相关阅读

来源和进一步阅读

常见问题解答

Scrapfly 的网页抓取 API 和云浏览器有什么区别?

网页抓取 API 是一个托管的 HTTP 端点,用于获取 URL,可选地渲染 JavaScript,并返回内容。云浏览器是一个完整的远程 Chromium 实例,您可以通过 CDP 控制,适用于多步骤交互和持久会话。

Scrapfly 是否对失败的请求收费?

不。由于反机器人阻止或上游错误(4xx/5xx)导致的失败请求不收费。只有成功的抓取才消耗信用点。

我可以将 Scrapfly 与 Playwright 或 Puppeteer 一起使用吗?

可以。云浏览器端点(wss://browser.scrapfly.io/cdp)接受来自 Playwright、Puppeteer 以及任何 CDP 兼容客户端的标准 CDP 连接。

AdsCrawl 与 Scrapfly 相比,在 AI 代理工作流程方面如何?

AdsCrawl 专为 AI 代理构建,提供真实浏览器会话、指纹配置文件和并发执行,并具有完整的 CDP 控制。Scrapfly 的 AI 浏览器代理针对类似用例,但将其打包在托管抓取平台中。选择取决于您是需要基础设施优先的浏览器控制(AdsCrawl)还是统一的抓取到代理管道(Scrapfly)。

Scrapfly 支持哪些截图格式?

PNG、JPEG、WebP 和 GIF。您可以使用 CSS 选择器捕获整页、仅视口或特定元素。

结论

Scrapfly 提供了一个成熟的、信用统一的平台,将反机器人复杂性、代理管理和浏览器渲染抽象在干净的 API 端点后面。其设置是最小的:注册、复制密钥,然后选择与您的任务匹配的端点。对于主要需求是可靠的大规模数据提取的团队,网页抓取 API 和截图 API 提供了快速的价值实现时间。对于那些需要更深入浏览器控制的团队,云浏览器在同一生态系统中提供 CDP 访问。

然而,当工作流程需要持久浏览器会话、自定义指纹配置文件以及专为 AI 代理构建的基础设施时,AdsCrawl 提供了一个引人注目的替代方案。它不是将浏览器访问层叠在抓取平台之上,而是以浏览器作为核心原语——为开发者提供下一代网页自动化所需的控制力和并发性。理解这两种方法可以让您将工具与任务匹配,无论是为一百万页面调用一个 API,还是一个像代理一样思考和行动的有状态浏览器会话。