11 min

如何将AdsCrawl与ChatGPT结合用于AI驱动的网页数据

了解如何将AdsCrawl的浏览器自动化API与ChatGPT结合,以提取、分析并利用网页数据。逐步设置、代码示例以及适用于AI代理的实用工作流程。

AAnonymous

如何将AdsCrawl与ChatGPT结合用于AI驱动的网页数据

将真实的浏览器自动化API与前沿的大语言模型相结合,可以解锁远超简单抓取的工作流程。AdsCrawl为您提供对实时渲染网页的编程访问——捕获截图、提取干净的Markdown或HTML,并控制远程Chrome实例。当您将结构化的实时网页数据输入ChatGPT时,您可以将原始页面内容转化为摘要、竞争情报、潜在客户列表、监控警报和决策就绪的报告。本文介绍了实用的设置、可用的代码以及真实世界的用例,使AdsCrawl–ChatGPT组合成为AI代理、增长团队和自动化工程师的强大资产。

为什么将浏览器API与语言模型配对?

ChatGPT product interface

ChatGPT product interface.

ChatGPT产品界面。

独立的ChatGPT可以回答训练数据中的问题,但它无法自行浏览实时网页或与JavaScript密集型页面交互。AdsCrawl通过充当浏览器基础设施来填补这一空白,该基础设施从任何公共URL获取、渲染和提取内容。它们共同解决了一个明确的问题:您需要只有真实浏览器才能检索的当前、特定于页面的数据,并且您需要ChatGPT的推理和生成能力将这些数据转化为有用的东西。

该组合表现出色的常见场景:

  • 竞争性广告监控: 捕获竞争对手的着陆页,并让ChatGPT识别消息模式、优惠和行动号召。
  • SEO内容简报: 提取关键词的排名靠前页面,然后让ChatGPT分析结构、标题和语义差距。
  • 电子商务情报: 从多个网站提取产品列表和定价,然后使用ChatGPT规范化数据并突出定价异常。
  • 潜在客户丰富: 抓取公司关于页面,让ChatGPT提取关键决策者、价值主张和行业信号。
  • 自动报告: 安排每日截图和HTML捕获,然后将差异输入ChatGPT以生成变更的通俗摘要。

由于AdsCrawl提供完整的Chrome DevTools协议(CDP)端点,您还可以在提取数据之前执行复杂的交互——例如登录、点击分页或填写表单。ChatGPT永远不会看到混乱的原始HTML;它接收您已经过滤的干净Markdown或结构化文本,使分析更快、更可靠。

工作流程如何组合在一起

ChatGPT product interface

ChatGPT product interface.

ChatGPT产品界面。

集成遵循一个简单的管道:

  1. 通过AdsCrawl API请求实时页面,可选使用特定的指纹配置文件或地理代理。
  2. 接收渲染的内容,格式为Markdown、HTML或截图URL。
  3. 在本地处理和修剪输出,仅保留相关部分。
  4. 将清理后的内容发送到ChatGPT,通过OpenAI API并附带有针对性的提示。
  5. 在您的应用程序中消费结构化响应——无论是仪表板、Slack警报还是数据库。

此管道可以按需运行,也可以通过cron作业、云函数或Airflow等编排工具进行调度。AdsCrawl基于信用的定价和并发会话支持意味着您可以从每天几次检查扩展到数千次并行提取,而无需管理自己的浏览器群。

为ChatGPT驱动的工作流程设置AdsCrawl

ChatGPT product interface

ChatGPT product interface.

ChatGPT产品界面。

在编写任何集成代码之前,您需要一个AdsCrawl账户和API密钥。该平台提供免费增值层,让您无需前期成本即可测试真实的浏览器会话。

步骤1:获取您的AdsCrawl API密钥

  1. 在AdsCrawl仪表板注册。
  2. 导航到API密钥部分并创建新密钥。
  3. 复制密钥并将其存储在环境变量中,作为ADSCRAWL_API_KEY

步骤2:发出您的第一个浏览器请求

AdsCrawl公开了一个统一的API端点。最简单的调用捕获截图并返回页面的Markdown内容。这是一个cURL示例:

curl -X POST https://api.adscrawl.io/v1/browser \
  -H "Authorization: Bearer $ADSCRAWL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "url": "https://example.com",
    "actions": [
      {"type": "screenshot"},
      {"type": "extract", "format": "markdown"}
    ]
  }'

响应包括一个screenshot_url和一个包含页面Markdown的content字段。对于需要交互的页面,您可以链接CDP命令或使用更高级别的操作,如clickwait_for_selector

步骤3:连接到OpenAI API

您需要一个OpenAI API密钥,并有权访问GPT-4o或GPT-5.6等模型。安装官方Python客户端:

pip install openai

然后设置您的客户端:

import openai

client = openai.OpenAI(api_key="your-openai-api-key")

实用示例:竞争对手着陆页分析

让我们逐步完成一个完整的Python脚本,该脚本捕获竞争对手的主页,提取其文本内容,并让ChatGPT总结消息并识别主要行动号召。

import os
import requests
import openai

ADSCRAWL_KEY = os.getenv("ADSCRAWL_API_KEY")
OPENAI_KEY = os.getenv("OPENAI_API_KEY")

openai_client = openai.OpenAI(api_key=OPENAI_KEY)

# 步骤1:通过AdsCrawl获取渲染页面
response = requests.post(
    "https://api.adscrawl.io/v1/browser",
    headers={
        "Authorization": f"Bearer {ADSCRAWL_KEY}",
        "Content-Type": "application/json"
    },
    json={
        "url": "https://competitor.com",
        "actions": [
            {"type": "extract", "format": "markdown"}
        ]
    }
)
data = response.json()
page_markdown = data["content"]

# 步骤2:修剪到可管理的上下文窗口
# 保留前8000个字符——足以覆盖首屏消息
trimmed_content = page_markdown[:8000]

# 步骤3:让ChatGPT分析
completion = openai_client.chat.completions.create(
    model="gpt-4o",
    messages=[
        {
            "role": "system",
            "content": "You are a competitive intelligence analyst. Analyze the provided webpage content and return a JSON object with keys: 'primary_headline', 'value_proposition', 'target_audience', 'main_cta', and 'tone'."
        },
        {
            "role": "user",
            "content": f"Analyze this landing page content:\n\n{trimmed_content}"
        }
    ],
    response_format={"type": "json_object"}
)

print(completion.choices[0].message.content)

此脚本输出结构化JSON,您可以将其存储在数据库中、推送到Google Sheets或输入监控仪表板。将URL替换为您要跟踪的任何页面,并安排脚本每天运行。

扩展管道:使用CDP控制进行多页面研究

对于跨多个页面的研究——例如抓取完整的产品目录或阅读分页搜索结果——AdsCrawl的CDP会话支持允许您在请求之间保持状态。

# 启动持久浏览器会话
session = requests.post(
    "https://api.adscrawl.io/v1/browser/session",
    headers={"Authorization": f"Bearer {ADSCRAWL_KEY}"},
    json={"profile": "desktop_chrome_latest"}
).json()
session_id = session["session_id"]

# 导航和交互
requests.post(
    f"https://api.adscrawl.io/v1/browser/{session_id}/cdp",
    headers={"Authorization": f"Bearer {ADSCRAWL_KEY}"},
    json={
        "method": "Page.navigate",
        "params": {"url": "https://example.com/products?page=1"}
    }
)

# 每次导航后提取,累积结果,然后输入ChatGPT

当您需要在提取前登录平台、接受cookie或点击“加载更多”按钮时,这种方法非常理想。ChatGPT然后可以处理聚合数据——例如,比较三个竞争对手的定价层级或总结多个页面的客户评论。

何时使用AdsCrawl + ChatGPT与其他方法

ChatGPT product interface

ChatGPT product interface.

ChatGPT产品界面。

并非每个数据任务都需要完整的浏览器和LLM。这是一个快速决策指南:

场景 推荐技术栈
简单API或静态HTML页面 直接requests + BeautifulSoup
JavaScript密集型网站,需要截图 仅AdsCrawl
需要解释、总结或分类提取的文本 AdsCrawl + ChatGPT
大规模监控,需要结构化输出 AdsCrawl + ChatGPT + 数据库
实时聊天,需要实时网页上下文 AdsCrawl作为ChatGPT工具/插件

对于已经使用Playwright或Selenium等浏览器自动化框架的团队,AdsCrawl消除了基础设施开销。我们的AdsCrawl与Selenium比较详细介绍了权衡。如果您专门评估云浏览器API,AdsCrawl与Browserless对决分解了CDP控制、定价和反检测功能。

构建浏览网页的AI代理

一个日益增长的用例是让ChatGPT本身能够调用AdsCrawl作为工具。使用OpenAI的函数调用或助手API,您可以定义一个fetch_webpage函数,ChatGPT在需要实时数据时调用它。

tools = [
    {
        "type": "function",
        "function": {
            "name": "fetch_webpage",
            "description": "Get the rendered Markdown content of a live webpage",
            "parameters": {
                "type": "object",
                "properties": {
                    "url": {"type": "string", "description": "The full URL to fetch"}
                },
                "required": ["url"]
            }
        }
    }
]

当用户问“Hacker News上现在有哪些热门故事?”时,ChatGPT可以调用fetch_webpage("https://news.ycombinator.com"),接收Markdown,并总结标题。这种模式将ChatGPT转变为一个可以回答实时网页问题而不会幻觉过时信息的代理。

处理常见陷阱

上下文窗口限制: 网页可能非常庞大。在发送到ChatGPT之前,始终将提取的Markdown修剪到您实际需要的部分。专注于首屏内容、特定的CSS选择器或语义地标。

速率限制和成本: AdsCrawl和OpenAI都按使用收费。尽可能缓存结果,并在调用LLM之前批量进行多次提取。对于定期监控,存储原始Markdown,仅将差异发送到ChatGPT。

反机器人检测: AdsCrawl的指纹配置文件和真实Chrome实例处理大多数挑战,但某些网站仍然阻止自动化访问。使用平台内置的代理轮换和会话持久性来模拟人类行为。有关AdsCrawl在反检测方面如何比较的深入分析,请参阅AdsCrawl与Scrapfly与Browserless分析

数据隐私: 抓取第三方网站时,尊重robots.txt和服务条款。AdsCrawl在临时会话中处理数据;除了您的请求生命周期之外,他们的服务器不存储任何页面内容。

来源和进一步阅读

常见问题解答

我可以将AdsCrawl与免费版ChatGPT一起使用吗?

免费的ChatGPT网页界面无法进行API调用。要构建自动化工作流程,您需要访问OpenAI API(按需付费)和AdsCrawl账户。但是,您可以手动将AdsCrawl输出复制到ChatGPT聊天界面中进行一次性分析。

哪种AdsCrawl输出格式最适合ChatGPT?

Markdown是最具令牌效率的格式。它保留标题、列表和链接,同时去除不必要的HTML标签和脚本。ChatGPT原生解析Markdown,因此模型无需额外提示即可理解文档结构。

如何避免达到ChatGPT的令牌限制?

使用AdsCrawl基于选择器的提取仅提取页面的相关部分。例如,定位mainarticle或特定的div ID。如果您需要处理长文档,请将其分成块,并使用ChatGPT的多轮对话依次分析每个部分。

这种组合适合实时应用吗?

借助AdsCrawl的并发会话和快速页面渲染,典型的往返(页面加载+提取+ChatGPT推理)需要3-8秒。对于实时聊天代理,您可以流式传输AdsCrawl结果并显示加载状态,同时ChatGPT处理内容。

ChatGPT可以自主触发AdsCrawl操作吗?

可以,使用OpenAI的函数调用或助手API。您将fetch_webpage定义为可用工具,ChatGPT根据用户的查询决定何时调用它。这是构建自主浏览网页的研究代理的基础。

结论

AdsCrawl和ChatGPT形成了一对自然的组合:一个大规模提供实时渲染的网页数据,另一个将这些数据转化为见解、内容和行动。无论您是在监控竞争对手、丰富潜在客户,还是构建一个真正能够浏览网页的AI代理,集成都是直接且强大的。从AdsCrawl的单个API调用开始,将Markdown输入ChatGPT,您很快就会看到当您的自动化能够看到实时互联网时,它会变得更加有用。

对于比较浏览器基础设施选项的团队,我们的Scrapfly API设置指南介绍了一种替代方法,ScrapingBee评论涵盖了另一种基于API的提取工具。但当您需要真实的Chrome会话、CDP控制以及直接进入前沿语言模型的管道时,AdsCrawl是为此而生的。