timeoutMs 可设置最长 3,600,000 毫秒(一小时),以处理缓慢或复杂的页面。
任务类型
AdsCrawl 提供三种浏览器任务端点,每种针对不同输出优化:HTML / Markdown
POST /html 渲染目标页面并以三种内容模式之一返回:
html(默认):完整的渲染页面 HTML,或在设置了selector时仅返回匹配元素markdown:通过 Readability 提取的文章内容,转换为 Markdownjson:结构化的 Readability 文章对象,包含title、byline、excerpt、textContent、length等字段
waitUntil: "domcontentloaded" 即可,它比等待图片和样式表加载更快。仅在页面加载后通过 XHR 获取所需内容时,才切换到 "networkidle"。
截图
POST /screenshot 捕获渲染页面的 PNG 图像,并直接以 image/png 格式流式返回。关键选项:
fullPage: true(默认):捕获整个可滚动页面selector:仅捕获匹配 CSS 选择器的第一个元素;如果选择器未匹配则返回422 CONTENT_SELECTOR_NOT_FOUNDviewport:设置宽度和高度以控制截图前的渲染视口
SPA 提取
POST /spa-extract 从动态单页应用中提取结构化字段。你可以自定义字段,在提取前执行页面操作(点击、填写、滚动),并使用 waitFor 等待元素或文本出现。提供两种模式:
inspect:返回页面候选字段和建议的字段方案,不消耗额外积分extract:返回你在fields映射或命名template中定义的数据
similarweb-overview、google-trends-explore、chrome-web-store-app-info)。通过 GET /spa-extract/templates 获取完整列表。
积分机制
每个浏览器任务请求扣除 1 积分。扣费发生在验证通过后(因此错误请求免费)但浏览器启动前(因此导航失败仍会消耗 1 积分)。在执行大批量任务前,请在 dashboard 中检查余额。代理行为
每个浏览器任务都通过代理运行。你可以通过两个可选字段控制使用的代理:countryCode 和 proxy 互斥,只能传入其中一个,不能同时传入两者。
请求限制
浏览器任务是无状态的,每次请求都会创建一个全新的浏览器上下文,不保留之前的访问记录。如果你需要在多个页面之间保持 cookies、local storage 或登录会话,请改用 Remote CDP 或 Cloud Browsers。
API 参考
POST /html
从任意 URL 获取渲染后的 HTML、Markdown 或结构化文章 JSON。
POST /screenshot
捕获整页或元素级别的 PNG 截图。
POST /spa-extract
从动态 SPA 中提取结构化字段,支持模板和操作。