XCrawl

2个月前发布 1 0 0

AI就绪的网页抓取API,支持提取结构化JSON、Markdown和SERP数据

语言:
zh
收录时间:
2026-08-04

前置条件

  • 注册 XCrawl 账号,获取 API Key
  • 确定目标网页 URL,确保该页面可公开访问
  • 确认需要提取的数据类型:结构化 JSON、Markdown 或 SERP 数据

操作步骤

1. 获取 API Key

  • 登录 XCrawl 控制台,进入「API 管理」页面
  • 点击「创建新密钥」,复制生成的 API Key 并保存到本地
  • 注意:密钥仅显示一次,丢失需重新生成

2. 发送抓取请求

  • 使用 HTTP POST 请求,目标地址:https://api.xcrawl.com/v1/crawl
  • 请求头设置:Authorization: Bearer <你的API Key>
  • 请求体示例(JSON 格式):
{
  "url": "https://example.com/product-page",
  "output_format": "json",
  "fields": ["title", "price", "description"]
}
  • 参数说明:
  • url:必填,目标网页完整 URL
  • output_format:可选,json / markdown / serp,默认 json
  • fields:可选,指定要提取的字段名称(仅 JSON 模式有效)

3. 接收并处理返回数据

  • 成功响应状态码:200,返回结构如下:
{
  "status": "success",
  "data": {
    "title": "产品名称",
    "price": "¥99.00",
    "description": "产品描述文本"
  },
  "metadata": {
    "url": "https://example.com/product-page",
    "crawled_at": "2025-04-01T10:30:00Z"
  }
}
  • 若输出格式为 markdown,data 字段返回纯文本 Markdown 内容
  • 若输出格式为 serp,data 字段返回搜索引擎结果页的结构化数据

4. 批量抓取与错误处理

  • 支持一次请求多个 URL:将 url 改为数组,如 ["url1", "url2"]
  • 每个 URL 独立返回结果,失败项在 errors 数组中列出
  • 常见错误码及处理:
  • 401:API Key 无效或过期,重新生成
  • 403:目标 URL 被屏蔽,检查 robots.txt 或更换代理
  • 429:请求频率超限,等待 60 秒后重试

预期结果

  • 成功获取指定网页的结构化数据,无需手动解析 HTML
  • 数据格式统一,可直接导入数据库、表格或文档
  • 支持动态页面(JavaScript 渲染)和静态页面,无需额外配置

常见问题与排查

问题原因解决方案
返回数据为空字段名与页面实际元素不匹配使用浏览器开发者工具检查页面 DOM,确认字段名正确
返回 HTML 片段页面结构复杂,自动提取失败切换为 markdown 模式,或手动指定更精确的 CSS 选择器
请求超时目标页面加载慢或资源阻塞添加 timeout 参数(单位秒,默认 30),或使用异步模式
数据不一致页面内容动态变化使用 cache 参数控制缓存策略,或指定抓取时间窗口

注意事项

  • 遵守目标网站的 robots.txt 规则,避免法律风险
  • 免费额度有限,超出后按量计费,建议设置每日预算上限
  • 敏感数据(如登录态内容)需先通过 Cookie 或 Session 模拟登录
  • 生产环境建议使用异步请求模式,避免阻塞主流程

数据统计

相关导航