一个什么都能爬
标准化 · 模块化 · 全自动爬虫引擎

给 AI 一句话任务 → 自动生成配置 → 自动运行 → 失败自修复。覆盖 HTTP / 浏览器渲染 / 桥取数四类取数、反爬四级方案、断点续跑、增量去重、代理池、MCP 原生接入。不是"爬虫脚本",而是一个爬虫操作系统

✅ 一代 100/100 挑战 ✅ 二代 100/100 挑战 ✅ LearnSpider 27/27 🤖 MCP Ready 🖥️ 零代码 WebUI 🔧 四级反爬
200/200自建攻防挑战全通过
27/27LearSpider 实战靶场
4 类取数方式
4 级反爬对抗方案
5 个MCP 工具
0 代码一句话全自动

能力矩阵

一个任务 = 一个任务包(JSON 配置 + 可选插件模块)。改配置不改代码,任何爬虫场景都能套用。

🌐 四类取数对标 Scrapy/Crawlee

http 普通请求 · browser 浏览器渲染(JS 页面/登录态)· bridge Node 桥过 WAF · json_paged API 分页。

🤖 AI 全自动对标 ScrapeGraphAI

一句话任务 → 大模型生成 v3 任务包 → 自动运行 → 失败后读取真实页面 Markdown 自修复配置,循环至成功。

🛡️ 反爬四级对标 botasaurus

①限流重试 ②UA/指纹伪装 ③验证码(ddddocr 自动 / 2captcha / 人工确认)④浏览器 Stealth 免检测。

🧩 MCP 原生接入对标 silkworm-mcp

Claude / Cursor / Codex 通过 stdio 直接调用 scrape / auto / crawl / extract / check 五个工具。

🗜️ Token 优化对标 cortex-scout

HTML → 干净 Markdown / 正文 / 表格 / 链接清单,AI 上下文省 90% token,选择器更准。

📦 工程化对标 Scrapy 生态

断点续跑 · 增量去重 · 代理池轮换 · 并发调度 · sitemap/robots 种子 · 中间件钩子 · JSON/CSV/XLSX 导出。

架构流程

🗣️ 一句话任务中文/英文自然语言
🤖 AI 配置生成器先探测入口页结构
⚙️ v3 任务包config.json + 插件
🚀 引擎调度并发/断点/去重/代理
📥 四类取数HTTP/浏览器/桥/API
📊 清洗导出JSON/CSV/XLSX

实战战绩

每一代都先设计 100 个"高难度 + 贴实际 + 低 token"的攻防挑战(验证码、WAF、JS 渲染、签名接口、登录态、增量、递归……),再逐题攻克,全部通过后才算一代。

⚔️ 第一代挑战营

100 / 100

基础反爬矩阵:robots、限流、登录、签名、JS 渲染、分页、递归、代理、验证码等价模拟、断点续跑。

⚔️ 第二代挑战营

100 / 100

现实场景升级:腾爱优 B 站、政府平台、电商、社交平台等 100 个真实难度场景,全部通过。

🎯 LearnSpider 靶场

27 / 27

GitHub 开源反爬靶场 LearnSpider 的 27 道可离线复现题目全部通过(其余题依赖外部站点不可复现)。

快速开始

零代码基础也能用:三种入口任选。

🖥️ WebUI(推荐新手)

一条命令启动可视化界面,浏览器打开 http://127.0.0.1:8642,输入一句话任务即可。

python3 -m universal_scraper.cli webui

🤖 AI 一句话任务

命令行直接说人话,AI 自动生成配置并运行。

python3 -m universal_scraper.cli auto \
  "抓取 https://quotes.toscrape.com/ 的\
   名言、作者和标签,翻 2 页"

⚡ 一键抓取

Firecrawl CLI 风格:URL 直接出干净 Markdown / 正文 / 表格。

python3 -m universal_scraper.cli fetch \
  https://example.com --article

python3 -m universal_scraper.cli crawl \
  https://docs.example.com/ --depth 2

MCP 接入

把爬虫引擎变成 AI 客户端的原生工具(对标 silkworm-mcp / scrape-mcp / cortex-scout 的 LLM 驱动爬虫方案)。启动后提供 5 个工具:

工具说明
scrape一键抓取 URL → Markdown / 正文 / 表格 / 链接(Firecrawl fetch 风格)
auto一句话任务 → AI 自动生成配置并运行 → 失败自修复(最强入口)
crawl从 URL 递归爬站(Firecrawl crawl 风格)
extractHTML → 干净 Markdown / 正文 / 表格,省 token
check引擎体检:版本 / 战绩 / LLM 可用性 / 能力清单

Claude Desktop / Cursor 配置示例:

{
  // claude_desktop_config.json 或 Cursor MCP 配置
  "mcpServers": {
    "universal-scraper": {
      "command": "/Users/you/.cache/codex-runtimes/codex-primary-runtime/dependencies/python/bin/python3",
      "args": ["-m", "universal_scraper.mcp_server"],
      "cwd": "/path/to/universal-scraper"
    }
  }
}

诚实边界

我们不吹"绝对什么都能爬"。引擎覆盖标准爬虫矩阵(公开网页 / API / JS 渲染 / WAF / 验证码四级 / 增量 / 并发 / 代理 / 下载)。仍存在物理边界:

🔒 客户端强加密 App 协议

需要真机抓包 + 逆向,属高级定制主题,非开箱即用。

🧑‍💻 真人物理操作验证

如银行级人脸 / 滑块轨迹真人验证,用机制等价模拟 + 人工介入兜底。

⚠️ 法律与合规

请仅抓取你有权访问的数据,遵守目标站 robots 与服务条款。本工具不用于攻击性用途。