Skip to content

Crawler

阅读路径

🟢 新手入门:README → quick-start → examples → concepts → glossary → usage

🔵 开发者:README → api → usage → concepts → examples

一句话总览

📌 FQBase 爬虫基础设施,基于 Selenium 和 requests 提供网页抓取和解析功能。

⚠️ AI 开发必读

使用场景

应该使用

  • 抓取 JavaScript 渲染的动态网页 → 使用 BaseCrawler + fetch_url_with_browser
  • 抓取静态网页 → 使用 BaseCrawler.fetch_url
  • 解析 HTML 内容 → 使用 PageParser 静态方法

不应该使用

  • 违反网站 robots.txt 的爬取
  • 过高频率请求导致封禁
  • 不加延迟的快速请求

注意事项

  1. 资源管理

    • 使用 with 语句或显式调用 close()
    • 大量爬取时使用 BrowserPool 复用浏览器
  2. 反爬策略

    • 内置随机延迟 delay 参数
    • 内置随机 User-Agent
    • 支持代理 use_proxy 参数
  3. 依赖安装

    • 需要 ChromeDriver:brew install chromedriver
    • 需要 selenium:pip install selenium
    • 需要 bs4:pip install beautifulsoup4

依赖

依赖类型模块说明
必须selenium浏览器自动化
必须requestsHTTP 请求
必须bs4HTML 解析
可选chromedriverChrome 驱动

TL;DR

  • 解决什么问题:提供统一的网页抓取和解析工具
  • 核心能力:Selenium 浏览器、requests 请求、PageParser 解析
  • 入门难度:🟢 简单

快速判断:当您需要 抓取网页/解析 HTML/提取数据 时,使用 Crawler。

主要组件

组件说明
BaseCrawler基础爬虫类,封装 Selenium 和 requests
PageParser页面解析工具,正则、CSS选择器、表格提取
BrowserPool浏览器池,复用浏览器实例(单例)
make_headless_browser创建无头浏览器

快速链接

需求文档
快速入门快速入门
查看 APIAPI参考
使用指南使用指南

相关文档