搜索开源项目
找到 5 个与"web-scraping"相关的项目
相关分类: 开发者工具 (3)
Crawlee
Apache-2.0用于网页抓取和浏览器自动化的 Node.js/TypeScript 库,旨在构建能够抵御反爬检测的可靠爬虫。
- 开发者工具
Scrapy
BSD-3-Clause快速的高层次 Python 网页抓取与爬虫框架,用于从网站中提取结构化数据。
- 开发者工具
Playwright
Apache-2.0面向现代 Web 应用的可靠端到端测试与浏览器自动化框架。
- 开发者工具
- 测试
Docling
MIT文档解析库,将 PDF、Word 文档等格式转换为适用于 LLM 和 RAG 流水线的干净结构化数据。
- AI 与机器学习
Instructor
MIT库,通过函数调用 API 和 Pydantic 模型校验,从大语言模型获取可靠的结构化数据输出。
- AI 与机器学习