由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

data-extraction

话题找到数量

firecrawl/firecrawl

面向AI的网页数据API——将整个网站转换为LLM就绪的Markdown或结构化数据🔥

157k
9k
744
+523
排名 #7
7月28日
查看详情

D4Vinci/Scrapling

🕷️ 一个自适应网络爬虫框架,能够处理从单个请求到大规模爬取的所有任务!

67k
6.7k
694
+280
排名 #11
6月30日
查看详情

ScrapeGraphAI/Scrapegraph-ai

基于人工智能的Python爬虫工具

28k
2.8k
107
+26
排名 #10
7月30日
查看详情

getmaxun/maxun

🔥 开源无代码网页抓取、爬虫、搜索与AI数据提取平台 • 数分钟内将网站转为结构化API 🔥

16k
1.4k
526
+88
排名 #12
7月1日
查看详情

yfedoseev/pdf_oxide

Python与Rust最快的PDF库。支持文本提取、图像提取、Markdown转换、PDF创建与编辑。平均耗时0.8毫秒,比行业领先产品快5倍,在3830份PDF测试中通过率100%。采用MIT/Apache-0双协议。

373
38
462
+33
排名 #6
3月6日
查看详情

mrshu/github-statuses

“缺失的GitHub状态页面”——一种基于Flat Data方法对GitHub状态进行历史记录尝试

302
17
326
+27
排名 #3
5月1日
查看详情
助手