由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

extraction

话题找到数量

firecrawl/firecrawl

面向AI的网页数据API——将整个网站转换为LLM就绪的Markdown或结构化数据🔥

157k
9k
745
+523
排名 #7
7月28日
查看详情

D4Vinci/Scrapling

🕷️ 一个自适应网络爬虫框架,能够处理从单个请求到大规模爬取的所有任务!

67k
6.7k
701
+280
排名 #11
6月30日
查看详情

ScrapeGraphAI/Scrapegraph-ai

基于人工智能的Python爬虫工具

28k
2.8k
108
+26
排名 #10
7月30日
查看详情

opendataloader-project/opendataloader-pdf

面向AI就绪数据的PDF解析器。

28k
2.7k
571
+39
排名 #6
8月3日
查看详情

getmaxun/maxun

🔥 开源无代码网页抓取、爬虫、搜索与AI数据提取平台 • 数分钟内将网站转为结构化API 🔥

16k
1.4k
529
+88
排名 #12
7月1日
查看详情

run-llama/liteparse

一款快速、实用且开源的文件解析工具

11k
788
370
+34
排名 #10
7月18日
查看详情

firecrawl/pdf-inspector

用于PDF检查、分类和文本提取的快速Rust库。智能检测扫描版与文本版PDF,以实现智能路由决策。

10k
656
330
+2.5k
排名 #1
8月4日
查看详情

Zipstack/unstract

基于大语言模型的非结构化数据提取——专为API部署与ETL管道工作流构建。

7.1k
686
614
+51
排名 #16
8月1日
查看详情

aonez/Keka

macOS与iOS文件归档工具

7.1k
291
589
+4
排名 #19
7月18日
查看详情

firecrawl/firecrawl-mcp-server

🔥 官方 Firecrawl MCP 服务器 - 为 Cursor、Claude 及其他 LLM 客户端添加强大的网络爬取功能

6.2k
699
532
+17
排名 #13
4月30日
查看详情

JohnSnowLabs/spark-nlp

顶尖自然语言处理技术

4.1k
743
485
排名 #10
7月17日
查看详情

apache/tika

Apache Tika 工具包可检测并提取超过千种文件类型(如 PPT、XLS 和 PDF)的元数据和文本

3.9k
952
600
+2
排名 #21
7月31日
查看详情

HoshinoSuzumi/chronoframe

自托管个人相册应用,支持在线照片管理与相册创建,具备实况照片解析、EXIF数据读取、地理位置识别及探索地图功能。

1.8k
131
635
+2
排名 #12
6月9日
查看详情

yifanfeng97/Hyper-Extract

利用大语言模型将非结构化文本转化为结构化知识。支持图、超图及时空数据提取——仅需一条命令。

1.8k
202
222
+124
排名 #2
6月18日
查看详情

yfedoseev/pdf_oxide

Python与Rust最快的PDF库。支持文本提取、图像提取、Markdown转换、PDF创建与编辑。平均耗时0.8毫秒,比行业领先产品快5倍,在3830份PDF测试中通过率100%。采用MIT/Apache-0双协议。

373
38
465
+33
排名 #6
3月6日
查看详情

mrshu/github-statuses

“缺失的GitHub状态页面”——一种基于Flat Data方法对GitHub状态进行历史记录尝试

302
17
326
+27
排名 #3
5月1日
查看详情
助手