由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

evaluation

话题找到数量

Tencent/WeKnora

基于大语言模型的深度文档理解框架,支持使用 RAG 范式实现语义检索和上下文感知应答。

27k
3.7k
1.4k
+478
排名 #7
9月19日
查看详情

mlflow/mlflow

构建AI/大语言模型应用的开源开发者平台,提供端到端追踪、可观测性与评估功能的一体化集成平台

26k
5.8k
1.4k
+24
排名 #14
6月11日
查看详情

promptfoo/promptfoo

测试您的提示词、智能体和检索增强生成系统。针对大语言模型的红队测试、渗透测试与漏洞扫描。对比GPT、Claude、Gemini、Llama等模型的性能表现。支持命令行与CI/CD集成的简易声明式配置。

24k
2.2k
1.1k
+48
排名 #16
8月6日
查看详情

comet-ml/opik

通过全面的追踪、自动化评估和生产就绪的仪表盘,调试、评估并监控您的LLM应用、RAG系统和智能体工作流。

21k
1.7k
1.3k
+29
排名 #10
8月3日
查看详情

confident-ai/deepeval

大语言模型评估框架

15k
1.4k
1.3k
+22
排名 #10
5月16日
查看详情

EleutherAI/lm-evaluation-harness

用于语言模型少样本评估的框架。

12k
3.3k
1.4k
+22
排名 #6
5月13日
查看详情

Tencent/AI-Infra-Guard

全栈 AI 红队平台通过代理扫描、技能扫描、MCP 扫描、AI 基础设施扫描和 LLM 越狱评估来保护 AI 生态系统。

6.1k
565
573
+1.8k
排名 #15
8月31日
查看详情

Helicone/helicone

🧊 开源大语言模型可观测性平台。一行代码实现监控、评估与实验。YC W23 🍓

5.5k
543
911
+7
排名 #7
4月21日
查看详情

TEAMMATES/teammates

TEAMMATES 是一款用于教育的反馈管理工具

1.8k
3.6k
1.3k
排名 #16
6月7日
查看详情

future-agi/future-agi

用于评估、观察和改进 LLM 和 AI 代理应用程序的开源端到端平台。追踪·评估·模拟·数据集·网关·护栏。可自行托管。阿帕奇2.0。

1.8k
544
359
+108
排名 #14
8月25日
查看详情

trpc-group/trpc-agent-go

trpc-agent-go 是一个基于 Go 语言的强大框架,用于利用大语言模型和工具构建智能代理系统。

1.6k
285
842
+5
排名 #18
8月1日
查看详情

cyberark/FuzzyAI

一款用于自动化大语言模型模糊测试的强大工具。

1.4k
197
835
+1
排名 #11
5月17日
查看详情

NVIDIA-NeMo/Gym

为大型语言模型训练构建强化学习环境

941
169
1.1k
+1
排名 #14
6月3日
查看详情

ScalingIntelligence/KernelBench

KernelBench:大语言模型能否编写GPU内核?——支持Torch转CUDA的基准测试与工具集

882
147
907
+4
排名 #13
3月23日
查看详情

JuliaReach/LazySets.jl

Julia中可扩展的符号-数值集合计算

258
39
784
排名 #12
6月25日
查看详情

zeno-ml/zeno

AI数据管理与评估平台

214
11
687
排名 #14
6月29日
查看详情

hatnote/montage

📷 专为维基爱竞赛设计且由该竞赛使用的照片评估工具

47
49
894
排名 #10
3月30日
查看详情

NVIDIA/garak

大语言模型漏洞扫描器

0
0
1.1k
排名 #14
9月12日
查看详情

langfuse/langfuse

🪢 开源LLM工程平台:LLM可观测性、指标评估、提示管理、游乐场、数据集。与OpenTelemetry、Langchain、OpenAI SDK、LiteLLM等工具集成。🍊YC W23

0
0
1.3k
排名 #17
8月22日
查看详情
助手