由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

evaluation

话题找到数量

langfuse/langfuse

🪢 开源LLM工程平台:LLM可观测性、指标评估、提示管理、游乐场、数据集。与OpenTelemetry、Langchain、OpenAI SDK、LiteLLM等工具集成。🍊YC W23

30k
3.2k
608
+94
排名 #7
7月9日
查看详情

mlflow/mlflow

构建AI/大语言模型应用的开源开发者平台,提供端到端追踪、可观测性与评估功能的一体化集成平台

26k
5.8k
719
+24
排名 #14
6月11日
查看详情

promptfoo/promptfoo

测试您的提示词、智能体和检索增强生成系统。针对大语言模型的红队测试、渗透测试与漏洞扫描。对比GPT、Claude、Gemini、Llama等模型的性能表现。支持命令行与CI/CD集成的简易声明式配置。

22k
2k
694
+41
排名 #17
6月17日
查看详情

comet-ml/opik

通过全面的追踪、自动化评估和生产就绪的仪表盘,调试、评估并监控您的LLM应用、RAG系统和智能体工作流。

21k
1.7k
659
+29
排名 #10
8月3日
查看详情

Tencent/WeKnora

基于大语言模型的深度文档理解框架,支持使用 RAG 范式实现语义检索和上下文感知应答。

19k
2.7k
581
+46
排名 #11
7月31日
查看详情

confident-ai/deepeval

大语言模型评估框架

15k
1.4k
697
+22
排名 #10
5月16日
查看详情

EleutherAI/lm-evaluation-harness

用于语言模型少样本评估的框架。

12k
3.3k
658
+22
排名 #6
5月13日
查看详情

NVIDIA/garak

大语言模型漏洞扫描器

7.7k
898
596
+12
排名 #5
4月25日
查看详情

Helicone/helicone

🧊 开源大语言模型可观测性平台。一行代码实现监控、评估与实验。YC W23 🍓

5.5k
543
423
+7
排名 #7
4月21日
查看详情

TEAMMATES/teammates

TEAMMATES 是一款用于教育的反馈管理工具

1.8k
3.6k
647
排名 #16
6月7日
查看详情

trpc-group/trpc-agent-go

trpc-agent-go 是一个基于 Go 语言的强大框架,用于利用大语言模型和工具构建智能代理系统。

1.6k
285
304
+5
排名 #18
8月1日
查看详情

cyberark/FuzzyAI

一款用于自动化大语言模型模糊测试的强大工具。

1.4k
197
375
+1
排名 #11
5月17日
查看详情

NVIDIA-NeMo/Gym

为大型语言模型训练构建强化学习环境

941
169
547
+1
排名 #14
6月3日
查看详情

ScalingIntelligence/KernelBench

KernelBench:大语言模型能否编写GPU内核?——支持Torch转CUDA的基准测试与工具集

882
147
442
+4
排名 #13
3月23日
查看详情

JuliaReach/LazySets.jl

Julia中可扩展的符号-数值集合计算

258
39
241
排名 #12
6月25日
查看详情

zeno-ml/zeno

AI数据管理与评估平台

214
11
212
排名 #14
6月29日
查看详情

hatnote/montage

📷 专为维基爱竞赛设计且由该竞赛使用的照片评估工具

47
49
432
排名 #10
3月30日
查看详情
助手