由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

llm-evaluation-framework

话题找到数量

promptfoo/promptfoo

测试您的提示词、智能体和检索增强生成系统。针对大语言模型的红队测试、渗透测试与漏洞扫描。对比GPT、Claude、Gemini、Llama等模型的性能表现。支持命令行与CI/CD集成的简易声明式配置。

22k
2k
695
+41
排名 #17
6月17日
查看详情

confident-ai/deepeval

大语言模型评估框架

15k
1.4k
698
+22
排名 #10
5月16日
查看详情
助手