由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

llm-evaluation-framework

话题找到数量

promptfoo/promptfoo

测试您的提示词、智能体和检索增强生成系统。针对大语言模型的红队测试、渗透测试与漏洞扫描。对比GPT、Claude、Gemini、Llama等模型的性能表现。支持命令行与CI/CD集成的简易声明式配置。

24k
2.2k
1.1k
+48
排名 #16
8月6日
查看详情

confident-ai/deepeval

大语言模型评估框架

15k
1.4k
1.3k
+22
排名 #10
5月16日
查看详情
助手