# AI Evals Testing

Ranked by the Vioscale composite score: a confidence-weighted blend of independent signals, not user reviews.

| # | Software | Score | Confidence | Vendor |
|--:|---|--:|---|---|
| 1 | [Patronus AI](https://www.vioscale.ai/software/patronus-ai) | 69 | 37% (low) | - |
| 2 | [Helm](https://www.vioscale.ai/software/helm) | 65.3 | 29% (low) | - |
| 3 | [Ragas](https://www.vioscale.ai/software/ragas) | 58.4 | 27% (low) | - |
| 4 | [Promptfoo](https://www.vioscale.ai/software/promptfoo) | 54.4 | 55% (medium) | - |
| 5 | [LM Evaluation Harness](https://www.vioscale.ai/software/lm-evaluation-harness) | 53.7 | 40% (low) | - |
| 6 | [TruLens](https://www.vioscale.ai/software/trulens) | 49.1 | 32% (low) | - |
| 7 | [OpenAI Evals](https://www.vioscale.ai/software/openai-evals) | 44.8 | 30% (low) | - |
| 8 | [Galileo](https://www.vioscale.ai/software/galileo) | 44.7 | 8% (low) | - |

---
*Source: Vioscale (https://www.vioscale.ai/categories/ai-evals-testing).*
