Add to CompareRAGASEvaluationRAGFreeReference-free evaluation framework specifically for RAG pipelines.Best forRAG faithfulness scoringContext precision/recallSynthetic test set generationOpen SourcePython SDK#evaluation#rag#metricsOfficial WebsiteRepositoryRead GuideDetails
Add to CompareDeepEvalEvaluationFreemiumOpen-source LLM evaluation framework with 50+ metrics and CI integration.Best forLLM unit testingRAG evaluation in CIRegression testing promptsOpen SourceAPICloudPython SDK#evaluation#testing#llmOfficial WebsiteRepositoryRead GuideDetails
Add to CompareBraintrustEvaluationObservabilityFreemiumAI evaluation and observability platform for testing prompts, models, and agents in production.Best forPrompt experimentsProduction eval loopsTeam collaboration on AI qualityAPICloudEnterprisePython SDKTypeScript SDK#evaluation#observability#platformOfficial WebsiteRead GuideDetails
Add to CompareLangFuseObservabilityEvaluationFreemiumOpen-source LLM engineering platform for tracing, evals, and analytics.Best forLLM tracingPrompt managementProduction monitoringOpen SourceAPICloudSelf-hostedEnterpriseTypeScript SDKPython SDK#observability#tracing#evalsOfficial WebsiteRepositoryRead GuideDetails
Add to CompareArize AIEvaluationObservabilityFreemiumML and LLM observability platform for monitoring, evaluation, and drift detection.Best forProduction LLM monitoringEmbedding drift detectionEnterprise MLOpsAPICloudEnterprisePython SDK#observability#evaluation#mlopsOfficial WebsiteRead GuideDetails
Add to CompareOpenAI EvalsEvaluationFreeOpen framework for evaluating LLMs and model outputs with customizable benchmarks.Best forCustom LLM benchmarksModel comparisonResearch evaluationsOpen SourcePython SDK#evaluation#openai#benchmarkOfficial WebsiteRepositoryRead GuideDetails
Add to CompareTruLensEvaluationObservabilityFreeEvaluation and tracking for LLM apps — feedback functions and experiment logging.Best forLLM app tracing + evalFeedback function developmentExperiment comparisonOpen SourceCloudPython SDK#evaluation#observability#llmOfficial WebsiteRepositoryRead GuideDetails
Add to ComparePromptfooEvaluationFreeCLI tool for testing and evaluating LLM outputs with red-teaming support.Best forPrompt regression testingModel comparisonRed-teamingOpen SourceAPISelf-hostedTypeScript SDK#evaluation#testing#red-teamOfficial WebsiteRepositoryDetails
Add to CompareConfident AIEvaluationObservabilityFreemiumCloud platform for LLM evaluation, regression testing, and monitoring built on DeepEval.Best forDeepEval in productionTeam eval dashboardsLLM regression monitoringAPICloudEnterprisePython SDK#evaluation#monitoring#platformOfficial WebsiteRead GuideDetails
Add to CompareDSPyFrameworksEvaluationFreeFramework for programming — not prompting — language models.Best forPrompt optimizationComposable LM programsResearch workflowsOpen SourceAPIPython SDK#framework#optimization#promptsOfficial WebsiteRepositoryDetails
Add to ComparePatronus AIEvaluationSecurityPaidAutomated evaluation and scoring platform for LLM outputs and safety.Best forSafety evaluationEnterprise LLM QAAutomated red-teamingAPICloudEnterprisePython SDK#evaluation#safety#enterpriseOfficial WebsiteRead GuideDetails
Add to ComparePhoenixObservabilityEvaluationFreeOpen-source observability for LLMs, embeddings, and retrieval.Best forRAG evaluationEmbedding analysisLLM trace debuggingOpen SourceAPISelf-hostedPython SDK#observability#evals#ragOfficial WebsiteRepositoryDetails