Eval & observability AI tools

Eval, tracing, and monitoring tools for production LLM apps.

How to choose eval & observability AI tools

  • Run one real task you already understand — not a vendor demo
  • Check privacy, retention, and commercial license for your use case
  • Compare two alternatives with the same success check before you commit

Related guides

Showing 148 of 64 tools · page 1 of 2

ToolPricingSummaryActions
Adk PythonFreeAn open-source, code-first Python toolkit for building, evaluating, and deploying sophisticated AI agents with flexibility and control.DetailsVisit
Arize PhoenixFreemiumArize Phoenix is a evaluation and observability tool for everyday AI workflows. It typically offers a freemium model (free tier plus paid u…DetailsVisit
Awesome Semantic SegmentationFreeUse Awesome Semantic Segmentation when you need evaluation and observability help with drafts, iteration, and faster first passes. Pricing…DetailsVisit
BraintrustFreemiumBraintrust is a evaluation and observability tool for everyday AI workflows. It typically offers a freemium model (free tier plus paid upgr…DetailsVisit
HeliconeFreemiumUse Helicone when you need evaluation and observability help with drafts, iteration, and faster first passes. Pricing is a freemium model (…DetailsVisit
KedroFreeKedro is a toolbox for production-ready data science. It uses software engineering best practices to help you create data engineering and d…DetailsVisit
LangfuseFreemiumLangfuse helps with evaluation and observability work across drafting and review loops. Expect a freemium model (free tier plus paid upgrad…DetailsVisit
LangSmithFreemiumLangSmith helps with evaluation and observability work across drafting and review loops. Expect a freemium model (free tier plus paid upgra…DetailsVisit
Mlops ZoomcampFreeMlops Zoomcamp helps with evaluation and observability work across drafting and review loops. Expect a free plan; compare quality on your o…DetailsVisit
promptfooFreemiumpromptfoo sits in the Eval & observability category. Teams pick it for evaluation and observability tasks, then apply a human verification…DetailsVisit
Weights & BiasesFreemiumWeights & Biases is a evaluation and observability tool for everyday AI workflows. It typically offers a freemium model (free tier plus pai…DetailsVisit
AgentaFreemiumAgenta is a evaluation and observability tool for everyday AI workflows. It typically offers a freemium model (free tier plus paid upgrades…DetailsVisit
Arize AIEnterpriseArize AI helps with evaluation and observability work across drafting and review loops. Expect enterprise pricing; compare quality on your…DetailsVisit
ArthurEnterpriseArthur sits in the Eval & observability category. Teams pick it for evaluation and observability tasks, then apply a human verification bar…DetailsVisit
Awesome Face RecognitionFreepapers about Face Detection; Face Alignment; Face Recognition && Face Identification && Face Verification && Face Representation; Face Reco…DetailsVisit
BtraceFreeBtrace helps with evaluation and observability work across drafting and review loops. Expect a free plan; compare quality on your own conte…DetailsVisit
ClearMLFreemiumClearML sits in the Eval & observability category. Teams pick it for evaluation and observability tasks, then apply a human verification ba…DetailsVisit
CometFreemiumComet helps with evaluation and observability work across drafting and review loops. Expect a freemium model (free tier plus paid upgrades)…DetailsVisit
Confident AIFreemiumConfident AI helps with evaluation and observability work across drafting and review loops. Expect a freemium model (free tier plus paid up…DetailsVisit
Datadog LLM ObsPaidDatadog LLM Obs sits in the Eval & observability category. Teams pick it for evaluation and observability tasks, then apply a human verific…DetailsVisit
Datadog LLM ObservabilityPaidDatadog LLM Observability helps with evaluation and observability work across drafting and review loops. Expect paid plans; compare quality…DetailsVisit
DeepchecksFreemiumDeepchecks is a evaluation and observability tool for everyday AI workflows. It typically offers a freemium model (free tier plus paid upgr…DetailsVisit
Deep Person ReidFreeUse Deep Person Reid when you need evaluation and observability help with drafts, iteration, and faster first passes. Pricing is a free pla…DetailsVisit
Domino Data LabFreemiumUse Domino Data Lab when you need evaluation and observability help with drafts, iteration, and faster first passes. Pricing is a freemium…DetailsVisit
Evidently AIFreemiumEvidently AI helps with evaluation and observability work across drafting and review loops. Expect a freemium model (free tier plus paid up…DetailsVisit
ExprFreeExpr is a evaluation and observability tool for everyday AI workflows. It typically offers a free plan; verify limits, data handling, and c…DetailsVisit
Fast AgentFreeFast Agent is a evaluation and observability tool for everyday AI workflows. It typically offers a free plan; verify limits, data handling,…DetailsVisit
Fast ReidFreeFast Reid helps with evaluation and observability work across drafting and review loops. Expect a free plan; compare quality on your own co…DetailsVisit
Fiddler AIEnterpriseFiddler AI sits in the Eval & observability category. Teams pick it for evaluation and observability tasks, then apply a human verification…DetailsVisit
GalileoFreemiumGalileo is a evaluation and observability tool for everyday AI workflows. It typically offers a freemium model (free tier plus paid upgrade…DetailsVisit
GiskardFreemiumGiskard is a evaluation and observability tool for everyday AI workflows. It typically offers a freemium model (free tier plus paid upgrade…DetailsVisit
Hierarchical LocalizationFreeHierarchical Localization sits in the Eval & observability category. Teams pick it for evaluation and observability tasks, then apply a hum…DetailsVisit
HoneyHiveFreemiumHoneyHive helps with evaluation and observability work across drafting and review loops. Expect a freemium model (free tier plus paid upgra…DetailsVisit
HumanloopFreemiumHumanloop helps with evaluation and observability work across drafting and review loops. Expect a freemium model (free tier plus paid upgra…DetailsVisit
InjectionIIIFreeInjectionIII sits in the Eval & observability category. Teams pick it for evaluation and observability tasks, then apply a human verificati…DetailsVisit
KubevalFreeValidate your Kubernetes configuration files, supports multiple Kubernetes versionsDetailsVisit
Langfuse RepoFreeLangfuse Repo is a evaluation and observability tool for everyday AI workflows. It typically offers a free plan; verify limits, data handli…DetailsVisit
LangWatchFreemiumLangWatch helps with evaluation and observability work across drafting and review loops. Expect a freemium model (free tier plus paid upgra…DetailsVisit
Lightning Hydra TemplateFreePyTorch Lightning + Hydra. A very user-friendly template for ML experimentation. ⚡🔥⚡DetailsVisit
LuceneFreeLucene is a evaluation and observability tool for everyday AI workflows. It typically offers a free plan; verify limits, data handling, and…DetailsVisit
Lucene SolrFreeLucene Solr is a evaluation and observability tool for everyday AI workflows. It typically offers a free plan; verify limits, data handling…DetailsVisit
MangayomiFreeFree and open source application for reading manga, novels, and watching animes available on Android, iOS, macOS, Linux and WindowsDetailsVisit
MLflowFreeMLflow sits in the Eval & observability category. Teams pick it for evaluation and observability tasks, then apply a human verification bar…DetailsVisit
NeptuneFreemiumUse Neptune when you need evaluation and observability help with drafts, iteration, and faster first passes. Pricing is a freemium model (f…DetailsVisit
New Relic AI MonitoringPaidNew Relic AI Monitoring is a evaluation and observability tool for everyday AI workflows. It typically offers paid plans; verify limits, da…DetailsVisit
OpenInferenceFreeOpenInference sits in the Eval & observability category. Teams pick it for evaluation and observability tasks, then apply a human verificat…DetailsVisit
OpenLLMetryFreeOpenLLMetry sits in the Eval & observability category. Teams pick it for evaluation and observability tasks, then apply a human verificatio…DetailsVisit
Opentelemetry DotnetFreeOpentelemetry Dotnet helps with evaluation and observability work across drafting and review loops. Expect a free plan; compare quality on…DetailsVisit