Test your prompts, agents, and RAGs. Red teaming/pentesting/vulnerability scanning for AI. Compare performance of GPT, Claude, Gemini, DeepSeek, and more. Simple declarative configs with command line and CI/CD integration. Used by OpenAI and Anthropic.
Llm EvalDockerLibrary OnlyLocal
Debug, evaluate, and monitor your LLM applications, RAG systems, and agentic workflows with comprehensive tracing, automated evaluations, and production-ready dashboards.
Llm EvalDockerKubernetesLibrary Only
The LLM Evaluation Framework
Llm EvalLibrary OnlyLocalCloud
AI Observability & Evaluation
Llm EvalDockerVercelServerless
A streamlined and customizable framework for efficient large model (LLM, VLM, AIGC) evaluation and performance benchmarking.
Llm EvalDockerLibrary OnlyLocal
🐢 Open-Source Evaluation & Testing library for LLM Agents
Llm EvalLibrary OnlyLocalCloud
the LLM vulnerability scanner
Llm EvalLibrary OnlyLocalCloud
Fast, flexible LLM inference
Llm EvalDockerKubernetesLibrary Only
The platform for LLM evaluations and AI agent testing
Llm EvalDockerVercelServerless
Evaluation and Tracking for LLM Experiments and AI Agents
Llm EvalLibrary OnlyLocalCloud
A framework for few-shot evaluation of language models.
Llm EvalDockerLibrary OnlyLocal
Inspect: A framework for large language model evaluations
Llm EvalDockerLibrary OnlyLocal