LLM/RAG評価フレームワーク。RAGAS(Retrieval-Augmented Generation Assessment・Faithfulness/Answer Relevance/Context Precision)・LLM-as-Judge(Claude/GPT-5 judge・Bias対策注意)・Ragas metrics・DeepEval(Python・14+ metric)・Promptfoo(CLI・YAML test)・Giskard・TruLens・PhoenixArize・LangSmith Evaluator・Braintrust Eval・Confident AI・2026年RAG品質測定標準。