[eval harness design (Inspect, Promptfoo, Braintrust, LangSmith)][LLM-as-judge and grader calibration against human assessments][dataset curation and golden-set design][statistical metric design and eval analytics][production Python][CI integration of eval quality gates]