Study reveals rubric design boosts LLM evaluation accuracy in domain-specific...
Research on 99,952 examples shows correct domain rubrics improve LLM evaluator accuracy by 2.11 points, suggesting specialization matters more in evaluation rules than model weights.