Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels Apple Machine Learning Research