Sun, B., Wang, Z., de la Torre, O., & Wang, Z. (2026). When Metrics Disagree: Automatic Similarity vs. LLM-as-a-Judge for Clinical Dialogue Evaluation.
Chicago Style (17th ed.) CitationSun, Bian, Zhenjian Wang, Orvill de la Torre, and Zirui Wang. When Metrics Disagree: Automatic Similarity Vs. LLM-as-a-Judge for Clinical Dialogue Evaluation. 2026.
MLA (9th ed.) CitationSun, Bian, et al. When Metrics Disagree: Automatic Similarity Vs. LLM-as-a-Judge for Clinical Dialogue Evaluation. 2026.
Warning: These citations may not always be 100% accurate.