Style Outweighs Substance: Failure Modes of LLM Judges in Alignment Benchmarking
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Feuer, Benjamin, Goldblum, Micah, Datta, Teresa, Nambiar, Sanjana, Besaleli, Raz, Dooley, Samuel, Cembalest, Max, Dickerson, John P. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
When Judgment Becomes Noise: How Design Failures in LLM Judge Benchmarks Silently Undermine Validity
par: Feuer, Benjamin, et autres
Publié: (2025)
par: Feuer, Benjamin, et autres
Publié: (2025)
FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges
par: Hayes, Kevin David, et autres
Publié: (2025)
par: Hayes, Kevin David, et autres
Publié: (2025)
Towards Provably Unbiased LLM Judges via Bias-Bounded Evaluation
par: Feuer, Benjamin, et autres
Publié: (2026)
par: Feuer, Benjamin, et autres
Publié: (2026)
LiveBench: A Challenging, Contamination-Limited LLM Benchmark
par: White, Colin, et autres
Publié: (2024)
par: White, Colin, et autres
Publié: (2024)
TuneTables: Context Optimization for Scalable Prior-Data Fitted Networks
par: Feuer, Benjamin, et autres
Publié: (2024)
par: Feuer, Benjamin, et autres
Publié: (2024)
A Simple Baseline for Predicting Events with Auto-Regressive Tabular Transformers
par: Stein, Alex, et autres
Publié: (2024)
par: Stein, Alex, et autres
Publié: (2024)
Strategies for Increasing Corporate Responsible AI Prioritization
par: Wang, Angelina, et autres
Publié: (2024)
par: Wang, Angelina, et autres
Publié: (2024)
Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive
par: Pal, Arka, et autres
Publié: (2024)
par: Pal, Arka, et autres
Publié: (2024)
When Do Neural Nets Outperform Boosted Trees on Tabular Data?
par: McElfresh, Duncan, et autres
Publié: (2023)
par: McElfresh, Duncan, et autres
Publié: (2023)
Measuring Style Similarity in Diffusion Models
par: Somepalli, Gowthami, et autres
Publié: (2024)
par: Somepalli, Gowthami, et autres
Publié: (2024)
Transformers Boost the Performance of Decision Trees on Tabular Data across Sample Sizes
par: Jayawardhana, Mayuka, et autres
Publié: (2025)
par: Jayawardhana, Mayuka, et autres
Publié: (2025)
Commercial LLM Agents Are Already Vulnerable to Simple Yet Dangerous Attacks
par: Li, Ang, et autres
Publié: (2025)
par: Li, Ang, et autres
Publié: (2025)
Cascade: Token-Sharded Private LLM Inference
par: Thomas, Rahul, et autres
Publié: (2025)
par: Thomas, Rahul, et autres
Publié: (2025)
WILDCHAT-50M: A Deep Dive Into the Role of Synthetic Data in Post-Training
par: Feuer, Benjamin, et autres
Publié: (2025)
par: Feuer, Benjamin, et autres
Publié: (2025)
When Gradients Collide: Failure Modes of Multi-Objective Prompt Optimization for LLM Judges
par: Darshan, Parth, et autres
Publié: (2026)
par: Darshan, Parth, et autres
Publié: (2026)
Attribution Quality in AI-Generated Content:Benchmarking Style Embeddings and LLM Judges
par: Abbas, Misam
Publié: (2025)
par: Abbas, Misam
Publié: (2025)
vTune: Verifiable Fine-Tuning for LLMs Through Backdooring
par: Zhang, Eva, et autres
Publié: (2024)
par: Zhang, Eva, et autres
Publié: (2024)
Dynamic Delayed Tree Expansion For Improved Multi-Path Speculative Decoding
par: Thomas, Rahul, et autres
Publié: (2026)
par: Thomas, Rahul, et autres
Publié: (2026)
Large Language Models Must Be Taught to Know What They Don't Know
par: Kapoor, Sanyam, et autres
Publié: (2024)
par: Kapoor, Sanyam, et autres
Publié: (2024)
KestRel: Relational Verification Using E-Graphs for Program Alignment
par: Dickerson, Robert, et autres
Publié: (2024)
par: Dickerson, Robert, et autres
Publié: (2024)
The Lie Derivative for Measuring Learned Equivariance
par: Gruver, Nate, et autres
Publié: (2022)
par: Gruver, Nate, et autres
Publié: (2022)
Adaptive Retention & Correction: Test-Time Training for Continual Learning
par: Chen, Haoran, et autres
Publié: (2024)
par: Chen, Haoran, et autres
Publié: (2024)
The No Free Lunch Theorem, Kolmogorov Complexity, and the Role of Inductive Biases in Machine Learning
par: Goldblum, Micah, et autres
Publié: (2023)
par: Goldblum, Micah, et autres
Publié: (2023)
Linting Style and Substance in READMEs
par: Mynampaty, Hima, et autres
Publié: (2026)
par: Mynampaty, Hima, et autres
Publié: (2026)
Participative Management--Style and Substance.
par: Goldberg, Robert L.
Publié: (1979)
par: Goldberg, Robert L.
Publié: (1979)
RAG-E: Quantifying Retriever-Generator Alignment and Failure Modes
par: Randl, Korbinian, et autres
Publié: (2026)
par: Randl, Korbinian, et autres
Publié: (2026)
Ensemble Monitoring for AI Control: Diverse Signals Outweigh More Compute
par: Koran, Eugene, et autres
Publié: (2026)
par: Koran, Eugene, et autres
Publié: (2026)
Multi-Token Prediction via Self-Distillation
par: Kirchenbauer, John, et autres
Publié: (2026)
par: Kirchenbauer, John, et autres
Publié: (2026)
Unveiling Substance Use Patterns and Dysfunctional Family Dynamics Among Adults in Rehabilitation
par: Bagsit, Micah Esther, et autres
Publié: (2026)
par: Bagsit, Micah Esther, et autres
Publié: (2026)
Privacy-Preserving Mechanisms Enable Cheap Verifiable Inference of LLMs
par: Pal, Arka, et autres
Publié: (2026)
par: Pal, Arka, et autres
Publié: (2026)
Knowing What You Know Is Not Enough: Large Language Model Confidences Don't Align With Their Actions
par: Pal, Arka, et autres
Publié: (2025)
par: Pal, Arka, et autres
Publié: (2025)
Preserving Cross-Modal Consistency for CLIP-based Class-Incremental Learning
par: Chen, Haoran, et autres
Publié: (2025)
par: Chen, Haoran, et autres
Publié: (2025)
Postpartum Obesity in Cuba: Risk Outweighs Response
par: Calixto Orozco-Muñoz
Publié: (2017)
par: Calixto Orozco-Muñoz
Publié: (2017)
LiveMathematicianBench: A Live Benchmark for Mathematician-Level Reasoning with Proof Sketches
par: He, Linyang, et autres
Publié: (2026)
par: He, Linyang, et autres
Publié: (2026)
Authorship and the Politics and Ethics of LLM Watermarks
par: Räz, Tim
Publié: (2024)
par: Räz, Tim
Publié: (2024)
Interpreting Chekhov’s Prose by Leonard A.Polakiewicz. Ars Rossica. Brookline: Academic Studies Press, 2024. 432 pp. $129.00. ISBN 979‐8‐88719‐566‐7
par: Robin Feuer Miller
Publié: (2025)
par: Robin Feuer Miller
Publié: (2025)
How Model Size, Temperature, and Prompt Style Affect LLM-Human Assessment Score Alignment
par: Jung, Julie, et autres
Publié: (2025)
par: Jung, Julie, et autres
Publié: (2025)
Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation
par: Lee, Dongryeol, et autres
Publié: (2026)
par: Lee, Dongryeol, et autres
Publié: (2026)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
par: Liu, Yixin, et autres
Publié: (2025)
par: Liu, Yixin, et autres
Publié: (2025)
Small Batch Size Training for Language Models: When Vanilla SGD Works, and Why Gradient Accumulation Is Wasteful
par: Marek, Martin, et autres
Publié: (2025)
par: Marek, Martin, et autres
Publié: (2025)
Documents similaires
-
When Judgment Becomes Noise: How Design Failures in LLM Judge Benchmarks Silently Undermine Validity
par: Feuer, Benjamin, et autres
Publié: (2025) -
FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges
par: Hayes, Kevin David, et autres
Publié: (2025) -
Towards Provably Unbiased LLM Judges via Bias-Bounded Evaluation
par: Feuer, Benjamin, et autres
Publié: (2026) -
LiveBench: A Challenging, Contamination-Limited LLM Benchmark
par: White, Colin, et autres
Publié: (2024) -
TuneTables: Context Optimization for Scalable Prior-Data Fitted Networks
par: Feuer, Benjamin, et autres
Publié: (2024)