Rubrik's Cube: Testing a New Rubric for Evaluating Explanations on the CUBE dataset
Fuente:
arXiv
Saved in:
| Main Authors: | Galvan-Sosa, Diana, Gaudeau, Gabrielle, Kavumba, Pride, Li, Yunmeng, gu, Hongyi, Yuan, Zheng, Sakaguchi, Keisuke, Buttery, Paula |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
by: Ashuach, Tomer, et al.
Published: (2025)
by: Ashuach, Tomer, et al.
Published: (2025)
LLM-Rubric: A Multidimensional, Calibrated Approach to Automated Evaluation of Natural Language Texts
by: Hashemi, Helia, et al.
Published: (2024)
by: Hashemi, Helia, et al.
Published: (2024)
Select or Project? Evaluating Lower-dimensional Vectors for LLM Training Data Explanations
by: Hinterleitner, Lukas, et al.
Published: (2026)
by: Hinterleitner, Lukas, et al.
Published: (2026)
Concept-based Rubrics Improve LLM Formative Assessment and Data Synthesis
by: Wei, Yuchen, et al.
Published: (2025)
by: Wei, Yuchen, et al.
Published: (2025)
BOUQuET: dataset, Benchmark and Open initiative for Universal Quality Evaluation in Translation
by: The Omnilingual MT Team, et al.
Published: (2025)
by: The Omnilingual MT Team, et al.
Published: (2025)
Y-NQ: English-Yorùbá Evaluation dataset for Open-Book Reading Comprehension and Text Generation
by: Costa-jussà, Marta R., et al.
Published: (2024)
by: Costa-jussà, Marta R., et al.
Published: (2024)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
by: Saji, Alan, et al.
Published: (2025)
by: Saji, Alan, et al.
Published: (2025)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
by: Peters, Sydney, et al.
Published: (2025)
by: Peters, Sydney, et al.
Published: (2025)
Descriptive Collision in Sparse Autoencoder Auto-Interpretability: When One Explanation Describes Many Features
by: McCann, Jordan F.
Published: (2026)
by: McCann, Jordan F.
Published: (2026)
Interactive Text-to-SQL Generation via Editable Step-by-Step Explanations
by: Tian, Yuan, et al.
Published: (2023)
by: Tian, Yuan, et al.
Published: (2023)
Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy
by: Lan, Guangchen, et al.
Published: (2026)
by: Lan, Guangchen, et al.
Published: (2026)
Measurement Risk in Supervised Financial NLP: Rubric and Metric Sensitivity on JF-ICR
by: Chang, Sidi, et al.
Published: (2026)
by: Chang, Sidi, et al.
Published: (2026)
Identifying Fairness Issues in Automatically Generated Testing Content
by: Stowe, Kevin, et al.
Published: (2024)
by: Stowe, Kevin, et al.
Published: (2024)
Test-Time Scaling of Reasoning Models for Machine Translation
by: Li, Zihao, et al.
Published: (2025)
by: Li, Zihao, et al.
Published: (2025)
RedHerring Attack: Testing the Reliability of Attack Detection
by: Rusert, Jonathan
Published: (2025)
by: Rusert, Jonathan
Published: (2025)
Towards Fundamental Language Models: Does Linguistic Competence Scale with Model Size?
by: Collado-Montañez, Jaime, et al.
Published: (2025)
by: Collado-Montañez, Jaime, et al.
Published: (2025)
SeLeRoSa: Sentence-Level Romanian Satire Detection Dataset
by: Smădu, Răzvan-Alexandru, et al.
Published: (2025)
by: Smădu, Răzvan-Alexandru, et al.
Published: (2025)
Compact Example-Based Explanations for Language Models
by: Schoenegger, Loris, et al.
Published: (2026)
by: Schoenegger, Loris, et al.
Published: (2026)
Inference to the Best Explanation in Large Language Models
by: Dalal, Dhairya, et al.
Published: (2024)
by: Dalal, Dhairya, et al.
Published: (2024)
Automated Bug Triaging using Instruction-Tuned Large Language Models
by: Kiashemshaki, Kiana, et al.
Published: (2025)
by: Kiashemshaki, Kiana, et al.
Published: (2025)
Toward Architecture-Aware Evaluation Metrics for LLM Agents
by: Souza, Débora, et al.
Published: (2026)
by: Souza, Débora, et al.
Published: (2026)
Merge-Bench: Resolve Merge Conflicts with Large Language Models
by: Schesch, Benedikt, et al.
Published: (2026)
by: Schesch, Benedikt, et al.
Published: (2026)
Guided Speculative Inference for Efficient Test-Time Alignment of LLMs
by: Geuter, Jonathan, et al.
Published: (2025)
by: Geuter, Jonathan, et al.
Published: (2025)
A Likelihood Ratio Test of Genetic Relationship among Languages
by: Akavarapu, V. S. D. S. Mahesh, et al.
Published: (2024)
by: Akavarapu, V. S. D. S. Mahesh, et al.
Published: (2024)
Verbosity Tradeoffs and the Impact of Scale on the Faithfulness of LLM Self-Explanations
by: Siegel, Noah Y., et al.
Published: (2025)
by: Siegel, Noah Y., et al.
Published: (2025)
Graphemic Normalization of the Perso-Arabic Script
by: Doctor, Raiomond, et al.
Published: (2022)
by: Doctor, Raiomond, et al.
Published: (2022)
Beyond Arabic: Software for Perso-Arabic Script Manipulation
by: Gutkin, Alexander, et al.
Published: (2023)
by: Gutkin, Alexander, et al.
Published: (2023)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
by: Oketunji, Abiodun Finbarrs
Published: (2023)
by: Oketunji, Abiodun Finbarrs
Published: (2023)
Planning vs Reasoning: Ablations to Test Capabilities of LoRA layers
by: Redkar, Neel
Published: (2024)
by: Redkar, Neel
Published: (2024)
LASTIST: LArge-Scale Target-Independent STance dataset
by: Kim, DongJae, et al.
Published: (2025)
by: Kim, DongJae, et al.
Published: (2025)
Evaluating Input Feature Explanations through a Unified Diagnostic Evaluation Framework
by: Sun, Jingyi, et al.
Published: (2024)
by: Sun, Jingyi, et al.
Published: (2024)
Extracting Structured Insights from Financial News: An Augmented LLM Driven Approach
by: Dolphin, Rian, et al.
Published: (2024)
by: Dolphin, Rian, et al.
Published: (2024)
RuOpinionNE-2024: Extraction of Opinion Tuples from Russian News Texts
by: Loukachevitch, Natalia, et al.
Published: (2025)
by: Loukachevitch, Natalia, et al.
Published: (2025)
BitCal-TTS: Bit-Calibrated Test-Time Scaling for Quantized Reasoning Models
by: Patarlapalli, Sai Babu, et al.
Published: (2026)
by: Patarlapalli, Sai Babu, et al.
Published: (2026)
The Sufficiency-Conciseness Trade-off in LLM Self-Explanation from an Information Bottleneck Perspective
by: Zahedzadeh, Ali, et al.
Published: (2026)
by: Zahedzadeh, Ali, et al.
Published: (2026)
Emergent Lexical Semantics in Neural Language Models: Testing Martin's Law on LLM-Generated Text
by: Kugler, Kai
Published: (2025)
by: Kugler, Kai
Published: (2025)
GrandJury: A Collaborative Machine Learning Model Evaluation Protocol for Dynamic Quality Rubrics
by: Cho, Arthur
Published: (2025)
by: Cho, Arthur
Published: (2025)
Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters
by: Shah, Aaryan, et al.
Published: (2026)
by: Shah, Aaryan, et al.
Published: (2026)
A dataset of questions on decision-theoretic reasoning in Newcomb-like problems
by: Oesterheld, Caspar, et al.
Published: (2024)
by: Oesterheld, Caspar, et al.
Published: (2024)
Enhancing Emotion Prediction in News Headlines: Insights from ChatGPT and Seq2Seq Models for Free-Text Generation
by: Gao, Ge, et al.
Published: (2024)
by: Gao, Ge, et al.
Published: (2024)
Similar Items
-
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
by: Ashuach, Tomer, et al.
Published: (2025) -
LLM-Rubric: A Multidimensional, Calibrated Approach to Automated Evaluation of Natural Language Texts
by: Hashemi, Helia, et al.
Published: (2024) -
Select or Project? Evaluating Lower-dimensional Vectors for LLM Training Data Explanations
by: Hinterleitner, Lukas, et al.
Published: (2026) -
Concept-based Rubrics Improve LLM Formative Assessment and Data Synthesis
by: Wei, Yuchen, et al.
Published: (2025) -
BOUQuET: dataset, Benchmark and Open initiative for Universal Quality Evaluation in Translation
by: The Omnilingual MT Team, et al.
Published: (2025)