SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Daynauth, Roland, Clarke, Christopher, Flautner, Krisztian, Tang, Lingjia, Mars, Jason |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat
by: Daynauth, Roland, et al.
Published: (2024)
by: Daynauth, Roland, et al.
Published: (2024)
Aligning Model Evaluations with Human Preferences: Mitigating Token Count Bias in Language Model Assessments
by: Daynauth, Roland, et al.
Published: (2024)
by: Daynauth, Roland, et al.
Published: (2024)
Guylingo: The Republic of Guyana Creole Corpora
by: Clarke, Christopher, et al.
Published: (2024)
by: Clarke, Christopher, et al.
Published: (2024)
PEFT-U: Parameter-Efficient Fine-Tuning for User Personalization
by: Clarke, Christopher, et al.
Published: (2024)
by: Clarke, Christopher, et al.
Published: (2024)
MTP: A Meaning-Typed Language Abstraction for AI-Integrated Programming
by: Dantanarayana, Jayanaka L., et al.
Published: (2024)
by: Dantanarayana, Jayanaka L., et al.
Published: (2024)
GraphRunner: A Multi-Stage Framework for Efficient and Accurate Graph-Based Retrieval
by: Kashmira, Savini, et al.
Published: (2025)
by: Kashmira, Savini, et al.
Published: (2025)
Scaling Down to Scale Up: A Cost-Benefit Analysis of Replacing OpenAI's LLM with Open Source SLMs in Production
by: Irugalbandara, Chandra, et al.
Published: (2023)
by: Irugalbandara, Chandra, et al.
Published: (2023)
Prompt Less, Smile More: MTP with Semantic Engineering in Lieu of Prompt Engineering
by: Dantanarayana, Jayanaka L., et al.
Published: (2025)
by: Dantanarayana, Jayanaka L., et al.
Published: (2025)
TOBUGraph: Knowledge Graph-Based Retrieval for Enhanced LLM Performance Beyond RAG
by: Kashmira, Savini, et al.
Published: (2024)
by: Kashmira, Savini, et al.
Published: (2024)
GraphMend: Code Transformations for Fixing Graph Breaks in PyTorch 2
by: Kashmira, Savini, et al.
Published: (2025)
by: Kashmira, Savini, et al.
Published: (2025)
Aligning Large Language Model Behavior with Human Citation Preferences
by: Ando, Kenichiro, et al.
Published: (2026)
by: Ando, Kenichiro, et al.
Published: (2026)
On the Entropy Calibration of Language Models
by: Cao, Steven, et al.
Published: (2025)
by: Cao, Steven, et al.
Published: (2025)
Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators
by: Liu, Yinhong, et al.
Published: (2024)
by: Liu, Yinhong, et al.
Published: (2024)
The Real, the Better: Aligning Large Language Models with Online Human Behaviors
by: Jiang, Guanying, et al.
Published: (2024)
by: Jiang, Guanying, et al.
Published: (2024)
Human-Alignment and Calibration of Inference-Time Uncertainty in Large Language Models
by: Moore, Kyle, et al.
Published: (2025)
by: Moore, Kyle, et al.
Published: (2025)
Entropy-Based Block Pruning for Efficient Large Language Models
by: Yang, Liangwei, et al.
Published: (2025)
by: Yang, Liangwei, et al.
Published: (2025)
Attention-Aligned Reasoning for Large Language Models
by: Zhang, Hongxiang, et al.
Published: (2025)
by: Zhang, Hongxiang, et al.
Published: (2025)
Aligning Large Language Models with Counterfactual DPO
by: Butcher, Bradley
Published: (2024)
by: Butcher, Bradley
Published: (2024)
Aligning Large Language Models with Searcher Preferences
by: Wu, Wei, et al.
Published: (2026)
by: Wu, Wei, et al.
Published: (2026)
Calibrating Verbalized Probabilities for Large Language Models
by: Wang, Cheng, et al.
Published: (2024)
by: Wang, Cheng, et al.
Published: (2024)
Reward Collapse in Aligning Large Language Models
by: Song, Ziang, et al.
Published: (2023)
by: Song, Ziang, et al.
Published: (2023)
Beyond Labels: Aligning Large Language Models with Human-like Reasoning
by: Kabir, Muhammad Rafsan, et al.
Published: (2024)
by: Kabir, Muhammad Rafsan, et al.
Published: (2024)
Large Language Models Align with the Human Brain during Creative Thinking
by: Ismayilzada, Mete, et al.
Published: (2026)
by: Ismayilzada, Mete, et al.
Published: (2026)
MVPBench: A Benchmark and Fine-Tuning Framework for Aligning Large Language Models with Diverse Human Values
by: Liang, Yao, et al.
Published: (2025)
by: Liang, Yao, et al.
Published: (2025)
Credence Calibration Game? Calibrating Large Language Models through Structured Play
by: Fang, Ke, et al.
Published: (2025)
by: Fang, Ke, et al.
Published: (2025)
Task-Aligned Tool Recommendation for Large Language Models
by: Gao, Hang, et al.
Published: (2024)
by: Gao, Hang, et al.
Published: (2024)
Evaluating Causal Explanation in Medical Reports with LLM-Based and Human-Aligned Metrics
by: Cho, Yousang, et al.
Published: (2025)
by: Cho, Yousang, et al.
Published: (2025)
Human-Calibrated Automated Testing and Validation of Generative Language Models
by: Sudjianto, Agus, et al.
Published: (2024)
by: Sudjianto, Agus, et al.
Published: (2024)
Social Meaning in Large Language Models: Structure, Magnitude, and Pragmatic Prompting
by: Mühlenbernd, Roland
Published: (2026)
by: Mühlenbernd, Roland
Published: (2026)
ConSiDERS-The-Human Evaluation Framework: Rethinking Human Evaluation for Generative Large Language Models
by: Elangovan, Aparna, et al.
Published: (2024)
by: Elangovan, Aparna, et al.
Published: (2024)
Human-Inspired Learning for Large Language Models via Obvious Record and Maximum-Entropy Method Discovery
by: Su, Hong
Published: (2025)
by: Su, Hong
Published: (2025)
A Critical Evaluation of AI Feedback for Aligning Large Language Models
by: Sharma, Archit, et al.
Published: (2024)
by: Sharma, Archit, et al.
Published: (2024)
One Agent Too Many: User Perspectives on Approaches to Multi-agent Conversational AI
by: Clarke, Christopher, et al.
Published: (2024)
by: Clarke, Christopher, et al.
Published: (2024)
Improve Decoding Factuality by Token-wise Cross Layer Entropy of Large Language Models
by: Wu, Jialiang, et al.
Published: (2025)
by: Wu, Jialiang, et al.
Published: (2025)
Evaluation of Prompt Injection Defenses in Large Language Models
by: Deep, Priyal, et al.
Published: (2026)
by: Deep, Priyal, et al.
Published: (2026)
SPRI: Aligning Large Language Models with Context-Situated Principles
by: Zhan, Hongli, et al.
Published: (2025)
by: Zhan, Hongli, et al.
Published: (2025)
Semantic Representation Attack against Aligned Large Language Models
by: Lian, Jiawei, et al.
Published: (2025)
by: Lian, Jiawei, et al.
Published: (2025)
Empathy by Design: Aligning Large Language Models for Healthcare Dialogue
by: Umucu, Emre, et al.
Published: (2025)
by: Umucu, Emre, et al.
Published: (2025)
Revealing the Intrinsic Ethical Vulnerability of Aligned Large Language Models
by: Lian, Jiawei, et al.
Published: (2025)
by: Lian, Jiawei, et al.
Published: (2025)
Evaluating Creative Short Story Generation in Humans and Large Language Models
by: Ismayilzada, Mete, et al.
Published: (2024)
by: Ismayilzada, Mete, et al.
Published: (2024)
Similar Items
-
Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat
by: Daynauth, Roland, et al.
Published: (2024) -
Aligning Model Evaluations with Human Preferences: Mitigating Token Count Bias in Language Model Assessments
by: Daynauth, Roland, et al.
Published: (2024) -
Guylingo: The Republic of Guyana Creole Corpora
by: Clarke, Christopher, et al.
Published: (2024) -
PEFT-U: Parameter-Efficient Fine-Tuning for User Personalization
by: Clarke, Christopher, et al.
Published: (2024) -
MTP: A Meaning-Typed Language Abstraction for AI-Integrated Programming
by: Dantanarayana, Jayanaka L., et al.
Published: (2024)