HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Yuxuan, Yang, Tianchi, Huang, Shaohan, Zhang, Zihan, Huang, Haizhen, Wei, Furu, Deng, Weiwei, Sun, Feng, Zhang, Qi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Text Diffusion with Reinforced Conditioning
por: Liu, Yuxuan, et al.
Publicado: (2024)
por: Liu, Yuxuan, et al.
Publicado: (2024)
Context-DPO: Aligning Language Models for Context-Faithfulness
por: Bi, Baolong, et al.
Publicado: (2024)
por: Bi, Baolong, et al.
Publicado: (2024)
ResLoRA: Identity Residual Mapping in Low-Rank Adaption
por: Shi, Shuhua, et al.
Publicado: (2024)
por: Shi, Shuhua, et al.
Publicado: (2024)
Improving Domain Adaptation through Extended-Text Reading Comprehension
por: Jiang, Ting, et al.
Publicado: (2024)
por: Jiang, Ting, et al.
Publicado: (2024)
MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning
por: Jiang, Ting, et al.
Publicado: (2024)
por: Jiang, Ting, et al.
Publicado: (2024)
Adapting Large Language Models to Domains via Reading Comprehension
por: Cheng, Daixuan, et al.
Publicado: (2023)
por: Cheng, Daixuan, et al.
Publicado: (2023)
E5-V: Universal Embeddings with Multimodal Large Language Models
por: Jiang, Ting, et al.
Publicado: (2024)
por: Jiang, Ting, et al.
Publicado: (2024)
Textual Aesthetics in Large Language Models
por: Jiang, Lingjie, et al.
Publicado: (2024)
por: Jiang, Lingjie, et al.
Publicado: (2024)
$Se^2$: Sequential Example Selection for In-Context Learning
por: Liu, Haoyu, et al.
Publicado: (2024)
por: Liu, Haoyu, et al.
Publicado: (2024)
GeAR: Generation Augmented Retrieval
por: Liu, Haoyu, et al.
Publicado: (2025)
por: Liu, Haoyu, et al.
Publicado: (2025)
ASI++: Towards Distributionally Balanced End-to-End Generative Retrieval
por: Liu, Yuxuan, et al.
Publicado: (2024)
por: Liu, Yuxuan, et al.
Publicado: (2024)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
Mixture of LoRA Experts
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
Black-Box On-Policy Distillation of Large Language Models
por: Ye, Tianzhu, et al.
Publicado: (2025)
por: Ye, Tianzhu, et al.
Publicado: (2025)
On-Policy Context Distillation for Language Models
por: Ye, Tianzhu, et al.
Publicado: (2026)
por: Ye, Tianzhu, et al.
Publicado: (2026)
MH-MoE: Multi-Head Mixture-of-Experts
por: Huang, Shaohan, et al.
Publicado: (2024)
por: Huang, Shaohan, et al.
Publicado: (2024)
Instruction Pre-Training: Language Models are Supervised Multitask Learners
por: Cheng, Daixuan, et al.
Publicado: (2024)
por: Cheng, Daixuan, et al.
Publicado: (2024)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
por: Pan, Xichen, et al.
Publicado: (2023)
por: Pan, Xichen, et al.
Publicado: (2023)
Online Experiential Learning for Language Models
por: Ye, Tianzhu, et al.
Publicado: (2026)
por: Ye, Tianzhu, et al.
Publicado: (2026)
Multi-Head Mixture-of-Experts
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
Mnemis: Dual-Route Retrieval on Hierarchical Graphs for Long-Term LLM Memory
por: Tang, Zihao, et al.
Publicado: (2026)
por: Tang, Zihao, et al.
Publicado: (2026)
SocialEval: Evaluating Social Intelligence of Large Language Models
por: Zhou, Jinfeng, et al.
Publicado: (2025)
por: Zhou, Jinfeng, et al.
Publicado: (2025)
DnA-Eval: Enhancing Large Language Model Evaluation through Decomposition and Aggregation
por: Li, Minzhi, et al.
Publicado: (2024)
por: Li, Minzhi, et al.
Publicado: (2024)
Universal YOCO for Efficient Depth Scaling
por: Sun, Yutao, et al.
Publicado: (2026)
por: Sun, Yutao, et al.
Publicado: (2026)
You Only Cache Once: Decoder-Decoder Architectures for Language Models
por: Sun, Yutao, et al.
Publicado: (2024)
por: Sun, Yutao, et al.
Publicado: (2024)
Thinking Augmented Pre-training
por: Wang, Liang, et al.
Publicado: (2025)
por: Wang, Liang, et al.
Publicado: (2025)
CriticEval: Evaluating Large Language Model as Critic
por: Lan, Tian, et al.
Publicado: (2024)
por: Lan, Tian, et al.
Publicado: (2024)
Evaluating and Enhancing Large Language Models for Conversational Reasoning on Knowledge Graphs
por: Huang, Yuxuan
Publicado: (2023)
por: Huang, Yuxuan
Publicado: (2023)
The Era of Agentic Organization: Learning to Organize with Language Models
por: Chi, Zewen, et al.
Publicado: (2025)
por: Chi, Zewen, et al.
Publicado: (2025)
VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
por: Jiang, Lingjie, et al.
Publicado: (2025)
por: Jiang, Lingjie, et al.
Publicado: (2025)
EvalLM: Interactive Evaluation of Large Language Model Prompts on User-Defined Criteria
por: Kim, Tae Soo, et al.
Publicado: (2023)
por: Kim, Tae Soo, et al.
Publicado: (2023)
RedStone: Curating General, Code, Math, and QA Data for Large Language Models
por: Chang, Yaoyao, et al.
Publicado: (2024)
por: Chang, Yaoyao, et al.
Publicado: (2024)
Reasoning with Exploration: An Entropy Perspective
por: Cheng, Daixuan, et al.
Publicado: (2025)
por: Cheng, Daixuan, et al.
Publicado: (2025)
SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research
por: Sun, Liangtai, et al.
Publicado: (2023)
por: Sun, Liangtai, et al.
Publicado: (2023)
LexInstructEval: Lexical Instruction Following Evaluation for Large Language Models
por: Ren, Huimin, et al.
Publicado: (2025)
por: Ren, Huimin, et al.
Publicado: (2025)
MiniLLM: On-Policy Distillation of Large Language Models
por: Gu, Yuxian, et al.
Publicado: (2023)
por: Gu, Yuxian, et al.
Publicado: (2023)
On-Policy RL with Optimal Reward Baseline
por: Hao, Yaru, et al.
Publicado: (2025)
por: Hao, Yaru, et al.
Publicado: (2025)
Chain-of-Dictionary Prompting Elicits Translation in Large Language Models
por: Lu, Hongyuan, et al.
Publicado: (2023)
por: Lu, Hongyuan, et al.
Publicado: (2023)
Beyond Static Dialogues: Benchmarking Realistic, Heterogeneous, and Evolving Long-Term Memory
por: Zhang, Han, et al.
Publicado: (2026)
por: Zhang, Han, et al.
Publicado: (2026)
Multimodal Latent Language Modeling with Next-Token Diffusion
por: Sun, Yutao, et al.
Publicado: (2024)
por: Sun, Yutao, et al.
Publicado: (2024)
Ejemplares similares
-
Text Diffusion with Reinforced Conditioning
por: Liu, Yuxuan, et al.
Publicado: (2024) -
Context-DPO: Aligning Language Models for Context-Faithfulness
por: Bi, Baolong, et al.
Publicado: (2024) -
ResLoRA: Identity Residual Mapping in Low-Rank Adaption
por: Shi, Shuhua, et al.
Publicado: (2024) -
Improving Domain Adaptation through Extended-Text Reading Comprehension
por: Jiang, Ting, et al.
Publicado: (2024) -
MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning
por: Jiang, Ting, et al.
Publicado: (2024)