IHEval: Evaluating Language Models on Following the Instruction Hierarchy
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Zhihan, Li, Shiyang, Zhang, Zixuan, Liu, Xin, Jiang, Haoming, Tang, Xianfeng, Gao, Yifan, Li, Zheng, Wang, Haodong, Tan, Zhaoxuan, Li, Yichuan, Yin, Qingyu, Yin, Bing, Jiang, Meng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Can Language Models Follow Multiple Turns of Entangled Instructions?
by: Han, Chi, et al.
Published: (2025)
by: Han, Chi, et al.
Published: (2025)
RNR: Teaching Large Language Models to Follow Roles and Rules
by: Wang, Kuan, et al.
Published: (2024)
by: Wang, Kuan, et al.
Published: (2024)
Data Diversity Matters for Robust Instruction Tuning
by: Bukharin, Alexander, et al.
Published: (2023)
by: Bukharin, Alexander, et al.
Published: (2023)
Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards
by: Jiayang, Cheng, et al.
Published: (2026)
by: Jiayang, Cheng, et al.
Published: (2026)
Aligning Large Language Models with Implicit Preferences from User-Generated Content
by: Tan, Zhaoxuan, et al.
Published: (2025)
by: Tan, Zhaoxuan, et al.
Published: (2025)
MEMORYLLM: Towards Self-Updatable Large Language Models
by: Wang, Yu, et al.
Published: (2024)
by: Wang, Yu, et al.
Published: (2024)
Learning to Optimize Multi-Objective Alignment Through Dynamic Reward Weighting
by: Lu, Yining, et al.
Published: (2025)
by: Lu, Yining, et al.
Published: (2025)
TOWER: Tree Organized Weighting for Evaluating Complex Instructions
by: Ziems, Noah, et al.
Published: (2024)
by: Ziems, Noah, et al.
Published: (2024)
Instant Personalized Large Language Model Adaptation via Hypernetwork
by: Tan, Zhaoxuan, et al.
Published: (2025)
by: Tan, Zhaoxuan, et al.
Published: (2025)
Democratizing Large Language Models via Personalized Parameter-Efficient Fine-tuning
by: Tan, Zhaoxuan, et al.
Published: (2024)
by: Tan, Zhaoxuan, et al.
Published: (2024)
Enhancing Mathematical Reasoning in LLMs by Stepwise Correction
by: Wu, Zhenyu, et al.
Published: (2024)
by: Wu, Zhenyu, et al.
Published: (2024)
Large Language Models Can Self-Correct with Key Condition Verification
by: Wu, Zhenyu, et al.
Published: (2024)
by: Wu, Zhenyu, et al.
Published: (2024)
Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning
by: Xu, Siyuan, et al.
Published: (2026)
by: Xu, Siyuan, et al.
Published: (2026)
Inductive or Deductive? Rethinking the Fundamental Reasoning Abilities of LLMs
by: Cheng, Kewei, et al.
Published: (2024)
by: Cheng, Kewei, et al.
Published: (2024)
How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing
by: Zhang, Huanyu, et al.
Published: (2026)
by: Zhang, Huanyu, et al.
Published: (2026)
Personalized Pieces: Efficient Personalized Large Language Models through Collaborative Efforts
by: Tan, Zhaoxuan, et al.
Published: (2024)
by: Tan, Zhaoxuan, et al.
Published: (2024)
Chain-of-Layer: Iteratively Prompting Large Language Models for Taxonomy Induction from Limited Examples
by: Zeng, Qingkai, et al.
Published: (2024)
by: Zeng, Qingkai, et al.
Published: (2024)
Shopping MMLU: A Massive Multi-Task Online Shopping Benchmark for Large Language Models
by: Jin, Yilun, et al.
Published: (2024)
by: Jin, Yilun, et al.
Published: (2024)
Agentic Conversational Search with Contextualized Reasoning via Reinforcement Learning
by: Mo, Fengran, et al.
Published: (2026)
by: Mo, Fengran, et al.
Published: (2026)
POPI: Personalizing LLMs via Optimized Natural Language Preference Inference
by: Chen, Yizhuo, et al.
Published: (2025)
by: Chen, Yizhuo, et al.
Published: (2025)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
by: Zhang, Qingru, et al.
Published: (2025)
by: Zhang, Qingru, et al.
Published: (2025)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
by: Xu, Yinglun, et al.
Published: (2023)
by: Xu, Yinglun, et al.
Published: (2023)
Mitigating Heterogeneous Token Overfitting in LLM Knowledge Editing
by: Liu, Tianci, et al.
Published: (2025)
by: Liu, Tianci, et al.
Published: (2025)
A nonparametric test for elliptical distribution based on kernel embedding of probabilities
by: Tang, Yin, et al.
Published: (2023)
by: Tang, Yin, et al.
Published: (2023)
Belted and Ensembled Neural Network for Linear and Nonlinear Sufficient Dimension Reduction
by: Tang, Yin, et al.
Published: (2024)
by: Tang, Yin, et al.
Published: (2024)
A Kernel-Based Nonparametric Test for Conditional Independence of Functional Data
by: Tang, Yin, et al.
Published: (2026)
by: Tang, Yin, et al.
Published: (2026)
Situated Natural Language Explanations
by: Zhu, Zining, et al.
Published: (2023)
by: Zhu, Zining, et al.
Published: (2023)
Large Language Models in the Clinic: A Comprehensive Benchmark
by: Liu, Fenglin, et al.
Published: (2024)
by: Liu, Fenglin, et al.
Published: (2024)
MaXIFE: Multilingual and Cross-lingual Instruction Following Evaluation
by: Liu, Yile, et al.
Published: (2025)
by: Liu, Yile, et al.
Published: (2025)
Instruction-following Evaluation through Verbalizer Manipulation
by: Li, Shiyang, et al.
Published: (2023)
by: Li, Shiyang, et al.
Published: (2023)
Toward Zero-Shot Instruction Following
by: Lou, Renze, et al.
Published: (2023)
by: Lou, Renze, et al.
Published: (2023)
Prioritizing the Best: Incentivizing Reliable Multimodal Reasoning by Rewarding Beyond Answer Correctness
by: Jia, Mengzhao, et al.
Published: (2026)
by: Jia, Mengzhao, et al.
Published: (2026)
XIFBench: Evaluating Large Language Models on Multilingual Instruction Following
by: Li, Zhenyu, et al.
Published: (2025)
by: Li, Zhenyu, et al.
Published: (2025)
Large Language Model Instruction Following: A Survey of Progresses and Challenges
by: Lou, Renze, et al.
Published: (2023)
by: Lou, Renze, et al.
Published: (2023)
InstructAttribute: Fine-grained Object Attributes editing with Instruction
by: Yin, Xingxi, et al.
Published: (2025)
by: Yin, Xingxi, et al.
Published: (2025)
Evaluating Large Language Models at Evaluating Instruction Following
by: Zeng, Zhiyuan, et al.
Published: (2023)
by: Zeng, Zhiyuan, et al.
Published: (2023)
Robust Reinforcement Learning from Corrupted Human Feedback
by: Bukharin, Alexander, et al.
Published: (2024)
by: Bukharin, Alexander, et al.
Published: (2024)
Towards Robust Temporal Reasoning of Large Language Models via a Multi-Hop QA Dataset and Pseudo-Instruction Tuning
by: Tan, Qingyu, et al.
Published: (2023)
by: Tan, Qingyu, et al.
Published: (2023)
Modality-Aware Neuron Pruning for Unlearning in Multimodal Large Language Models
by: Liu, Zheyuan, et al.
Published: (2025)
by: Liu, Zheyuan, et al.
Published: (2025)
MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems
by: Zhu, Zifeng, et al.
Published: (2024)
by: Zhu, Zifeng, et al.
Published: (2024)
Similar Items
-
Can Language Models Follow Multiple Turns of Entangled Instructions?
by: Han, Chi, et al.
Published: (2025) -
RNR: Teaching Large Language Models to Follow Roles and Rules
by: Wang, Kuan, et al.
Published: (2024) -
Data Diversity Matters for Robust Instruction Tuning
by: Bukharin, Alexander, et al.
Published: (2023) -
Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards
by: Jiayang, Cheng, et al.
Published: (2026) -
Aligning Large Language Models with Implicit Preferences from User-Generated Content
by: Tan, Zhaoxuan, et al.
Published: (2025)