Beyond Instruction Following: Evaluating Inferential Rule Following of Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Wangtao, Zhang, Chenxiang, Zhang, XueYou, Yu, Xuanqing, Huang, Ziyang, Chen, Pei, Xu, Haotian, He, Shizhu, Zhao, Jun, Liu, Kang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ItD: Large Language Models Can Teach Themselves Induction through Deduction
por: Sun, Wangtao, et al.
Publicado: (2024)
por: Sun, Wangtao, et al.
Publicado: (2024)
Shuttle Between the Instructions and the Parameters of Large Language Models
por: Sun, Wangtao, et al.
Publicado: (2025)
por: Sun, Wangtao, et al.
Publicado: (2025)
ExpNote: Black-box Large Language Models are Better Task Solvers with Experience Notebook
por: Sun, Wangtao, et al.
Publicado: (2023)
por: Sun, Wangtao, et al.
Publicado: (2023)
From Chain to Tree: Refining Chain-like Rules into Tree-like Rules on Knowledge Graphs
por: Sun, Wangtao, et al.
Publicado: (2024)
por: Sun, Wangtao, et al.
Publicado: (2024)
Improve Rule Retrieval and Reasoning with Self-Induction and Relevance ReEstimate
por: Huang, Ziyang, et al.
Publicado: (2025)
por: Huang, Ziyang, et al.
Publicado: (2025)
CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation
por: Yan, Kaiwen, et al.
Publicado: (2025)
por: Yan, Kaiwen, et al.
Publicado: (2025)
ONSEP: A Novel Online Neural-Symbolic Framework for Event Prediction Based on Large Language Model
por: Yu, Xuanqing, et al.
Publicado: (2024)
por: Yu, Xuanqing, et al.
Publicado: (2024)
Probabilistic Uncertain Reward Model
por: Sun, Wangtao, et al.
Publicado: (2025)
por: Sun, Wangtao, et al.
Publicado: (2025)
LIFEBench: Evaluating Length Instruction Following in Large Language Models
por: Zhang, Wei, et al.
Publicado: (2025)
por: Zhang, Wei, et al.
Publicado: (2025)
Instruction-Following Evaluation of Large Vision-Language Models
por: Shiono, Daiki, et al.
Publicado: (2025)
por: Shiono, Daiki, et al.
Publicado: (2025)
XIFBench: Evaluating Large Language Models on Multilingual Instruction Following
por: Li, Zhenyu, et al.
Publicado: (2025)
por: Li, Zhenyu, et al.
Publicado: (2025)
Parrot: Enhancing Multi-Turn Instruction Following for Large Language Models
por: Sun, Yuchong, et al.
Publicado: (2023)
por: Sun, Yuchong, et al.
Publicado: (2023)
S3Eval: A Synthetic, Scalable, Systematic Evaluation Suite for Large Language Models
por: Lei, Fangyu, et al.
Publicado: (2023)
por: Lei, Fangyu, et al.
Publicado: (2023)
Evaluating Large Language Models at Evaluating Instruction Following
por: Zeng, Zhiyuan, et al.
Publicado: (2023)
por: Zeng, Zhiyuan, et al.
Publicado: (2023)
RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models
por: Yan, Jianhao, et al.
Publicado: (2024)
por: Yan, Jianhao, et al.
Publicado: (2024)
LexInstructEval: Lexical Instruction Following Evaluation for Large Language Models
por: Ren, Huimin, et al.
Publicado: (2025)
por: Ren, Huimin, et al.
Publicado: (2025)
Neural Incompatibility: The Unbridgeable Gap of Cross-Scale Parametric Knowledge Transfer in Large Language Models
por: Tan, Yuqiao, et al.
Publicado: (2025)
por: Tan, Yuqiao, et al.
Publicado: (2025)
Towards Better Instruction Following Retrieval Models
por: Zhuang, Yuchen, et al.
Publicado: (2025)
por: Zhuang, Yuchen, et al.
Publicado: (2025)
Towards Agentic Self-Learning LLMs in Search Environment
por: Sun, Wangtao, et al.
Publicado: (2025)
por: Sun, Wangtao, et al.
Publicado: (2025)
Beyond Content Relevance: Evaluating Instruction Following in Retrieval Models
por: Zhou, Jianqun, et al.
Publicado: (2024)
por: Zhou, Jianqun, et al.
Publicado: (2024)
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
por: Wen, Bosi, et al.
Publicado: (2026)
por: Wen, Bosi, et al.
Publicado: (2026)
RNR: Teaching Large Language Models to Follow Roles and Rules
por: Wang, Kuan, et al.
Publicado: (2024)
por: Wang, Kuan, et al.
Publicado: (2024)
Instruction-Free Tuning of Large Vision Language Models for Medical Instruction Following
por: Kang, Myeongkyun, et al.
Publicado: (2026)
por: Kang, Myeongkyun, et al.
Publicado: (2026)
Instruction-Following Evaluation in Function Calling for Large Language Models
por: Skripko, Nikolai
Publicado: (2025)
por: Skripko, Nikolai
Publicado: (2025)
IHEval: Evaluating Language Models on Following the Instruction Hierarchy
por: Zhang, Zhihan, et al.
Publicado: (2025)
por: Zhang, Zhihan, et al.
Publicado: (2025)
LsrIF: Enhancing Logic-Structured Instruction Following of Large Language Models
por: Ren, Qingyu, et al.
Publicado: (2026)
por: Ren, Qingyu, et al.
Publicado: (2026)
LIFBench: Evaluating the Instruction Following Performance and Stability of Large Language Models in Long-Context Scenarios
por: Wu, Xiaodong, et al.
Publicado: (2024)
por: Wu, Xiaodong, et al.
Publicado: (2024)
EIFBENCH: Extremely Complex Instruction Following Benchmark for Large Language Models
por: Zou, Tao, et al.
Publicado: (2025)
por: Zou, Tao, et al.
Publicado: (2025)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
por: LI, Yizhi, et al.
Publicado: (2024)
por: LI, Yizhi, et al.
Publicado: (2024)
SC-Taxo: Hierarchical Taxonomy Generation under Semantic Consistency Constraints using Large Language Models
por: Cai, Shiqiang, et al.
Publicado: (2026)
por: Cai, Shiqiang, et al.
Publicado: (2026)
LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models
por: Zhang, Wei, et al.
Publicado: (2026)
por: Zhang, Wei, et al.
Publicado: (2026)
Instruction-Following Pruning for Large Language Models
por: Hou, Bairu, et al.
Publicado: (2025)
por: Hou, Bairu, et al.
Publicado: (2025)
Large Language Model Instruction Following: A Survey of Progresses and Challenges
por: Lou, Renze, et al.
Publicado: (2023)
por: Lou, Renze, et al.
Publicado: (2023)
IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation
por: Wen, Bosi, et al.
Publicado: (2025)
por: Wen, Bosi, et al.
Publicado: (2025)
From Instance Training to Instruction Learning: Task Adapters Generation from Instructions
por: Liao, Huanxuan, et al.
Publicado: (2024)
por: Liao, Huanxuan, et al.
Publicado: (2024)
Revisiting the Reliability of Language Models in Instruction-Following
por: Dong, Jianshuo, et al.
Publicado: (2025)
por: Dong, Jianshuo, et al.
Publicado: (2025)
Conifer: Improving Complex Constrained Instruction-Following Ability of Large Language Models
por: Sun, Haoran, et al.
Publicado: (2024)
por: Sun, Haoran, et al.
Publicado: (2024)
Incentivizing Reasoning for Advanced Instruction-Following of Large Language Models
por: Qin, Yulei, et al.
Publicado: (2025)
por: Qin, Yulei, et al.
Publicado: (2025)
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
por: Wang, Peiding, et al.
Publicado: (2025)
por: Wang, Peiding, et al.
Publicado: (2025)
Beyond the Trade-off: Self-Supervised Reinforcement Learning for Reasoning Models' Instruction Following
por: Ren, Qingyu, et al.
Publicado: (2025)
por: Ren, Qingyu, et al.
Publicado: (2025)
Ejemplares similares
-
ItD: Large Language Models Can Teach Themselves Induction through Deduction
por: Sun, Wangtao, et al.
Publicado: (2024) -
Shuttle Between the Instructions and the Parameters of Large Language Models
por: Sun, Wangtao, et al.
Publicado: (2025) -
ExpNote: Black-box Large Language Models are Better Task Solvers with Experience Notebook
por: Sun, Wangtao, et al.
Publicado: (2023) -
From Chain to Tree: Refining Chain-like Rules into Tree-like Rules on Knowledge Graphs
por: Sun, Wangtao, et al.
Publicado: (2024) -
Improve Rule Retrieval and Reasoning with Self-Induction and Relevance ReEstimate
por: Huang, Ziyang, et al.
Publicado: (2025)