InFoBench: Evaluating Instruction Following Ability in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qin, Yiwei, Song, Kaiqiang, Hu, Yebowen, Yao, Wenlin, Cho, Sangwoo, Wang, Xiaoyang, Wu, Xuansheng, Liu, Fei, Liu, Pengfei, Yu, Dong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can Large Language Models do Analytical Reasoning?
par: Hu, Yebowen, et autres
Publié: (2024)
par: Hu, Yebowen, et autres
Publié: (2024)
When Reasoning Meets Information Aggregation: A Case Study with Sports Narratives
par: Hu, Yebowen, et autres
Publié: (2024)
par: Hu, Yebowen, et autres
Publié: (2024)
SportsMetrics: Blending Text and Numerical Data to Understand Information Fusion in LLMs
par: Hu, Yebowen, et autres
Publié: (2024)
par: Hu, Yebowen, et autres
Publié: (2024)
MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning
par: Liu, Fuxiao, et autres
Publié: (2023)
par: Liu, Fuxiao, et autres
Publié: (2023)
From Language Modeling to Instruction Following: Understanding the Behavior Shift in LLMs after Instruction Tuning
par: Wu, Xuansheng, et autres
Publié: (2023)
par: Wu, Xuansheng, et autres
Publié: (2023)
SPECTRUM: Speaker-Enhanced Pre-Training for Long Dialogue Summarization
par: Cho, Sangwoo, et autres
Publié: (2024)
par: Cho, Sangwoo, et autres
Publié: (2024)
A Versatile Multimodal Agent for Multimedia Content Generation
par: Zhang, Daoan, et autres
Publié: (2026)
par: Zhang, Daoan, et autres
Publié: (2026)
DeFine: Decision-Making with Analogical Reasoning over Factor Profiles
par: Hu, Yebowen, et autres
Publié: (2024)
par: Hu, Yebowen, et autres
Publié: (2024)
Polarity Calibration for Opinion Summarization
par: Lei, Yuanyuan, et autres
Publié: (2024)
par: Lei, Yuanyuan, et autres
Publié: (2024)
TCIA: A Task-Centric Instruction Augmentation Method for Instruction Finetuning
par: Ma, Simin, et autres
Publié: (2025)
par: Ma, Simin, et autres
Publié: (2025)
Conifer: Improving Complex Constrained Instruction-Following Ability of Large Language Models
par: Sun, Haoran, et autres
Publié: (2024)
par: Sun, Haoran, et autres
Publié: (2024)
Could Small Language Models Serve as Recommenders? Towards Data-centric Cold-start Recommendations
par: Wu, Xuansheng, et autres
Publié: (2023)
par: Wu, Xuansheng, et autres
Publié: (2023)
Complex Logical Instruction Generation
par: Zhang, Mian, et autres
Publié: (2025)
par: Zhang, Mian, et autres
Publié: (2025)
Interpreting and Steering LLMs with Mutual Information-based Explanations on Sparse Autoencoders
par: Wu, Xuansheng, et autres
Publié: (2025)
par: Wu, Xuansheng, et autres
Publié: (2025)
Evaluation of Instruction-Following Ability for Large Language Models on Story-Ending Generation
par: Hida, Rem, et autres
Publié: (2024)
par: Hida, Rem, et autres
Publié: (2024)
Soundness-Aware Level: A Microscopic Signature that Predicts LLM Reasoning Potential
par: Wu, Xuansheng, et autres
Publié: (2025)
par: Wu, Xuansheng, et autres
Publié: (2025)
RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models
par: Yan, Jianhao, et autres
Publié: (2024)
par: Yan, Jianhao, et autres
Publié: (2024)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
par: Chu, Zheng, et autres
Publié: (2023)
par: Chu, Zheng, et autres
Publié: (2023)
BadRAG: Identifying Vulnerabilities in Retrieval Augmented Generation of Large Language Models
par: Xue, Jiaqi, et autres
Publié: (2024)
par: Xue, Jiaqi, et autres
Publié: (2024)
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
par: Wang, Peiding, et autres
Publié: (2025)
par: Wang, Peiding, et autres
Publié: (2025)
KITE: A Benchmark for Evaluating Korean Instruction-Following Abilities in Large Language Models
par: Kim, Dongjun, et autres
Publié: (2025)
par: Kim, Dongjun, et autres
Publié: (2025)
Can It Edit? Evaluating the Ability of Large Language Models to Follow Code Editing Instructions
par: Cassano, Federico, et autres
Publié: (2023)
par: Cassano, Federico, et autres
Publié: (2023)
Deconstructing Instruction-Following: A New Benchmark for Granular Evaluation of Large Language Model Instruction Compliance Abilities
par: Purpura, Alberto, et autres
Publié: (2026)
par: Purpura, Alberto, et autres
Publié: (2026)
Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models
par: Zeng, Bo, et autres
Publié: (2025)
par: Zeng, Bo, et autres
Publié: (2025)
The SIFo Benchmark: Investigating the Sequential Instruction Following Ability of Large Language Models
par: Chen, Xinyi, et autres
Publié: (2024)
par: Chen, Xinyi, et autres
Publié: (2024)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
par: LI, Yizhi, et autres
Publié: (2024)
par: LI, Yizhi, et autres
Publié: (2024)
Skills-in-Context Prompting: Unlocking Compositionality in Large Language Models
par: Chen, Jiaao, et autres
Publié: (2023)
par: Chen, Jiaao, et autres
Publié: (2023)
Beyond Instruction Following: Evaluating Inferential Rule Following of Large Language Models
par: Sun, Wangtao, et autres
Publié: (2024)
par: Sun, Wangtao, et autres
Publié: (2024)
Revisiting Compositional Generalization Capability of Large Language Models Considering Instruction Following Ability
par: Sakai, Yusuke, et autres
Publié: (2025)
par: Sakai, Yusuke, et autres
Publié: (2025)
StakeBench: Evaluating Language Understanding Grounded in Market Commitment
par: Pei, Yunhua, et autres
Publié: (2026)
par: Pei, Yunhua, et autres
Publié: (2026)
Evaluating Large Language Models at Evaluating Instruction Following
par: Zeng, Zhiyuan, et autres
Publié: (2023)
par: Zeng, Zhiyuan, et autres
Publié: (2023)
MathChat: Benchmarking Mathematical Reasoning and Instruction Following in Multi-Turn Interactions
par: Liang, Zhenwen, et autres
Publié: (2024)
par: Liang, Zhenwen, et autres
Publié: (2024)
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
par: Shu, Dong, et autres
Publié: (2025)
par: Shu, Dong, et autres
Publié: (2025)
TeachBench: A Syllabus-Grounded Framework for Evaluating Teaching Ability in Large Language Models
par: Li, Zheng, et autres
Publié: (2026)
par: Li, Zheng, et autres
Publié: (2026)
STRUX: An LLM for Decision-Making with Structured Explanations
par: Lu, Yiming, et autres
Publié: (2024)
par: Lu, Yiming, et autres
Publié: (2024)
LIFEBench: Evaluating Length Instruction Following in Large Language Models
par: Zhang, Wei, et autres
Publié: (2025)
par: Zhang, Wei, et autres
Publié: (2025)
PeFoMed: Parameter Efficient Fine-tuning of Multimodal Large Language Models for Medical Imaging
par: He, Jinlong, et autres
Publié: (2024)
par: He, Jinlong, et autres
Publié: (2024)
DIVE: Diversified Iterative Self-Improvement
par: Qin, Yiwei, et autres
Publié: (2025)
par: Qin, Yiwei, et autres
Publié: (2025)
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
par: Wang, Xiaoxuan, et autres
Publié: (2023)
par: Wang, Xiaoxuan, et autres
Publié: (2023)
InnovatorBench: Evaluating Agents' Ability to Conduct Innovative LLM Research
par: Wu, Yunze, et autres
Publié: (2025)
par: Wu, Yunze, et autres
Publié: (2025)
Documents similaires
-
Can Large Language Models do Analytical Reasoning?
par: Hu, Yebowen, et autres
Publié: (2024) -
When Reasoning Meets Information Aggregation: A Case Study with Sports Narratives
par: Hu, Yebowen, et autres
Publié: (2024) -
SportsMetrics: Blending Text and Numerical Data to Understand Information Fusion in LLMs
par: Hu, Yebowen, et autres
Publié: (2024) -
MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning
par: Liu, Fuxiao, et autres
Publié: (2023) -
From Language Modeling to Instruction Following: Understanding the Behavior Shift in LLMs after Instruction Tuning
par: Wu, Xuansheng, et autres
Publié: (2023)