HREF: Human Response-Guided Evaluation of Instruction Following in Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Lyu, Xinxi, Wang, Yizhong, Hajishirzi, Hannaneh, Dasigi, Pradeep |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BTR: Binary Token Representations for Efficient Retrieval Augmented Language Models
di: Cao, Qingqing, et al.
Pubblicazione: (2023)
di: Cao, Qingqing, et al.
Pubblicazione: (2023)
Generalizing Verifiable Instruction Following
di: Pyatkin, Valentina, et al.
Pubblicazione: (2025)
di: Pyatkin, Valentina, et al.
Pubblicazione: (2025)
OLMES: A Standard for Language Model Evaluations
di: Gu, Yuling, et al.
Pubblicazione: (2024)
di: Gu, Yuling, et al.
Pubblicazione: (2024)
TurnWise: The Gap between Single- and Multi-turn Language Model Capabilities
di: Graf, Victoria, et al.
Pubblicazione: (2026)
di: Graf, Victoria, et al.
Pubblicazione: (2026)
SciRIFF: A Resource to Enhance Language Model Instruction-Following over Scientific Literature
di: Wadden, David, et al.
Pubblicazione: (2024)
di: Wadden, David, et al.
Pubblicazione: (2024)
ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context
di: Kim, Joongwon, et al.
Pubblicazione: (2025)
di: Kim, Joongwon, et al.
Pubblicazione: (2025)
The Art of Saying No: Contextual Noncompliance in Language Models
di: Brahman, Faeze, et al.
Pubblicazione: (2024)
di: Brahman, Faeze, et al.
Pubblicazione: (2024)
A Systematic Examination of Preference Learning through the Lens of Instruction-Following
di: Kim, Joongwon, et al.
Pubblicazione: (2024)
di: Kim, Joongwon, et al.
Pubblicazione: (2024)
Husky: A Unified, Open-Source Language Agent for Multi-Step Reasoning
di: Kim, Joongwon, et al.
Pubblicazione: (2024)
di: Kim, Joongwon, et al.
Pubblicazione: (2024)
LIFEBench: Evaluating Length Instruction Following in Large Language Models
di: Zhang, Wei, et al.
Pubblicazione: (2025)
di: Zhang, Wei, et al.
Pubblicazione: (2025)
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
di: Liu, Jiacheng, et al.
Pubblicazione: (2024)
di: Liu, Jiacheng, et al.
Pubblicazione: (2024)
Merge to Learn: Efficiently Adding Skills to Language Models with Model Merging
di: Morrison, Jacob, et al.
Pubblicazione: (2024)
di: Morrison, Jacob, et al.
Pubblicazione: (2024)
Data Engineering for Scaling Language Models to 128K Context
di: Fu, Yao, et al.
Pubblicazione: (2024)
di: Fu, Yao, et al.
Pubblicazione: (2024)
Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback
di: Miranda, Lester James V., et al.
Pubblicazione: (2024)
di: Miranda, Lester James V., et al.
Pubblicazione: (2024)
Learning to Detect Language Model Training Data via Active Reconstruction
di: Yin, Junjie Oscar, et al.
Pubblicazione: (2026)
di: Yin, Junjie Oscar, et al.
Pubblicazione: (2026)
Answer, Assemble, Ace: Understanding How LMs Answer Multiple Choice Questions
di: Wiegreffe, Sarah, et al.
Pubblicazione: (2024)
di: Wiegreffe, Sarah, et al.
Pubblicazione: (2024)
EvalTree: Profiling Language Model Weaknesses via Hierarchical Capability Trees
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)
OMEGA: Can LLMs Reason Outside the Box in Math? Evaluating Exploratory, Compositional, and Transformative Generalization
di: Sun, Yiyou, et al.
Pubblicazione: (2025)
di: Sun, Yiyou, et al.
Pubblicazione: (2025)
Beyond Instruction Following: Evaluating Inferential Rule Following of Large Language Models
di: Sun, Wangtao, et al.
Pubblicazione: (2024)
di: Sun, Wangtao, et al.
Pubblicazione: (2024)
Don't throw away your value model! Generating more preferable text with Value-Guided Monte-Carlo Tree Search decoding
di: Liu, Jiacheng, et al.
Pubblicazione: (2023)
di: Liu, Jiacheng, et al.
Pubblicazione: (2023)
Set the Clock: Temporal Alignment of Pretrained Language Models
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
SILO Language Models: Isolating Legal Risk In a Nonparametric Datastore
di: Min, Sewon, et al.
Pubblicazione: (2023)
di: Min, Sewon, et al.
Pubblicazione: (2023)
Reliable, Adaptable, and Attributable Language Models with Retrieval
di: Asai, Akari, et al.
Pubblicazione: (2024)
di: Asai, Akari, et al.
Pubblicazione: (2024)
InFoBench: Evaluating Instruction Following Ability in Large Language Models
di: Qin, Yiwei, et al.
Pubblicazione: (2024)
di: Qin, Yiwei, et al.
Pubblicazione: (2024)
RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
LexInstructEval: Lexical Instruction Following Evaluation for Large Language Models
di: Ren, Huimin, et al.
Pubblicazione: (2025)
di: Ren, Huimin, et al.
Pubblicazione: (2025)
Countering Catastrophic Forgetting of Large Language Models for Better Instruction Following via Weight-Space Model Merging
di: Lyu, Mengxian, et al.
Pubblicazione: (2026)
di: Lyu, Mengxian, et al.
Pubblicazione: (2026)
KITE: A Benchmark for Evaluating Korean Instruction-Following Abilities in Large Language Models
di: Kim, Dongjun, et al.
Pubblicazione: (2025)
di: Kim, Dongjun, et al.
Pubblicazione: (2025)
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
di: Chen, Tong, et al.
Pubblicazione: (2025)
di: Chen, Tong, et al.
Pubblicazione: (2025)
Can Language Models Follow Multiple Turns of Entangled Instructions?
di: Han, Chi, et al.
Pubblicazione: (2025)
di: Han, Chi, et al.
Pubblicazione: (2025)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
di: LI, Yizhi, et al.
Pubblicazione: (2024)
di: LI, Yizhi, et al.
Pubblicazione: (2024)
Infer Human's Intentions Before Following Natural Language Instructions
di: Wan, Yanming, et al.
Pubblicazione: (2024)
di: Wan, Yanming, et al.
Pubblicazione: (2024)
Honest AI: Fine-Tuning "Small" Language Models to Say "I Don't Know", and Reducing Hallucination in RAG
di: Chen, Xinxi, et al.
Pubblicazione: (2024)
di: Chen, Xinxi, et al.
Pubblicazione: (2024)
Fluid Language Model Benchmarking
di: Hofmann, Valentin, et al.
Pubblicazione: (2025)
di: Hofmann, Valentin, et al.
Pubblicazione: (2025)
Evaluating Correctness and Faithfulness of Instruction-Following Models for Question Answering
di: Adlakha, Vaibhav, et al.
Pubblicazione: (2023)
di: Adlakha, Vaibhav, et al.
Pubblicazione: (2023)
AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios
di: Qi, Yunjia, et al.
Pubblicazione: (2025)
di: Qi, Yunjia, et al.
Pubblicazione: (2025)
MulDimIF: A Multi-Dimensional Constraint Framework for Evaluating and Improving Instruction Following in Large Language Models
di: Ye, Junjie, et al.
Pubblicazione: (2025)
di: Ye, Junjie, et al.
Pubblicazione: (2025)
M-IFEval: Multilingual Instruction-Following Evaluation
di: Dussolle, Antoine, et al.
Pubblicazione: (2025)
di: Dussolle, Antoine, et al.
Pubblicazione: (2025)
Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
Constraint Back-translation Improves Complex Instruction Following of Large Language Models
di: Qi, Yunjia, et al.
Pubblicazione: (2024)
di: Qi, Yunjia, et al.
Pubblicazione: (2024)
Documenti analoghi
-
BTR: Binary Token Representations for Efficient Retrieval Augmented Language Models
di: Cao, Qingqing, et al.
Pubblicazione: (2023) -
Generalizing Verifiable Instruction Following
di: Pyatkin, Valentina, et al.
Pubblicazione: (2025) -
OLMES: A Standard for Language Model Evaluations
di: Gu, Yuling, et al.
Pubblicazione: (2024) -
TurnWise: The Gap between Single- and Multi-turn Language Model Capabilities
di: Graf, Victoria, et al.
Pubblicazione: (2026) -
SciRIFF: A Resource to Enhance Language Model Instruction-Following over Scientific Literature
di: Wadden, David, et al.
Pubblicazione: (2024)