LexInstructEval: Lexical Instruction Following Evaluation for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Ren, Huimin, Liang, Yan, Su, Baiqiao, Sun, Chaobo, Lu, Hengtong, Zhang, Kaike, Wei, Chen |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
by: Li, Haitao, et al.
Published: (2024)
by: Li, Haitao, et al.
Published: (2024)
ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions
by: He, Xingwei, et al.
Published: (2025)
by: He, Xingwei, et al.
Published: (2025)
ProLex: A Benchmark for Language Proficiency-oriented Lexical Substitution
by: Zhang, Xuanming, et al.
Published: (2024)
by: Zhang, Xuanming, et al.
Published: (2024)
LIFEBench: Evaluating Length Instruction Following in Large Language Models
by: Zhang, Wei, et al.
Published: (2025)
by: Zhang, Wei, et al.
Published: (2025)
SetLexSem Challenge: Using Set Operations to Evaluate the Lexical and Semantic Robustness of Language Models
by: Akhbari, Bardiya, et al.
Published: (2024)
by: Akhbari, Bardiya, et al.
Published: (2024)
XIFBench: Evaluating Large Language Models on Multilingual Instruction Following
by: Li, Zhenyu, et al.
Published: (2025)
by: Li, Zhenyu, et al.
Published: (2025)
Improved Supervised Fine-Tuning for Large Language Models to Mitigate Catastrophic Forgetting
by: Ding, Fei, et al.
Published: (2025)
by: Ding, Fei, et al.
Published: (2025)
Evaluating Large Language Models at Evaluating Instruction Following
by: Zeng, Zhiyuan, et al.
Published: (2023)
by: Zeng, Zhiyuan, et al.
Published: (2023)
LIFBench: Evaluating the Instruction Following Performance and Stability of Large Language Models in Long-Context Scenarios
by: Wu, Xiaodong, et al.
Published: (2024)
by: Wu, Xiaodong, et al.
Published: (2024)
Beyond Instruction Following: Evaluating Inferential Rule Following of Large Language Models
by: Sun, Wangtao, et al.
Published: (2024)
by: Sun, Wangtao, et al.
Published: (2024)
RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models
by: Yan, Jianhao, et al.
Published: (2024)
by: Yan, Jianhao, et al.
Published: (2024)
InstructAV: Instruction Fine-tuning Large Language Models for Authorship Verification
by: Hu, Yujia, et al.
Published: (2024)
by: Hu, Yujia, et al.
Published: (2024)
InstructCoder: Instruction Tuning Large Language Models for Code Editing
by: Li, Kaixin, et al.
Published: (2023)
by: Li, Kaixin, et al.
Published: (2023)
MultiLexNorm++: A Unified Benchmark and a Generative Model for Lexical Normalization for Asian Languages
by: Buaphet, Weerayut, et al.
Published: (2026)
by: Buaphet, Weerayut, et al.
Published: (2026)
InstructEdit: Instruction-based Knowledge Editing for Large Language Models
by: Zhang, Ningyu, et al.
Published: (2024)
by: Zhang, Ningyu, et al.
Published: (2024)
LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models
by: Zhang, Wei, et al.
Published: (2026)
by: Zhang, Wei, et al.
Published: (2026)
ESC-Eval: Evaluating Emotion Support Conversations in Large Language Models
by: Zhao, Haiquan, et al.
Published: (2024)
by: Zhao, Haiquan, et al.
Published: (2024)
Instruction-Following Pruning for Large Language Models
by: Hou, Bairu, et al.
Published: (2025)
by: Hou, Bairu, et al.
Published: (2025)
Instruction-Following Evaluation of Large Vision-Language Models
by: Shiono, Daiki, et al.
Published: (2025)
by: Shiono, Daiki, et al.
Published: (2025)
SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research
by: Sun, Liangtai, et al.
Published: (2023)
by: Sun, Liangtai, et al.
Published: (2023)
Semi-Instruct: Bridging Natural-Instruct and Self-Instruct for Code Large Language Models
by: Luo, Xianzhen, et al.
Published: (2024)
by: Luo, Xianzhen, et al.
Published: (2024)
BioInstruct: Instruction Tuning of Large Language Models for Biomedical Natural Language Processing
by: Tran, Hieu, et al.
Published: (2023)
by: Tran, Hieu, et al.
Published: (2023)
SocialEval: Evaluating Social Intelligence of Large Language Models
by: Zhou, Jinfeng, et al.
Published: (2025)
by: Zhou, Jinfeng, et al.
Published: (2025)
CriticEval: Evaluating Large Language Model as Critic
by: Lan, Tian, et al.
Published: (2024)
by: Lan, Tian, et al.
Published: (2024)
S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models
by: Yuan, Xiaohan, et al.
Published: (2024)
by: Yuan, Xiaohan, et al.
Published: (2024)
FastLexRank: Efficient Lexical Ranking for Structuring Social Media Posts
by: Li, Mao, et al.
Published: (2024)
by: Li, Mao, et al.
Published: (2024)
IFEval-Audio: Benchmarking Instruction-Following Capability in Audio-based Large Language Models
by: Gao, Yiming, et al.
Published: (2025)
by: Gao, Yiming, et al.
Published: (2025)
NeLLCom-Lex: A Neural-agent Framework to Study the Interplay between Lexical Systems and Language Use
by: Zhang, Yuqing, et al.
Published: (2025)
by: Zhang, Yuqing, et al.
Published: (2025)
OpenHuEval: Evaluating Large Language Model on Hungarian Specifics
by: Yang, Haote, et al.
Published: (2025)
by: Yang, Haote, et al.
Published: (2025)
Evaluation of Instruction-Following Ability for Large Language Models on Story-Ending Generation
by: Hida, Rem, et al.
Published: (2024)
by: Hida, Rem, et al.
Published: (2024)
InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems
by: Huang, Kexin, et al.
Published: (2025)
by: Huang, Kexin, et al.
Published: (2025)
ViLexNorm: A Lexical Normalization Corpus for Vietnamese Social Media Text
by: Nguyen, Thanh-Nhi, et al.
Published: (2024)
by: Nguyen, Thanh-Nhi, et al.
Published: (2024)
DS$^2$-Instruct: Domain-Specific Data Synthesis for Large Language Models Instruction Tuning
by: Xu, Ruiyao, et al.
Published: (2026)
by: Xu, Ruiyao, et al.
Published: (2026)
PsychoLex: Unveiling the Psychological Mind of Large Language Models
by: Abbasi, Mohammad Amin, et al.
Published: (2024)
by: Abbasi, Mohammad Amin, et al.
Published: (2024)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
by: Shen, Tianhao, et al.
Published: (2023)
by: Shen, Tianhao, et al.
Published: (2023)
GraphIF: Enhancing Multi-Turn Instruction Following for Large Language Models with Relation Graph Prompt
by: Li, Zhenhe, et al.
Published: (2025)
by: Li, Zhenhe, et al.
Published: (2025)
HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition
by: Liu, Yuxuan, et al.
Published: (2024)
by: Liu, Yuxuan, et al.
Published: (2024)
StructEval: Deepen and Broaden Large Language Model Assessment via Structured Evaluation
by: Cao, Boxi, et al.
Published: (2024)
by: Cao, Boxi, et al.
Published: (2024)
IHEval: Evaluating Language Models on Following the Instruction Hierarchy
by: Zhang, Zhihan, et al.
Published: (2025)
by: Zhang, Zhihan, et al.
Published: (2025)
Evaluating the Evaluator: Problems with SemEval-2020 Task 1 for Lexical Semantic Change Detection
by: Phan-Tat, Bach, et al.
Published: (2026)
by: Phan-Tat, Bach, et al.
Published: (2026)
Similar Items
-
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
by: Li, Haitao, et al.
Published: (2024) -
ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions
by: He, Xingwei, et al.
Published: (2025) -
ProLex: A Benchmark for Language Proficiency-oriented Lexical Substitution
by: Zhang, Xuanming, et al.
Published: (2024) -
LIFEBench: Evaluating Length Instruction Following in Large Language Models
by: Zhang, Wei, et al.
Published: (2025) -
SetLexSem Challenge: Using Set Operations to Evaluate the Lexical and Semantic Robustness of Language Models
by: Akhbari, Bardiya, et al.
Published: (2024)