On the Paradoxical Interference between Instruction-Following and Task Solving
Fuente:
arXiv
Guardado en:
| Autores principales: | Qi, Yunjia, Peng, Hao, Shi, Xintong, Xin, Amy, Wang, Xiaozhi, Xu, Bin, Hou, Lei, Li, Juanzi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VerIF: Verification Engineering for Reinforcement Learning in Instruction Following
por: Peng, Hao, et al.
Publicado: (2025)
por: Peng, Hao, et al.
Publicado: (2025)
Constraint Back-translation Improves Complex Instruction Following of Large Language Models
por: Qi, Yunjia, et al.
Publicado: (2024)
por: Qi, Yunjia, et al.
Publicado: (2024)
AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios
por: Qi, Yunjia, et al.
Publicado: (2025)
por: Qi, Yunjia, et al.
Publicado: (2025)
ADELIE: Aligning Large Language Models on Information Extraction
por: Qi, Yunjia, et al.
Publicado: (2024)
por: Qi, Yunjia, et al.
Publicado: (2024)
MAVEN-Fact: A Large-scale Event Factuality Detection Dataset
por: Li, Chunyang, et al.
Publicado: (2024)
por: Li, Chunyang, et al.
Publicado: (2024)
StoryWriter: A Multi-Agent Framework for Long Story Generation
por: Xia, Haotian, et al.
Publicado: (2025)
por: Xia, Haotian, et al.
Publicado: (2025)
StoryAlign: Evaluating and Training Reward Models for Story Generation
por: Xia, Haotian, et al.
Publicado: (2026)
por: Xia, Haotian, et al.
Publicado: (2026)
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
por: Peng, Hao, et al.
Publicado: (2025)
por: Peng, Hao, et al.
Publicado: (2025)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
por: Peng, Hao, et al.
Publicado: (2026)
por: Peng, Hao, et al.
Publicado: (2026)
OpenEP: Open-Ended Future Event Prediction
por: Guan, Yong, et al.
Publicado: (2024)
por: Guan, Yong, et al.
Publicado: (2024)
LLMAEL: Large Language Models are Good Context Augmenters for Entity Linking
por: Xin, Amy, et al.
Publicado: (2024)
por: Xin, Amy, et al.
Publicado: (2024)
Auxiliary Metrics Help Decoding Skill Neurons in the Wild
por: Zhao, Yixiu, et al.
Publicado: (2025)
por: Zhao, Yixiu, et al.
Publicado: (2025)
Event-level Knowledge Editing
por: Peng, Hao, et al.
Publicado: (2024)
por: Peng, Hao, et al.
Publicado: (2024)
ChatLog: Carefully Evaluating the Evolution of ChatGPT Across Time
por: Tu, Shangqing, et al.
Publicado: (2023)
por: Tu, Shangqing, et al.
Publicado: (2023)
MRCEval: A Comprehensive, Challenging and Accessible Machine Reading Comprehension Benchmark
por: Ma, Shengkun, et al.
Publicado: (2025)
por: Ma, Shengkun, et al.
Publicado: (2025)
LinguaLens: Towards Interpreting Linguistic Mechanisms of Large Language Models via Sparse Auto-Encoder
por: Jing, Yi, et al.
Publicado: (2025)
por: Jing, Yi, et al.
Publicado: (2025)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
por: Chen, Jianhui, et al.
Publicado: (2024)
por: Chen, Jianhui, et al.
Publicado: (2024)
TacoERE: Cluster-aware Compression for Event Relation Extraction
por: Guan, Yong, et al.
Publicado: (2024)
por: Guan, Yong, et al.
Publicado: (2024)
Preserving Knowledge Invariance: Rethinking Robustness Evaluation of Open Information Extraction
por: Qi, Ji, et al.
Publicado: (2023)
por: Qi, Ji, et al.
Publicado: (2023)
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
VidCoM: Fast Video Comprehension through Large Language Models with Multimodal Tools
por: Qi, Ji, et al.
Publicado: (2023)
por: Qi, Ji, et al.
Publicado: (2023)
LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
por: Bai, Yushi, et al.
Publicado: (2024)
por: Bai, Yushi, et al.
Publicado: (2024)
Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
por: Jing, Yi, et al.
Publicado: (2026)
por: Jing, Yi, et al.
Publicado: (2026)
MAVEN-Arg: Completing the Puzzle of All-in-One Event Understanding Dataset with Event Argument Annotation
por: Wang, Xiaozhi, et al.
Publicado: (2023)
por: Wang, Xiaozhi, et al.
Publicado: (2023)
AtomR: Atomic Operator-Empowered Large Language Models for Heterogeneous Knowledge Reasoning
por: Xin, Amy, et al.
Publicado: (2024)
por: Xin, Amy, et al.
Publicado: (2024)
Precise Localization of Memories: A Fine-grained Neuron-level Knowledge Editing Technique for LLMs
por: Pan, Haowen, et al.
Publicado: (2025)
por: Pan, Haowen, et al.
Publicado: (2025)
Pre-training Language Model Incorporating Domain-specific Heterogeneous Knowledge into A Unified Representation
por: Zhu, Hongyin, et al.
Publicado: (2021)
por: Zhu, Hongyin, et al.
Publicado: (2021)
WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection
por: He, Guanzhong, et al.
Publicado: (2025)
por: He, Guanzhong, et al.
Publicado: (2025)
MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification
por: Sun, Kai, et al.
Publicado: (2024)
por: Sun, Kai, et al.
Publicado: (2024)
Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards
por: Zhang, Jiajie, et al.
Publicado: (2026)
por: Zhang, Jiajie, et al.
Publicado: (2026)
Pre-training Distillation for Large Language Models: A Design Space Exploration
por: Peng, Hao, et al.
Publicado: (2024)
por: Peng, Hao, et al.
Publicado: (2024)
Instruction-Following Pruning for Large Language Models
por: Hou, Bairu, et al.
Publicado: (2025)
por: Hou, Bairu, et al.
Publicado: (2025)
StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets?
por: Chen, Yanxu, et al.
Publicado: (2025)
por: Chen, Yanxu, et al.
Publicado: (2025)
Layer-Aware Task Arithmetic: Disentangling Task-Specific and Instruction-Following Knowledge
por: Chen, Yan-Lun, et al.
Publicado: (2025)
por: Chen, Yan-Lun, et al.
Publicado: (2025)
TOD-ProcBench: Benchmarking Complex Instruction-Following in Task-Oriented Dialogues
por: Ghazarian, Sarik, et al.
Publicado: (2025)
por: Ghazarian, Sarik, et al.
Publicado: (2025)
KoLA: Carefully Benchmarking World Knowledge of Large Language Models
por: Yu, Jifan, et al.
Publicado: (2023)
por: Yu, Jifan, et al.
Publicado: (2023)
Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
por: Lin, Nianyi, et al.
Publicado: (2025)
por: Lin, Nianyi, et al.
Publicado: (2025)
Dancing in Chains: Reconciling Instruction Following and Faithfulness in Language Models
por: Wu, Zhengxuan, et al.
Publicado: (2024)
por: Wu, Zhengxuan, et al.
Publicado: (2024)
Event GDR: Event-Centric Generative Document Retrieval
por: Guan, Yong, et al.
Publicado: (2024)
por: Guan, Yong, et al.
Publicado: (2024)
DeepPrune: Parallel Scaling without Inter-trace Redundancy
por: Tu, Shangqing, et al.
Publicado: (2025)
por: Tu, Shangqing, et al.
Publicado: (2025)
Ejemplares similares
-
VerIF: Verification Engineering for Reinforcement Learning in Instruction Following
por: Peng, Hao, et al.
Publicado: (2025) -
Constraint Back-translation Improves Complex Instruction Following of Large Language Models
por: Qi, Yunjia, et al.
Publicado: (2024) -
AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios
por: Qi, Yunjia, et al.
Publicado: (2025) -
ADELIE: Aligning Large Language Models on Information Extraction
por: Qi, Yunjia, et al.
Publicado: (2024) -
MAVEN-Fact: A Large-scale Event Factuality Detection Dataset
por: Li, Chunyang, et al.
Publicado: (2024)