Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Zhicheng, Wang, Ziyan, Du, Yali, Fang, Fei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Safe Multi-agent Reinforcement Learning with Natural Language Constraints
par: Wang, Ziyan, et autres
Publié: (2024)
par: Wang, Ziyan, et autres
Publié: (2024)
Safe Reinforcement Learning with Free-form Natural Language Constraints and Pre-Trained Language Models
par: Lou, Xingzhou, et autres
Publié: (2024)
par: Lou, Xingzhou, et autres
Publié: (2024)
Evaluating Large Language Models at Evaluating Instruction Following
par: Zeng, Zhiyuan, et autres
Publié: (2023)
par: Zeng, Zhiyuan, et autres
Publié: (2023)
Compositional Instruction Following with Language Models and Reinforcement Learning
par: Cohen, Vanya, et autres
Publié: (2025)
par: Cohen, Vanya, et autres
Publié: (2025)
Improving Instruction-Following in Language Models through Activation Steering
par: Stolfo, Alessandro, et autres
Publié: (2024)
par: Stolfo, Alessandro, et autres
Publié: (2024)
Instruction Following by Principled Boosting Attention of Large Language Models
par: Guardieiro, Vitoria, et autres
Publié: (2025)
par: Guardieiro, Vitoria, et autres
Publié: (2025)
Instruction Tuning for Large Language Models: A Survey
par: Zhang, Shengyu, et autres
Publié: (2023)
par: Zhang, Shengyu, et autres
Publié: (2023)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
par: Xu, Jiashu, et autres
Publié: (2023)
par: Xu, Jiashu, et autres
Publié: (2023)
Conifer: Improving Complex Constrained Instruction-Following Ability of Large Language Models
par: Sun, Haoran, et autres
Publié: (2024)
par: Sun, Haoran, et autres
Publié: (2024)
Instructional Fingerprinting of Large Language Models
par: Xu, Jiashu, et autres
Publié: (2024)
par: Xu, Jiashu, et autres
Publié: (2024)
Improving Instruction Following in Language Models through Proxy-Based Uncertainty Estimation
par: Lee, JoonHo, et autres
Publié: (2024)
par: Lee, JoonHo, et autres
Publié: (2024)
From Language Modeling to Instruction Following: Understanding the Behavior Shift in LLMs after Instruction Tuning
par: Wu, Xuansheng, et autres
Publié: (2023)
par: Wu, Xuansheng, et autres
Publié: (2023)
Instruction Mining: Instruction Data Selection for Tuning Large Language Models
par: Cao, Yihan, et autres
Publié: (2023)
par: Cao, Yihan, et autres
Publié: (2023)
Incentivizing Reasoning for Advanced Instruction-Following of Large Language Models
par: Qin, Yulei, et autres
Publié: (2025)
par: Qin, Yulei, et autres
Publié: (2025)
SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models
par: Cheng, Jiale, et autres
Publié: (2024)
par: Cheng, Jiale, et autres
Publié: (2024)
HiDe-LLaVA: Hierarchical Decoupling for Continual Instruction Tuning of Multimodal Large Language Model
par: Guo, Haiyang, et autres
Publié: (2025)
par: Guo, Haiyang, et autres
Publié: (2025)
Non-instructional Fine-tuning: Enabling Instruction-Following Capabilities in Pre-trained Language Models without Instruction-Following Data
par: Xie, Juncheng, et autres
Publié: (2024)
par: Xie, Juncheng, et autres
Publié: (2024)
SAIF: A Sparse Autoencoder Framework for Interpreting and Steering Instruction Following of Language Models
par: He, Zirui, et autres
Publié: (2025)
par: He, Zirui, et autres
Publié: (2025)
Shuttle Between the Instructions and the Parameters of Large Language Models
par: Sun, Wangtao, et autres
Publié: (2025)
par: Sun, Wangtao, et autres
Publié: (2025)
Unveiling Instruction-Specific Neurons & Experts: An Analytical Framework for LLM's Instruction-Following Capabilities
par: Zhang, Junyan, et autres
Publié: (2025)
par: Zhang, Junyan, et autres
Publié: (2025)
OmniJARVIS: Unified Vision-Language-Action Tokenization Enables Open-World Instruction Following Agents
par: Wang, Zihao, et autres
Publié: (2024)
par: Wang, Zihao, et autres
Publié: (2024)
Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
par: Zhang, Kongcheng, et autres
Publié: (2025)
par: Zhang, Kongcheng, et autres
Publié: (2025)
M3HF: Multi-agent Reinforcement Learning from Multi-phase Human Feedback of Mixed Quality
par: Wang, Ziyan, et autres
Publié: (2025)
par: Wang, Ziyan, et autres
Publié: (2025)
All Language Models Large and Small
par: Chen, Zhixun, et autres
Publié: (2024)
par: Chen, Zhixun, et autres
Publié: (2024)
VAM: Verbalized Action Masking for Controllable Exploration in RL Post-Training -- A Chess Case Study
par: Zhang, Zhicheng, et autres
Publié: (2026)
par: Zhang, Zhicheng, et autres
Publié: (2026)
Is In-Context Learning Sufficient for Instruction Following in LLMs?
par: Zhao, Hao, et autres
Publié: (2024)
par: Zhao, Hao, et autres
Publié: (2024)
Infer Human's Intentions Before Following Natural Language Instructions
par: Wan, Yanming, et autres
Publié: (2024)
par: Wan, Yanming, et autres
Publié: (2024)
SPRINT: Scalable Policy Pre-Training via Language Instruction Relabeling
par: Zhang, Jesse, et autres
Publié: (2023)
par: Zhang, Jesse, et autres
Publié: (2023)
LGR2: Language Guided Reward Relabeling for Accelerating Hierarchical Reinforcement Learning
par: Singh, Utsav, et autres
Publié: (2024)
par: Singh, Utsav, et autres
Publié: (2024)
Enhancing Event Reasoning in Large Language Models through Instruction Fine-Tuning with Semantic Causal Graphs
par: Bethany, Mazal, et autres
Publié: (2024)
par: Bethany, Mazal, et autres
Publié: (2024)
Enhancing and Assessing Instruction-Following with Fine-Grained Instruction Variants
par: Yang, Jiuding, et autres
Publié: (2024)
par: Yang, Jiuding, et autres
Publié: (2024)
Toward General Instruction-Following Alignment for Retrieval-Augmented Generation
par: Dong, Guanting, et autres
Publié: (2024)
par: Dong, Guanting, et autres
Publié: (2024)
DiJiang: Efficient Large Language Models through Compact Kernelization
par: Chen, Hanting, et autres
Publié: (2024)
par: Chen, Hanting, et autres
Publié: (2024)
Optimizing Cross-Client Domain Coverage for Federated Instruction Tuning of Large Language Models
par: Wang, Zezhou, et autres
Publié: (2024)
par: Wang, Zezhou, et autres
Publié: (2024)
FollowIR: Evaluating and Teaching Information Retrieval Models to Follow Instructions
par: Weller, Orion, et autres
Publié: (2024)
par: Weller, Orion, et autres
Publié: (2024)
Who is In Charge? Dissecting Role Conflicts in Instruction Following
par: Zeng, Siqi
Publié: (2025)
par: Zeng, Siqi
Publié: (2025)
Mol-Instructions: A Large-Scale Biomolecular Instruction Dataset for Large Language Models
par: Fang, Yin, et autres
Publié: (2023)
par: Fang, Yin, et autres
Publié: (2023)
Natural Language Reinforcement Learning
par: Feng, Xidong, et autres
Publié: (2024)
par: Feng, Xidong, et autres
Publié: (2024)
Nevermind: Instruction Override and Moderation in Large Language Models
par: Kim, Edward
Publié: (2024)
par: Kim, Edward
Publié: (2024)
Layer by Layer: Uncovering Where Multi-Task Learning Happens in Instruction-Tuned Large Language Models
par: Zhao, Zheng, et autres
Publié: (2024)
par: Zhao, Zheng, et autres
Publié: (2024)
Documents similaires
-
Safe Multi-agent Reinforcement Learning with Natural Language Constraints
par: Wang, Ziyan, et autres
Publié: (2024) -
Safe Reinforcement Learning with Free-form Natural Language Constraints and Pre-Trained Language Models
par: Lou, Xingzhou, et autres
Publié: (2024) -
Evaluating Large Language Models at Evaluating Instruction Following
par: Zeng, Zhiyuan, et autres
Publié: (2023) -
Compositional Instruction Following with Language Models and Reinforcement Learning
par: Cohen, Vanya, et autres
Publié: (2025) -
Improving Instruction-Following in Language Models through Activation Steering
par: Stolfo, Alessandro, et autres
Publié: (2024)