LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Shipeng, Yang, Zhiqin, Li, Shikun, Xia, Xiaobo, Liu, Hengyu, Zhang, Xinghua, Chen, Gaode, Fang, Dong, Tai, Ying, Peng, Zhe |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
Transferring Annotator- and Instance-dependent Transition Matrix for Learning from Crowds
di: Li, Shikun, et al.
Pubblicazione: (2023)
di: Li, Shikun, et al.
Pubblicazione: (2023)
Prior-Informed Zeroth-Order Optimization with Adaptive Direction Alignment for Memory-Efficient LLM Fine-Tuning
di: Jin, Feihu, et al.
Pubblicazione: (2026)
di: Jin, Feihu, et al.
Pubblicazione: (2026)
Pairwise Alignment Improves Graph Domain Adaptation
di: Liu, Shikun, et al.
Pubblicazione: (2024)
di: Liu, Shikun, et al.
Pubblicazione: (2024)
Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
di: Kong, Deyang, et al.
Pubblicazione: (2025)
di: Kong, Deyang, et al.
Pubblicazione: (2025)
Rethinking Inverse Reinforcement Learning: from Data Alignment to Task Alignment
di: Zhou, Weichao, et al.
Pubblicazione: (2024)
di: Zhou, Weichao, et al.
Pubblicazione: (2024)
Data Selection for LLM Alignment Using Fine-Grained Preferences
di: Zhang, Jia, et al.
Pubblicazione: (2025)
di: Zhang, Jia, et al.
Pubblicazione: (2025)
Learning to Align, Aligning to Learn: A Unified Approach for Self-Optimized Alignment
di: Wang, Haowen, et al.
Pubblicazione: (2025)
di: Wang, Haowen, et al.
Pubblicazione: (2025)
Data Selection for Multi-turn Dialogue Instruction Tuning
di: Li, Bo, et al.
Pubblicazione: (2026)
di: Li, Bo, et al.
Pubblicazione: (2026)
Structural Alignment Improves Graph Test-Time Adaptation
di: Hsu, Hans Hao-Hsun, et al.
Pubblicazione: (2025)
di: Hsu, Hans Hao-Hsun, et al.
Pubblicazione: (2025)
Aligning Data Selection with Performance: Performance-driven Reinforcement Learning for Active Learning in Object Detection
di: Liang, Zhixuan, et al.
Pubblicazione: (2023)
di: Liang, Zhixuan, et al.
Pubblicazione: (2023)
Towards Data-efficient Customer Intent Recognition with Prompt-based Learning Paradigm
di: Luo, Hengyu, et al.
Pubblicazione: (2023)
di: Luo, Hengyu, et al.
Pubblicazione: (2023)
Euclidean Distance Matrix Completion via Asymmetric Projected Gradient Descent
di: Li, Yicheng, et al.
Pubblicazione: (2025)
di: Li, Yicheng, et al.
Pubblicazione: (2025)
Beyond Algorithm Evolution: An LLM-Driven Framework for the Co-Evolution of Swarm Intelligence Optimization Algorithms and Prompts
di: Cen, Shipeng, et al.
Pubblicazione: (2025)
di: Cen, Shipeng, et al.
Pubblicazione: (2025)
Towards Comprehensible Recommendation with Large Language Model Fine-tuning
di: Luo, Yunze, et al.
Pubblicazione: (2025)
di: Luo, Yunze, et al.
Pubblicazione: (2025)
Learning More by Seeing Less: Structure First Learning for Efficient, Transferable, and Human-Aligned Vision
di: Li, Tianqin, et al.
Pubblicazione: (2025)
di: Li, Tianqin, et al.
Pubblicazione: (2025)
Clean First, Align Later: Benchmarking Preference Data Cleaning for Reliable LLM Alignment
di: Yeh, Samuel, et al.
Pubblicazione: (2025)
di: Yeh, Samuel, et al.
Pubblicazione: (2025)
Flatness and Gradient Alignment Are Both Necessary: Spectral-Aware Gradient-Aligned Exploration for Multi-Distribution Learning
di: Ballas, Aristotelis, et al.
Pubblicazione: (2026)
di: Ballas, Aristotelis, et al.
Pubblicazione: (2026)
Sensor Network Localization via Riemannian Conjugate Gradient and Rank Reduction: An Extended Version
di: Li, Yicheng, et al.
Pubblicazione: (2024)
di: Li, Yicheng, et al.
Pubblicazione: (2024)
Instruction Data Selection via Answer Divergence
di: Li, Bo, et al.
Pubblicazione: (2026)
di: Li, Bo, et al.
Pubblicazione: (2026)
AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning
di: Zhang, Yi, et al.
Pubblicazione: (2025)
di: Zhang, Yi, et al.
Pubblicazione: (2025)
Back-stepping Experience Replay with Application to Model-free Reinforcement Learning for a Soft Snake Robot
di: Qi, Xinda, et al.
Pubblicazione: (2024)
di: Qi, Xinda, et al.
Pubblicazione: (2024)
Less is More: Improving LLM Alignment via Preference Data Selection
di: Deng, Xun, et al.
Pubblicazione: (2025)
di: Deng, Xun, et al.
Pubblicazione: (2025)
Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM
di: Duong, Thang, et al.
Pubblicazione: (2025)
di: Duong, Thang, et al.
Pubblicazione: (2025)
Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates
di: Li, Yibo, et al.
Pubblicazione: (2026)
di: Li, Yibo, et al.
Pubblicazione: (2026)
Getting More Juice Out of the SFT Data: Reward Learning from Human Demonstration Improves SFT for LLM Alignment
di: Li, Jiaxiang, et al.
Pubblicazione: (2024)
di: Li, Jiaxiang, et al.
Pubblicazione: (2024)
Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment
di: Neekhara, Paarth, et al.
Pubblicazione: (2024)
di: Neekhara, Paarth, et al.
Pubblicazione: (2024)
History Rhymes: Accelerating LLM Reinforcement Learning with RhymeRL
di: He, Jingkai, et al.
Pubblicazione: (2025)
di: He, Jingkai, et al.
Pubblicazione: (2025)
LLM-Enhanced Reinforcement Learning for Long-Term User Satisfaction in Interactive Recommendation
di: Xia, Chongjun, et al.
Pubblicazione: (2026)
di: Xia, Chongjun, et al.
Pubblicazione: (2026)
Gradient-Based Data Valuation Improves Curriculum Learning for Game-Theoretic Motion Planning
di: Li, Shihao, et al.
Pubblicazione: (2026)
di: Li, Shihao, et al.
Pubblicazione: (2026)
FLAG-Trader: Fusion LLM-Agent with Gradient-based Reinforcement Learning for Financial Trading
di: Xiong, Guojun, et al.
Pubblicazione: (2025)
di: Xiong, Guojun, et al.
Pubblicazione: (2025)
AlignSAM: Aligning Segment Anything Model to Open Context via Reinforcement Learning
di: Huang, Duojun, et al.
Pubblicazione: (2024)
di: Huang, Duojun, et al.
Pubblicazione: (2024)
GAPSL: A Gradient-Aligned Parallel Split Learning on Heterogeneous Data
di: Lin, Zheng, et al.
Pubblicazione: (2026)
di: Lin, Zheng, et al.
Pubblicazione: (2026)
Learn More, Forget Less: A Gradient-Aware Data Selection Approach for LLM
di: Liu, Yibai, et al.
Pubblicazione: (2025)
di: Liu, Yibai, et al.
Pubblicazione: (2025)
SaRO: Enhancing LLM Safety through Reasoning-based Alignment
di: Mou, Yutao, et al.
Pubblicazione: (2025)
di: Mou, Yutao, et al.
Pubblicazione: (2025)
DiSA-IQL: Offline Reinforcement Learning for Robust Soft Robot Control under Distribution Shifts
di: He, Linjin, et al.
Pubblicazione: (2025)
di: He, Linjin, et al.
Pubblicazione: (2025)
Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment
di: Yang, Zhiqin, et al.
Pubblicazione: (2026)
di: Yang, Zhiqin, et al.
Pubblicazione: (2026)
Target-Aligned Reinforcement Learning
di: Pleiss, Leonard S., et al.
Pubblicazione: (2026)
di: Pleiss, Leonard S., et al.
Pubblicazione: (2026)
Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning
di: Liang, Zhenwen, et al.
Pubblicazione: (2025)
di: Liang, Zhenwen, et al.
Pubblicazione: (2025)
Agent Q-Mix: Selecting the Right Action for LLM Multi-Agent Systems through Reinforcement Learning
di: Jiang, Eric Hanchen, et al.
Pubblicazione: (2026)
di: Jiang, Eric Hanchen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning
di: Yang, Ningyuan, et al.
Pubblicazione: (2026) -
Transferring Annotator- and Instance-dependent Transition Matrix for Learning from Crowds
di: Li, Shikun, et al.
Pubblicazione: (2023) -
Prior-Informed Zeroth-Order Optimization with Adaptive Direction Alignment for Memory-Efficient LLM Fine-Tuning
di: Jin, Feihu, et al.
Pubblicazione: (2026) -
Pairwise Alignment Improves Graph Domain Adaptation
di: Liu, Shikun, et al.
Pubblicazione: (2024) -
Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
di: Kong, Deyang, et al.
Pubblicazione: (2025)