Efficient and Stable Reinforcement Learning for Diffusion Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Jiawei, Wang, Xiting, Zhong, Yuanyuan, Lian, Defu, Yang, Yu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Efficient Machine Unlearning via Influence Approximation
von: Liu, Jiawei, et al.
Veröffentlicht: (2025)
von: Liu, Jiawei, et al.
Veröffentlicht: (2025)
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
von: Jin, Haoran, et al.
Veröffentlicht: (2025)
von: Jin, Haoran, et al.
Veröffentlicht: (2025)
Stabilizing Reinforcement Learning for Diffusion Language Models
von: Zhong, Jianyuan, et al.
Veröffentlicht: (2026)
von: Zhong, Jianyuan, et al.
Veröffentlicht: (2026)
Refine Large Language Model Fine-tuning via Instruction Vector
von: Jiang, Gangwei, et al.
Veröffentlicht: (2024)
von: Jiang, Gangwei, et al.
Veröffentlicht: (2024)
EquivPruner: Boosting Efficiency and Quality in LLM-Based Search via Action Pruning
von: Liu, Jiawei, et al.
Veröffentlicht: (2025)
von: Liu, Jiawei, et al.
Veröffentlicht: (2025)
Model Specific Task Similarity for Vision Language Model Selection via Layer Conductance
von: Yang, Wei, et al.
Veröffentlicht: (2026)
von: Yang, Wei, et al.
Veröffentlicht: (2026)
RecExplainer: Aligning Large Language Models for Explaining Recommendation Models
von: Lei, Yuxuan, et al.
Veröffentlicht: (2023)
von: Lei, Yuxuan, et al.
Veröffentlicht: (2023)
Rethinking Reinforcement fine-tuning of LLMs: A Multi-armed Bandit Learning Perspective
von: Hu, Xiao, et al.
Veröffentlicht: (2026)
von: Hu, Xiao, et al.
Veröffentlicht: (2026)
Enhancing Safety of Large Language Models via Embedding Space Separation
von: Zhao, Xu, et al.
Veröffentlicht: (2026)
von: Zhao, Xu, et al.
Veröffentlicht: (2026)
Analytical and Empirical Study of Herding Effects in Recommendation Systems
von: Xie, Hong, et al.
Veröffentlicht: (2024)
von: Xie, Hong, et al.
Veröffentlicht: (2024)
Evaluating Readability and Faithfulness of Concept-based Explanations
von: Li, Meng, et al.
Veröffentlicht: (2024)
von: Li, Meng, et al.
Veröffentlicht: (2024)
Recommender AI Agent: Integrating Large Language Models for Interactive Recommendations
von: Huang, Xu, et al.
Veröffentlicht: (2023)
von: Huang, Xu, et al.
Veröffentlicht: (2023)
Stable Reinforcement Learning for Efficient Reasoning
von: Dai, Muzhi, et al.
Veröffentlicht: (2025)
von: Dai, Muzhi, et al.
Veröffentlicht: (2025)
Understanding Privacy Risks of Embeddings Induced by Large Language Models
von: Zhu, Zhihao, et al.
Veröffentlicht: (2024)
von: Zhu, Zhihao, et al.
Veröffentlicht: (2024)
Guiding Diffusion Models with Reinforcement Learning for Stable Molecule Generation
von: Zhou, Zhijian, et al.
Veröffentlicht: (2025)
von: Zhou, Zhijian, et al.
Veröffentlicht: (2025)
NoiseDiffusion: Correcting Noise for Image Interpolation with Diffusion Models beyond Spherical Linear Interpolation
von: Zheng, PengFei, et al.
Veröffentlicht: (2024)
von: Zheng, PengFei, et al.
Veröffentlicht: (2024)
CPGD: Toward Stable Rule-based Reinforcement Learning for Language Models
von: Liu, Zongkai, et al.
Veröffentlicht: (2025)
von: Liu, Zongkai, et al.
Veröffentlicht: (2025)
Securing Recommender System via Cooperative Training
von: Wang, Qingyang, et al.
Veröffentlicht: (2024)
von: Wang, Qingyang, et al.
Veröffentlicht: (2024)
Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models
von: Liang, Shuang, et al.
Veröffentlicht: (2025)
von: Liang, Shuang, et al.
Veröffentlicht: (2025)
Denoising Pre-Training and Customized Prompt Learning for Efficient Multi-Behavior Sequential Recommendation
von: Wang, Hao, et al.
Veröffentlicht: (2024)
von: Wang, Hao, et al.
Veröffentlicht: (2024)
UniMEL: A Unified Framework for Multimodal Entity Linking with Large Language Models
von: Qi, Liu, et al.
Veröffentlicht: (2024)
von: Qi, Liu, et al.
Veröffentlicht: (2024)
ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning
von: Liu, Zeyuan, et al.
Veröffentlicht: (2025)
von: Liu, Zeyuan, et al.
Veröffentlicht: (2025)
Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning
von: Shan, Lianlei, et al.
Veröffentlicht: (2026)
von: Shan, Lianlei, et al.
Veröffentlicht: (2026)
CoVSpec: Efficient Device-Edge Co-Inference for Vision-Language Models via Speculative Decoding
von: Jia, Yuanyuan, et al.
Veröffentlicht: (2026)
von: Jia, Yuanyuan, et al.
Veröffentlicht: (2026)
WaferSAGE: Large Language Model-Powered Wafer Defect Analysis via Synthetic Data Generation and Rubric-Guided Reinforcement Learning
von: Xu, Ke, et al.
Veröffentlicht: (2026)
von: Xu, Ke, et al.
Veröffentlicht: (2026)
GHPO: Adaptive Guidance for Stable and Efficient LLM Reinforcement Learning
von: Liu, Ziru, et al.
Veröffentlicht: (2025)
von: Liu, Ziru, et al.
Veröffentlicht: (2025)
Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models
von: Luo, Siqi, et al.
Veröffentlicht: (2026)
von: Luo, Siqi, et al.
Veröffentlicht: (2026)
TimeDiT: General-purpose Diffusion Transformers for Time Series Foundation Model
von: Cao, Defu, et al.
Veröffentlicht: (2024)
von: Cao, Defu, et al.
Veröffentlicht: (2024)
Diffusion Models for Reinforcement Learning: A Survey
von: Zhu, Zhengbang, et al.
Veröffentlicht: (2023)
von: Zhu, Zhengbang, et al.
Veröffentlicht: (2023)
SEM: Reinforcement Learning for Search-Efficient Large Language Models
von: Sha, Zeyang, et al.
Veröffentlicht: (2025)
von: Sha, Zeyang, et al.
Veröffentlicht: (2025)
DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing
von: Cao, Qian, et al.
Veröffentlicht: (2026)
von: Cao, Qian, et al.
Veröffentlicht: (2026)
SLearnLLM: A Self-Learning Framework for Efficient Domain-Specific Adaptation of Large Language Models
von: Liu, Xiang, et al.
Veröffentlicht: (2025)
von: Liu, Xiang, et al.
Veröffentlicht: (2025)
Demystifying Design Choices of Reinforcement Fine-tuning: A Batched Contextual Bandit Learning Perspective
von: Xie, Hong, et al.
Veröffentlicht: (2026)
von: Xie, Hong, et al.
Veröffentlicht: (2026)
Foundation Models for Demand Forecasting via Dual-Strategy Ensembling
von: Yang, Wei, et al.
Veröffentlicht: (2025)
von: Yang, Wei, et al.
Veröffentlicht: (2025)
EnECG: Efficient Ensemble Learning for Electrocardiogram Multi-task Foundation Model
von: Xu, Yuhao, et al.
Veröffentlicht: (2025)
von: Xu, Yuhao, et al.
Veröffentlicht: (2025)
Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning
von: Yang, Dongchao, et al.
Veröffentlicht: (2025)
von: Yang, Dongchao, et al.
Veröffentlicht: (2025)
Robust and Efficient Communication in Multi-Agent Reinforcement Learning
von: Liu, Zejiao, et al.
Veröffentlicht: (2025)
von: Liu, Zejiao, et al.
Veröffentlicht: (2025)
Multi-agent Multi-armed Bandits with Stochastic Sharable Arm Capacities
von: Xie, Hong, et al.
Veröffentlicht: (2024)
von: Xie, Hong, et al.
Veröffentlicht: (2024)
Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
von: Sun, Yan, et al.
Veröffentlicht: (2025)
von: Sun, Yan, et al.
Veröffentlicht: (2025)
Prototypical Reward Network for Data-Efficient RLHF
von: Zhang, Jinghan, et al.
Veröffentlicht: (2024)
von: Zhang, Jinghan, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Efficient Machine Unlearning via Influence Approximation
von: Liu, Jiawei, et al.
Veröffentlicht: (2025) -
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
von: Jin, Haoran, et al.
Veröffentlicht: (2025) -
Stabilizing Reinforcement Learning for Diffusion Language Models
von: Zhong, Jianyuan, et al.
Veröffentlicht: (2026) -
Refine Large Language Model Fine-tuning via Instruction Vector
von: Jiang, Gangwei, et al.
Veröffentlicht: (2024) -
EquivPruner: Boosting Efficiency and Quality in LLM-Based Search via Action Pruning
von: Liu, Jiawei, et al.
Veröffentlicht: (2025)