Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yinjie, Yang, Ling, Li, Bowen, Tian, Ye, Shen, Ke, Wang, Mengdi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning
di: Wang, Yinjie, et al.
Pubblicazione: (2025)
di: Wang, Yinjie, et al.
Pubblicazione: (2025)
RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System
di: Wang, Yinjie, et al.
Pubblicazione: (2026)
di: Wang, Yinjie, et al.
Pubblicazione: (2026)
MMaDA: Multimodal Large Diffusion Language Models
di: Yang, Ling, et al.
Pubblicazione: (2025)
di: Yang, Ling, et al.
Pubblicazione: (2025)
ScoreFlow: Mastering LLM Agent Workflows via Score-based Preference Optimization
di: Wang, Yinjie, et al.
Pubblicazione: (2025)
di: Wang, Yinjie, et al.
Pubblicazione: (2025)
GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment Simulators
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
OpenClaw-RL: Train Any Agent Simply by Talking
di: Wang, Yinjie, et al.
Pubblicazione: (2026)
di: Wang, Yinjie, et al.
Pubblicazione: (2026)
Demystifying Reinforcement Learning in Agentic Reasoning
di: Yu, Zhaochen, et al.
Pubblicazione: (2025)
di: Yu, Zhaochen, et al.
Pubblicazione: (2025)
ReTok: Replacing Tokenizer to Enhance Representation Efficiency in Large Language Model
di: Gu, Shuhao, et al.
Pubblicazione: (2024)
di: Gu, Shuhao, et al.
Pubblicazione: (2024)
Off-Policy Value-Based Reinforcement Learning for Large Language Models
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2026)
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2026)
MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation
di: Tian, Ye, et al.
Pubblicazione: (2025)
di: Tian, Ye, et al.
Pubblicazione: (2025)
Quantifying Uncertainty in Natural Language Explanations of Large Language Models for Question Answering
di: Li, Yangyi, et al.
Pubblicazione: (2025)
di: Li, Yangyi, et al.
Pubblicazione: (2025)
Understanding the Repeat Curse in Large Language Models from a Feature Perspective
di: Yao, Junchi, et al.
Pubblicazione: (2025)
di: Yao, Junchi, et al.
Pubblicazione: (2025)
WenyanGPT: A Large Language Model for Classical Chinese Tasks
di: Yao, Xinyu, et al.
Pubblicazione: (2025)
di: Yao, Xinyu, et al.
Pubblicazione: (2025)
Prejudge-Before-Think: Enhancing Large Language Models at Test-Time by Process Prejudge Reasoning
di: Wang, Jianing, et al.
Pubblicazione: (2025)
di: Wang, Jianing, et al.
Pubblicazione: (2025)
ReasonFlux-PRM: Trajectory-Aware PRMs for Long Chain-of-Thought Reasoning in LLMs
di: Zou, Jiaru, et al.
Pubblicazione: (2025)
di: Zou, Jiaru, et al.
Pubblicazione: (2025)
DARE: Diffusion Large Language Models Alignment and Reinforcement Executor
di: Yang, Jingyi, et al.
Pubblicazione: (2026)
di: Yang, Jingyi, et al.
Pubblicazione: (2026)
Reinforcing the Diffusion Chain of Lateral Thought with Diffusion Language Models
di: Huang, Zemin, et al.
Pubblicazione: (2025)
di: Huang, Zemin, et al.
Pubblicazione: (2025)
KBQA-R1: Reinforcing Large Language Models for Knowledge Base Question Answering
di: Sun, Xin, et al.
Pubblicazione: (2025)
di: Sun, Xin, et al.
Pubblicazione: (2025)
Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding
di: Sun, Bowen, et al.
Pubblicazione: (2025)
di: Sun, Bowen, et al.
Pubblicazione: (2025)
Improving Sample Efficiency of Reinforcement Learning with Background Knowledge from Large Language Models
di: Zhang, Fuxiang, et al.
Pubblicazione: (2024)
di: Zhang, Fuxiang, et al.
Pubblicazione: (2024)
Adaptive Reinforcement Learning Planning: Harnessing Large Language Models for Complex Information Extraction
di: Ding, Zepeng, et al.
Pubblicazione: (2024)
di: Ding, Zepeng, et al.
Pubblicazione: (2024)
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data?
di: Qi, Xuan, et al.
Pubblicazione: (2025)
di: Qi, Xuan, et al.
Pubblicazione: (2025)
Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models
di: Zhang, Gongbo, et al.
Pubblicazione: (2026)
di: Zhang, Gongbo, et al.
Pubblicazione: (2026)
Emergent Symbolic Mechanisms Support Abstract Reasoning in Large Language Models
di: Yang, Yukang, et al.
Pubblicazione: (2025)
di: Yang, Yukang, et al.
Pubblicazione: (2025)
Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models
di: Xu, Xin, et al.
Pubblicazione: (2026)
di: Xu, Xin, et al.
Pubblicazione: (2026)
In-Memory Learning: A Declarative Learning Framework for Large Language Models
di: Wang, Bo, et al.
Pubblicazione: (2024)
di: Wang, Bo, et al.
Pubblicazione: (2024)
DiffER: Diffusion Entity-Relation Modeling for Reversal Curse in Diffusion Large Language Models
di: He, Shaokai, et al.
Pubblicazione: (2026)
di: He, Shaokai, et al.
Pubblicazione: (2026)
Safely Learning with Private Data: A Federated Learning Framework for Large Language Model
di: Zheng, JiaYing, et al.
Pubblicazione: (2024)
di: Zheng, JiaYing, et al.
Pubblicazione: (2024)
Prompt engineering does not universally improve Large Language Model performance across clinical decision-making tasks
di: Chai, Mengdi, et al.
Pubblicazione: (2025)
di: Chai, Mengdi, et al.
Pubblicazione: (2025)
Rec-R1: Bridging Generative Large Language Models and User-Centric Recommendation Systems via Reinforcement Learning
di: Lin, Jiacheng, et al.
Pubblicazione: (2025)
di: Lin, Jiacheng, et al.
Pubblicazione: (2025)
Visual In-Context Learning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
Can Large Language Models Identify Implicit Suicidal Ideation? An Empirical Evaluation
di: Li, Tong, et al.
Pubblicazione: (2025)
di: Li, Tong, et al.
Pubblicazione: (2025)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
di: Wang, Yiping, et al.
Pubblicazione: (2025)
di: Wang, Yiping, et al.
Pubblicazione: (2025)
Interleaved Reasoning for Large Language Models via Reinforcement Learning
di: Xie, Roy, et al.
Pubblicazione: (2025)
di: Xie, Roy, et al.
Pubblicazione: (2025)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
AR-MAP: Are Autoregressive Large Language Models Implicit Teachers for Diffusion Large Language Models?
di: Lin, Liang, et al.
Pubblicazione: (2026)
di: Lin, Liang, et al.
Pubblicazione: (2026)
Iterative Forward Tuning Boosts In-Context Learning in Language Models
di: Yang, Jiaxi, et al.
Pubblicazione: (2023)
di: Yang, Jiaxi, et al.
Pubblicazione: (2023)
SEM: Reinforcement Learning for Search-Efficient Large Language Models
di: Sha, Zeyang, et al.
Pubblicazione: (2025)
di: Sha, Zeyang, et al.
Pubblicazione: (2025)
Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle
di: Liu, Keliang, et al.
Pubblicazione: (2025)
di: Liu, Keliang, et al.
Pubblicazione: (2025)
InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language Models
di: Yan, Yuchen, et al.
Pubblicazione: (2025)
di: Yan, Yuchen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning
di: Wang, Yinjie, et al.
Pubblicazione: (2025) -
RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System
di: Wang, Yinjie, et al.
Pubblicazione: (2026) -
MMaDA: Multimodal Large Diffusion Language Models
di: Yang, Ling, et al.
Pubblicazione: (2025) -
ScoreFlow: Mastering LLM Agent Workflows via Score-based Preference Optimization
di: Wang, Yinjie, et al.
Pubblicazione: (2025) -
GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment Simulators
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)