Saved in:
| Main Authors: | Liu, Shunyu, Fang, Wenkai, Hu, Zetian, Zhang, Junjie, Zhou, Yang, Zhang, Kongcheng, Tu, Rongcheng, Lin, Ting-En, Huang, Fei, Song, Mingli, Li, Yongbin, Tao, Dacheng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2503.11701 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
by: Fang, Wenkai, et al.
Published: (2025)
by: Fang, Wenkai, et al.
Published: (2025)
Reasoning with Reinforced Functional Token Tuning
by: Zhang, Kongcheng, et al.
Published: (2025)
by: Zhang, Kongcheng, et al.
Published: (2025)
STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning
by: Zhang, Junjie, et al.
Published: (2026)
by: Zhang, Junjie, et al.
Published: (2026)
Supervised Optimism Correction: Be Confident When LLMs Are Sure
by: Zhang, Junjie, et al.
Published: (2025)
by: Zhang, Junjie, et al.
Published: (2025)
Odyssey: Empowering Minecraft Agents with Open-World Skills
by: Liu, Shunyu, et al.
Published: (2024)
by: Liu, Shunyu, et al.
Published: (2024)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
by: Zhang, Kongcheng, et al.
Published: (2025)
by: Zhang, Kongcheng, et al.
Published: (2025)
A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models
by: Zhang, Junjie, et al.
Published: (2025)
by: Zhang, Junjie, et al.
Published: (2025)
Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
by: Zhang, Kongcheng, et al.
Published: (2025)
by: Zhang, Kongcheng, et al.
Published: (2025)
Reverse Preference Optimization for Complex Instruction Following
by: Huang, Xiang, et al.
Published: (2025)
by: Huang, Xiang, et al.
Published: (2025)
Lightning Fast Caching-based Parallel Denoising Prediction for Accelerating Talking Head Generation
by: Long, Jianzhi, et al.
Published: (2025)
by: Long, Jianzhi, et al.
Published: (2025)
A Survey on Self-Evolution of Large Language Models
by: Tao, Zhengwei, et al.
Published: (2024)
by: Tao, Zhengwei, et al.
Published: (2024)
A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models
by: Shuai, Xincheng, et al.
Published: (2024)
by: Shuai, Xincheng, et al.
Published: (2024)
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
by: Zhou, Yang, et al.
Published: (2025)
by: Zhou, Yang, et al.
Published: (2025)
Improving Factual Consistency of News Summarization by Contrastive Preference Optimization
by: Feng, Huawen, et al.
Published: (2023)
by: Feng, Huawen, et al.
Published: (2023)
Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?
by: Sun, Zetian, et al.
Published: (2025)
by: Sun, Zetian, et al.
Published: (2025)
T2V-OptJail: Discrete Prompt Optimization for Text-to-Video Jailbreak Attacks
by: Liu, Jiayang, et al.
Published: (2025)
by: Liu, Jiayang, et al.
Published: (2025)
T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models
by: Liang, Siyuan, et al.
Published: (2025)
by: Liang, Siyuan, et al.
Published: (2025)
Tree of Preferences for Diversified Recommendation
by: Yuan, Hanyang, et al.
Published: (2025)
by: Yuan, Hanyang, et al.
Published: (2025)
A Survey on Explainable Reinforcement Learning: Concepts, Algorithms, Challenges
by: Qing, Yunpeng, et al.
Published: (2022)
by: Qing, Yunpeng, et al.
Published: (2022)
Preference Ranking Optimization for Human Alignment
by: Song, Feifan, et al.
Published: (2023)
by: Song, Feifan, et al.
Published: (2023)
IOPO: Empowering LLMs with Complex Instruction Following via Input-Output Preference Optimization
by: Zhang, Xinghua, et al.
Published: (2024)
by: Zhang, Xinghua, et al.
Published: (2024)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
by: Zhang, Jingyi, et al.
Published: (2025)
by: Zhang, Jingyi, et al.
Published: (2025)
SDPO: Segment-Level Direct Preference Optimization for Social Agents
by: Kong, Aobo, et al.
Published: (2025)
by: Kong, Aobo, et al.
Published: (2025)
GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering
by: Shuai, Xincheng, et al.
Published: (2026)
by: Shuai, Xincheng, et al.
Published: (2026)
A Survey on Agentic Multimodal Large Language Models
by: Yao, Huanjin, et al.
Published: (2025)
by: Yao, Huanjin, et al.
Published: (2025)
Bi-level Mean Field: Dynamic Grouping for Large-Scale MARL
by: Zheng, Yuxuan, et al.
Published: (2025)
by: Zheng, Yuxuan, et al.
Published: (2025)
Topology-aware Generalization of Decentralized SGD
by: Zhu, Tongtian, et al.
Published: (2022)
by: Zhu, Tongtian, et al.
Published: (2022)
Advances in photosynthesis research: Unlocking the potential for food security, renewable energy, and environmental sustainability
by: Wenqiang Yang, et al.
Published: (2025)
by: Wenqiang Yang, et al.
Published: (2025)
Intra-Trajectory Consistency for Reward Modeling
by: Zhou, Chaoyang, et al.
Published: (2025)
by: Zhou, Chaoyang, et al.
Published: (2025)
Event-based Simultaneous Localization and Mapping: A Comprehensive Survey
by: Huang, Kunping, et al.
Published: (2023)
by: Huang, Kunping, et al.
Published: (2023)
Temporal Prototype-Aware Learning for Active Voltage Control on Power Distribution Networks
by: Xu, Feiyang, et al.
Published: (2024)
by: Xu, Feiyang, et al.
Published: (2024)
A2PO: Towards Effective Offline Reinforcement Learning from an Advantage-aware Perspective
by: Qing, Yunpeng, et al.
Published: (2024)
by: Qing, Yunpeng, et al.
Published: (2024)
Learning a Mini-batch Graph Transformer via Two-stage Interaction Augmentation
by: Li, Wenda, et al.
Published: (2024)
by: Li, Wenda, et al.
Published: (2024)
Unveiling Global Interactive Patterns across Graphs: Towards Interpretable Graph Neural Networks
by: Wang, Yuwen, et al.
Published: (2024)
by: Wang, Yuwen, et al.
Published: (2024)
COLA: Cross-city Mobility Transformer for Human Trajectory Simulation
by: Wang, Yu, et al.
Published: (2024)
by: Wang, Yu, et al.
Published: (2024)
Parallelized Planning-Acting for Efficient LLM-based Multi-Agent Systems in Minecraft
by: Li, Yaoru, et al.
Published: (2025)
by: Li, Yaoru, et al.
Published: (2025)
Reinforced Model Merging
by: Han, Jiaqi, et al.
Published: (2025)
by: Han, Jiaqi, et al.
Published: (2025)
Experience is the Best Teacher: Motivating Effective Exploration in Reinforcement Learning for LLMs
by: Zhang, Wenjian, et al.
Published: (2026)
by: Zhang, Wenjian, et al.
Published: (2026)
Diffusion Model-Based Video Editing: A Survey
by: Sun, Wenhao, et al.
Published: (2024)
by: Sun, Wenhao, et al.
Published: (2024)
Interaction Pattern Disentangling for Multi-Agent Reinforcement Learning
by: Liu, Shunyu, et al.
Published: (2022)
by: Liu, Shunyu, et al.
Published: (2022)
Similar Items
-
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
by: Fang, Wenkai, et al.
Published: (2025) -
Reasoning with Reinforced Functional Token Tuning
by: Zhang, Kongcheng, et al.
Published: (2025) -
STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning
by: Zhang, Junjie, et al.
Published: (2026) -
Supervised Optimism Correction: Be Confident When LLMs Are Sure
by: Zhang, Junjie, et al.
Published: (2025) -
Odyssey: Empowering Minecraft Agents with Open-World Skills
by: Liu, Shunyu, et al.
Published: (2024)