On Predictability of Reinforcement Learning Dynamics for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Cai, Yuchen, Cao, Ding, Xu, Xin, Yao, Zijun, Huang, Yuqing, Tan, Zhenyu, Zhang, Benyi, Sun, Guangzhong, Liu, Guiquan, Fang, Junfeng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
On the Superimposed Noise Accumulation Problem in Sequential Knowledge Editing of Large Language Models
by: Cao, Ding, et al.
Published: (2025)
by: Cao, Ding, et al.
Published: (2025)
Locating and Mitigating Gender Bias in Large Language Models
by: Cai, Yuchen, et al.
Published: (2024)
by: Cai, Yuchen, et al.
Published: (2024)
Editing Knowledge Representation of Language Model via Rephrased Prefix Prompts
by: Cai, Yuchen, et al.
Published: (2024)
by: Cai, Yuchen, et al.
Published: (2024)
O-Edit: Orthogonal Subspace Editing for Language Model Sequential Editing
by: Cai, Yuchen, et al.
Published: (2024)
by: Cai, Yuchen, et al.
Published: (2024)
T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
by: Hou, Zhenyu, et al.
Published: (2025)
by: Hou, Zhenyu, et al.
Published: (2025)
Untangle the KNOT: Interweaving Conflicting Knowledge and Reasoning Skills in Large Language Models
by: Liu, Yantao, et al.
Published: (2024)
by: Liu, Yantao, et al.
Published: (2024)
Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models
by: Bao, Yicheng, et al.
Published: (2026)
by: Bao, Yicheng, et al.
Published: (2026)
Evaluating Retrieval-Augmented Generation Strategies for Large Language Models in Travel Mode Choice Prediction
by: Xu, Yiming, et al.
Published: (2025)
by: Xu, Yiming, et al.
Published: (2025)
Effective, Platform-Independent GUI Testing via Image Embedding and Reinforcement Learning
by: Yu, Shengcheng, et al.
Published: (2022)
by: Yu, Shengcheng, et al.
Published: (2022)
AREAL-DTA: Dynamic Tree Attention for Efficient Reinforcement Learning of Large Language Models
by: Zhang, Jiarui, et al.
Published: (2026)
by: Zhang, Jiarui, et al.
Published: (2026)
AtomR: Atomic Operator-Empowered Large Language Models for Heterogeneous Knowledge Reasoning
by: Xin, Amy, et al.
Published: (2024)
by: Xin, Amy, et al.
Published: (2024)
Large Vision Model-Enhanced Digital Twin with Deep Reinforcement Learning for User Association and Load Balancing in Dynamic Wireless Networks
by: Tao, Zhenyu, et al.
Published: (2024)
by: Tao, Zhenyu, et al.
Published: (2024)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
by: Fang, Junfeng, et al.
Published: (2025)
by: Fang, Junfeng, et al.
Published: (2025)
An elementary derivation of 3-cycles for a quadratic map
by: Benyi, Arpad, et al.
Published: (2025)
by: Benyi, Arpad, et al.
Published: (2025)
Floor, ceiling and the space between
by: Bényi, Árpád, et al.
Published: (2025)
by: Bényi, Árpád, et al.
Published: (2025)
Partial degenerate Stirling numbers
by: Bényi, Beáta, et al.
Published: (2026)
by: Bényi, Beáta, et al.
Published: (2026)
Benchmarking and Defending Against Indirect Prompt Injection Attacks on Large Language Models
by: Yi, Jingwei, et al.
Published: (2023)
by: Yi, Jingwei, et al.
Published: (2023)
Teaching Large Language Models to Reason with Reinforcement Learning
by: Havrilla, Alex, et al.
Published: (2024)
by: Havrilla, Alex, et al.
Published: (2024)
Reinforced Lifelong Editing for Language Models
by: Li, Zherui, et al.
Published: (2025)
by: Li, Zherui, et al.
Published: (2025)
Scaling Reinforcement Learning for Content Moderation with Large Language Models
by: Firooz, Hamed, et al.
Published: (2025)
by: Firooz, Hamed, et al.
Published: (2025)
Stabilizing Reinforcement Learning for Diffusion Language Models
by: Zhong, Jianyuan, et al.
Published: (2026)
by: Zhong, Jianyuan, et al.
Published: (2026)
Vision Language Model-Empowered Contract Theory for AIGC Task Allocation in Teleoperation
by: Zhan, Zijun, et al.
Published: (2024)
by: Zhan, Zijun, et al.
Published: (2024)
Signal Watermark on Large Language Models
by: Xu, Zhenyu, et al.
Published: (2024)
by: Xu, Zhenyu, et al.
Published: (2024)
Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning
by: Wan, Xu, et al.
Published: (2026)
by: Wan, Xu, et al.
Published: (2026)
LLMAEL: Large Language Models are Good Context Augmenters for Entity Linking
by: Xin, Amy, et al.
Published: (2024)
by: Xin, Amy, et al.
Published: (2024)
Reasoning-Driven Retrosynthesis Prediction with Large Language Models via Reinforcement Learning
by: Zhang, Situo, et al.
Published: (2025)
by: Zhang, Situo, et al.
Published: (2025)
Active Zero: Self-Evolving Vision-Language Models through Active Environment Exploration
by: He, Jinghan, et al.
Published: (2026)
by: He, Jinghan, et al.
Published: (2026)
Nemobot Games: Crafting Strategic AI Gaming Agents for Interactive Learning with Large Language Models
by: Tan, Chee Wei, et al.
Published: (2026)
by: Tan, Chee Wei, et al.
Published: (2026)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
by: Sun, Jingwen, et al.
Published: (2026)
by: Sun, Jingwen, et al.
Published: (2026)
$B$-Stirling numbers associated to potential polynomials
by: Adell, José A., et al.
Published: (2024)
by: Adell, José A., et al.
Published: (2024)
S^3cMath: Spontaneous Step-level Self-correction Makes Large Language Models Better Mathematical Reasoners
by: Yan, Yuchen, et al.
Published: (2024)
by: Yan, Yuchen, et al.
Published: (2024)
Evaluating Generative Language Models in Information Extraction as Subjective Question Correction
by: Fan, Yuchen, et al.
Published: (2024)
by: Fan, Yuchen, et al.
Published: (2024)
Enhancing Large Language Models'Machine Translation via Dynamic Focus Anchoring
by: Ding, Qiuyu, et al.
Published: (2025)
by: Ding, Qiuyu, et al.
Published: (2025)
Rethinking Agentic Reinforcement Learning In Large Language Models
by: Cui, Fangming, et al.
Published: (2026)
by: Cui, Fangming, et al.
Published: (2026)
P-ICL: Point In-Context Learning for Named Entity Recognition with Large Language Models
by: Jiang, Guochao, et al.
Published: (2024)
by: Jiang, Guochao, et al.
Published: (2024)
MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
by: Zhang, Yin, et al.
Published: (2026)
by: Zhang, Yin, et al.
Published: (2026)
EGGS-PTP: An Expander-Graph Guided Structured Post-training Pruning Method for Large Language Models
by: Bazarbachi, Omar, et al.
Published: (2025)
by: Bazarbachi, Omar, et al.
Published: (2025)
ChemEval: A Comprehensive Multi-Level Chemical Evaluation for Large Language Models
by: Huang, Yuqing, et al.
Published: (2024)
by: Huang, Yuqing, et al.
Published: (2024)
Pre-training Distillation for Large Language Models: A Design Space Exploration
by: Peng, Hao, et al.
Published: (2024)
by: Peng, Hao, et al.
Published: (2024)
EARL: Efficient Agentic Reinforcement Learning Systems for Large Language Models
by: Tan, Zheyue, et al.
Published: (2025)
by: Tan, Zheyue, et al.
Published: (2025)
Similar Items
-
On the Superimposed Noise Accumulation Problem in Sequential Knowledge Editing of Large Language Models
by: Cao, Ding, et al.
Published: (2025) -
Locating and Mitigating Gender Bias in Large Language Models
by: Cai, Yuchen, et al.
Published: (2024) -
Editing Knowledge Representation of Language Model via Rephrased Prefix Prompts
by: Cai, Yuchen, et al.
Published: (2024) -
O-Edit: Orthogonal Subspace Editing for Language Model Sequential Editing
by: Cai, Yuchen, et al.
Published: (2024) -
T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
by: Hou, Zhenyu, et al.
Published: (2025)