Reinforcement Learning with Promising Tokens for Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Pang, Jing-Cheng, Lu, Liang, Tang, Xian, Jiang, Kun, Wu, Sijie, Zhang, Kai, Li, Xubin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
von: Pang, Jing-Cheng, et al.
Veröffentlicht: (2024)
von: Pang, Jing-Cheng, et al.
Veröffentlicht: (2024)
A Survey of Large Language Models for Graphs
von: Ren, Xubin, et al.
Veröffentlicht: (2024)
von: Ren, Xubin, et al.
Veröffentlicht: (2024)
Scalable Token-Level Hallucination Detection in Large Language Models
von: Min, Rui, et al.
Veröffentlicht: (2026)
von: Min, Rui, et al.
Veröffentlicht: (2026)
Offline Reinforcement Learning with Imbalanced Datasets
von: Jiang, Li, et al.
Veröffentlicht: (2023)
von: Jiang, Li, et al.
Veröffentlicht: (2023)
Reinforcement Learning With Sparse-Executing Actions via Sparsity Regularization
von: Pang, Jing-Cheng, et al.
Veröffentlicht: (2021)
von: Pang, Jing-Cheng, et al.
Veröffentlicht: (2021)
EDCO: Dynamic Curriculum Orchestration for Domain-specific Large Language Model Fine-tuning
von: Pang, Jing-Cheng, et al.
Veröffentlicht: (2026)
von: Pang, Jing-Cheng, et al.
Veröffentlicht: (2026)
RLAX: Large-Scale, Distributed Reinforcement Learning for Large Language Models on TPUs
von: Zhou, Runlong, et al.
Veröffentlicht: (2025)
von: Zhou, Runlong, et al.
Veröffentlicht: (2025)
On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models
von: Zhao, Chongyang, et al.
Veröffentlicht: (2026)
von: Zhao, Chongyang, et al.
Veröffentlicht: (2026)
Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models
von: Bao, Yicheng, et al.
Veröffentlicht: (2026)
von: Bao, Yicheng, et al.
Veröffentlicht: (2026)
Cognitive Edge Computing: A Comprehensive Survey on Optimizing Large Models and AI Agents for Pervasive Deployment
von: Wang, Xubin, et al.
Veröffentlicht: (2025)
von: Wang, Xubin, et al.
Veröffentlicht: (2025)
AlignedCoT: Prompting Large Language Models via Native-Speaking Demonstrations
von: Yang, Zhicheng, et al.
Veröffentlicht: (2023)
von: Yang, Zhicheng, et al.
Veröffentlicht: (2023)
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
von: Wen, Muning, et al.
Veröffentlicht: (2024)
von: Wen, Muning, et al.
Veröffentlicht: (2024)
AR$^2$: Adversarial Reinforcement Learning for Abstract Reasoning in Large Language Models
von: Yeh, Cheng-Kai, et al.
Veröffentlicht: (2025)
von: Yeh, Cheng-Kai, et al.
Veröffentlicht: (2025)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
von: Ye, Kai, et al.
Veröffentlicht: (2025)
von: Ye, Kai, et al.
Veröffentlicht: (2025)
On Predictability of Reinforcement Learning Dynamics for Large Language Models
von: Cai, Yuchen, et al.
Veröffentlicht: (2025)
von: Cai, Yuchen, et al.
Veröffentlicht: (2025)
Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting
von: Luo, Miaosen, et al.
Veröffentlicht: (2025)
von: Luo, Miaosen, et al.
Veröffentlicht: (2025)
Offline Regularised Reinforcement Learning for Large Language Models Alignment
von: Richemond, Pierre Harvey, et al.
Veröffentlicht: (2024)
von: Richemond, Pierre Harvey, et al.
Veröffentlicht: (2024)
Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
von: Sun, Yan, et al.
Veröffentlicht: (2025)
von: Sun, Yan, et al.
Veröffentlicht: (2025)
Probabilistic Token Alignment for Large Language Model Fusion
von: Zeng, Runjia, et al.
Veröffentlicht: (2025)
von: Zeng, Runjia, et al.
Veröffentlicht: (2025)
Spatiotemporal Forecasting as Planning: A Model-Based Reinforcement Learning Approach with Generative World Models
von: Wu, Hao, et al.
Veröffentlicht: (2025)
von: Wu, Hao, et al.
Veröffentlicht: (2025)
Continuity and Ordinality Matter: Constraining Time Series Tokens for Effective Time Series Analysis with Large Language Models
von: Li, Musheng, et al.
Veröffentlicht: (2026)
von: Li, Musheng, et al.
Veröffentlicht: (2026)
Discovering Reinforcement Learning Interfaces with Large Language Models
von: Jaswal, Akshat Singh, et al.
Veröffentlicht: (2026)
von: Jaswal, Akshat Singh, et al.
Veröffentlicht: (2026)
Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model
von: Liang, Jing, et al.
Veröffentlicht: (2025)
von: Liang, Jing, et al.
Veröffentlicht: (2025)
Token-Efficient Leverage Learning in Large Language Models
von: Zeng, Yuanhao, et al.
Veröffentlicht: (2024)
von: Zeng, Yuanhao, et al.
Veröffentlicht: (2024)
Geometric Manifold Rectification for Imbalanced Learning
von: Wang, Xubin, et al.
Veröffentlicht: (2026)
von: Wang, Xubin, et al.
Veröffentlicht: (2026)
GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models
von: Tang, Xiaohang, et al.
Veröffentlicht: (2026)
von: Tang, Xiaohang, et al.
Veröffentlicht: (2026)
Towards Explainable Fusion and Balanced Learning in Multimodal Sentiment Analysis
von: Luo, Miaosen, et al.
Veröffentlicht: (2025)
von: Luo, Miaosen, et al.
Veröffentlicht: (2025)
Learning on Graphs with Large Language Models(LLMs): A Deep Dive into Model Robustness
von: Guo, Kai, et al.
Veröffentlicht: (2024)
von: Guo, Kai, et al.
Veröffentlicht: (2024)
Meta-Sel: Efficient Demonstration Selection for In-Context Learning via Supervised Meta-Learning
von: Wang, Xubin, et al.
Veröffentlicht: (2026)
von: Wang, Xubin, et al.
Veröffentlicht: (2026)
A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions
von: Yu, Zhiyin, et al.
Veröffentlicht: (2026)
von: Yu, Zhiyin, et al.
Veröffentlicht: (2026)
Causality for Large Language Models
von: Wu, Anpeng, et al.
Veröffentlicht: (2024)
von: Wu, Anpeng, et al.
Veröffentlicht: (2024)
Entropy-Gated Selective Policy Optimization:Token-Level Gradient Allocation for Hybrid Training of Large Language Models
von: Hu, Yuelin, et al.
Veröffentlicht: (2026)
von: Hu, Yuelin, et al.
Veröffentlicht: (2026)
Towards Robust Trajectory Representations: Isolating Environmental Confounders with Causal Learning
von: Luo, Kang, et al.
Veröffentlicht: (2024)
von: Luo, Kang, et al.
Veröffentlicht: (2024)
Evolutionary Discovery of Reinforcement Learning Algorithms via Large Language Models
von: Sygkounas, Alkis, et al.
Veröffentlicht: (2026)
von: Sygkounas, Alkis, et al.
Veröffentlicht: (2026)
TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning
von: Zhang, Tunyu, et al.
Veröffentlicht: (2025)
von: Zhang, Tunyu, et al.
Veröffentlicht: (2025)
RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback
von: Wang, Yufei, et al.
Veröffentlicht: (2024)
von: Wang, Yufei, et al.
Veröffentlicht: (2024)
On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language Models
von: Wang, Shumin, et al.
Veröffentlicht: (2026)
von: Wang, Shumin, et al.
Veröffentlicht: (2026)
Are Large Language Models In-Context Graph Learners?
von: Li, Jintang, et al.
Veröffentlicht: (2025)
von: Li, Jintang, et al.
Veröffentlicht: (2025)
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
Scaling Capability in Token Space: An Analysis of Large Vision Language Model
von: Li, Tenghui, et al.
Veröffentlicht: (2024)
von: Li, Tenghui, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
von: Pang, Jing-Cheng, et al.
Veröffentlicht: (2024) -
A Survey of Large Language Models for Graphs
von: Ren, Xubin, et al.
Veröffentlicht: (2024) -
Scalable Token-Level Hallucination Detection in Large Language Models
von: Min, Rui, et al.
Veröffentlicht: (2026) -
Offline Reinforcement Learning with Imbalanced Datasets
von: Jiang, Li, et al.
Veröffentlicht: (2023) -
Reinforcement Learning With Sparse-Executing Actions via Sparsity Regularization
von: Pang, Jing-Cheng, et al.
Veröffentlicht: (2021)