LLM-Empowered State Representation for Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Boyuan, Qu, Yun, Jiang, Yuhang, Shao, Jianzhun, Liu, Chang, Yang, Wenming, Ji, Xiangyang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
par: Qu, Yun, et autres
Publié: (2024)
par: Qu, Yun, et autres
Publié: (2024)
Stop Wandering, Find the Keys: LLMs Discriminate Key States for Efficient Multi-Agent Exploration
par: Qu, Yun, et autres
Publié: (2024)
par: Qu, Yun, et autres
Publié: (2024)
Doubly Mild Generalization for Offline Reinforcement Learning
par: Mao, Yixiu, et autres
Publié: (2024)
par: Mao, Yixiu, et autres
Publié: (2024)
Hokoff: Real Game Dataset from Honor of Kings and its Offline Reinforcement Learning Benchmarks
par: Qu, Yun, et autres
Publié: (2024)
par: Qu, Yun, et autres
Publié: (2024)
Offline Reinforcement Learning with OOD State Correction and OOD Action Suppression
par: Mao, Yixiu, et autres
Publié: (2024)
par: Mao, Yixiu, et autres
Publié: (2024)
Adaptive Neighborhood-Constrained Q Learning for Offline Reinforcement Learning
par: Mao, Yixiu, et autres
Publié: (2025)
par: Mao, Yixiu, et autres
Publié: (2025)
Unsupervised Data Generation for Offline Reinforcement Learning: A Perspective from Model
par: He, Shuncheng, et autres
Publié: (2025)
par: He, Shuncheng, et autres
Publié: (2025)
RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning
par: Mao, Yixiu, et autres
Publié: (2026)
par: Mao, Yixiu, et autres
Publié: (2026)
LLM-Empowered Representation Learning for Emerging Item Recommendation
par: Zhang, Ziying, et autres
Publié: (2025)
par: Zhang, Ziying, et autres
Publié: (2025)
Utility-Diversity Aware Online Batch Selection for LLM Supervised Fine-tuning
par: Zou, Heming, et autres
Publié: (2025)
par: Zou, Heming, et autres
Publié: (2025)
Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex
par: Qu, Yun, et autres
Publié: (2026)
par: Qu, Yun, et autres
Publié: (2026)
Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models
par: Qu, Yun, et autres
Publié: (2026)
par: Qu, Yun, et autres
Publié: (2026)
Scrutinize What We Ignore: Reining In Task Representation Shift Of Context-Based Offline Meta Reinforcement Learning
par: Zhang, Hai, et autres
Publié: (2024)
par: Zhang, Hai, et autres
Publié: (2024)
Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models
par: Mao, Yixiu, et autres
Publié: (2026)
par: Mao, Yixiu, et autres
Publié: (2026)
Fast and Robust: Task Sampling with Posterior and Diversity Synergies for Adaptive Decision-Makers in Randomized Environments
par: Qu, Yun, et autres
Publié: (2025)
par: Qu, Yun, et autres
Publié: (2025)
Pref-GUIDE: Continual Policy Learning from Real-Time Human Feedback via Preference-Based Learning
par: Ji, Zhengran, et autres
Publié: (2025)
par: Ji, Zhengran, et autres
Publié: (2025)
ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism
par: Liu, Jia, et autres
Publié: (2025)
par: Liu, Jia, et autres
Publié: (2025)
Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning
par: Dong, Guanting, et autres
Publié: (2025)
par: Dong, Guanting, et autres
Publié: (2025)
Can Prompt Difficulty be Online Predicted for Accelerating RL Finetuning of Reasoning Models?
par: Qu, Yun, et autres
Publié: (2025)
par: Qu, Yun, et autres
Publié: (2025)
Empowering Epidemic Response: The Role of Reinforcement Learning in Infectious Disease Control
par: Liu, Mutong, et autres
Publié: (2026)
par: Liu, Mutong, et autres
Publié: (2026)
Enhancing Cloud Network Resilience via a Robust LLM-Empowered Multi-Agent Reinforcement Learning Framework
par: Peng, Yixiao, et autres
Publié: (2026)
par: Peng, Yixiao, et autres
Publié: (2026)
Simulating Human-Like Learning Dynamics with LLM-Empowered Agents
par: Yuan, Yu, et autres
Publié: (2025)
par: Yuan, Yu, et autres
Publié: (2025)
Learning Compact Representations of LLM Abilities via Item Response Theory
par: Chen, Jianhao, et autres
Publié: (2025)
par: Chen, Jianhao, et autres
Publié: (2025)
On Causally Disentangled State Representation Learning for Reinforcement Learning based Recommender Systems
par: Wang, Siyu, et autres
Publié: (2024)
par: Wang, Siyu, et autres
Publié: (2024)
Higher Replay Ratio Empowers Sample-Efficient Multi-Agent Reinforcement Learning
par: Xu, Linjie, et autres
Publié: (2024)
par: Xu, Linjie, et autres
Publié: (2024)
A Survey of State Representation Learning for Deep Reinforcement Learning
par: Echchahed, Ayoub, et autres
Publié: (2025)
par: Echchahed, Ayoub, et autres
Publié: (2025)
Tree Search for LLM Agent Reinforcement Learning
par: Ji, Yuxiang, et autres
Publié: (2025)
par: Ji, Yuxiang, et autres
Publié: (2025)
Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning
par: Wu, Yuhang, et autres
Publié: (2026)
par: Wu, Yuhang, et autres
Publié: (2026)
Learning More from Less: Unlocking Internal Representations for Benchmark Compression
par: Zhang, Yueqi, et autres
Publié: (2026)
par: Zhang, Yueqi, et autres
Publié: (2026)
POI-Enhancer: An LLM-based Semantic Enhancement Framework for POI Representation Learning
par: Cheng, Jiawei, et autres
Publié: (2025)
par: Cheng, Jiawei, et autres
Publié: (2025)
Detection vs. Execution: Single-Bucket Probes Miss Half the Mamba-2 State Sink
par: Jiang, Yuhang
Publié: (2026)
par: Jiang, Yuhang
Publié: (2026)
Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning
par: Li, Ang, et autres
Publié: (2025)
par: Li, Ang, et autres
Publié: (2025)
Efficient Reinforcement Learning with Semantic and Token Entropy for LLM Reasoning
par: Cao, Hongye, et autres
Publié: (2025)
par: Cao, Hongye, et autres
Publié: (2025)
Approximate Subgraph Matching with Neural Graph Representations and Reinforcement Learning
par: Li, Kaiyang, et autres
Publié: (2026)
par: Li, Kaiyang, et autres
Publié: (2026)
CoRe-ECG: Advancing Self-Supervised Representation Learning for 12-Lead ECG via Contrastive and Reconstructive Synergy
par: Qin, Zehao, et autres
Publié: (2026)
par: Qin, Zehao, et autres
Publié: (2026)
GeoAgent: Learning to Geolocate Everywhere with Reinforced Geographic Characteristics
par: Jin, Modi, et autres
Publié: (2026)
par: Jin, Modi, et autres
Publié: (2026)
Towards Security-Auditable LLM Agents: A Unified Graph Representation
par: Li, Chaofan, et autres
Publié: (2026)
par: Li, Chaofan, et autres
Publié: (2026)
ThinkDrive: Chain-of-Thought Guided Progressive Reinforcement Learning Fine-Tuning for Autonomous Driving
par: Zhao, Chang, et autres
Publié: (2026)
par: Zhao, Chang, et autres
Publié: (2026)
LLM-assisted Semantic Option Discovery for Facilitating Adaptive Deep Reinforcement Learning
par: Yao, Chang, et autres
Publié: (2026)
par: Yao, Chang, et autres
Publié: (2026)
BinCtx: Multi-Modal Representation Learning for Robust Android App Behavior Detection
par: Liu, Zichen, et autres
Publié: (2025)
par: Liu, Zichen, et autres
Publié: (2025)
Documents similaires
-
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
par: Qu, Yun, et autres
Publié: (2024) -
Stop Wandering, Find the Keys: LLMs Discriminate Key States for Efficient Multi-Agent Exploration
par: Qu, Yun, et autres
Publié: (2024) -
Doubly Mild Generalization for Offline Reinforcement Learning
par: Mao, Yixiu, et autres
Publié: (2024) -
Hokoff: Real Game Dataset from Honor of Kings and its Offline Reinforcement Learning Benchmarks
par: Qu, Yun, et autres
Publié: (2024) -
Offline Reinforcement Learning with OOD State Correction and OOD Action Suppression
par: Mao, Yixiu, et autres
Publié: (2024)