Saved in:
| Main Authors: | Sun, Luning, Liu, Xin-Yang, Zhao, Siyan, Grover, Aditya, Wang, Jian-Xun, Thiagarajan, Jayaraman J. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2504.05588 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Probing the Decision Boundaries of In-context Learning in Large Language Models
by: Zhao, Siyan, et al.
Published: (2024)
by: Zhao, Siyan, et al.
Published: (2024)
Self-supervised and Multi-fidelity Learning for Extended Predictive Soil Spectroscopy
by: Sun, Luning, et al.
Published: (2025)
by: Sun, Luning, et al.
Published: (2025)
Group Preference Optimization: Few-Shot Alignment of Large Language Models
by: Zhao, Siyan, et al.
Published: (2023)
by: Zhao, Siyan, et al.
Published: (2023)
Prepacking: A Simple Method for Fast Prefilling and Increased Throughput in Large Language Models
by: Zhao, Siyan, et al.
Published: (2024)
by: Zhao, Siyan, et al.
Published: (2024)
d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning
by: Zhao, Siyan, et al.
Published: (2025)
by: Zhao, Siyan, et al.
Published: (2025)
Privileged Sensing Scaffolds Reinforcement Learning
by: Hu, Edward S., et al.
Published: (2024)
by: Hu, Edward S., et al.
Published: (2024)
Multi-Scenario Combination Based on Multi-Agent Reinforcement Learning to Optimize the Advertising Recommendation System
by: Zhao, Yang, et al.
Published: (2024)
by: Zhao, Yang, et al.
Published: (2024)
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
by: Bansal, Hritik, et al.
Published: (2023)
by: Bansal, Hritik, et al.
Published: (2023)
Deep Reinforcement Learning for Traffic Light Control in Intelligent Transportation Systems
by: Zhu, Ming, et al.
Published: (2023)
by: Zhu, Ming, et al.
Published: (2023)
LICO: Large Language Models for In-Context Molecular Optimization
by: Nguyen, Tung, et al.
Published: (2024)
by: Nguyen, Tung, et al.
Published: (2024)
Efficient Embedding-based Synthetic Data Generation for Complex Reasoning Tasks
by: Jayaraman, Srideepika, et al.
Published: (2026)
by: Jayaraman, Srideepika, et al.
Published: (2026)
Learning Future Representation with Synthetic Observations for Sample-efficient Reinforcement Learning
by: Liu, Xin, et al.
Published: (2024)
by: Liu, Xin, et al.
Published: (2024)
On Predictability of Reinforcement Learning Dynamics for Large Language Models
by: Cai, Yuchen, et al.
Published: (2025)
by: Cai, Yuchen, et al.
Published: (2025)
Adaptive Event-triggered Reinforcement Learning Control for Complex Nonlinear Systems
by: Siddique, Umer, et al.
Published: (2024)
by: Siddique, Umer, et al.
Published: (2024)
Offline Trajectory Optimization for Offline Reinforcement Learning
by: Zhao, Ziqi, et al.
Published: (2024)
by: Zhao, Ziqi, et al.
Published: (2024)
Knowledge-Guided Manipulation Using Multi-Task Reinforcement Learning
by: Narendra, Aditya, et al.
Published: (2026)
by: Narendra, Aditya, et al.
Published: (2026)
SED2AM: Solving Multi-Trip Time-Dependent Vehicle Routing Problem using Deep Reinforcement Learning
by: Mozhdehi, Arash, et al.
Published: (2025)
by: Mozhdehi, Arash, et al.
Published: (2025)
A Survey of Constraint Formulations in Safe Reinforcement Learning
by: Wachi, Akifumi, et al.
Published: (2024)
by: Wachi, Akifumi, et al.
Published: (2024)
Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective
by: Zhang, Feng, et al.
Published: (2026)
by: Zhang, Feng, et al.
Published: (2026)
Multi-granularity Knowledge Transfer for Continual Reinforcement Learning
by: Pan, Chaofan, et al.
Published: (2024)
by: Pan, Chaofan, et al.
Published: (2024)
Sample Complexity of Distributionally Robust Off-Dynamics Reinforcement Learning with Online Interaction
by: He, Yiting, et al.
Published: (2025)
by: He, Yiting, et al.
Published: (2025)
On Distributional Reinforcement Learning in Chaotic Dynamical Systems
by: Rudd-Jones, James, et al.
Published: (2026)
by: Rudd-Jones, James, et al.
Published: (2026)
Enabling Autoregressive Models to Fill In Masked Tokens
by: Israel, Daniel, et al.
Published: (2025)
by: Israel, Daniel, et al.
Published: (2025)
TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance
by: Liu, Yuyang, et al.
Published: (2025)
by: Liu, Yuyang, et al.
Published: (2025)
Real-World Reinforcement Learning of Active Perception Behaviors
by: Hu, Edward S., et al.
Published: (2025)
by: Hu, Edward S., et al.
Published: (2025)
Visualizing Critic Match Loss Landscapes for Interpretation of Online Reinforcement Learning Control Algorithms
by: Liu, Jingyi, et al.
Published: (2026)
by: Liu, Jingyi, et al.
Published: (2026)
Structure in Deep Reinforcement Learning: A Survey and Open Problems
by: Mohan, Aditya, et al.
Published: (2023)
by: Mohan, Aditya, et al.
Published: (2023)
Test-driven Reinforcement Learning in Continuous Control
by: Yu, Zhao, et al.
Published: (2025)
by: Yu, Zhao, et al.
Published: (2025)
Adventurer: Exploration with BiGAN for Deep Reinforcement Learning
by: Liu, Yongshuai, et al.
Published: (2025)
by: Liu, Yongshuai, et al.
Published: (2025)
Implicit Neural Differential Model for Spatiotemporal Dynamics
by: Akhare, Deepak, et al.
Published: (2025)
by: Akhare, Deepak, et al.
Published: (2025)
Multi-agent Reinforcement Learning for Dynamic Dispatching in Material Handling Systems
by: Lee, Xian Yeow, et al.
Published: (2024)
by: Lee, Xian Yeow, et al.
Published: (2024)
Deep Generative Model for Mechanical System Configuration Design
by: Etesam, Yasaman, et al.
Published: (2024)
by: Etesam, Yasaman, et al.
Published: (2024)
Cross-domain Random Pre-training with Prototypes for Reinforcement Learning
by: Liu, Xin, et al.
Published: (2023)
by: Liu, Xin, et al.
Published: (2023)
The Pitfalls of KV Cache Compression
by: Chen, Alex, et al.
Published: (2025)
by: Chen, Alex, et al.
Published: (2025)
Redistributing Rewards Across Time and Agents for Multi-Agent Reinforcement Learning
by: Kapoor, Aditya, et al.
Published: (2025)
by: Kapoor, Aditya, et al.
Published: (2025)
Accelerating Diffusion LLMs via Adaptive Parallel Decoding
by: Israel, Daniel, et al.
Published: (2025)
by: Israel, Daniel, et al.
Published: (2025)
MARS: Co-evolving Dual-System Deep Research via Multi-Agent Reinforcement Learning
by: Chen, Guoxin, et al.
Published: (2025)
by: Chen, Guoxin, et al.
Published: (2025)
Networked Restless Multi-Arm Bandits with Reinforcement Learning
by: Zhang, Hanmo, et al.
Published: (2025)
by: Zhang, Hanmo, et al.
Published: (2025)
Look Before Leap: Look-Ahead Planning with Uncertainty in Reinforcement Learning
by: Liu, Yongshuai, et al.
Published: (2025)
by: Liu, Yongshuai, et al.
Published: (2025)
End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning
by: Chen, Guanzhong, et al.
Published: (2025)
by: Chen, Guanzhong, et al.
Published: (2025)
Similar Items
-
Probing the Decision Boundaries of In-context Learning in Large Language Models
by: Zhao, Siyan, et al.
Published: (2024) -
Self-supervised and Multi-fidelity Learning for Extended Predictive Soil Spectroscopy
by: Sun, Luning, et al.
Published: (2025) -
Group Preference Optimization: Few-Shot Alignment of Large Language Models
by: Zhao, Siyan, et al.
Published: (2023) -
Prepacking: A Simple Method for Fast Prefilling and Increased Throughput in Large Language Models
by: Zhao, Siyan, et al.
Published: (2024) -
d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning
by: Zhao, Siyan, et al.
Published: (2025)