Saved in:
| Main Authors: | Bai, Chenjia, Zhang, Yang, Qiu, Shuang, Zhang, Qiaosheng, Xu, Kang, Li, Xuelong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2501.12735 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Constrained Ensemble Exploration for Unsupervised Skill Discovery
by: Bai, Chenjia, et al.
Published: (2024)
by: Bai, Chenjia, et al.
Published: (2024)
Regularized Conditional Diffusion Model for Multi-Task Preference Alignment
by: Yu, Xudong, et al.
Published: (2024)
by: Yu, Xudong, et al.
Published: (2024)
Provably Efficient Information-Directed Sampling Algorithms for Multi-Agent Reinforcement Learning
by: Zhang, Qiaosheng, et al.
Published: (2024)
by: Zhang, Qiaosheng, et al.
Published: (2024)
Ensemble Successor Representations for Task Generalization in Offline-to-Online Reinforcement Learning
by: Wang, Changhong, et al.
Published: (2024)
by: Wang, Changhong, et al.
Published: (2024)
Unsupervised Skill Discovery through Skill Regions Differentiation
by: Xiao, Ting, et al.
Published: (2025)
by: Xiao, Ting, et al.
Published: (2025)
Forward KL Regularized Preference Optimization for Aligning Diffusion Policies
by: Shan, Zhao, et al.
Published: (2024)
by: Shan, Zhao, et al.
Published: (2024)
Contrastive UCB: Provably Efficient Contrastive Self-Supervised Learning in Online Reinforcement Learning
by: Qiu, Shuang, et al.
Published: (2022)
by: Qiu, Shuang, et al.
Published: (2022)
Contrastive Representation for Data Filtering in Cross-Domain Offline Reinforcement Learning
by: Wen, Xiaoyu, et al.
Published: (2024)
by: Wen, Xiaoyu, et al.
Published: (2024)
Decentralized Transformers with Centralized Aggregation are Sample-Efficient Multi-Agent World Models
by: Zhang, Yang, et al.
Published: (2024)
by: Zhang, Yang, et al.
Published: (2024)
Unifying Value Alignment and Assignment in Cross-Domain Offline Reinforcement Learning with Heterogeneous Datasets
by: Qiao, Zhongjian, et al.
Published: (2026)
by: Qiao, Zhongjian, et al.
Published: (2026)
Humanoid Whole-Body Locomotion on Narrow Terrain via Dynamic Balance and Reinforcement Learning
by: Xie, Weiji, et al.
Published: (2025)
by: Xie, Weiji, et al.
Published: (2025)
Learning an Actionable Discrete Diffusion Policy via Large-Scale Actionless Video Pre-Training
by: He, Haoran, et al.
Published: (2024)
by: He, Haoran, et al.
Published: (2024)
Community Detection in the Multi-View Stochastic Block Model
by: Zhang, Yexin, et al.
Published: (2024)
by: Zhang, Yexin, et al.
Published: (2024)
Revisiting Multi-Agent World Modeling from a Diffusion-Inspired Perspective
by: Zhang, Yang, et al.
Published: (2025)
by: Zhang, Yang, et al.
Published: (2025)
VLP: Vision-Language Preference Learning for Embodied Manipulation
by: Liu, Runze, et al.
Published: (2025)
by: Liu, Runze, et al.
Published: (2025)
Towards Efficient LLM Grounding for Embodied Multi-Agent Collaboration
by: Zhang, Yang, et al.
Published: (2024)
by: Zhang, Yang, et al.
Published: (2024)
Radiology Report Generation via Multi-objective Preference Optimization
by: Xiao, Ting, et al.
Published: (2024)
by: Xiao, Ting, et al.
Published: (2024)
Efficient Cross-Domain Offline Reinforcement Learning with Dynamics- and Value-Aligned Data Filtering
by: Qiao, Zhongjian, et al.
Published: (2025)
by: Qiao, Zhongjian, et al.
Published: (2025)
Self-Exploring Language Models: Active Preference Elicitation for Online Alignment
by: Zhang, Shenao, et al.
Published: (2024)
by: Zhang, Shenao, et al.
Published: (2024)
Online Self-Preferring Language Models
by: Zhai, Yuanzhao, et al.
Published: (2024)
by: Zhai, Yuanzhao, et al.
Published: (2024)
Towards Robust Offline-to-Online Reinforcement Learning via Uncertainty and Smoothness
by: Wen, Xiaoyu, et al.
Published: (2023)
by: Wen, Xiaoyu, et al.
Published: (2023)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
by: Yang, Yiqin, et al.
Published: (2026)
by: Yang, Yiqin, et al.
Published: (2026)
Pessimistic Value Iteration for Multi-Task Data Sharing in Offline Reinforcement Learning
by: Bai, Chenjia, et al.
Published: (2024)
by: Bai, Chenjia, et al.
Published: (2024)
SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied Manipulation
by: Zhang, Junjie, et al.
Published: (2024)
by: Zhang, Junjie, et al.
Published: (2024)
RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning
by: Wei, Zeming, et al.
Published: (2026)
by: Wei, Zeming, et al.
Published: (2026)
Hybrid Preference Optimization for Alignment: Provably Faster Convergence Rates by Combining Offline Preferences with Online Exploration
by: Bose, Avinandan, et al.
Published: (2024)
by: Bose, Avinandan, et al.
Published: (2024)
Sample-Efficient Reinforcement Learning from Human Feedback via Information-Directed Sampling
by: Qi, Han, et al.
Published: (2025)
by: Qi, Han, et al.
Published: (2025)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
by: Wang, Haoxiang, et al.
Published: (2024)
by: Wang, Haoxiang, et al.
Published: (2024)
A Fast Convergence Theory for Offline Decision Making
by: Mao, Chenjie, et al.
Published: (2024)
by: Mao, Chenjie, et al.
Published: (2024)
Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment
by: Yang, Rui, et al.
Published: (2024)
by: Yang, Rui, et al.
Published: (2024)
Human Alignment of Large Language Models through Online Preference Optimisation
by: Calandriello, Daniele, et al.
Published: (2024)
by: Calandriello, Daniele, et al.
Published: (2024)
T-POP: Test-Time Personalization with Online Preference Feedback
by: Qu, Zikun, et al.
Published: (2025)
by: Qu, Zikun, et al.
Published: (2025)
Misclassification Rate and Privacy-Utility Trade-offs in Graph Convolutional Networks via Subsampling Stability
by: Zhang, Yexin, et al.
Published: (2026)
by: Zhang, Yexin, et al.
Published: (2026)
Sample Efficient Preference Alignment in LLMs via Active Exploration
by: Mehta, Viraj, et al.
Published: (2023)
by: Mehta, Viraj, et al.
Published: (2023)
Community Detection for Contextual-LSBM: Theoretical Limitations of Misclassification Rate and Efficient Algorithms
by: Jin, Dian, et al.
Published: (2025)
by: Jin, Dian, et al.
Published: (2025)
Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment
by: Zhang, Yifan, et al.
Published: (2024)
by: Zhang, Yifan, et al.
Published: (2024)
Exponential Topology-enabled Scalable Communication in Multi-agent Reinforcement Learning
by: Li, Xinran, et al.
Published: (2025)
by: Li, Xinran, et al.
Published: (2025)
PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations
by: Zhang, Yang, et al.
Published: (2026)
by: Zhang, Yang, et al.
Published: (2026)
ODRL: A Benchmark for Off-Dynamics Reinforcement Learning
by: Lyu, Jiafei, et al.
Published: (2024)
by: Lyu, Jiafei, et al.
Published: (2024)
CPGD: Toward Stable Rule-based Reinforcement Learning for Language Models
by: Liu, Zongkai, et al.
Published: (2025)
by: Liu, Zongkai, et al.
Published: (2025)
Similar Items
-
Constrained Ensemble Exploration for Unsupervised Skill Discovery
by: Bai, Chenjia, et al.
Published: (2024) -
Regularized Conditional Diffusion Model for Multi-Task Preference Alignment
by: Yu, Xudong, et al.
Published: (2024) -
Provably Efficient Information-Directed Sampling Algorithms for Multi-Agent Reinforcement Learning
by: Zhang, Qiaosheng, et al.
Published: (2024) -
Ensemble Successor Representations for Task Generalization in Offline-to-Online Reinforcement Learning
by: Wang, Changhong, et al.
Published: (2024) -
Unsupervised Skill Discovery through Skill Regions Differentiation
by: Xiao, Ting, et al.
Published: (2025)