Fewer May Be Better: Enhancing Offline Reinforcement Learning with Reduced Dataset
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Yiqin, Wang, Quanwei, Li, Chenghao, Hu, Hao, Wu, Chengjie, Jiang, Yuhua, Zhong, Dianyu, Zhang, Ziyou, Zhao, Qianchuan, Zhang, Chongjie, Bo, Xu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Bayesian Design Principles for Offline-to-Online Reinforcement Learning
por: Hu, Hao, et al.
Publicado: (2024)
por: Hu, Hao, et al.
Publicado: (2024)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
por: Yang, Yiqin, et al.
Publicado: (2026)
por: Yang, Yiqin, et al.
Publicado: (2026)
Episodic Novelty Through Temporal Distance
por: Jiang, Yuhua, et al.
Publicado: (2025)
por: Jiang, Yuhua, et al.
Publicado: (2025)
GlobeDiff: State Diffusion Process for Partial Observability in Multi-Agent Systems
por: Yang, Yiqin, et al.
Publicado: (2026)
por: Yang, Yiqin, et al.
Publicado: (2026)
DAIL: Beyond Task Ambiguity for Language-Conditioned Reinforcement Learning
por: Xie, Runpeng, et al.
Publicado: (2025)
por: Xie, Runpeng, et al.
Publicado: (2025)
Towards Robust Offline Reinforcement Learning under Diverse Data Corruption
por: Yang, Rui, et al.
Publicado: (2023)
por: Yang, Rui, et al.
Publicado: (2023)
$p1$: Better Prompt Optimization with Fewer Prompts
por: Gao, Zhaolin, et al.
Publicado: (2026)
por: Gao, Zhaolin, et al.
Publicado: (2026)
Offline Reinforcement Learning with Imbalanced Datasets
por: Jiang, Li, et al.
Publicado: (2023)
por: Jiang, Li, et al.
Publicado: (2023)
PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
por: Jiang, Yuhua, et al.
Publicado: (2025)
por: Jiang, Yuhua, et al.
Publicado: (2025)
Dataset Distillation for Offline Reinforcement Learning
por: Light, Jonathan, et al.
Publicado: (2024)
por: Light, Jonathan, et al.
Publicado: (2024)
Few and Fewer: Learning Better from Few Examples Using Fewer Base Classes
por: Lafargue, Raphael, et al.
Publicado: (2024)
por: Lafargue, Raphael, et al.
Publicado: (2024)
Hierarchical Control Framework Integrating LLMs with RL for Decarbonized HVAC Operation
por: Zhong, Dianyu, et al.
Publicado: (2026)
por: Zhong, Dianyu, et al.
Publicado: (2026)
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
por: Tu, Songjun, et al.
Publicado: (2024)
por: Tu, Songjun, et al.
Publicado: (2024)
Partial Channel Network: Compute Fewer, Perform Better
por: Huang, Haiduo, et al.
Publicado: (2025)
por: Huang, Haiduo, et al.
Publicado: (2025)
Preserve Support, Not Correspondence: Dynamic Routing for Offline Reinforcement Learning
por: Mu, Zhancun, et al.
Publicado: (2026)
por: Mu, Zhancun, et al.
Publicado: (2026)
CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries
por: Mu, Ni, et al.
Publicado: (2025)
por: Mu, Ni, et al.
Publicado: (2025)
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
por: Jiang, Jingjing, et al.
Publicado: (2025)
por: Jiang, Jingjing, et al.
Publicado: (2025)
AlpaGasus: Training A Better Alpaca with Fewer Data
por: Chen, Lichang, et al.
Publicado: (2023)
por: Chen, Lichang, et al.
Publicado: (2023)
ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
por: Li, Chaoyu, et al.
Publicado: (2025)
por: Li, Chaoyu, et al.
Publicado: (2025)
Fewer, but Better: On the Benefits of Surfactant‐Free Colloidal Syntheses of Nanomaterials
por: Márton Varga, et al.
Publicado: (2025)
por: Márton Varga, et al.
Publicado: (2025)
Risk-Sensitive RL for Alleviating Exploration Dilemmas in Large Language Models
por: Jiang, Yuhua, et al.
Publicado: (2025)
por: Jiang, Yuhua, et al.
Publicado: (2025)
Enhancing Decision-Making of Large Language Models via Actor-Critic
por: Dong, Heng, et al.
Publicado: (2025)
por: Dong, Heng, et al.
Publicado: (2025)
Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning
por: Wu, Xiefeng, et al.
Publicado: (2025)
por: Wu, Xiefeng, et al.
Publicado: (2025)
From Fewer Samples to Fewer Bits: Reframing Dataset Distillation as Joint Optimization of Precision and Compactness
por: Dinh, My H., et al.
Publicado: (2026)
por: Dinh, My H., et al.
Publicado: (2026)
Fewer is More: Boosting LLM Reasoning with Reinforced Context Pruning
por: Huang, Xijie, et al.
Publicado: (2023)
por: Huang, Xijie, et al.
Publicado: (2023)
XNet v2: Fewer Limitations, Better Results and Greater Universality
por: Zhou, Yanfeng, et al.
Publicado: (2024)
por: Zhou, Yanfeng, et al.
Publicado: (2024)
Large Kernel Modulation Network for Efficient Image Super-Resolution
por: Hu, Quanwei, et al.
Publicado: (2025)
por: Hu, Quanwei, et al.
Publicado: (2025)
Towards Global Optimality in Cooperative MARL with the Transformation And Distillation Framework
por: Ye, Jianing, et al.
Publicado: (2022)
por: Ye, Jianing, et al.
Publicado: (2022)
Learning from Many and Adapting to the Unknown in Open-set Test Streams
por: Zhang, Xiao, et al.
Publicado: (2026)
por: Zhang, Xiao, et al.
Publicado: (2026)
Policy-Based Trajectory Clustering in Offline Reinforcement Learning
por: Hu, Hao, et al.
Publicado: (2025)
por: Hu, Hao, et al.
Publicado: (2025)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
por: Wang, Huaijie, et al.
Publicado: (2024)
por: Wang, Huaijie, et al.
Publicado: (2024)
LKFMixer: Exploring Large Kernel Feature For Efficient Image Super-Resolution
por: Tang, Yinggan, et al.
Publicado: (2025)
por: Tang, Yinggan, et al.
Publicado: (2025)
Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems
por: Liu, Langming, et al.
Publicado: (2025)
por: Liu, Langming, et al.
Publicado: (2025)
LLM-Driven Policy Diffusion: Enhancing Generalization in Offline Reinforcement Learning
por: Zhang, Hanping, et al.
Publicado: (2025)
por: Zhang, Hanping, et al.
Publicado: (2025)
Enhancing Generative Auto-bidding with Offline Reward Evaluation and Policy Search
por: Mou, Zhiyu, et al.
Publicado: (2025)
por: Mou, Zhiyu, et al.
Publicado: (2025)
Switching the Loss Reduces the Cost in Batch (Offline) Reinforcement Learning
por: Ayoub, Alex, et al.
Publicado: (2024)
por: Ayoub, Alex, et al.
Publicado: (2024)
UNSEEN: Enhancing Dataset Pruning from a Generalization Perspective
por: Xu, Furui, et al.
Publicado: (2025)
por: Xu, Furui, et al.
Publicado: (2025)
Integrated Power and Thermal Management for Enhancing Energy Efficiency and Battery Life in Connected and Automated Electric Vehicles
por: Li, Dongjun, et al.
Publicado: (2024)
por: Li, Dongjun, et al.
Publicado: (2024)
Clean Code, Better Models: Enhancing LLM Performance with Smell-Cleaned Dataset
por: Xue, Zhipeng, et al.
Publicado: (2025)
por: Xue, Zhipeng, et al.
Publicado: (2025)
BAFFLE: Hiding Backdoors in Offline Reinforcement Learning Datasets
por: Gong, Chen, et al.
Publicado: (2022)
por: Gong, Chen, et al.
Publicado: (2022)
Ejemplares similares
-
Bayesian Design Principles for Offline-to-Online Reinforcement Learning
por: Hu, Hao, et al.
Publicado: (2024) -
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
por: Yang, Yiqin, et al.
Publicado: (2026) -
Episodic Novelty Through Temporal Distance
por: Jiang, Yuhua, et al.
Publicado: (2025) -
GlobeDiff: State Diffusion Process for Partial Observability in Multi-Agent Systems
por: Yang, Yiqin, et al.
Publicado: (2026) -
DAIL: Beyond Task Ambiguity for Language-Conditioned Reinforcement Learning
por: Xie, Runpeng, et al.
Publicado: (2025)