ODICE: Revealing the Mystery of Distribution Correction Estimation via Orthogonal-gradient Update
Fuente:
arXiv
Guardado en:
| Autores principales: | Mao, Liyuan, Xu, Haoran, Zhang, Weinan, Zhan, Xianyuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning
por: Mao, Liyuan, et al.
Publicado: (2024)
por: Mao, Liyuan, et al.
Publicado: (2024)
Information-Theoretic Reward Decomposition for Generalizable RLHF
por: Mao, Liyuan, et al.
Publicado: (2025)
por: Mao, Liyuan, et al.
Publicado: (2025)
MADiff: Offline Multi-agent Learning with Diffusion Models
por: Zhu, Zhengbang, et al.
Publicado: (2023)
por: Zhu, Zhengbang, et al.
Publicado: (2023)
Revealing Behavioral Plasticity in Large Language Models: A Token-Conditional Perspective
por: Mao, Liyuan, et al.
Publicado: (2026)
por: Mao, Liyuan, et al.
Publicado: (2026)
Bidirectional-Reachable Hierarchical Reinforcement Learning with Mutually Responsive Policies
por: Luo, Yu, et al.
Publicado: (2024)
por: Luo, Yu, et al.
Publicado: (2024)
Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL
por: Luo, Yu, et al.
Publicado: (2024)
por: Luo, Yu, et al.
Publicado: (2024)
OMPO: A Unified Framework for RL under Policy and Dynamics Shifts
por: Luo, Yu, et al.
Publicado: (2024)
por: Luo, Yu, et al.
Publicado: (2024)
A Comprehensive Survey of Cross-Domain Policy Transfer for Embodied Agents
por: Niu, Haoyi, et al.
Publicado: (2024)
por: Niu, Haoyi, et al.
Publicado: (2024)
Dion: Distributed Orthonormalized Updates
por: Ahn, Kwangjun, et al.
Publicado: (2025)
por: Ahn, Kwangjun, et al.
Publicado: (2025)
Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
por: Zheng, Yinan, et al.
Publicado: (2025)
por: Zheng, Yinan, et al.
Publicado: (2025)
One-Token Verification for Reasoning Correctness Estimation
por: Zhuang, Zhan, et al.
Publicado: (2026)
por: Zhuang, Zhan, et al.
Publicado: (2026)
Seizing Serendipity: Exploiting the Value of Past Success in Off-Policy Actor-Critic
por: Ji, Tianying, et al.
Publicado: (2023)
por: Ji, Tianying, et al.
Publicado: (2023)
Towards Robust Zero-Shot Reinforcement Learning
por: Zheng, Kexin, et al.
Publicado: (2025)
por: Zheng, Kexin, et al.
Publicado: (2025)
It Ain't That Bad: Understanding the Mysterious Performance Drop in OOD Generalization for Generative Transformer Models
por: Xu, Xingcheng, et al.
Publicado: (2023)
por: Xu, Xingcheng, et al.
Publicado: (2023)
Are Expressive Models Truly Necessary for Offline RL?
por: Wang, Guan, et al.
Publicado: (2024)
por: Wang, Guan, et al.
Publicado: (2024)
HD-PiSSA: High-Rank Distributed Orthogonal Adaptation
por: Wang, Yiding, et al.
Publicado: (2025)
por: Wang, Yiding, et al.
Publicado: (2025)
Exact Stiefel Optimization for Probabilistic PLS: Closed-Form Updates, Error Bounds, and Calibrated Uncertainty
por: Hu, Haoran, et al.
Publicado: (2026)
por: Hu, Haoran, et al.
Publicado: (2026)
CFG-OEC: Classifier Free Guidance with Orthogonal Error Correction
por: Yang, Nakgyu, et al.
Publicado: (2025)
por: Yang, Nakgyu, et al.
Publicado: (2025)
Correcting Influence: Unboxing LLM Outputs with Orthogonal Latent Spaces
por: Yu, Shixing, et al.
Publicado: (2026)
por: Yu, Shixing, et al.
Publicado: (2026)
Skill Expansion and Composition in Parameter Space
por: Liu, Tenglong, et al.
Publicado: (2025)
por: Liu, Tenglong, et al.
Publicado: (2025)
When to Trust Your Simulator: Dynamics-Aware Hybrid Offline-and-Online Reinforcement Learning
por: Niu, Haoyi, et al.
Publicado: (2022)
por: Niu, Haoyi, et al.
Publicado: (2022)
Unveiling the Mystery of Weight in Large Foundation Models: Gaussian Distribution Never Fades
por: Si, Chongjie, et al.
Publicado: (2025)
por: Si, Chongjie, et al.
Publicado: (2025)
Robust Uncertainty Estimation under Distribution Shift via Difference Reconstruction
por: Xu, Xinran, et al.
Publicado: (2026)
por: Xu, Xinran, et al.
Publicado: (2026)
Score-Based Diffusion Policy Compatible with Reinforcement Learning via Optimal Transport
por: Sun, Mingyang, et al.
Publicado: (2025)
por: Sun, Mingyang, et al.
Publicado: (2025)
Autonomous Goal Detection and Cessation in Reinforcement Learning: A Case Study on Source Term Estimation
por: Shi, Yiwei, et al.
Publicado: (2024)
por: Shi, Yiwei, et al.
Publicado: (2024)
OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting
por: Hu, Xing, et al.
Publicado: (2025)
por: Hu, Xing, et al.
Publicado: (2025)
Beyond Prior Limits: Addressing Distribution Misalignment in Particle Filtering
por: Shi, Yiwei, et al.
Publicado: (2025)
por: Shi, Yiwei, et al.
Publicado: (2025)
Partial Parameter Updates for Efficient Distributed Training
por: Filippova, Anastasiia, et al.
Publicado: (2025)
por: Filippova, Anastasiia, et al.
Publicado: (2025)
Reinforcement Learning via Value Gradient Flow
por: Xu, Haoran, et al.
Publicado: (2026)
por: Xu, Haoran, et al.
Publicado: (2026)
DecisionNCE: Embodied Multimodal Representations via Implicit Preference Learning
por: Li, Jianxiong, et al.
Publicado: (2024)
por: Li, Jianxiong, et al.
Publicado: (2024)
UNO: Unlearning via Orthogonalization in Generative models
por: Mandal, Pinak, et al.
Publicado: (2025)
por: Mandal, Pinak, et al.
Publicado: (2025)
Generalizing Knowledge Graph Embedding with Universal Orthogonal Parameterization
por: Li, Rui, et al.
Publicado: (2024)
por: Li, Rui, et al.
Publicado: (2024)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
por: Wen, Muning, et al.
Publicado: (2024)
por: Wen, Muning, et al.
Publicado: (2024)
Diffusion Models for Reinforcement Learning: A Survey
por: Zhu, Zhengbang, et al.
Publicado: (2023)
por: Zhu, Zhengbang, et al.
Publicado: (2023)
Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model
por: Zheng, Yinan, et al.
Publicado: (2024)
por: Zheng, Yinan, et al.
Publicado: (2024)
Uncertainty Estimation using Variance-Gated Distributions
por: Gillis, H. Martin, et al.
Publicado: (2025)
por: Gillis, H. Martin, et al.
Publicado: (2025)
Quantifying Multimodal Capabilities: Formal Generalization Guarantees in Pairwise Metric Learning
por: Zhou, Richeng, et al.
Publicado: (2026)
por: Zhou, Richeng, et al.
Publicado: (2026)
JPmHC Dynamical Isometry via Orthogonal Hyper-Connections
por: Sengupta, Biswa, et al.
Publicado: (2026)
por: Sengupta, Biswa, et al.
Publicado: (2026)
MT-DAO: Multi-Timescale Distributed Adaptive Optimizers with Local Updates
por: Iacob, Alex, et al.
Publicado: (2025)
por: Iacob, Alex, et al.
Publicado: (2025)
Uncertain Multi-Objective Recommendation via Orthogonal Meta-Learning Enhanced Bayesian Optimization
por: Wang, Hongxu, et al.
Publicado: (2025)
por: Wang, Hongxu, et al.
Publicado: (2025)
Ejemplares similares
-
Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning
por: Mao, Liyuan, et al.
Publicado: (2024) -
Information-Theoretic Reward Decomposition for Generalizable RLHF
por: Mao, Liyuan, et al.
Publicado: (2025) -
MADiff: Offline Multi-agent Learning with Diffusion Models
por: Zhu, Zhengbang, et al.
Publicado: (2023) -
Revealing Behavioral Plasticity in Large Language Models: A Token-Conditional Perspective
por: Mao, Liyuan, et al.
Publicado: (2026) -
Bidirectional-Reachable Hierarchical Reinforcement Learning with Mutually Responsive Policies
por: Luo, Yu, et al.
Publicado: (2024)