TQL: Scaling Q-Functions with Transformers by Preventing Attention Collapse
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dong, Perry, Hung, Kuo-Han, Swerdlow, Alexander, Sadigh, Dorsa, Finn, Chelsea |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FASTER: Value-Guided Sampling for Fast RL
par: Dong, Perry, et autres
Publié: (2026)
par: Dong, Perry, et autres
Publié: (2026)
EXPO: Stable Reinforcement Learning with Expressive Policies
par: Dong, Perry, et autres
Publié: (2025)
par: Dong, Perry, et autres
Publié: (2025)
Value Flows
par: Dong, Perry, et autres
Publié: (2025)
par: Dong, Perry, et autres
Publié: (2025)
EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models
par: Dong, Perry, et autres
Publié: (2026)
par: Dong, Perry, et autres
Publié: (2026)
Efficient Data Collection for Robotic Manipulation via Compositional Generalization
par: Gao, Jensen, et autres
Publié: (2024)
par: Gao, Jensen, et autres
Publié: (2024)
What Matters for Batch Online Reinforcement Learning in Robotics?
par: Dong, Perry, et autres
Publié: (2025)
par: Dong, Perry, et autres
Publié: (2025)
Polychromic Objectives for Reinforcement Learning
par: Hamid, Jubayer Ibn, et autres
Publié: (2025)
par: Hamid, Jubayer Ibn, et autres
Publié: (2025)
Contrastive Preference Learning: Learning from Human Feedback without RL
par: Hejna, Joey, et autres
Publié: (2023)
par: Hejna, Joey, et autres
Publié: (2023)
Batch Active Learning of Reward Functions from Human Preferences
par: Bıyık, Erdem, et autres
Publié: (2024)
par: Bıyık, Erdem, et autres
Publié: (2024)
Imitation Bootstrapped Reinforcement Learning
par: Hu, Hengyuan, et autres
Publié: (2023)
par: Hu, Hengyuan, et autres
Publié: (2023)
Reinforcement Learning via Implicit Imitation Guidance
par: Dong, Perry, et autres
Publié: (2025)
par: Dong, Perry, et autres
Publié: (2025)
Invariance Co-training for Robot Visual Generalization
par: Yang, Jonathan, et autres
Publié: (2025)
par: Yang, Jonathan, et autres
Publié: (2025)
Universal Neural Functionals
par: Zhou, Allan, et autres
Publié: (2024)
par: Zhou, Allan, et autres
Publié: (2024)
Diffusion Models are Secretly Exchangeable: Parallelizing DDPMs via Autospeculation
par: Hu, Hengyuan, et autres
Publié: (2025)
par: Hu, Hengyuan, et autres
Publié: (2025)
Latent Diffusion Planning for Imitation Learning
par: Xie, Amber, et autres
Publié: (2025)
par: Xie, Amber, et autres
Publié: (2025)
Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning
par: Wagenmaker, Andrew, et autres
Publié: (2025)
par: Wagenmaker, Andrew, et autres
Publié: (2025)
Policy Learning with a Language Bottleneck
par: Srivastava, Megha, et autres
Publié: (2024)
par: Srivastava, Megha, et autres
Publié: (2024)
Motion Tracks: A Unified Representation for Human-Robot Transfer in Few-Shot Imitation Learning
par: Ren, Juntao, et autres
Publié: (2025)
par: Ren, Juntao, et autres
Publié: (2025)
MemER: Scaling Up Memory for Robot Control via Experience Retrieval
par: Sridhar, Ajay, et autres
Publié: (2025)
par: Sridhar, Ajay, et autres
Publié: (2025)
Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents
par: Putta, Pranav, et autres
Publié: (2024)
par: Putta, Pranav, et autres
Publié: (2024)
A Taxonomy for Evaluating Generalist Robot Manipulation Policies
par: Gao, Jensen, et autres
Publié: (2025)
par: Gao, Jensen, et autres
Publié: (2025)
Preventing Model Collapse via Contraction-Conditioned Neural Filters
par: Han, Zongjian, et autres
Publié: (2025)
par: Han, Zongjian, et autres
Publié: (2025)
Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning
par: Sarkar, Bidipta, et autres
Publié: (2025)
par: Sarkar, Bidipta, et autres
Publié: (2025)
Calibrating Language Models with Adaptive Temperature Scaling
par: Xie, Johnathan, et autres
Publié: (2024)
par: Xie, Johnathan, et autres
Publié: (2024)
ProVox: Personalization and Proactive Planning for Situated Human-Robot Collaboration
par: Grannen, Jennifer, et autres
Publié: (2025)
par: Grannen, Jennifer, et autres
Publié: (2025)
Grounding by Trying: LLMs with Reinforcement Learning-Enhanced Retrieval
par: Hsu, Sheryl, et autres
Publié: (2024)
par: Hsu, Sheryl, et autres
Publié: (2024)
Self-Guided Masked Autoencoders for Domain-Agnostic Self-Supervised Learning
par: Xie, Johnathan, et autres
Publié: (2024)
par: Xie, Johnathan, et autres
Publié: (2024)
Preventing Curriculum Collapse in Self-Evolving Reasoning Systems
par: Mishra, Vaibhav
Publié: (2026)
par: Mishra, Vaibhav
Publié: (2026)
Preventing Collapse in Contrastive Learning with Orthonormal Prototypes (CLOP)
par: Li, Huanran, et autres
Publié: (2024)
par: Li, Huanran, et autres
Publié: (2024)
What's the Move? Hybrid Imitation Learning via Salient Points
par: Sundaresan, Priya, et autres
Publié: (2024)
par: Sundaresan, Priya, et autres
Publié: (2024)
Learning Long-Context Diffusion Policies via Past-Token Prediction
par: Torne, Marcel, et autres
Publié: (2025)
par: Torne, Marcel, et autres
Publié: (2025)
Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization
par: Xu, Huimin, et autres
Publié: (2026)
par: Xu, Huimin, et autres
Publié: (2026)
CURE: Critical-Token-Guided Re-Concatenation for Entropy-Collapse Prevention
par: Li, Qingbin, et autres
Publié: (2025)
par: Li, Qingbin, et autres
Publié: (2025)
Preventing Dimensional Collapse in Self-Supervised Learning via Orthogonality Regularization
par: He, Junlin, et autres
Publié: (2024)
par: He, Junlin, et autres
Publié: (2024)
Vocal Sandbox: Continual Learning and Adaptation for Situated Human-Robot Collaboration
par: Grannen, Jennifer, et autres
Publié: (2024)
par: Grannen, Jennifer, et autres
Publié: (2024)
Curating Demonstrations using Online Experience
par: Chen, Annie S., et autres
Publié: (2025)
par: Chen, Annie S., et autres
Publié: (2025)
Periodic Regularized Q-Learning
par: Yang, Hyukjun, et autres
Publié: (2026)
par: Yang, Hyukjun, et autres
Publié: (2026)
ML-Driven Approaches to Combat Medicare Fraud: Advances in Class Imbalance Solutions, Feature Engineering, Adaptive Learning, and Business Impact
par: Farahmandazad, Dorsa, et autres
Publié: (2025)
par: Farahmandazad, Dorsa, et autres
Publié: (2025)
Nexusformer: Nonlinear Attention Expansion for Stable and Inheritable Transformer Scaling
par: Zhao, Weijie, et autres
Publié: (2026)
par: Zhao, Weijie, et autres
Publié: (2026)
LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning
par: Kang, Haoqiang, et autres
Publié: (2026)
par: Kang, Haoqiang, et autres
Publié: (2026)
Documents similaires
-
FASTER: Value-Guided Sampling for Fast RL
par: Dong, Perry, et autres
Publié: (2026) -
EXPO: Stable Reinforcement Learning with Expressive Policies
par: Dong, Perry, et autres
Publié: (2025) -
Value Flows
par: Dong, Perry, et autres
Publié: (2025) -
EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models
par: Dong, Perry, et autres
Publié: (2026) -
Efficient Data Collection for Robotic Manipulation via Compositional Generalization
par: Gao, Jensen, et autres
Publié: (2024)