TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zheng, Ruijie, Liang, Yongyuan, Huang, Shuaiyi, Gao, Jianfeng, Daumé III, Hal, Kolobov, Andrey, Huang, Furong, Yang, Jianwei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PRISE: LLM-Style Sequence Compression for Learning Temporal Action Abstractions in Control
par: Zheng, Ruijie, et autres
Publié: (2024)
par: Zheng, Ruijie, et autres
Publié: (2024)
Premier-TACO is a Few-Shot Policy Learner: Pretraining Multitask Representation via Temporal Action-Driven Contrastive Loss
par: Zheng, Ruijie, et autres
Publié: (2024)
par: Zheng, Ruijie, et autres
Publié: (2024)
TACO: Temporal Latent Action-Driven Contrastive Loss for Visual Reinforcement Learning
par: Zheng, Ruijie, et autres
Publié: (2023)
par: Zheng, Ruijie, et autres
Publié: (2023)
HateCOT: An Explanation-Enhanced Dataset for Generalizable Offensive Speech Detection via Large Language Models
par: Nghiem, Huy, et autres
Publié: (2024)
par: Nghiem, Huy, et autres
Publié: (2024)
Spatial Traces: Enhancing VLA Models with Spatial-Temporal Understanding
par: Patratskiy, Maxim A., et autres
Publié: (2025)
par: Patratskiy, Maxim A., et autres
Publié: (2025)
Lemon: A Unified and Scalable 3D Multimodal Model for Universal Spatial Understanding
par: Liang, Yongyuan, et autres
Publié: (2025)
par: Liang, Yongyuan, et autres
Publié: (2025)
A Necessary Step toward Faithfulness: Measuring and Improving Consistency in Free-Text Explanations
par: Zhao, Lingjun, et autres
Publié: (2025)
par: Zhao, Lingjun, et autres
Publié: (2025)
When Stereotypes GTG: The Impact of Predictive Text Suggestions on Gender Bias in Human-AI Co-Writing
par: Baumler, Connor, et autres
Publié: (2024)
par: Baumler, Connor, et autres
Publié: (2024)
Steering Safely or Off a Cliff? Rethinking Specificity and Robustness in Inference-Time Interventions
par: Goyal, Navita, et autres
Publié: (2026)
par: Goyal, Navita, et autres
Publié: (2026)
DrM: Mastering Visual Reinforcement Learning through Dormant Ratio Minimization
par: Xu, Guowei, et autres
Publié: (2023)
par: Xu, Guowei, et autres
Publié: (2023)
Make-An-Agent: A Generalizable Policy Network Generator with Behavior-Prompted Diffusion
par: Liang, Yongyuan, et autres
Publié: (2024)
par: Liang, Yongyuan, et autres
Publié: (2024)
SMARTER: A Data-efficient Framework to Improve Toxicity Detection with Explanation via Self-augmenting Large Language Models
par: Nghiem, Huy, et autres
Publié: (2025)
par: Nghiem, Huy, et autres
Publié: (2025)
Successfully Guiding Humans with Imperfect Instructions by Highlighting Potential Errors and Suggesting Corrections
par: Zhao, Lingjun, et autres
Publié: (2024)
par: Zhao, Lingjun, et autres
Publié: (2024)
Language Models Predict Empathy Gaps Between Social In-groups and Out-groups
par: Hou, Yu, et autres
Publié: (2025)
par: Hou, Yu, et autres
Publié: (2025)
TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos
par: Lee, Seungjae, et autres
Publié: (2025)
par: Lee, Seungjae, et autres
Publié: (2025)
ACE : Off-Policy Actor-Critic with Causality-Aware Entropy Regularization
par: Ji, Tianying, et autres
Publié: (2024)
par: Ji, Tianying, et autres
Publié: (2024)
Beyond Worst-case Attacks: Robust RL with Adaptive Defense via Non-dominated Policies
par: Liu, Xiangyu, et autres
Publié: (2024)
par: Liu, Xiangyu, et autres
Publié: (2024)
Game-Theoretic Robust Reinforcement Learning Handles Temporally-Coupled Perturbations
par: Liang, Yongyuan, et autres
Publié: (2023)
par: Liang, Yongyuan, et autres
Publié: (2023)
Causal Effect of Group Diversity on Redundancy and Coverage in Peer-Reviewing
par: Goyal, Navita, et autres
Publié: (2024)
par: Goyal, Navita, et autres
Publié: (2024)
Pragmatics Meets Culture: Culturally-adapted Artwork Description Generation and Evaluation
par: Zhao, Lingjun, et autres
Publié: (2026)
par: Zhao, Lingjun, et autres
Publié: (2026)
"You Gotta be a Doctor, Lin": An Investigation of Name-Based Bias of Large Language Models in Employment Recommendations
par: Nghiem, Huy, et autres
Publié: (2024)
par: Nghiem, Huy, et autres
Publié: (2024)
The Impact of Explanations on Fairness in Human-AI Decision-Making: Protected vs Proxy Features
par: Goyal, Navita, et autres
Publié: (2023)
par: Goyal, Navita, et autres
Publié: (2023)
Say It My Way: Exploring Control in Conversational Visual Question Answering with Blind Users
par: Zeraati, Farnaz Zamiri, et autres
Publié: (2026)
par: Zeraati, Farnaz Zamiri, et autres
Publié: (2026)
Do great minds think alike? Investigating Human-AI Complementarity in Question Answering with CAIMIRA
par: Gor, Maharshi, et autres
Publié: (2024)
par: Gor, Maharshi, et autres
Publié: (2024)
InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
par: Chen, Xinyi, et autres
Publié: (2025)
par: Chen, Xinyi, et autres
Publié: (2025)
ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning
par: Van Vo, Tuan, et autres
Publié: (2026)
par: Van Vo, Tuan, et autres
Publié: (2026)
Is poisoning a real threat to LLM alignment? Maybe more so than you think
par: Pathmanathan, Pankayaraj, et autres
Publié: (2024)
par: Pathmanathan, Pankayaraj, et autres
Publié: (2024)
Effort-aware Fairness: Incorporating a Philosophy-informed, Human-centered Notion of Effort into Algorithmic Fairness Metrics
par: Nguyen, Tin Trung, et autres
Publié: (2025)
par: Nguyen, Tin Trung, et autres
Publié: (2025)
NanoVLA: Routing Decoupled Vision-Language Understanding for Nano-sized Generalist Robotic Policies
par: Chen, Jiahong, et autres
Publié: (2025)
par: Chen, Jiahong, et autres
Publié: (2025)
SITE: towards Spatial Intelligence Thorough Evaluation
par: Wang, Wenqi, et autres
Publié: (2025)
par: Wang, Wenqi, et autres
Publié: (2025)
Bias in the Tails: How Name-conditioned Evaluative Framing in Resume Summaries Destabilizes LLM-based Hiring
par: Nghiem, Huy, et autres
Publié: (2026)
par: Nghiem, Huy, et autres
Publié: (2026)
Can Hallucination Correction Improve Video-Language Alignment?
par: Zhao, Lingjun, et autres
Publié: (2025)
par: Zhao, Lingjun, et autres
Publié: (2025)
Refined Policy Distillation: From VLA Generalists to RL Experts
par: Jülg, Tobias, et autres
Publié: (2025)
par: Jülg, Tobias, et autres
Publié: (2025)
Can You Make It Sound Like You? Post-Editing LLM-Generated Text for Personal Style
par: Baumler, Connor, et autres
Publié: (2026)
par: Baumler, Connor, et autres
Publié: (2026)
Natural Language Inference Improves Compositionality in Vision-Language Models
par: Cascante-Bonilla, Paola, et autres
Publié: (2024)
par: Cascante-Bonilla, Paola, et autres
Publié: (2024)
My LLM might Mimic AAE -- But When Should it?
par: Sandoval, Sandra C., et autres
Publié: (2025)
par: Sandoval, Sandra C., et autres
Publié: (2025)
'Rich Dad, Poor Lad': How do Large Language Models Contextualize Socioeconomic Factors in College Admission ?
par: Nghiem, Huy, et autres
Publié: (2025)
par: Nghiem, Huy, et autres
Publié: (2025)
Reheat Nachos for Dinner? Evaluating AI Support for Cross-Cultural Communication of Neologisms
par: Ki, Dayeon, et autres
Publié: (2026)
par: Ki, Dayeon, et autres
Publié: (2026)
Seamful XAI: Operationalizing Seamful Design in Explainable AI
par: Ehsan, Upol, et autres
Publié: (2022)
par: Ehsan, Upol, et autres
Publié: (2022)
VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing
par: Shi, Haoyuan, et autres
Publié: (2026)
par: Shi, Haoyuan, et autres
Publié: (2026)
Documents similaires
-
PRISE: LLM-Style Sequence Compression for Learning Temporal Action Abstractions in Control
par: Zheng, Ruijie, et autres
Publié: (2024) -
Premier-TACO is a Few-Shot Policy Learner: Pretraining Multitask Representation via Temporal Action-Driven Contrastive Loss
par: Zheng, Ruijie, et autres
Publié: (2024) -
TACO: Temporal Latent Action-Driven Contrastive Loss for Visual Reinforcement Learning
par: Zheng, Ruijie, et autres
Publié: (2023) -
HateCOT: An Explanation-Enhanced Dataset for Generalizable Offensive Speech Detection via Large Language Models
par: Nghiem, Huy, et autres
Publié: (2024) -
Spatial Traces: Enhancing VLA Models with Spatial-Temporal Understanding
par: Patratskiy, Maxim A., et autres
Publié: (2025)