R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sohn, Tin Stribor, Dillitzer, Maximilian, Corso, Jason J., Sax, Eric |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SNOW: Spatio-Temporal Scene Understanding with World Knowledge for Open-World Embodied Reasoning
par: Sohn, Tin Stribor, et autres
Publié: (2025)
par: Sohn, Tin Stribor, et autres
Publié: (2025)
Embodied4C: Measuring What Matters for Embodied Vision-Language Navigation
par: Sohn, Tin Stribor, et autres
Publié: (2025)
par: Sohn, Tin Stribor, et autres
Publié: (2025)
A Framework for a Capability-driven Evaluation of Scenario Understanding for Multimodal Large Language Models in Autonomous Driving
par: Sohn, Tin Stribor, et autres
Publié: (2025)
par: Sohn, Tin Stribor, et autres
Publié: (2025)
ST-Booster: An Iterative SpatioTemporal Perception Booster for Vision-and-Language Navigation in Continuous Environments
par: Yue, Lu, et autres
Publié: (2025)
par: Yue, Lu, et autres
Publié: (2025)
Unifying 2D and 3D Vision-Language Understanding
par: Jain, Ayush, et autres
Publié: (2025)
par: Jain, Ayush, et autres
Publié: (2025)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
par: Ye, Angen, et autres
Publié: (2025)
par: Ye, Angen, et autres
Publié: (2025)
CLIPping the Limits: Finding the Sweet Spot for Relevant Images in Automated Driving Systems Perception Testing
par: Rigoll, Philipp, et autres
Publié: (2024)
par: Rigoll, Philipp, et autres
Publié: (2024)
Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation
par: Kim, Jisoo, et autres
Publié: (2026)
par: Kim, Jisoo, et autres
Publié: (2026)
VG4D: Vision-Language Model Goes 4D Video Recognition
par: Deng, Zhichao, et autres
Publié: (2024)
par: Deng, Zhichao, et autres
Publié: (2024)
ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models
par: Song, Zirui, et autres
Publié: (2025)
par: Song, Zirui, et autres
Publié: (2025)
Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving
par: Wang, Yiru, et autres
Publié: (2026)
par: Wang, Yiru, et autres
Publié: (2026)
Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model
par: Li, Peiyan, et autres
Publié: (2026)
par: Li, Peiyan, et autres
Publié: (2026)
3DGS-Calib: 3D Gaussian Splatting for Multimodal SpatioTemporal Calibration
par: Herau, Quentin, et autres
Publié: (2024)
par: Herau, Quentin, et autres
Publié: (2024)
Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model
par: Won, John, et autres
Publié: (2025)
par: Won, John, et autres
Publié: (2025)
BOP-ASK: Object-Interaction Reasoning for Vision-Language Models
par: Bhat, Vineet, et autres
Publié: (2025)
par: Bhat, Vineet, et autres
Publié: (2025)
TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics
par: Han, Yi, et autres
Publié: (2025)
par: Han, Yi, et autres
Publié: (2025)
Transformer-Based Spatio-Temporal Association of Apple Fruitlets
par: Freeman, Harry, et autres
Publié: (2025)
par: Freeman, Harry, et autres
Publié: (2025)
General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling
par: Lyu, Huaihai, et autres
Publié: (2026)
par: Lyu, Huaihai, et autres
Publié: (2026)
Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
par: Zhang, Dapeng, et autres
Publié: (2025)
par: Zhang, Dapeng, et autres
Publié: (2025)
WorldVLM: Combining World Model Forecasting and Vision-Language Reasoning
par: Englmeier, Stefan, et autres
Publié: (2026)
par: Englmeier, Stefan, et autres
Publié: (2026)
ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation
par: Huang, Wenlong, et autres
Publié: (2024)
par: Huang, Wenlong, et autres
Publié: (2024)
GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond
par: Halacheva, Anna-Maria, et autres
Publié: (2025)
par: Halacheva, Anna-Maria, et autres
Publié: (2025)
ST-$π$: Structured SpatioTemporal VLA for Robotic Manipulation
par: Ma, Chuanhao, et autres
Publié: (2026)
par: Ma, Chuanhao, et autres
Publié: (2026)
MAP-VLA: Memory-Augmented Prompting for Vision-Language-Action Model in Robotic Manipulation
par: Li, Runhao, et autres
Publié: (2025)
par: Li, Runhao, et autres
Publié: (2025)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
par: Ling, Yiran, et autres
Publié: (2026)
par: Ling, Yiran, et autres
Publié: (2026)
RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics
par: Zhou, Enshen, et autres
Publié: (2025)
par: Zhou, Enshen, et autres
Publié: (2025)
RAZER: Robust Accelerated Zero-Shot 3D Open-Vocabulary Panoptic Reconstruction with Spatio-Temporal Aggregation
par: Patel, Naman, et autres
Publié: (2025)
par: Patel, Naman, et autres
Publié: (2025)
S.T.A.R.-Track: Latent Motion Models for End-to-End 3D Object Tracking with Adaptive Spatio-Temporal Appearance Representations
par: Doll, Simon, et autres
Publié: (2023)
par: Doll, Simon, et autres
Publié: (2023)
Aion: Towards Hierarchical 4D Scene Graphs with Temporal Flow Dynamics
par: Catalano, Iacopo, et autres
Publié: (2025)
par: Catalano, Iacopo, et autres
Publié: (2025)
Generalized Robot 3D Vision-Language Model with Fast Rendering and Pre-Training Vision-Language Alignment
par: Liu, Kangcheng, et autres
Publié: (2023)
par: Liu, Kangcheng, et autres
Publié: (2023)
Weather-Robust Scene Semantics with Vision-Aligned 4D Radar
par: Hamilton, Kali, et autres
Publié: (2026)
par: Hamilton, Kali, et autres
Publié: (2026)
STRNet: Visual Navigation with Spatio-Temporal Representation through Dynamic Graph Aggregation
par: Ren, Hao, et autres
Publié: (2026)
par: Ren, Hao, et autres
Publié: (2026)
CapVector: Learning Transferable Capability Vectors in Parametric Space for Vision-Language-Action Models
par: Song, Wenxuan, et autres
Publié: (2026)
par: Song, Wenxuan, et autres
Publié: (2026)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
par: Guo, Wenxuan, et autres
Publié: (2026)
par: Guo, Wenxuan, et autres
Publié: (2026)
AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving
par: Qian, Kangan, et autres
Publié: (2025)
par: Qian, Kangan, et autres
Publié: (2025)
Kinema4D: Kinematic 4D World Modeling for Spatiotemporal Embodied Simulation
par: Xu, Mutian, et autres
Publié: (2026)
par: Xu, Mutian, et autres
Publié: (2026)
CLIP-Clique: Graph-based Correspondence Matching Augmented by Vision Language Models for Object-based Global Localization
par: Matsuzaki, Shigemichi, et autres
Publié: (2024)
par: Matsuzaki, Shigemichi, et autres
Publié: (2024)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
par: jia, Feiyang, et autres
Publié: (2026)
par: jia, Feiyang, et autres
Publié: (2026)
Affordance-R1: Reinforcement Learning for Generalizable Affordance Reasoning in Multimodal Large Language Model
par: Wang, Hanqing, et autres
Publié: (2025)
par: Wang, Hanqing, et autres
Publié: (2025)
Documents similaires
-
SNOW: Spatio-Temporal Scene Understanding with World Knowledge for Open-World Embodied Reasoning
par: Sohn, Tin Stribor, et autres
Publié: (2025) -
Embodied4C: Measuring What Matters for Embodied Vision-Language Navigation
par: Sohn, Tin Stribor, et autres
Publié: (2025) -
A Framework for a Capability-driven Evaluation of Scenario Understanding for Multimodal Large Language Models in Autonomous Driving
par: Sohn, Tin Stribor, et autres
Publié: (2025) -
ST-Booster: An Iterative SpatioTemporal Perception Booster for Vision-and-Language Navigation in Continuous Environments
par: Yue, Lu, et autres
Publié: (2025) -
Unifying 2D and 3D Vision-Language Understanding
par: Jain, Ayush, et autres
Publié: (2025)