PointArena: Probing Multimodal Grounding Through Language-Guided Pointing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cheng, Long, Duan, Jiafei, Wang, Yi Ru, Fang, Haoquan, Li, Boyang, Huang, Yushan, Wang, Elvis, Eftekhar, Ainaz, Lee, Jason, Yuan, Wentao, Hendrix, Rose, Smith, Noah A., Xia, Fei, Fox, Dieter, Krishna, Ranjay |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Selective Visual Representations Improve Convergence and Generalization for Embodied AI
par: Eftekhar, Ainaz, et autres
Publié: (2023)
par: Eftekhar, Ainaz, et autres
Publié: (2023)
SAM2Act: Integrating Visual Foundation Model with A Memory Architecture for Robotic Manipulation
par: Fang, Haoquan, et autres
Publié: (2025)
par: Fang, Haoquan, et autres
Publié: (2025)
RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics
par: Yuan, Wentao, et autres
Publié: (2024)
par: Yuan, Wentao, et autres
Publié: (2024)
Manipulate-Anything: Automating Real-World Robots using Vision-Language Models
par: Duan, Jiafei, et autres
Publié: (2024)
par: Duan, Jiafei, et autres
Publié: (2024)
FailSafe: Reasoning and Recovery from Failures in Vision-Language-Action Models
par: Lin, Zijun, et autres
Publié: (2025)
par: Lin, Zijun, et autres
Publié: (2025)
Recurrent-Depth VLA: Implicit Test-Time Compute Scaling of Vision-Language-Action Models via Latent Iterative Reasoning
par: Tur, Yalcin, et autres
Publié: (2026)
par: Tur, Yalcin, et autres
Publié: (2026)
EVE: Enabling Anyone to Train Robots using Augmented Reality
par: Wang, Jun, et autres
Publié: (2024)
par: Wang, Jun, et autres
Publié: (2024)
THE COLOSSEUM: A Benchmark for Evaluating Generalization for Robotic Manipulation
par: Pumacay, Wilbert, et autres
Publié: (2024)
par: Pumacay, Wilbert, et autres
Publié: (2024)
Convergent Functions, Divergent Forms
par: Jeon, Hyeonseong, et autres
Publié: (2025)
par: Jeon, Hyeonseong, et autres
Publié: (2025)
The One RING: a Robotic Indoor Navigation Generalist
par: Eftekhar, Ainaz, et autres
Publié: (2024)
par: Eftekhar, Ainaz, et autres
Publié: (2024)
MolmoAct: Action Reasoning Models that can Reason in Space
par: Lee, Jason, et autres
Publié: (2025)
par: Lee, Jason, et autres
Publié: (2025)
AHA: A Vision-Language-Model for Detecting and Reasoning Over Failures in Robotic Manipulation
par: Duan, Jiafei, et autres
Publié: (2024)
par: Duan, Jiafei, et autres
Publié: (2024)
MolmoB0T: Large-Scale Simulation Enables Zero-Shot Manipulation
par: Deshpande, Abhay, et autres
Publié: (2026)
par: Deshpande, Abhay, et autres
Publié: (2026)
MolmoAct2: Action Reasoning Models for Real-world Deployment
par: Fang, Haoquan, et autres
Publié: (2026)
par: Fang, Haoquan, et autres
Publié: (2026)
MolmoPoint: Better Pointing for VLMs with Grounding Tokens
par: Clark, Christopher, et autres
Publié: (2026)
par: Clark, Christopher, et autres
Publié: (2026)
GraspMolmo: Generalizable Task-Oriented Grasping via Large-Scale Synthetic Data Generation
par: Deshpande, Abhay, et autres
Publié: (2025)
par: Deshpande, Abhay, et autres
Publié: (2025)
VLS: Steering Pretrained Robot Policies via Vision-Language Models
par: Liu, Shuo, et autres
Publié: (2026)
par: Liu, Shuo, et autres
Publié: (2026)
TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics
par: Chen, Shirui, et autres
Publié: (2026)
par: Chen, Shirui, et autres
Publié: (2026)
MolmoSpaces: A Large-Scale Open Ecosystem for Robot Navigation and Manipulation
par: Kim, Yejin, et autres
Publié: (2026)
par: Kim, Yejin, et autres
Publié: (2026)
SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models
par: Ray, Arijit, et autres
Publié: (2024)
par: Ray, Arijit, et autres
Publié: (2024)
RoboEval: Where Robotic Manipulation Meets Structured and Scalable Evaluation
par: Wang, Yi Ru, et autres
Publié: (2025)
par: Wang, Yi Ru, et autres
Publié: (2025)
Effect of Pullulan‐Chitosan Film Containing Titanium Dioxide (TiO 2 ) Nanoparticle and Tarragon Essential Oil on the Quality Properties During Refrigerated Storage of Rainbow Trout Fillets
par: Ainaz Khodanazary
Publié: (2025)
par: Ainaz Khodanazary
Publié: (2025)
Effects of Carboxymethyl Chitosan/Pectin Coating Containing Free and Nanoliposome Mentha piperita Essential Oil on the Shelf Life of Shrimp During Ice Storage
par: Ainaz Khodanazary
Publié: (2025)
par: Ainaz Khodanazary
Publié: (2025)
vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models
par: Choi, Suhwan, et autres
Publié: (2026)
par: Choi, Suhwan, et autres
Publié: (2026)
GGPT: Geometry Grounded Point Transformer
par: Chen, Yutong, et autres
Publié: (2026)
par: Chen, Yutong, et autres
Publié: (2026)
SFPNet: Sparse Focal Point Network for Semantic Segmentation on General LiDAR Point Clouds
par: Wang, Yanbo, et autres
Publié: (2024)
par: Wang, Yanbo, et autres
Publié: (2024)
Comprehensive Analysis of the Full Tess Orbital Phase Curve of Wasp-121b
par: M. Eftekhar
Publié: (2022)
par: M. Eftekhar
Publié: (2022)
Exploring expectations of Iranian audiences in terms of consecutive interpreting: A reception study
par: Elnaz Eftekhar
Publié: (2024)
par: Elnaz Eftekhar
Publié: (2024)
RoboMD: Uncovering Robot Vulnerabilities through Semantic Potential Fields
par: Sagar, Som, et autres
Publié: (2024)
par: Sagar, Som, et autres
Publié: (2024)
Approximating First Hitting Point Distribution in Milestoning for Rare Event Kinetics
par: Wang, Ru, et autres
Publié: (2023)
par: Wang, Ru, et autres
Publié: (2023)
I Can Tell What I am Doing: Toward Real-World Natural Language Grounding of Robot Experiences
par: Wang, Zihan, et autres
Publié: (2024)
par: Wang, Zihan, et autres
Publié: (2024)
Neuro-Symbolic Temporal Point Processes
par: Yang, Yang, et autres
Publié: (2024)
par: Yang, Yang, et autres
Publié: (2024)
Point2Quad: Generating Quad Meshes from Point Clouds via Face Prediction
par: Li, Zezeng, et autres
Publié: (2025)
par: Li, Zezeng, et autres
Publié: (2025)
Study of Dropout in PointPillars with 3D Object Detection
par: Sun, Xiaoxiang, et autres
Publié: (2024)
par: Sun, Xiaoxiang, et autres
Publié: (2024)
MutaGReP: Execution-Free Repository-Grounded Plan Search for Code-Use
par: Khan, Zaid, et autres
Publié: (2025)
par: Khan, Zaid, et autres
Publié: (2025)
Point Bridge: 3D Representations for Cross Domain Policy Learning
par: Haldar, Siddhant, et autres
Publié: (2026)
par: Haldar, Siddhant, et autres
Publié: (2026)
Videoshop: Localized Semantic Video Editing with Noise-Extrapolated Diffusion Inversion
par: Fan, Xiang, et autres
Publié: (2024)
par: Fan, Xiang, et autres
Publié: (2024)
Ablate-to-Validate: Are Vision-Language Models Really Using Continuous Thought Tokens?
par: Zhang, Tianyi, et autres
Publié: (2026)
par: Zhang, Tianyi, et autres
Publié: (2026)
Non-conformal Line Defect (Shell Operator) in AdS$_3$/CFT$_2$: Spinning and Higher Point Correlators
par: Liu, Yuefeng, et autres
Publié: (2025)
par: Liu, Yuefeng, et autres
Publié: (2025)
Multimodal Point Cloud Semantic Segmentation With Virtual Point Enhancement
par: Duan, Zaipeng, et autres
Publié: (2025)
par: Duan, Zaipeng, et autres
Publié: (2025)
Documents similaires
-
Selective Visual Representations Improve Convergence and Generalization for Embodied AI
par: Eftekhar, Ainaz, et autres
Publié: (2023) -
SAM2Act: Integrating Visual Foundation Model with A Memory Architecture for Robotic Manipulation
par: Fang, Haoquan, et autres
Publié: (2025) -
RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics
par: Yuan, Wentao, et autres
Publié: (2024) -
Manipulate-Anything: Automating Real-World Robots using Vision-Language Models
par: Duan, Jiafei, et autres
Publié: (2024) -
FailSafe: Reasoning and Recovery from Failures in Vision-Language-Action Models
par: Lin, Zijun, et autres
Publié: (2025)