MolmoPoint: Better Pointing for VLMs with Grounding Tokens
Fuente:
arXiv
Guardado en:
| Autores principales: | Clark, Christopher, Yang, Yue, Park, Jae Sung, Ma, Zixian, Zhang, Jieyu, Tripathi, Rohun, Salehi, Mohammadreza, Lee, Sangho, Anderson, Taira, Han, Winson, Krishna, Ranjay |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
por: Zhang, Jianrui, et al.
Publicado: (2026)
por: Zhang, Jianrui, et al.
Publicado: (2026)
Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding
por: Clark, Christopher, et al.
Publicado: (2026)
por: Clark, Christopher, et al.
Publicado: (2026)
VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition
por: Yadav, Tanush, et al.
Publicado: (2026)
por: Yadav, Tanush, et al.
Publicado: (2026)
MolmoWeb: Open Visual Web Agent and Open Data for the Open Web
por: Gupta, Tanmay, et al.
Publicado: (2026)
por: Gupta, Tanmay, et al.
Publicado: (2026)
One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory
por: Zheng, Chenhao, et al.
Publicado: (2025)
por: Zheng, Chenhao, et al.
Publicado: (2025)
Synthetic Object Compositions for Scalable and Accurate Learning in Detection, Segmentation, and Grounding
por: Huang, Weikai, et al.
Publicado: (2025)
por: Huang, Weikai, et al.
Publicado: (2025)
MolmoAct: Action Reasoning Models that can Reason in Space
por: Lee, Jason, et al.
Publicado: (2025)
por: Lee, Jason, et al.
Publicado: (2025)
SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning
por: Jain, Jitesh, et al.
Publicado: (2025)
por: Jain, Jitesh, et al.
Publicado: (2025)
VideoMolmo: Spatio-Temporal Grounding Meets Pointing
por: Ahmad, Ghazi Shazan, et al.
Publicado: (2025)
por: Ahmad, Ghazi Shazan, et al.
Publicado: (2025)
Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models
por: Deitke, Matt, et al.
Publicado: (2024)
por: Deitke, Matt, et al.
Publicado: (2024)
GraspMolmo: Generalizable Task-Oriented Grasping via Large-Scale Synthetic Data Generation
por: Deshpande, Abhay, et al.
Publicado: (2025)
por: Deshpande, Abhay, et al.
Publicado: (2025)
MolmoB0T: Large-Scale Simulation Enables Zero-Shot Manipulation
por: Deshpande, Abhay, et al.
Publicado: (2026)
por: Deshpande, Abhay, et al.
Publicado: (2026)
m&m's: A Benchmark to Evaluate Tool-Use for multi-step multi-modal Tasks
por: Ma, Zixian, et al.
Publicado: (2024)
por: Ma, Zixian, et al.
Publicado: (2024)
You Only Judge Once: Multi-response Reward Modeling in a Single Forward Pass
por: Yang, Yinuo, et al.
Publicado: (2026)
por: Yang, Yinuo, et al.
Publicado: (2026)
ActionAtlas: A VideoQA Benchmark for Domain-specialized Action Recognition
por: Salehi, Mohammadreza, et al.
Publicado: (2024)
por: Salehi, Mohammadreza, et al.
Publicado: (2024)
MolmoAct2: Action Reasoning Models for Real-world Deployment
por: Fang, Haoquan, et al.
Publicado: (2026)
por: Fang, Haoquan, et al.
Publicado: (2026)
MolmoSpaces: A Large-Scale Open Ecosystem for Robot Navigation and Manipulation
por: Kim, Yejin, et al.
Publicado: (2026)
por: Kim, Yejin, et al.
Publicado: (2026)
Iterated Learning Improves Compositionality in Large Vision-Language Models
por: Zheng, Chenhao, et al.
Publicado: (2024)
por: Zheng, Chenhao, et al.
Publicado: (2024)
PointArena: Probing Multimodal Grounding Through Language-Guided Pointing
por: Cheng, Long, et al.
Publicado: (2025)
por: Cheng, Long, et al.
Publicado: (2025)
One Diffusion to Generate Them All
por: Le, Duong H., et al.
Publicado: (2024)
por: Le, Duong H., et al.
Publicado: (2024)
Synthetic Visual Genome 2: Extracting Large-scale Spatio-Temporal Scene Graphs from Videos
por: Gao, Ziqi, et al.
Publicado: (2026)
por: Gao, Ziqi, et al.
Publicado: (2026)
Visual Representations inside the Language Model
por: Liu, Benlin, et al.
Publicado: (2025)
por: Liu, Benlin, et al.
Publicado: (2025)
Ablate-to-Validate: Are Vision-Language Models Really Using Continuous Thought Tokens?
por: Zhang, Tianyi, et al.
Publicado: (2026)
por: Zhang, Tianyi, et al.
Publicado: (2026)
Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training
por: Gao, Ziqi, et al.
Publicado: (2024)
por: Gao, Ziqi, et al.
Publicado: (2024)
TrajTok: Learning Trajectory Tokens enables better Video Understanding
por: Zheng, Chenhao, et al.
Publicado: (2026)
por: Zheng, Chenhao, et al.
Publicado: (2026)
See, Symbolize, Act: Grounding VLMs with Spatial Representations for Better Gameplay
por: Baghel, Ashish, et al.
Publicado: (2026)
por: Baghel, Ashish, et al.
Publicado: (2026)
Rethinking Human Preference Evaluation of LLM Rationales
por: Li, Ziang, et al.
Publicado: (2025)
por: Li, Ziang, et al.
Publicado: (2025)
Towards Acyclic Preference Evaluation of Language Models via Multiple Evaluators
por: Hu, Zhengyu, et al.
Publicado: (2024)
por: Hu, Zhengyu, et al.
Publicado: (2024)
Task Me Anything
por: Zhang, Jieyu, et al.
Publicado: (2024)
por: Zhang, Jieyu, et al.
Publicado: (2024)
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
por: Chung, Jiwan, et al.
Publicado: (2025)
por: Chung, Jiwan, et al.
Publicado: (2025)
Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
por: Qin, Yiming, et al.
Publicado: (2025)
por: Qin, Yiming, et al.
Publicado: (2025)
Synthetic Visual Genome
por: Park, Jae Sung, et al.
Publicado: (2025)
por: Park, Jae Sung, et al.
Publicado: (2025)
RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics
por: Yuan, Wentao, et al.
Publicado: (2024)
por: Yuan, Wentao, et al.
Publicado: (2024)
WildDet3D: Scaling Promptable 3D Detection in the Wild
por: Huang, Weikai, et al.
Publicado: (2026)
por: Huang, Weikai, et al.
Publicado: (2026)
Video-Based Reward Modeling for Computer-Use Agents
por: Song, Linxin, et al.
Publicado: (2026)
por: Song, Linxin, et al.
Publicado: (2026)
Idiopathic colonic and small bowel varices: a rare endoscopic finding
por: Yue Zhao, et al.
Publicado: (2024)
por: Yue Zhao, et al.
Publicado: (2024)
REALEDIT: Reddit Edits As a Large-scale Empirical Dataset for Image Transformations
por: Sushko, Peter, et al.
Publicado: (2025)
por: Sushko, Peter, et al.
Publicado: (2025)
Offline Training of Language Model Agents with Functions as Learnable Weights
por: Zhang, Shaokun, et al.
Publicado: (2024)
por: Zhang, Shaokun, et al.
Publicado: (2024)
Compression of Large-Scale 3D Point Clouds Based on Joint Optimization of Point Sampling and Feature Extraction
por: Yim, Jae-Young, et al.
Publicado: (2024)
por: Yim, Jae-Young, et al.
Publicado: (2024)
The Physical Accessibility of Public Libraries to Users: A GIS Study
por: Park, Sung Jae
Publicado: (2011)
por: Park, Sung Jae
Publicado: (2011)
Ejemplares similares
-
Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
por: Zhang, Jianrui, et al.
Publicado: (2026) -
Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding
por: Clark, Christopher, et al.
Publicado: (2026) -
VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition
por: Yadav, Tanush, et al.
Publicado: (2026) -
MolmoWeb: Open Visual Web Agent and Open Data for the Open Web
por: Gupta, Tanmay, et al.
Publicado: (2026) -
One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory
por: Zheng, Chenhao, et al.
Publicado: (2025)