Learning to Localize Objects Improves Spatial Reasoning in Visual-LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Ranasinghe, Kanchana, Shukla, Satya Narayan, Poursaeed, Omid, Ryoo, Michael S., Lin, Tsung-Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CoPT: Unsupervised Domain Adaptive Segmentation using Domain-Agnostic Text Embeddings
di: Mata, Cristina, et al.
Pubblicazione: (2025)
di: Mata, Cristina, et al.
Pubblicazione: (2025)
Language Repository for Long Video Understanding
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
Understanding Long Videos with Multimodal Language Models
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024)
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024)
Pixel Motion Diffusion is What We Need for Robot Control
di: Nguyen, E-Ro, et al.
Pubblicazione: (2025)
di: Nguyen, E-Ro, et al.
Pubblicazione: (2025)
Too Many Frames, Not All Useful: Efficient Strategies for Long-Form Video QA
di: Park, Jongwoo, et al.
Pubblicazione: (2024)
di: Park, Jongwoo, et al.
Pubblicazione: (2024)
Pixel Motion as Universal Representation for Robot Control
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2025)
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2025)
Future Optical Flow Prediction Improves Robot Control & Video Generation
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2026)
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2026)
LatentCRF: Continuous CRF for Efficient Latent Diffusion
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024)
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024)
Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning
di: Watawana, Hasindri, et al.
Pubblicazione: (2024)
di: Watawana, Hasindri, et al.
Pubblicazione: (2024)
A Simple and Effective Reinforcement Learning Method for Text-to-Image Diffusion Fine-tuning
di: Gupta, Shashank, et al.
Pubblicazione: (2025)
di: Gupta, Shashank, et al.
Pubblicazione: (2025)
Robotic VLA Benefits from Joint Learning with Motion Image Diffusion
di: Fang, Yu, et al.
Pubblicazione: (2025)
di: Fang, Yu, et al.
Pubblicazione: (2025)
Predicting Penalty Kick Direction Using Multi-Modal Deep Learning with Pose-Guided Attention
di: Ranasinghe, Pasindu, et al.
Pubblicazione: (2025)
di: Ranasinghe, Pasindu, et al.
Pubblicazione: (2025)
Decorum: A Language-Based Approach For Style-Conditioned Synthesis of Indoor 3D Scenes
di: Marshall, Kelly O., et al.
Pubblicazione: (2025)
di: Marshall, Kelly O., et al.
Pubblicazione: (2025)
Learning to See Through a Baby's Eyes: Early Visual Diets Enable Robust Visual Intelligence in Humans and Machines
di: Cai, Yusen, et al.
Pubblicazione: (2025)
di: Cai, Yusen, et al.
Pubblicazione: (2025)
SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning
di: Li, Yian, et al.
Pubblicazione: (2026)
di: Li, Yian, et al.
Pubblicazione: (2026)
RAWDet-7: A Multi-Scenario Benchmark for Object Detection and Description on Quantized RAW Images
di: Fatima, Mishal, et al.
Pubblicazione: (2026)
di: Fatima, Mishal, et al.
Pubblicazione: (2026)
Test-Time Optimization for Domain Adaptive Open Vocabulary Segmentation
di: De Silva, Ulindu, et al.
Pubblicazione: (2025)
di: De Silva, Ulindu, et al.
Pubblicazione: (2025)
Learning GUI Grounding with Spatial Reasoning from Visual Feedback
di: Zhao, Yu, et al.
Pubblicazione: (2025)
di: Zhao, Yu, et al.
Pubblicazione: (2025)
Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning
di: Yang, Jingru, et al.
Pubblicazione: (2024)
di: Yang, Jingru, et al.
Pubblicazione: (2024)
MambaGlue: Fast and Robust Local Feature Matching With Mamba
di: Ryoo, Kihwan, et al.
Pubblicazione: (2025)
di: Ryoo, Kihwan, et al.
Pubblicazione: (2025)
Improving Object Detection via Local-global Contrastive Learning
di: Triantafyllidou, Danai, et al.
Pubblicazione: (2024)
di: Triantafyllidou, Danai, et al.
Pubblicazione: (2024)
Seeing Through Smoke: Surgical Desmoking for Improved Visual Perception
di: Lu, Jingpei, et al.
Pubblicazione: (2026)
di: Lu, Jingpei, et al.
Pubblicazione: (2026)
Crossway Diffusion: Improving Diffusion-based Visuomotor Policy via Self-supervised Learning
di: Li, Xiang, et al.
Pubblicazione: (2023)
di: Li, Xiang, et al.
Pubblicazione: (2023)
Detect2Interact: Localizing Object Key Field in Visual Question Answering (VQA) with LLMs
di: Wang, Jialou, et al.
Pubblicazione: (2024)
di: Wang, Jialou, et al.
Pubblicazione: (2024)
LLaRA: Supercharging Robot Learning Data for Vision-Language Policy
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback
di: Chen, Yang, et al.
Pubblicazione: (2025)
di: Chen, Yang, et al.
Pubblicazione: (2025)
Spatial Reasoning in Foundation Models: Benchmarking Object-Centric Spatial Understanding
di: Mirjalili, Vahid, et al.
Pubblicazione: (2025)
di: Mirjalili, Vahid, et al.
Pubblicazione: (2025)
CausalSpatial: A Benchmark for Object-Centric Causal Spatial Reasoning
di: Ma, Wenxin, et al.
Pubblicazione: (2026)
di: Ma, Wenxin, et al.
Pubblicazione: (2026)
Improving Open-World Object Localization by Discovering Background
di: Singh, Ashish, et al.
Pubblicazione: (2025)
di: Singh, Ashish, et al.
Pubblicazione: (2025)
WLST: Weak Labels Guided Self-training for Weakly-supervised Domain Adaptation on 3D Object Detection
di: Tsou, Tsung-Lin, et al.
Pubblicazione: (2023)
di: Tsou, Tsung-Lin, et al.
Pubblicazione: (2023)
SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization
di: Pham, Tan-Hanh, et al.
Pubblicazione: (2024)
di: Pham, Tan-Hanh, et al.
Pubblicazione: (2024)
WaSt-3D: Wasserstein-2 Distance for Scene-to-Scene Stylization on 3D Gaussians
di: Kotovenko, Dmytro, et al.
Pubblicazione: (2024)
di: Kotovenko, Dmytro, et al.
Pubblicazione: (2024)
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026)
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026)
Structured Spatial Reasoning with Open Vocabulary Object Detectors
di: Nejatishahidin, Negar, et al.
Pubblicazione: (2024)
di: Nejatishahidin, Negar, et al.
Pubblicazione: (2024)
Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
Image Translation with Kernel Prediction Networks for Semantic Segmentation
di: Mata, Cristina, et al.
Pubblicazione: (2025)
di: Mata, Cristina, et al.
Pubblicazione: (2025)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
di: Ni, Minheng, et al.
Pubblicazione: (2025)
di: Ni, Minheng, et al.
Pubblicazione: (2025)
Video Spatial Reasoning with Object-Centric 3D Rollout
di: Tang, Haoran, et al.
Pubblicazione: (2025)
di: Tang, Haoran, et al.
Pubblicazione: (2025)
A Versatile and Differentiable Hand-Object Interaction Representation
di: Morales, Théo, et al.
Pubblicazione: (2024)
di: Morales, Théo, et al.
Pubblicazione: (2024)
STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs
di: Li, Zongzhao, et al.
Pubblicazione: (2025)
di: Li, Zongzhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CoPT: Unsupervised Domain Adaptive Segmentation using Domain-Agnostic Text Embeddings
di: Mata, Cristina, et al.
Pubblicazione: (2025) -
Language Repository for Long Video Understanding
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024) -
Understanding Long Videos with Multimodal Language Models
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024) -
Pixel Motion Diffusion is What We Need for Robot Control
di: Nguyen, E-Ro, et al.
Pubblicazione: (2025) -
Too Many Frames, Not All Useful: Efficient Strategies for Long-Form Video QA
di: Park, Jongwoo, et al.
Pubblicazione: (2024)