MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Qirui, He, Jingyi, Pan, Yining, Yeo, Si Yong, Yang, Xulei, Li, Shijie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Grounding by Remembering: Cross-Scene and In-Scene Memory for 3D Functional Affordances
por: Wang, Qirui, et al.
Publicado: (2026)
por: Wang, Qirui, et al.
Publicado: (2026)
Future-Aware Interaction Network For Motion Forecasting
por: Li, Shijie, et al.
Publicado: (2025)
por: Li, Shijie, et al.
Publicado: (2025)
Perception-Aware Multimodal Spatial Reasoning from Monocular Images
por: Cheng, Yanchun, et al.
Publicado: (2026)
por: Cheng, Yanchun, et al.
Publicado: (2026)
VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine
por: Zhang, Ziyang, et al.
Publicado: (2025)
por: Zhang, Ziyang, et al.
Publicado: (2025)
SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding
por: Li, Rong, et al.
Publicado: (2024)
por: Li, Rong, et al.
Publicado: (2024)
PanDA: Unsupervised Domain Adaptation for Multimodal 3D Panoptic Segmentation in Autonomous Driving
por: Pan, Yining, et al.
Publicado: (2026)
por: Pan, Yining, et al.
Publicado: (2026)
Global-Aware Monocular Semantic Scene Completion with State Space Models
por: Li, Shijie, et al.
Publicado: (2025)
por: Li, Shijie, et al.
Publicado: (2025)
Multi-View Industrial Anomaly Detection with Epipolar Constrained Cross-View Fusion
por: Liu, Yifan, et al.
Publicado: (2025)
por: Liu, Yifan, et al.
Publicado: (2025)
RIHA: Report-Image Hierarchical Alignment for Radiology Report Generation
por: Chen, Yucheng, et al.
Publicado: (2026)
por: Chen, Yucheng, et al.
Publicado: (2026)
Open Vocabulary Monocular 3D Object Detection
por: Yao, Jin, et al.
Publicado: (2024)
por: Yao, Jin, et al.
Publicado: (2024)
MonoPCC: Photometric-invariant Cycle Constraint for Monocular Depth Estimation of Endoscopic Images
por: Wang, Zhiwei, et al.
Publicado: (2024)
por: Wang, Zhiwei, et al.
Publicado: (2024)
MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations
por: Zhang, Ziyang, et al.
Publicado: (2025)
por: Zhang, Ziyang, et al.
Publicado: (2025)
Structured Spatial Reasoning with Open Vocabulary Object Detectors
por: Nejatishahidin, Negar, et al.
Publicado: (2024)
por: Nejatishahidin, Negar, et al.
Publicado: (2024)
OpenMonoGS-SLAM: Monocular Gaussian Splatting SLAM with Open-set Semantics
por: Yoo, Jisang, et al.
Publicado: (2025)
por: Yoo, Jisang, et al.
Publicado: (2025)
MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction
por: Li, Haitian, et al.
Publicado: (2026)
por: Li, Haitian, et al.
Publicado: (2026)
Monocular Open Vocabulary Occupancy Prediction for Indoor Scenes
por: Zhou, Changqing, et al.
Publicado: (2026)
por: Zhou, Changqing, et al.
Publicado: (2026)
Mono3R: Exploiting Monocular Cues for Geometric 3D Reconstruction
por: Li, Wenyu, et al.
Publicado: (2025)
por: Li, Wenyu, et al.
Publicado: (2025)
An Efficient 3D Convolutional Neural Network with Channel-wise, Spatial-grouped, and Temporal Convolutions
por: Wang, Zhe, et al.
Publicado: (2025)
por: Wang, Zhe, et al.
Publicado: (2025)
How Do Images Align and Complement LiDAR? Towards a Harmonized Multi-modal 3D Panoptic Segmentation
por: Pan, Yining, et al.
Publicado: (2025)
por: Pan, Yining, et al.
Publicado: (2025)
MonoDETRNext: Next-Generation Accurate and Efficient Monocular 3D Object Detector
por: Liao, Pan, et al.
Publicado: (2024)
por: Liao, Pan, et al.
Publicado: (2024)
MonoOcc: Digging into Monocular Semantic Occupancy Prediction
por: Zheng, Yupeng, et al.
Publicado: (2024)
por: Zheng, Yupeng, et al.
Publicado: (2024)
MonoDream: Monocular Vision-Language Navigation with Panoramic Dreaming
por: Wang, Shuo, et al.
Publicado: (2025)
por: Wang, Shuo, et al.
Publicado: (2025)
Mono2Stereo: Monocular Knowledge Transfer for Enhanced Stereo Matching
por: Wang, Yuran, et al.
Publicado: (2024)
por: Wang, Yuran, et al.
Publicado: (2024)
MonoGS++: Fast and Accurate Monocular RGB Gaussian SLAM
por: Li, Renwu, et al.
Publicado: (2025)
por: Li, Renwu, et al.
Publicado: (2025)
MonoPatchNeRF: Improving Neural Radiance Fields with Patch-based Monocular Guidance
por: Wu, Yuqun, et al.
Publicado: (2024)
por: Wu, Yuqun, et al.
Publicado: (2024)
Open-Vocabulary SAM3D: Towards Training-free Open-Vocabulary 3D Scene Understanding
por: Tai, Hanchen, et al.
Publicado: (2024)
por: Tai, Hanchen, et al.
Publicado: (2024)
MonoCloth: Reconstruction and Animation of Cloth-Decoupled Human Avatars from Monocular Videos
por: Jin, Daisheng, et al.
Publicado: (2025)
por: Jin, Daisheng, et al.
Publicado: (2025)
MonoMSK: Monocular 3D Musculoskeletal Dynamics Estimation
por: Koleini, Farnoosh, et al.
Publicado: (2025)
por: Koleini, Farnoosh, et al.
Publicado: (2025)
Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes Interactively
por: Yuan, Haobo, et al.
Publicado: (2024)
por: Yuan, Haobo, et al.
Publicado: (2024)
MonoPlane: Exploiting Monocular Geometric Cues for Generalizable 3D Plane Reconstruction
por: Zhao, Wang, et al.
Publicado: (2024)
por: Zhao, Wang, et al.
Publicado: (2024)
GLRD: Global-Local Collaborative Reason and Debate with PSL for 3D Open-Vocabulary Detection
por: Peng, Xingyu, et al.
Publicado: (2025)
por: Peng, Xingyu, et al.
Publicado: (2025)
Open-Vocabulary Segmentation with Semantic-Assisted Calibration
por: Liu, Yong, et al.
Publicado: (2023)
por: Liu, Yong, et al.
Publicado: (2023)
DiffPCN: Latent Diffusion Model Based on Multi-view Depth Images for Point Cloud Completion
por: Li, Zijun, et al.
Publicado: (2025)
por: Li, Zijun, et al.
Publicado: (2025)
Mono3DVG-EnSD: Enhanced Spatial-aware and Dimension-decoupled Text Encoding for Monocular 3D Visual Grounding
por: Li, Yuzhen, et al.
Publicado: (2025)
por: Li, Yuzhen, et al.
Publicado: (2025)
ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs
por: Li, Jiangyang, et al.
Publicado: (2026)
por: Li, Jiangyang, et al.
Publicado: (2026)
MonoDGP: Monocular 3D Object Detection with Decoupled-Query and Geometry-Error Priors
por: Pu, Fanqi, et al.
Publicado: (2024)
por: Pu, Fanqi, et al.
Publicado: (2024)
MonoMVSNet: Monocular Priors Guided Multi-View Stereo Network
por: Jiang, Jianfei, et al.
Publicado: (2025)
por: Jiang, Jianfei, et al.
Publicado: (2025)
MonoNPHM: Dynamic Head Reconstruction from Monocular Videos
por: Giebenhain, Simon, et al.
Publicado: (2023)
por: Giebenhain, Simon, et al.
Publicado: (2023)
USE: Universal Segment Embeddings for Open-Vocabulary Image Segmentation
por: Wang, Xiaoqi, et al.
Publicado: (2024)
por: Wang, Xiaoqi, et al.
Publicado: (2024)
Training an Open-Vocabulary Monocular 3D Object Detection Model without 3D Data
por: Huang, Rui, et al.
Publicado: (2024)
por: Huang, Rui, et al.
Publicado: (2024)
Ejemplares similares
-
Grounding by Remembering: Cross-Scene and In-Scene Memory for 3D Functional Affordances
por: Wang, Qirui, et al.
Publicado: (2026) -
Future-Aware Interaction Network For Motion Forecasting
por: Li, Shijie, et al.
Publicado: (2025) -
Perception-Aware Multimodal Spatial Reasoning from Monocular Images
por: Cheng, Yanchun, et al.
Publicado: (2026) -
VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine
por: Zhang, Ziyang, et al.
Publicado: (2025) -
SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding
por: Li, Rong, et al.
Publicado: (2024)