SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Pingyi, Lou, Yujing, Cao, Shen, Guo, Jinhui, Fan, Lubin, Wu, Yue, Yang, Lin, Ma, Lizhuang, Ye, Jieping |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PTZ-Calib: Robust Pan-Tilt-Zoom Camera Calibration
by: Guo, Jinhui, et al.
Published: (2025)
by: Guo, Jinhui, et al.
Published: (2025)
CoL3D: Collaborative Learning of Single-view Depth and Camera Intrinsics for Metric 3D Shape Recovery
by: Zhang, Chenghao, et al.
Published: (2025)
by: Zhang, Chenghao, et al.
Published: (2025)
AddressVLM: Cross-view Alignment Tuning for Image Address Localization using Large Vision-Language Models
by: Xu, Shixiong, et al.
Published: (2025)
by: Xu, Shixiong, et al.
Published: (2025)
Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs
by: Tong, Jintao, et al.
Published: (2025)
by: Tong, Jintao, et al.
Published: (2025)
NoPe-NeRF++: Local-to-Global Optimization of NeRF with No Pose Prior
by: Shi, Dongbo, et al.
Published: (2025)
by: Shi, Dongbo, et al.
Published: (2025)
HybridGS: Decoupling Transients and Statics with 2D and 3D Gaussian Splatting
by: Lin, Jingyu, et al.
Published: (2024)
by: Lin, Jingyu, et al.
Published: (2024)
AddressCLIP: Empowering Vision-Language Models for City-wide Image Address Localization
by: Xu, Shixiong, et al.
Published: (2024)
by: Xu, Shixiong, et al.
Published: (2024)
Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger
by: Yang, Qi, et al.
Published: (2025)
by: Yang, Qi, et al.
Published: (2025)
FastVLM: Efficient Vision Encoding for Vision Language Models
by: Vasu, Pavan Kumar Anasosalu, et al.
Published: (2024)
by: Vasu, Pavan Kumar Anasosalu, et al.
Published: (2024)
TrackGS: Optimizing COLMAP-Free 3D Gaussian Splatting with Global Track Constraints
by: Shi, Dongbo, et al.
Published: (2025)
by: Shi, Dongbo, et al.
Published: (2025)
Learning Neural Volumetric Pose Features for Camera Localization
by: Lin, Jingyu, et al.
Published: (2024)
by: Lin, Jingyu, et al.
Published: (2024)
CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering
by: Hong, Yuyang, et al.
Published: (2026)
by: Hong, Yuyang, et al.
Published: (2026)
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
by: Liu, Hanqing, et al.
Published: (2026)
by: Liu, Hanqing, et al.
Published: (2026)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
by: Chen, Boyuan, et al.
Published: (2024)
by: Chen, Boyuan, et al.
Published: (2024)
ScVLM: Enhancing Vision-Language Model for Safety-Critical Event Understanding
by: Shi, Liang, et al.
Published: (2024)
by: Shi, Liang, et al.
Published: (2024)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
by: Huang, Zhipeng, et al.
Published: (2024)
by: Huang, Zhipeng, et al.
Published: (2024)
Female Directors and Firms' Environmental Initiatives: Evidence From a Developing Economy
by: Nongnapat Thosuwanchot, et al.
Published: (2026)
by: Nongnapat Thosuwanchot, et al.
Published: (2026)
Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
by: Hong, Yuyang, et al.
Published: (2025)
by: Hong, Yuyang, et al.
Published: (2025)
HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding
by: Shi, Yanzhao, et al.
Published: (2025)
by: Shi, Yanzhao, et al.
Published: (2025)
BehaviorVLM: Unified Finetuning-Free Behavioral Understanding with Vision-Language Reasoning
by: Ke, Jingyang, et al.
Published: (2026)
by: Ke, Jingyang, et al.
Published: (2026)
A Survey on Semantic Communications in Internet of Vehicles
by: Ye, Sha, et al.
Published: (2025)
by: Ye, Sha, et al.
Published: (2025)
Amplifying Inter-message Distance: On Information Divergence Measures in Big Data
by: She, Rui, et al.
Published: (2017)
by: She, Rui, et al.
Published: (2017)
ExploreVLM: Closed-Loop Robot Exploration Task Planning with Vision-Language Models
by: Lou, Zhichen, et al.
Published: (2025)
by: Lou, Zhichen, et al.
Published: (2025)
MpoxVLM: A Vision-Language Model for Diagnosing Skin Lesions from Mpox Virus Infection
by: Cao, Xu, et al.
Published: (2024)
by: Cao, Xu, et al.
Published: (2024)
MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding
by: Wu, Qinzhuo, et al.
Published: (2024)
by: Wu, Qinzhuo, et al.
Published: (2024)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
by: Zhang, Jianke, et al.
Published: (2026)
by: Zhang, Jianke, et al.
Published: (2026)
PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models
by: Li, Yuliang, et al.
Published: (2026)
by: Li, Yuliang, et al.
Published: (2026)
FloorplanVLM: A Vision-Language Model for Floorplan Vectorization
by: Liu, Yuanqing, et al.
Published: (2026)
by: Liu, Yuanqing, et al.
Published: (2026)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
by: Zhang, Jusheng, et al.
Published: (2025)
by: Zhang, Jusheng, et al.
Published: (2025)
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
by: Zhang, Jian, et al.
Published: (2026)
by: Zhang, Jian, et al.
Published: (2026)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
by: Jin, Yizhang, et al.
Published: (2024)
by: Jin, Yizhang, et al.
Published: (2024)
Composition Vision-Language Understanding via Segment and Depth Anything Model
by: Huo, Mingxiao, et al.
Published: (2024)
by: Huo, Mingxiao, et al.
Published: (2024)
AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding
by: Masry, Ahmed, et al.
Published: (2025)
by: Masry, Ahmed, et al.
Published: (2025)
GazeVLM: A Vision-Language Model for Multi-Task Gaze Understanding
by: Mathew, Athul M., et al.
Published: (2025)
by: Mathew, Athul M., et al.
Published: (2025)
Arrow-Guided VLM: Enhancing Flowchart Understanding via Arrow Direction Encoding
by: Omasa, Takamitsu, et al.
Published: (2025)
by: Omasa, Takamitsu, et al.
Published: (2025)
IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
by: Ji, Yatai, et al.
Published: (2024)
by: Ji, Yatai, et al.
Published: (2024)
DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory
by: Ji, Zihe, et al.
Published: (2025)
by: Ji, Zihe, et al.
Published: (2025)
Uninformative news, limited attention and institutional investors
by: Maria Efthymiou, et al.
Published: (2026)
by: Maria Efthymiou, et al.
Published: (2026)
CF-VLM:CounterFactual Vision-Language Fine-tuning
by: Zhang, Jusheng, et al.
Published: (2025)
by: Zhang, Jusheng, et al.
Published: (2025)
VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm
by: Wu, Zhenkai, et al.
Published: (2025)
by: Wu, Zhenkai, et al.
Published: (2025)
Similar Items
-
PTZ-Calib: Robust Pan-Tilt-Zoom Camera Calibration
by: Guo, Jinhui, et al.
Published: (2025) -
CoL3D: Collaborative Learning of Single-view Depth and Camera Intrinsics for Metric 3D Shape Recovery
by: Zhang, Chenghao, et al.
Published: (2025) -
AddressVLM: Cross-view Alignment Tuning for Image Address Localization using Large Vision-Language Models
by: Xu, Shixiong, et al.
Published: (2025) -
Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs
by: Tong, Jintao, et al.
Published: (2025) -
NoPe-NeRF++: Local-to-Global Optimization of NeRF with No Pose Prior
by: Shi, Dongbo, et al.
Published: (2025)