ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yiming, Chen, Jiacheng, Tan, Jiaqi, Mao, Yongsen, Chen, Wenhu, Chang, Angel X. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes
di: Liu, Tianhui, et al.
Pubblicazione: (2026)
di: Liu, Tianhui, et al.
Pubblicazione: (2026)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
di: Wang, Yuxin, et al.
Pubblicazione: (2025)
di: Wang, Yuxin, et al.
Pubblicazione: (2025)
SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding
di: Lin, Jiawen, et al.
Pubblicazione: (2025)
di: Lin, Jiawen, et al.
Pubblicazione: (2025)
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
di: Zhang, Jian, et al.
Pubblicazione: (2026)
di: Zhang, Jian, et al.
Pubblicazione: (2026)
Doctor: Optimizing Container Rebuild Efficiency by Instruction Re-Orchestration
di: Zhu, Zhiling, et al.
Pubblicazione: (2025)
di: Zhu, Zhiling, et al.
Pubblicazione: (2025)
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
di: Xu, Runsen, et al.
Pubblicazione: (2024)
di: Xu, Runsen, et al.
Pubblicazione: (2024)
ReMedi: Reasoner for Medical Clinical Prediction
di: Cao, Yushi, et al.
Pubblicazione: (2026)
di: Cao, Yushi, et al.
Pubblicazione: (2026)
Duoduo CLIP: Efficient 3D Understanding with Multi-View Images
di: Lee, Han-Hung, et al.
Pubblicazione: (2024)
di: Lee, Han-Hung, et al.
Pubblicazione: (2024)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
di: Chen, Boyuan, et al.
Pubblicazione: (2024)
di: Chen, Boyuan, et al.
Pubblicazione: (2024)
Rebuilding Public Confidence in Educational Assessment
di: Richardson, Mary
Pubblicazione: (2022)
di: Richardson, Mary
Pubblicazione: (2022)
VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding
di: He, Jianxiang, et al.
Pubblicazione: (2025)
di: He, Jianxiang, et al.
Pubblicazione: (2025)
ViGiL3D: A Linguistically Diverse Dataset for 3D Visual Grounding
di: Wang, Austin T., et al.
Pubblicazione: (2025)
di: Wang, Austin T., et al.
Pubblicazione: (2025)
CREG: Compass Relational Evidence Graph for Characterizing Directional Structure in VLM Spatial-Reasoning Attribution
di: Tan, Kaizhen, et al.
Pubblicazione: (2026)
di: Tan, Kaizhen, et al.
Pubblicazione: (2026)
VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents
di: Meng, Rui, et al.
Pubblicazione: (2025)
di: Meng, Rui, et al.
Pubblicazione: (2025)
VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
di: Jiang, Ziyan, et al.
Pubblicazione: (2024)
di: Jiang, Ziyan, et al.
Pubblicazione: (2024)
CoRe3D: Collaborative Reasoning as a Foundation for 3D Intelligence
di: Yu, Tianjiao, et al.
Pubblicazione: (2025)
di: Yu, Tianjiao, et al.
Pubblicazione: (2025)
SpatialLM: Training Large Language Models for Structured Indoor Modeling
di: Mao, Yongsen, et al.
Pubblicazione: (2025)
di: Mao, Yongsen, et al.
Pubblicazione: (2025)
S2O: Static to Openable Enhancement for Articulated 3D Objects
di: Iliash, Denys, et al.
Pubblicazione: (2024)
di: Iliash, Denys, et al.
Pubblicazione: (2024)
MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence
di: Yin, Xingyilang, et al.
Pubblicazione: (2026)
di: Yin, Xingyilang, et al.
Pubblicazione: (2026)
Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation
di: Zhang, Lingfeng, et al.
Pubblicazione: (2025)
di: Zhang, Lingfeng, et al.
Pubblicazione: (2025)
Rebuilding Syria
Pubblicazione: (2019)
Pubblicazione: (2019)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
di: Hu, Wenbo, et al.
Pubblicazione: (2025)
di: Hu, Wenbo, et al.
Pubblicazione: (2025)
How Do Document Parsers Break? Auditing Structural Vulnerability in Document Intelligence
di: Chen, Yue, et al.
Pubblicazione: (2026)
di: Chen, Yue, et al.
Pubblicazione: (2026)
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
di: Wang, Haozhe, et al.
Pubblicazione: (2026)
di: Wang, Haozhe, et al.
Pubblicazione: (2026)
Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning
di: Ma, Xueqi, et al.
Pubblicazione: (2026)
di: Ma, Xueqi, et al.
Pubblicazione: (2026)
SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning
di: Li, Yian, et al.
Pubblicazione: (2026)
di: Li, Yian, et al.
Pubblicazione: (2026)
Self-Rebuilding Artificial Mimetic Super-Intelligence: Proof of Ubiquitous Regeneration
di: Tabary, Frédéric
Pubblicazione: (2025)
di: Tabary, Frédéric
Pubblicazione: (2025)
ReVul-CoT: Towards Effective Software Vulnerability Assessment with Retrieval-Augmented Generation and Chain-of-Thought Prompting
di: Chen, Zhijie, et al.
Pubblicazione: (2025)
di: Chen, Zhijie, et al.
Pubblicazione: (2025)
SPATIALGEN: Layout-guided 3D Indoor Scene Generation
di: Fang, Chuan, et al.
Pubblicazione: (2025)
di: Fang, Chuan, et al.
Pubblicazione: (2025)
SpatialTraceGen: High-Fidelity Traces for Efficient VLM Spatial Reasoning Distillation
di: Huh, Gio, et al.
Pubblicazione: (2025)
di: Huh, Gio, et al.
Pubblicazione: (2025)
Do 3D Large Language Models Really Understand 3D Spatial Relationships?
di: Ma, Xianzheng, et al.
Pubblicazione: (2026)
di: Ma, Xianzheng, et al.
Pubblicazione: (2026)
VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search
di: Jia, Yiming, et al.
Pubblicazione: (2025)
di: Jia, Yiming, et al.
Pubblicazione: (2025)
I Know About "Up"! Enhancing Spatial Reasoning in Visual Language Models Through 3D Reconstruction
di: Meng, Zaiqiao, et al.
Pubblicazione: (2024)
di: Meng, Zaiqiao, et al.
Pubblicazione: (2024)
ReTrace: Interactive Visualizations for Reasoning Traces of Large Reasoning Models
di: Felder, Ludwig, et al.
Pubblicazione: (2025)
di: Felder, Ludwig, et al.
Pubblicazione: (2025)
VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm
di: Wu, Zhenkai, et al.
Pubblicazione: (2025)
di: Wu, Zhenkai, et al.
Pubblicazione: (2025)
DiReCT: Diagnostic Reasoning for Clinical Notes via Large Language Models
di: Wang, Bowen, et al.
Pubblicazione: (2024)
di: Wang, Bowen, et al.
Pubblicazione: (2024)
pySpatial: Generating 3D Visual Programs for Zero-Shot Spatial Reasoning
di: Luo, Zhanpeng, et al.
Pubblicazione: (2026)
di: Luo, Zhanpeng, et al.
Pubblicazione: (2026)
VISOR: VIsual Spatial Object Reasoning for Language-driven Object Navigation
di: Taioli, Francesco, et al.
Pubblicazione: (2026)
di: Taioli, Francesco, et al.
Pubblicazione: (2026)
UV-processing of icy pebbles in the outer parts of VSI-turbulent disks
di: Flores-Rivera, Lizxandra, et al.
Pubblicazione: (2024)
di: Flores-Rivera, Lizxandra, et al.
Pubblicazione: (2024)
Evaluating Visual and Cultural Interpretation: The K-Viscuit Benchmark with Human-VLM Collaboration
di: Park, ChaeHun, et al.
Pubblicazione: (2024)
di: Park, ChaeHun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes
di: Liu, Tianhui, et al.
Pubblicazione: (2026) -
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
di: Wang, Yuxin, et al.
Pubblicazione: (2025) -
SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding
di: Lin, Jiawen, et al.
Pubblicazione: (2025) -
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
di: Zhang, Jian, et al.
Pubblicazione: (2026) -
Doctor: Optimizing Container Rebuild Efficiency by Instruction Re-Orchestration
di: Zhu, Zhiling, et al.
Pubblicazione: (2025)