CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Zeyuan, Zhang, Xiang, Xu, Haiyang, Xie, Jianwen, Tu, Zhuowen |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DepR: Depth Guided Single-view Scene Reconstruction with Instance-level Diffusion
by: Zhao, Qingcheng, et al.
Published: (2025)
by: Zhao, Qingcheng, et al.
Published: (2025)
OverLayBench: A Benchmark for Layout-to-Image Generation with Dense Overlaps
by: Li, Bingnan, et al.
Published: (2025)
by: Li, Bingnan, et al.
Published: (2025)
YOLO-Count: Differentiable Object Counting for Text-to-Image Generation
by: Zeng, Guanning, et al.
Published: (2025)
by: Zeng, Guanning, et al.
Published: (2025)
Bayesian Diffusion Models for 3D Shape Reconstruction
by: Xu, Haiyang, et al.
Published: (2024)
by: Xu, Haiyang, et al.
Published: (2024)
Exploring the Equivalence of Closed-Set Generative and Real Data Augmentation in Image Classification
by: Wang, Haowen, et al.
Published: (2025)
by: Wang, Haowen, et al.
Published: (2025)
OmniControlNet: Dual-stage Integration for Conditional Image Generation
by: Wang, Yilin, et al.
Published: (2024)
by: Wang, Yilin, et al.
Published: (2024)
Soft Tail-dropping for Adaptive Visual Tokenization
by: Chen, Zeyuan, et al.
Published: (2026)
by: Chen, Zeyuan, et al.
Published: (2026)
Gaussian Swaying: Surface-Based Framework for Aerodynamic Simulation with 3D Gaussians
by: Yan, Hongru, et al.
Published: (2025)
by: Yan, Hongru, et al.
Published: (2025)
CyCLeGen: Cycle-Consistent Layout Prediction and Image Generation in Vision Foundation Models
by: Shan, Xiaojun, et al.
Published: (2026)
by: Shan, Xiaojun, et al.
Published: (2026)
C3Editor: Achieving Controllable Consistency in 2D Model for 3D Editing
by: Tao, Zeng, et al.
Published: (2025)
by: Tao, Zeng, et al.
Published: (2025)
PixARMesh: Autoregressive Mesh-Native Single-View Scene Reconstruction
by: Zhang, Xiang, et al.
Published: (2026)
by: Zhang, Xiang, et al.
Published: (2026)
VideoNSA: Native Sparse Attention Scales Video Understanding
by: Song, Enxin, et al.
Published: (2025)
by: Song, Enxin, et al.
Published: (2025)
Hierarchical Spatial Proximity Reasoning for Vision-and-Language Navigation
by: Xu, Ming, et al.
Published: (2024)
by: Xu, Ming, et al.
Published: (2024)
SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
by: Ma, Wufei, et al.
Published: (2025)
by: Ma, Wufei, et al.
Published: (2025)
AffordanceLLM: Grounding Affordance from Vision Language Models
by: Qian, Shengyi, et al.
Published: (2024)
by: Qian, Shengyi, et al.
Published: (2024)
Non-autoregressive Sequence-to-Sequence Vision-Language Models
by: Shi, Kunyu, et al.
Published: (2024)
by: Shi, Kunyu, et al.
Published: (2024)
Restoration by Generation with Constrained Priors
by: Ding, Zheng, et al.
Published: (2023)
by: Ding, Zheng, et al.
Published: (2023)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
by: Deng, Nianchen, et al.
Published: (2025)
by: Deng, Nianchen, et al.
Published: (2025)
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
by: Batra, Hunar, et al.
Published: (2025)
by: Batra, Hunar, et al.
Published: (2025)
Distributed Image Compression with Multimodal Side Information at Extremely Low Bitrates
by: Xu, Guojun, et al.
Published: (2026)
by: Xu, Guojun, et al.
Published: (2026)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
by: Tian, Kexin, et al.
Published: (2025)
by: Tian, Kexin, et al.
Published: (2025)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
by: Cheng, An-Chieh, et al.
Published: (2024)
by: Cheng, An-Chieh, et al.
Published: (2024)
Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
by: Dongfang, Zihao, et al.
Published: (2025)
by: Dongfang, Zihao, et al.
Published: (2025)
Multimodal Spatial Reasoning in the Large Model Era: A Survey and Benchmarks
by: Zheng, Xu, et al.
Published: (2025)
by: Zheng, Xu, et al.
Published: (2025)
Vision-Language Memory for Spatial Reasoning
by: Liu, Zuntao, et al.
Published: (2025)
by: Liu, Zuntao, et al.
Published: (2025)
Lay-Your-Scene: Natural Scene Layout Generation with Diffusion Transformers
by: Srivastava, Divyansh, et al.
Published: (2025)
by: Srivastava, Divyansh, et al.
Published: (2025)
SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
by: Guo, Xianda, et al.
Published: (2024)
by: Guo, Xianda, et al.
Published: (2024)
OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning
by: Li, Xianhang, et al.
Published: (2025)
by: Li, Xianhang, et al.
Published: (2025)
Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels
by: Zong, Yongshuo, et al.
Published: (2025)
by: Zong, Yongshuo, et al.
Published: (2025)
DrVD-Bench: Do Vision-Language Models Reason Like Human Doctors in Medical Image Diagnosis?
by: Zhou, Tianhong, et al.
Published: (2025)
by: Zhou, Tianhong, et al.
Published: (2025)
11Plus-Bench: Demystifying Multimodal LLM Spatial Reasoning with Cognitive-Inspired Analysis
by: Li, Chengzu, et al.
Published: (2025)
by: Li, Chengzu, et al.
Published: (2025)
AuthGuard: Generalizable Deepfake Detection via Language Guidance
by: Shen, Guangyu, et al.
Published: (2025)
by: Shen, Guangyu, et al.
Published: (2025)
How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning
by: Yang, Luyu, et al.
Published: (2026)
by: Yang, Luyu, et al.
Published: (2026)
Neural Plasticity-Inspired Multimodal Foundation Model for Earth Observation
by: Xiong, Zhitong, et al.
Published: (2024)
by: Xiong, Zhitong, et al.
Published: (2024)
TRIM: Scalable 3D Gaussian Diffusion Inference with Temporal and Spatial Trimming
by: Yin, Zeyuan, et al.
Published: (2025)
by: Yin, Zeyuan, et al.
Published: (2025)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
by: Chen, Jiaxing, et al.
Published: (2024)
by: Chen, Jiaxing, et al.
Published: (2024)
A Light and Smart Wearable Platform with Multimodal Foundation Model for Enhanced Spatial Reasoning in People with Blindness and Low Vision
by: Magay, Alexey, et al.
Published: (2025)
by: Magay, Alexey, et al.
Published: (2025)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
by: Zhou, Shengchao, et al.
Published: (2025)
by: Zhou, Shengchao, et al.
Published: (2025)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
by: Huang, Xinmiao, et al.
Published: (2025)
by: Huang, Xinmiao, et al.
Published: (2025)
Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens
by: Yang, Zeyuan, et al.
Published: (2025)
by: Yang, Zeyuan, et al.
Published: (2025)
Similar Items
-
DepR: Depth Guided Single-view Scene Reconstruction with Instance-level Diffusion
by: Zhao, Qingcheng, et al.
Published: (2025) -
OverLayBench: A Benchmark for Layout-to-Image Generation with Dense Overlaps
by: Li, Bingnan, et al.
Published: (2025) -
YOLO-Count: Differentiable Object Counting for Text-to-Image Generation
by: Zeng, Guanning, et al.
Published: (2025) -
Bayesian Diffusion Models for 3D Shape Reconstruction
by: Xu, Haiyang, et al.
Published: (2024) -
Exploring the Equivalence of Closed-Set Generative and Real Data Augmentation in Image Classification
by: Wang, Haowen, et al.
Published: (2025)