CoSpace: Benchmarking Continuous Space Perception Ability for Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Yiqi, Wang, Ziyue, Zhang, Can, Li, Peng, Liu, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ActiView: Evaluating Active Perception Ability for Multimodal Large Language Models
par: Wang, Ziyue, et autres
Publié: (2024)
par: Wang, Ziyue, et autres
Publié: (2024)
EscapeCraft: A 3D Room Escape Environment for Benchmarking Complex Multimodal Reasoning Ability
par: Wang, Ziyue, et autres
Publié: (2025)
par: Wang, Ziyue, et autres
Publié: (2025)
CoMamba: Real-time Cooperative Perception Unlocked with State Space Models
par: Li, Jinlong, et autres
Publié: (2024)
par: Li, Jinlong, et autres
Publié: (2024)
SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models
par: Ranjbar, Sepehr Kazemi, et autres
Publié: (2025)
par: Ranjbar, Sepehr Kazemi, et autres
Publié: (2025)
G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning
par: Chen, Liang, et autres
Publié: (2025)
par: Chen, Liang, et autres
Publié: (2025)
Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models
par: Pham, Tan-Hanh, et autres
Publié: (2025)
par: Pham, Tan-Hanh, et autres
Publié: (2025)
Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time
par: Zhou, Weijie, et autres
Publié: (2026)
par: Zhou, Weijie, et autres
Publié: (2026)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
par: Zhang, Juntian, et autres
Publié: (2025)
par: Zhang, Juntian, et autres
Publié: (2025)
Mamba-CL: Optimizing Selective State Space Model in Null Space for Continual Learning
par: Cheng, De, et autres
Publié: (2024)
par: Cheng, De, et autres
Publié: (2024)
Dysca: A Dynamic and Scalable Benchmark for Evaluating Perception Ability of LVLMs
par: Zhang, Jie, et autres
Publié: (2024)
par: Zhang, Jie, et autres
Publié: (2024)
OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks
par: Fu, Ronghao, et autres
Publié: (2026)
par: Fu, Ronghao, et autres
Publié: (2026)
QuoVLA: Quotient Space for Vision-Language-Action Models
par: Wang, Xuan, et autres
Publié: (2026)
par: Wang, Xuan, et autres
Publié: (2026)
PolarVSR: A Unified Framework and Benchmark for Continuous Space-Time Polarization Video Reconstruction
par: Li, Chenggong, et autres
Publié: (2026)
par: Li, Chenggong, et autres
Publié: (2026)
Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens
par: Chen, Feng, et autres
Publié: (2024)
par: Chen, Feng, et autres
Publié: (2024)
Empowering Segmentation Ability to Multi-modal Large Language Models
par: Yang, Yuqi, et autres
Publié: (2024)
par: Yang, Yuqi, et autres
Publié: (2024)
MERGETUNE: Continued Fine-Tuning of Vision-Language Models
par: Wang, Wenqing, et autres
Publié: (2026)
par: Wang, Wenqing, et autres
Publié: (2026)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
par: Zhao, Baining, et autres
Publié: (2025)
par: Zhao, Baining, et autres
Publié: (2025)
LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models
par: Wang, Shuai, et autres
Publié: (2025)
par: Wang, Shuai, et autres
Publié: (2025)
Smooth Operator: Smooth Verifiable Reward Activates Spatial Reasoning Ability of Vision-Language Model
par: Jiao, Siwen, et autres
Publié: (2026)
par: Jiao, Siwen, et autres
Publié: (2026)
MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking
par: Liu, Xinqi, et autres
Publié: (2024)
par: Liu, Xinqi, et autres
Publié: (2024)
FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models
par: Zheng, Weiying, et autres
Publié: (2025)
par: Zheng, Weiying, et autres
Publié: (2025)
Long Context Transfer from Language to Vision
par: Zhang, Peiyuan, et autres
Publié: (2024)
par: Zhang, Peiyuan, et autres
Publié: (2024)
Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models
par: Wang, Weihang, et autres
Publié: (2025)
par: Wang, Weihang, et autres
Publié: (2025)
Evaluating Time Awareness and Cross-modal Active Perception of Large Models via 4D Escape Room Task
par: Dong, Yurui, et autres
Publié: (2026)
par: Dong, Yurui, et autres
Publié: (2026)
CoIN: A Benchmark of Continual Instruction tuNing for Multimodel Large Language Model
par: Chen, Cheng, et autres
Publié: (2024)
par: Chen, Cheng, et autres
Publié: (2024)
Selective State Space Memory for Large Vision-Language Models
par: Ng, Chee, et autres
Publié: (2024)
par: Ng, Chee, et autres
Publié: (2024)
SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models
par: Yu, Youngjoon, et autres
Publié: (2024)
par: Yu, Youngjoon, et autres
Publié: (2024)
QMamba: Post-Training Quantization for Vision State Space Models
par: Li, Yinglong, et autres
Publié: (2025)
par: Li, Yinglong, et autres
Publié: (2025)
Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces
par: Yang, Jihan, et autres
Publié: (2024)
par: Yang, Jihan, et autres
Publié: (2024)
Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis
par: Weng, Xingxing, et autres
Publié: (2026)
par: Weng, Xingxing, et autres
Publié: (2026)
Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval
par: Wang, Xin, et autres
Publié: (2025)
par: Wang, Xin, et autres
Publié: (2025)
From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D
par: Zhang, Jiahui, et autres
Publié: (2025)
par: Zhang, Jiahui, et autres
Publié: (2025)
PathReasoner-R1: Instilling Structured Reasoning into Pathology Vision-Language Model via Knowledge-Guided Policy Optimization
par: Jiang, Songhan, et autres
Publié: (2026)
par: Jiang, Songhan, et autres
Publié: (2026)
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
par: Wei, Yanbin, et autres
Publié: (2026)
par: Wei, Yanbin, et autres
Publié: (2026)
DAMamba: Vision State Space Model with Dynamic Adaptive Scan
par: Li, Tanzhe, et autres
Publié: (2025)
par: Li, Tanzhe, et autres
Publié: (2025)
GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models
par: Xie, Qinghongbing, et autres
Publié: (2025)
par: Xie, Qinghongbing, et autres
Publié: (2025)
HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models
par: Peng, Zelin, et autres
Publié: (2025)
par: Peng, Zelin, et autres
Publié: (2025)
Vision SmolMamba: Spike-Guided Token Pruning for Energy-Efficient Spiking State-Space Vision Models
par: Bai, Dewei, et autres
Publié: (2026)
par: Bai, Dewei, et autres
Publié: (2026)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
par: Wang, Jiankang, et autres
Publié: (2025)
par: Wang, Jiankang, et autres
Publié: (2025)
CoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language Tasks
par: Qi, Yu, et autres
Publié: (2025)
par: Qi, Yu, et autres
Publié: (2025)
Documents similaires
-
ActiView: Evaluating Active Perception Ability for Multimodal Large Language Models
par: Wang, Ziyue, et autres
Publié: (2024) -
EscapeCraft: A 3D Room Escape Environment for Benchmarking Complex Multimodal Reasoning Ability
par: Wang, Ziyue, et autres
Publié: (2025) -
CoMamba: Real-time Cooperative Perception Unlocked with State Space Models
par: Li, Jinlong, et autres
Publié: (2024) -
SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models
par: Ranjbar, Sepehr Kazemi, et autres
Publié: (2025) -
G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning
par: Chen, Liang, et autres
Publié: (2025)