DSI-Bench: A Benchmark for Dynamic Spatial Intelligence
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Ziang, Wang, Zehan, Zhang, Guanghao, Dai, Weilong, Xia, Yan, Yan, Ziang, Hong, Minjie, Zhao, Zhou |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization
par: Hong, Minjie, et autres
Publié: (2025)
par: Hong, Minjie, et autres
Publié: (2025)
GenSpace: Benchmarking Spatially-Aware Image Generation
par: Wang, Zehan, et autres
Publié: (2025)
par: Wang, Zehan, et autres
Publié: (2025)
Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models
par: Wang, Zehan, et autres
Publié: (2024)
par: Wang, Zehan, et autres
Publié: (2024)
Depth Anything with Any Prior
par: Wang, Zehan, et autres
Publié: (2025)
par: Wang, Zehan, et autres
Publié: (2025)
OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
par: Wang, Zehan, et autres
Publié: (2024)
par: Wang, Zehan, et autres
Publié: (2024)
Spatial4D-Bench: A Versatile 4D Spatial Intelligence Benchmark
par: Wang, Pan, et autres
Publié: (2025)
par: Wang, Pan, et autres
Publié: (2025)
Orient Anything V2: Unifying Orientation and Rotation Understanding
par: Wang, Zehan, et autres
Publié: (2026)
par: Wang, Zehan, et autres
Publié: (2026)
Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture
par: Zhang, Longxiang, et autres
Publié: (2026)
par: Zhang, Longxiang, et autres
Publié: (2026)
MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence
par: Yang, Sihan, et autres
Publié: (2025)
par: Yang, Sihan, et autres
Publié: (2025)
DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding
par: Zhang, Peng, et autres
Publié: (2026)
par: Zhang, Peng, et autres
Publié: (2026)
SpineBench: Benchmarking Multimodal LLMs for Spinal Pathology Analysis
par: Zhang, Chenghanyu, et autres
Publié: (2025)
par: Zhang, Chenghanyu, et autres
Publié: (2025)
DSI2I: Dense Style for Unpaired Image-to-Image Translation
par: Ozaydin, Baran, et autres
Publié: (2022)
par: Ozaydin, Baran, et autres
Publié: (2022)
ExpVid: A Benchmark for Experiment Video Understanding & Reasoning
par: Xu, Yicheng, et autres
Publié: (2025)
par: Xu, Yicheng, et autres
Publié: (2025)
EvoEmpirBench: Dynamic Spatial Reasoning with Agent-ExpVer
par: Zhao, Pukun, et autres
Publié: (2025)
par: Zhao, Pukun, et autres
Publié: (2025)
CageDroneRF: A Large-Scale RF Benchmark and Toolkit for Drone Perception
par: Rostami, Mohammad, et autres
Publié: (2026)
par: Rostami, Mohammad, et autres
Publié: (2026)
IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
par: Zhang, Tao, et autres
Publié: (2025)
par: Zhang, Tao, et autres
Publié: (2025)
SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation
par: Zhou, Sashuai, et autres
Publié: (2026)
par: Zhou, Sashuai, et autres
Publié: (2026)
EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery
par: Xu, Zelin, et autres
Publié: (2026)
par: Xu, Zelin, et autres
Publié: (2026)
ER-LoRA: Effective-Rank Guided Adaptation for Weather-Generalized Depth Estimation
par: Yan, Weilong, et autres
Publié: (2025)
par: Yan, Weilong, et autres
Publié: (2025)
ArtiBench and ArtiBrain: Benchmarking Generalizable Vision-Language Articulated Object Manipulation
par: Wu, Yuhan, et autres
Publié: (2025)
par: Wu, Yuhan, et autres
Publié: (2025)
Framework for lung CT image segmentation based on UNet++
par: Ziang, Hao, et autres
Publié: (2025)
par: Ziang, Hao, et autres
Publié: (2025)
MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence
par: Lin, Jingli, et autres
Publié: (2025)
par: Lin, Jingli, et autres
Publié: (2025)
SpatialBench: Is Your Spatial Foundation Model an All-Round Player?
par: Peng, Haosong, et autres
Publié: (2026)
par: Peng, Haosong, et autres
Publié: (2026)
DiffTF++: 3D-aware Diffusion Transformer for Large-Vocabulary 3D Generation
par: Cao, Ziang, et autres
Publié: (2024)
par: Cao, Ziang, et autres
Publié: (2024)
DIME-Net: A Dual-Illumination Adaptive Enhancement Network Based on Retinex and Mixture-of-Experts
par: Wang, Ziang, et autres
Publié: (2025)
par: Wang, Ziang, et autres
Publié: (2025)
Research on Intelligent Aided Diagnosis System of Medical Image Based on Computer Deep Learning
par: Yuan, Jiajie, et autres
Publié: (2024)
par: Yuan, Jiajie, et autres
Publié: (2024)
MedDiff-FT: Data-Efficient Diffusion Model Fine-tuning with Structural Guidance for Controllable Medical Image Synthesis
par: Xie, Jianhao, et autres
Publié: (2025)
par: Xie, Jianhao, et autres
Publié: (2025)
HiSciBench: A Hierarchical Multi-disciplinary Benchmark for Scientific Intelligence from Reading to Discovery
par: Zhang, Yaping, et autres
Publié: (2025)
par: Zhang, Yaping, et autres
Publié: (2025)
MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents
par: Huang, Peizhou, et autres
Publié: (2026)
par: Huang, Peizhou, et autres
Publié: (2026)
SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence
par: Pan, Yulu, et autres
Publié: (2026)
par: Pan, Yulu, et autres
Publié: (2026)
Investigation of Customized Medical Decision Algorithms Utilizing Graph Neural Networks
par: Yan, Yafeng, et autres
Publié: (2024)
par: Yan, Yafeng, et autres
Publié: (2024)
Everything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Models
par: Wang, Zengbin, et autres
Publié: (2026)
par: Wang, Zengbin, et autres
Publié: (2026)
SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation
par: Zhou, Xiaolong, et autres
Publié: (2026)
par: Zhou, Xiaolong, et autres
Publié: (2026)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
par: Zhao, Baining, et autres
Publié: (2025)
par: Zhao, Baining, et autres
Publié: (2025)
Stepping VLMs onto the Court: Benchmarking Spatial Intelligence in Sports
par: Yang, Yuchen, et autres
Publié: (2026)
par: Yang, Yuchen, et autres
Publié: (2026)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
par: Wang, Xinran, et autres
Publié: (2026)
par: Wang, Xinran, et autres
Publié: (2026)
PhysX-3D: Physical-Grounded 3D Asset Generation
par: Cao, Ziang, et autres
Publié: (2025)
par: Cao, Ziang, et autres
Publié: (2025)
Collaborative Multi-Modal Coding for High-Quality 3D Generation
par: Cao, Ziang, et autres
Publié: (2025)
par: Cao, Ziang, et autres
Publié: (2025)
Generalizable Metric Network for Cross-domain Person Re-identification
par: Qi, Lei, et autres
Publié: (2023)
par: Qi, Lei, et autres
Publié: (2023)
DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain
par: Jin, Song, et autres
Publié: (2026)
par: Jin, Song, et autres
Publié: (2026)
Documents similaires
-
APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization
par: Hong, Minjie, et autres
Publié: (2025) -
GenSpace: Benchmarking Spatially-Aware Image Generation
par: Wang, Zehan, et autres
Publié: (2025) -
Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models
par: Wang, Zehan, et autres
Publié: (2024) -
Depth Anything with Any Prior
par: Wang, Zehan, et autres
Publié: (2025) -
OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
par: Wang, Zehan, et autres
Publié: (2024)