SITE: towards Spatial Intelligence Thorough Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Wenqi, Tan, Reuben, Zhu, Pengyue, Yang, Jianwei, Yang, Zhengyuan, Wang, Lijuan, Kolobov, Andrey, Gao, Jianfeng, Gong, Boqing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
di: Jain, Jitesh, et al.
Pubblicazione: (2024)
di: Jain, Jitesh, et al.
Pubblicazione: (2024)
List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs
di: Yan, An, et al.
Pubblicazione: (2024)
di: Yan, An, et al.
Pubblicazione: (2024)
Bring Metric Functions into Diffusion Models
di: An, Jie, et al.
Pubblicazione: (2024)
di: An, Jie, et al.
Pubblicazione: (2024)
Lifting Data-Tracing Machine Unlearning to Knowledge-Tracing for Foundation Models
di: Tan, Yuwen, et al.
Pubblicazione: (2025)
di: Tan, Yuwen, et al.
Pubblicazione: (2025)
Entity6K: A Large Open-Domain Evaluation Dataset for Real-World Entity Recognition
di: Qiu, Jielin, et al.
Pubblicazione: (2024)
di: Qiu, Jielin, et al.
Pubblicazione: (2024)
LiVOS: Light Video Object Segmentation with Gated Linear Matching
di: Liu, Qin, et al.
Pubblicazione: (2024)
di: Liu, Qin, et al.
Pubblicazione: (2024)
Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation
di: Yang, Zhengyuan, et al.
Pubblicazione: (2023)
di: Yang, Zhengyuan, et al.
Pubblicazione: (2023)
Culture in Action: Evaluating Text-to-Image Models through Social Activities
di: Malakouti, Sina, et al.
Pubblicazione: (2025)
di: Malakouti, Sina, et al.
Pubblicazione: (2025)
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
di: Yu, Weihao, et al.
Pubblicazione: (2023)
di: Yu, Weihao, et al.
Pubblicazione: (2023)
Pix2Gif: Motion-Guided Diffusion for GIF Generation
di: Kandala, Hitesh, et al.
Pubblicazione: (2024)
di: Kandala, Hitesh, et al.
Pubblicazione: (2024)
COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
Motion Consistency Model: Accelerating Video Diffusion with Disentangled Motion-Appearance Distillation
di: Zhai, Yuanhao, et al.
Pubblicazione: (2024)
di: Zhai, Yuanhao, et al.
Pubblicazione: (2024)
MindJourney: Test-Time Scaling with World Models for Spatial Reasoning
di: Yang, Yuncong, et al.
Pubblicazione: (2025)
di: Yang, Yuncong, et al.
Pubblicazione: (2025)
Attention to Neural Plagiarism: Diffusion Models Can Plagiarize Your Copyrighted Images!
di: Zou, Zihang, et al.
Pubblicazione: (2026)
di: Zou, Zihang, et al.
Pubblicazione: (2026)
V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
di: Zheng, Xiangxi, et al.
Pubblicazione: (2025)
di: Zheng, Xiangxi, et al.
Pubblicazione: (2025)
Conditional Text-to-Image Generation with Reference Guidance
di: Kim, Taewook, et al.
Pubblicazione: (2024)
di: Kim, Taewook, et al.
Pubblicazione: (2024)
AsgardBench -- Evaluating Visually Grounded Interactive Planning Under Minimal Feedback
di: Tupini, Andrea, et al.
Pubblicazione: (2026)
di: Tupini, Andrea, et al.
Pubblicazione: (2026)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
di: Hao, Yunzhuo, et al.
Pubblicazione: (2025)
di: Hao, Yunzhuo, et al.
Pubblicazione: (2025)
Tuning Timestep-Distilled Diffusion Model Using Pairwise Sample Optimization
di: Miao, Zichen, et al.
Pubblicazione: (2024)
di: Miao, Zichen, et al.
Pubblicazione: (2024)
IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation
di: Zhai, Yuanhao, et al.
Pubblicazione: (2024)
di: Zhai, Yuanhao, et al.
Pubblicazione: (2024)
Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding
di: Xiong, Yuanhao, et al.
Pubblicazione: (2023)
di: Xiong, Yuanhao, et al.
Pubblicazione: (2023)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
di: Yu, Weihao, et al.
Pubblicazione: (2024)
di: Yu, Weihao, et al.
Pubblicazione: (2024)
AutoDirector: Online Auto-scheduling Agents for Multi-sensory Composition
di: Ni, Minheng, et al.
Pubblicazione: (2024)
di: Ni, Minheng, et al.
Pubblicazione: (2024)
The LLM Bottleneck: Why Open-Source Vision LLMs Struggle with Hierarchical Visual Recognition
di: Tan, Yuwen, et al.
Pubblicazione: (2025)
di: Tan, Yuwen, et al.
Pubblicazione: (2025)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
Thinking in Structures: Evaluating Spatial Intelligence in Constraint-Governed Spaces
di: Yang, Chen, et al.
Pubblicazione: (2026)
di: Yang, Chen, et al.
Pubblicazione: (2026)
GenXD: Generating Any 3D and 4D Scenes
di: Zhao, Yuyang, et al.
Pubblicazione: (2024)
di: Zhao, Yuyang, et al.
Pubblicazione: (2024)
MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos
di: He, Xuehai, et al.
Pubblicazione: (2024)
di: He, Xuehai, et al.
Pubblicazione: (2024)
CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness
di: Liu, Zhihang, et al.
Pubblicazione: (2025)
di: Liu, Zhihang, et al.
Pubblicazione: (2025)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
di: Ni, Minheng, et al.
Pubblicazione: (2025)
di: Ni, Minheng, et al.
Pubblicazione: (2025)
HypDAE: Hyperbolic Diffusion Autoencoders for Hierarchical Few-shot Image Generation
di: Li, Lingxiao, et al.
Pubblicazione: (2024)
di: Li, Lingxiao, et al.
Pubblicazione: (2024)
TechImage-Bench: Rubric-Based Evaluation for Technical Image Generation
di: Ni, Minheng, et al.
Pubblicazione: (2025)
di: Ni, Minheng, et al.
Pubblicazione: (2025)
Continual Adapter Tuning with Semantic Shift Compensation for Class-Incremental Learning
di: Zhou, Qinhao, et al.
Pubblicazione: (2024)
di: Zhou, Qinhao, et al.
Pubblicazione: (2024)
Glance: Accelerating Diffusion Models with 1 Sample
di: Dong, Zhuobai, et al.
Pubblicazione: (2025)
di: Dong, Zhuobai, et al.
Pubblicazione: (2025)
Interfacing Foundation Models' Embeddings
di: Zou, Xueyan, et al.
Pubblicazione: (2023)
di: Zou, Xueyan, et al.
Pubblicazione: (2023)
Struct2D: A Perception-Guided Framework for Spatial Reasoning in MLLMs
di: Zhu, Fangrui, et al.
Pubblicazione: (2025)
di: Zhu, Fangrui, et al.
Pubblicazione: (2025)
Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence
di: Gao, Yuanyuan, et al.
Pubblicazione: (2026)
di: Gao, Yuanyuan, et al.
Pubblicazione: (2026)
Stepping VLMs onto the Court: Benchmarking Spatial Intelligence in Sports
di: Yang, Yuchen, et al.
Pubblicazione: (2026)
di: Yang, Yuchen, et al.
Pubblicazione: (2026)
FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
di: Yi, Junchao, et al.
Pubblicazione: (2026)
di: Yi, Junchao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
di: Jain, Jitesh, et al.
Pubblicazione: (2024) -
List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs
di: Yan, An, et al.
Pubblicazione: (2024) -
Bring Metric Functions into Diffusion Models
di: An, Jie, et al.
Pubblicazione: (2024) -
Lifting Data-Tracing Machine Unlearning to Knowledge-Tracing for Foundation Models
di: Tan, Yuwen, et al.
Pubblicazione: (2025) -
Entity6K: A Large Open-Domain Evaluation Dataset for Real-World Entity Recognition
di: Qiu, Jielin, et al.
Pubblicazione: (2024)