PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Shaoxuan, Zhao, Zhixuan, Deng, Hanze, Ma, Zirun, Tian, Shulin, Liu, Zuyan, Hu, Yushi, Wu, Haoning, Dong, Yuhao, Liu, Benlin, Liu, Ziwei, Krishna, Ranjay |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
par: Dong, Yuhao, et autres
Publié: (2026)
par: Dong, Yuhao, et autres
Publié: (2026)
Efficient Inference of Vision Instruction-Following Models with Elastic Cache
par: Liu, Zuyan, et autres
Publié: (2024)
par: Liu, Zuyan, et autres
Publié: (2024)
Structure From Tracking: Distilling Structure-Preserving Motion for Video Generation
par: Fei, Yang, et autres
Publié: (2025)
par: Fei, Yang, et autres
Publié: (2025)
VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
par: Liu, Yuanxin, et autres
Publié: (2025)
par: Liu, Yuanxin, et autres
Publié: (2025)
Visual Representations inside the Language Model
par: Liu, Benlin, et autres
Publié: (2025)
par: Liu, Benlin, et autres
Publié: (2025)
CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation
par: Su, Xia, et autres
Publié: (2026)
par: Su, Xia, et autres
Publié: (2026)
MMInA: Benchmarking Multihop Multimodal Internet Agents
par: Tian, Shulin, et autres
Publié: (2024)
par: Tian, Shulin, et autres
Publié: (2024)
Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model
par: Liu, Benlin, et autres
Publié: (2024)
par: Liu, Benlin, et autres
Publié: (2024)
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
par: Dong, Yuhao, et autres
Publié: (2024)
par: Dong, Yuhao, et autres
Publié: (2024)
Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and Understanding
par: Zhang, Yuanhan, et autres
Publié: (2025)
par: Zhang, Yuanhan, et autres
Publié: (2025)
Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution
par: Liu, Zuyan, et autres
Publié: (2024)
par: Liu, Zuyan, et autres
Publié: (2024)
A Simple Baseline for Streaming Video Understanding
par: Shen, Yujiao, et autres
Publié: (2026)
par: Shen, Yujiao, et autres
Publié: (2026)
Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models
par: Liu, Zuyan, et autres
Publié: (2024)
par: Liu, Zuyan, et autres
Publié: (2024)
Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition
par: Dong, Yuhao, et autres
Publié: (2026)
par: Dong, Yuhao, et autres
Publié: (2026)
Reinforced Visual Perception with Tools
par: Zhou, Zetong, et autres
Publié: (2025)
par: Zhou, Zetong, et autres
Publié: (2025)
Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark
par: Zou, Kai, et autres
Publié: (2025)
par: Zou, Kai, et autres
Publié: (2025)
MM-SAP: A Comprehensive Benchmark for Assessing Self-Awareness of Multimodal Large Language Models in Perception
par: Wang, Yuhao, et autres
Publié: (2024)
par: Wang, Yuhao, et autres
Publié: (2024)
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning
par: Tian, Shulin, et autres
Publié: (2025)
par: Tian, Shulin, et autres
Publié: (2025)
Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning
par: Ding, Junpeng, et autres
Publié: (2026)
par: Ding, Junpeng, et autres
Publié: (2026)
Perception Tokens Enhance Visual Reasoning in Multimodal Language Models
par: Bigverdi, Mahtab, et autres
Publié: (2024)
par: Bigverdi, Mahtab, et autres
Publié: (2024)
Ola: Pushing the Frontiers of Omni-Modal Language Model
par: Liu, Zuyan, et autres
Publié: (2025)
par: Liu, Zuyan, et autres
Publié: (2025)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
par: Ma, David, et autres
Publié: (2025)
par: Ma, David, et autres
Publié: (2025)
Seeking and Updating with Live Visual Knowledge
par: Fu, Mingyang, et autres
Publié: (2025)
par: Fu, Mingyang, et autres
Publié: (2025)
Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models
par: Che, Liwei, et autres
Publié: (2026)
par: Che, Liwei, et autres
Publié: (2026)
WaterVideoQA: ASV-Centric Perception and Rule-Compliant Reasoning via Multi-Modal Agents
par: Guan, Runwei, et autres
Publié: (2026)
par: Guan, Runwei, et autres
Publié: (2026)
From Perception to Action: An Interactive Benchmark for Vision Reasoning
par: Wu, Yuhao, et autres
Publié: (2026)
par: Wu, Yuhao, et autres
Publié: (2026)
Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment
par: Chen, Dongping, et autres
Publié: (2024)
par: Chen, Dongping, et autres
Publié: (2024)
GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation
par: Kamath, Amita, et autres
Publié: (2025)
par: Kamath, Amita, et autres
Publié: (2025)
Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?
par: Huang, Yuesheng, et autres
Publié: (2025)
par: Huang, Yuesheng, et autres
Publié: (2025)
Interpretable Perception and Reasoning for Audiovisual Geolocation
par: Su, Yiyang, et autres
Publié: (2026)
par: Su, Yiyang, et autres
Publié: (2026)
Human vs. AI Safety Perception? Decoding Human Safety Perception with Eye-Tracking Systems, Street View Images, and Explainable AI
par: Kang, Yuhao, et autres
Publié: (2025)
par: Kang, Yuhao, et autres
Publié: (2025)
Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models
par: Zhang, Fan, et autres
Publié: (2024)
par: Zhang, Fan, et autres
Publié: (2024)
Benchmarking and Improving Bird's Eye View Perception Robustness in Autonomous Driving
par: Xie, Shaoyuan, et autres
Publié: (2024)
par: Xie, Shaoyuan, et autres
Publié: (2024)
RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video
par: Xun, Shuhang, et autres
Publié: (2025)
par: Xun, Shuhang, et autres
Publié: (2025)
Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models
par: Hu, Yushi, et autres
Publié: (2023)
par: Hu, Yushi, et autres
Publié: (2023)
DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain
par: Jin, Song, et autres
Publié: (2026)
par: Jin, Song, et autres
Publié: (2026)
MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding
par: Bai, Purui, et autres
Publié: (2026)
par: Bai, Purui, et autres
Publié: (2026)
Explore the Hallucination on Low-level Perception for MLLMs
par: Sun, Yinan, et autres
Publié: (2024)
par: Sun, Yinan, et autres
Publié: (2024)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
par: Huang, Yipo, et autres
Publié: (2024)
par: Huang, Yipo, et autres
Publié: (2024)
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
par: Kil, Jihyung, et autres
Publié: (2024)
par: Kil, Jihyung, et autres
Publié: (2024)
Documents similaires
-
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
par: Dong, Yuhao, et autres
Publié: (2026) -
Efficient Inference of Vision Instruction-Following Models with Elastic Cache
par: Liu, Zuyan, et autres
Publié: (2024) -
Structure From Tracking: Distilling Structure-Preserving Motion for Video Generation
par: Fei, Yang, et autres
Publié: (2025) -
VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
par: Liu, Yuanxin, et autres
Publié: (2025) -
Visual Representations inside the Language Model
par: Liu, Benlin, et autres
Publié: (2025)