MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Chengfei, Seoh, Ronald, Li, Bingxuan, Zhang, Liqiang, Han, Fengrong, Goldwasser, Dan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EmoGist: Efficient In-Context Learning for Visual Emotion Understanding
di: Seoh, Ronald, et al.
Pubblicazione: (2025)
di: Seoh, Ronald, et al.
Pubblicazione: (2025)
Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning
di: Zafar, Anas, et al.
Pubblicazione: (2026)
di: Zafar, Anas, et al.
Pubblicazione: (2026)
Multimodal Reference Visual Grounding
di: Lu, Yangxiao, et al.
Pubblicazione: (2025)
di: Lu, Yangxiao, et al.
Pubblicazione: (2025)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
di: Ni, Minheng, et al.
Pubblicazione: (2025)
di: Ni, Minheng, et al.
Pubblicazione: (2025)
Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations
di: Li, Linjie, et al.
Pubblicazione: (2025)
di: Li, Linjie, et al.
Pubblicazione: (2025)
Beyond Quantity: Distribution-Aware Labeling for Visual Grounding
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
UAUTrack: Towards Unified Multimodal Anti-UAV Visual Tracking
di: Ren, Qionglin, et al.
Pubblicazione: (2025)
di: Ren, Qionglin, et al.
Pubblicazione: (2025)
VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning
di: Wu, Xueqing, et al.
Pubblicazione: (2024)
di: Wu, Xueqing, et al.
Pubblicazione: (2024)
OpenGround: Active Cognition-based Reasoning for Open-World 3D Visual Grounding
di: Huang, Wenyuan, et al.
Pubblicazione: (2025)
di: Huang, Wenyuan, et al.
Pubblicazione: (2025)
Fuse after Align: Improving Face-Voice Association Learning via Multimodal Encoder
di: Peng, Chong, et al.
Pubblicazione: (2024)
di: Peng, Chong, et al.
Pubblicazione: (2024)
BARE: Towards Bias-Aware and Reasoning-Enhanced One-Tower Visual Grounding
di: Li, Hongbing, et al.
Pubblicazione: (2026)
di: Li, Hongbing, et al.
Pubblicazione: (2026)
Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs
di: Shu, Yan, et al.
Pubblicazione: (2025)
di: Shu, Yan, et al.
Pubblicazione: (2025)
See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs
di: Zhang, Yongchang, et al.
Pubblicazione: (2026)
di: Zhang, Yongchang, et al.
Pubblicazione: (2026)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
Unveiling the Cognitive Compass: Theory-of-Mind-Guided Multimodal Emotion Reasoning
di: Luo, Meng, et al.
Pubblicazione: (2026)
di: Luo, Meng, et al.
Pubblicazione: (2026)
Multimodal Latent Reasoning via Hierarchical Visual Cues Injection
di: Zhang, Yiming, et al.
Pubblicazione: (2026)
di: Zhang, Yiming, et al.
Pubblicazione: (2026)
VIBE: Can a VLM Read the Room?
di: Chakraborty, Tania, et al.
Pubblicazione: (2025)
di: Chakraborty, Tania, et al.
Pubblicazione: (2025)
MIRROR: Multimodal Iterative Reasoning via Reflection on Visual Regions
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding
di: Wu, Yuchuan, et al.
Pubblicazione: (2026)
di: Wu, Yuchuan, et al.
Pubblicazione: (2026)
REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection
di: Zhou, Jun, et al.
Pubblicazione: (2026)
di: Zhou, Jun, et al.
Pubblicazione: (2026)
Grounded Reinforcement Learning for Visual Reasoning
di: Sarch, Gabriel, et al.
Pubblicazione: (2025)
di: Sarch, Gabriel, et al.
Pubblicazione: (2025)
Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning
di: Cao, Meng, et al.
Pubblicazione: (2025)
di: Cao, Meng, et al.
Pubblicazione: (2025)
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
di: Chung, Jiwan, et al.
Pubblicazione: (2025)
di: Chung, Jiwan, et al.
Pubblicazione: (2025)
Towards Visual Discrimination and Reasoning of Real-World Physical Dynamics: Physics-Grounded Anomaly Detection
di: Li, Wenqiao, et al.
Pubblicazione: (2025)
di: Li, Wenqiao, et al.
Pubblicazione: (2025)
FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers
di: Zhang, Renshan, et al.
Pubblicazione: (2025)
di: Zhang, Renshan, et al.
Pubblicazione: (2025)
SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs
di: Gu, Bo, et al.
Pubblicazione: (2026)
di: Gu, Bo, et al.
Pubblicazione: (2026)
Hidden Meanings in Plain Sight: RebusBench for Evaluating Cognitive Visual Reasoning
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2026)
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2026)
Multimodal Skeleton-Based Action Representation Learning via Decomposition and Composition
di: Wang, Hongsong, et al.
Pubblicazione: (2025)
di: Wang, Hongsong, et al.
Pubblicazione: (2025)
EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation
di: Li, Bingxuan, et al.
Pubblicazione: (2025)
di: Li, Bingxuan, et al.
Pubblicazione: (2025)
Towards Meta-Cognitive Knowledge Editing for Multimodal LLMs
di: Fan, Zhaoyu, et al.
Pubblicazione: (2025)
di: Fan, Zhaoyu, et al.
Pubblicazione: (2025)
Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
Cultivating Forensic Reasoning for Generalizable Multimodal Manipulation Detection
di: Zhang, Yuchen, et al.
Pubblicazione: (2026)
di: Zhang, Yuchen, et al.
Pubblicazione: (2026)
Benchmarking Multimodal Mathematical Reasoning with Explicit Visual Dependency
di: Wang, Zhikai, et al.
Pubblicazione: (2025)
di: Wang, Zhikai, et al.
Pubblicazione: (2025)
RegionReasoner: Region-Grounded Multi-Round Visual Reasoning
di: Sun, Wenfang, et al.
Pubblicazione: (2026)
di: Sun, Wenfang, et al.
Pubblicazione: (2026)
Towards Visual Grounding: A Survey
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning
di: Zhang, Chi, et al.
Pubblicazione: (2025)
di: Zhang, Chi, et al.
Pubblicazione: (2025)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
di: Wei, Yana, et al.
Pubblicazione: (2025)
di: Wei, Yana, et al.
Pubblicazione: (2025)
TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity
di: Yang, Zheyuan, et al.
Pubblicazione: (2026)
di: Yang, Zheyuan, et al.
Pubblicazione: (2026)
EGM: Efficient Visual Grounding Language Models
di: Zhan, Guanqi, et al.
Pubblicazione: (2026)
di: Zhan, Guanqi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
EmoGist: Efficient In-Context Learning for Visual Emotion Understanding
di: Seoh, Ronald, et al.
Pubblicazione: (2025) -
Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning
di: Zafar, Anas, et al.
Pubblicazione: (2026) -
Multimodal Reference Visual Grounding
di: Lu, Yangxiao, et al.
Pubblicazione: (2025) -
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
di: Ni, Minheng, et al.
Pubblicazione: (2025) -
Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations
di: Li, Linjie, et al.
Pubblicazione: (2025)