Saved in:
| Main Authors: | Hu, Xia, Zhuang, Honglei, Potetz, Brian, Fathi, Alireza, Hu, Bo, Samari, Babak, Zhou, Howard |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2602.19001 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space
by: Hu, Xia, et al.
Published: (2026)
by: Hu, Xia, et al.
Published: (2026)
LATex: Leveraging Attribute-based Text Knowledge for Aerial-Ground Person Re-Identification
by: Zhang, Pingping, et al.
Published: (2025)
by: Zhang, Pingping, et al.
Published: (2025)
FirePlace: Geometric Refinements of LLM Common Sense Reasoning for 3D Object Placement
by: Huang, Ian, et al.
Published: (2025)
by: Huang, Ian, et al.
Published: (2025)
UEval: A Benchmark for Unified Multimodal Generation
by: Li, Bo, et al.
Published: (2026)
by: Li, Bo, et al.
Published: (2026)
EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease
by: Chen, Qiuhui, et al.
Published: (2026)
by: Chen, Qiuhui, et al.
Published: (2026)
REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection
by: Zhou, Jun, et al.
Published: (2026)
by: Zhou, Jun, et al.
Published: (2026)
Web-Scale Visual Entity Recognition: An LLM-Driven Data Approach
by: Caron, Mathilde, et al.
Published: (2024)
by: Caron, Mathilde, et al.
Published: (2024)
Retrieval-Enhanced Contrastive Vision-Text Models
by: Iscen, Ahmet, et al.
Published: (2023)
by: Iscen, Ahmet, et al.
Published: (2023)
A Generative Approach for Wikipedia-Scale Visual Entity Recognition
by: Caron, Mathilde, et al.
Published: (2024)
by: Caron, Mathilde, et al.
Published: (2024)
SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding
by: Shi, Liangtao, et al.
Published: (2025)
by: Shi, Liangtao, et al.
Published: (2025)
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
by: Li, Yunxin, et al.
Published: (2024)
by: Li, Yunxin, et al.
Published: (2024)
FSBench: A Figure Skating Benchmark for Advancing Artistic Sports Understanding
by: Gao, Rong, et al.
Published: (2025)
by: Gao, Rong, et al.
Published: (2025)
Specializing Large Models for Oracle Bone Script Interpretation via Component-Grounded Multimodal Knowledge Augmentation
by: Zhang, Jianing, et al.
Published: (2026)
by: Zhang, Jianing, et al.
Published: (2026)
SpineBench: Benchmarking Multimodal LLMs for Spinal Pathology Analysis
by: Zhang, Chenghanyu, et al.
Published: (2025)
by: Zhang, Chenghanyu, et al.
Published: (2025)
Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and Understanding
by: Zhang, Yuanhan, et al.
Published: (2025)
by: Zhang, Yuanhan, et al.
Published: (2025)
RECODE: Reasoning Through Code Generation for Visual Question Answering
by: Shen, Junhong, et al.
Published: (2025)
by: Shen, Junhong, et al.
Published: (2025)
MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency
by: Zhang, Junzhe, et al.
Published: (2024)
by: Zhang, Junzhe, et al.
Published: (2024)
Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
by: Xia, Jiaer, et al.
Published: (2025)
by: Xia, Jiaer, et al.
Published: (2025)
GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models
by: Hu, Xiangdong, et al.
Published: (2026)
by: Hu, Xiangdong, et al.
Published: (2026)
Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts
by: Wu, Jialin, et al.
Published: (2023)
by: Wu, Jialin, et al.
Published: (2023)
Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time
by: Zhou, Weijie, et al.
Published: (2026)
by: Zhou, Weijie, et al.
Published: (2026)
FileGram: Grounding Agent Personalization in File-System Behavioral Traces
by: Liu, Shuai, et al.
Published: (2026)
by: Liu, Shuai, et al.
Published: (2026)
VIVA: A Benchmark for Vision-Grounded Decision-Making with Human Values
by: Hu, Zhe, et al.
Published: (2024)
by: Hu, Zhe, et al.
Published: (2024)
AnomalyLMM: Bridging Generative Knowledge and Discriminative Retrieval for Text-Based Person Anomaly Search
by: Ju, Hao, et al.
Published: (2025)
by: Ju, Hao, et al.
Published: (2025)
ARK: A Dual-Axis Multimodal Retrieval Benchmark along Reasoning and Knowledge
by: Lin, Yijie, et al.
Published: (2026)
by: Lin, Yijie, et al.
Published: (2026)
SD-ReID: View-aware Stable Diffusion for Aerial-Ground Person Re-Identification
by: Wang, Yuhao, et al.
Published: (2025)
by: Wang, Yuhao, et al.
Published: (2025)
Beyond Forgetting in Continual Medical Image Segmentation: A Comprehensive Benchmark Study
by: Wang, Bomin, et al.
Published: (2026)
by: Wang, Bomin, et al.
Published: (2026)
Joint Top-Down and Bottom-Up Frameworks for 3D Visual Grounding
by: Liu, Yang, et al.
Published: (2024)
by: Liu, Yang, et al.
Published: (2024)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
by: Xia, Yinan, et al.
Published: (2025)
by: Xia, Yinan, et al.
Published: (2025)
A Multi-Agent Framework with Structured Reasoning and Reflective Refinement for Multimodal Empathetic Response Generation
by: Wang, Liping, et al.
Published: (2026)
by: Wang, Liping, et al.
Published: (2026)
CCTVBench: Contrastive Consistency Traffic VideoQA Benchmark for Multimodal LLMs
by: Zhou, Xingcheng, et al.
Published: (2026)
by: Zhou, Xingcheng, et al.
Published: (2026)
Joint Fusion and Encoding: Advancing Multimodal Retrieval from the Ground Up
by: Huang, Lang, et al.
Published: (2025)
by: Huang, Lang, et al.
Published: (2025)
EDFNet: Early Fusion of Edge and Depth for Thin-Obstacle Segmentation in UAV Navigation
by: Fathi, Negar
Published: (2026)
by: Fathi, Negar
Published: (2026)
ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming
by: Zhuang, Jiedong, et al.
Published: (2024)
by: Zhuang, Jiedong, et al.
Published: (2024)
PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies
by: Selch, Lukas, et al.
Published: (2025)
by: Selch, Lukas, et al.
Published: (2025)
MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection
by: Hu, Mengxue, et al.
Published: (2025)
by: Hu, Mengxue, et al.
Published: (2025)
DTFSal: Audio-Visual Dynamic Token Fusion for Video Saliency Prediction
by: Hooshanfar, Kiana, et al.
Published: (2025)
by: Hooshanfar, Kiana, et al.
Published: (2025)
Q Cache: Visual Attention is Valuable in Less than Half of Decode Layers for Multimodal Large Language Model
by: Zhuang, Jiedong, et al.
Published: (2026)
by: Zhuang, Jiedong, et al.
Published: (2026)
A Survey on Text-guided 3D Visual Grounding: Elements, Recent Advances, and Future Directions
by: Liu, Daizong, et al.
Published: (2024)
by: Liu, Daizong, et al.
Published: (2024)
Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge
by: Chen, Ruiming, et al.
Published: (2025)
by: Chen, Ruiming, et al.
Published: (2025)
Similar Items
-
The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space
by: Hu, Xia, et al.
Published: (2026) -
LATex: Leveraging Attribute-based Text Knowledge for Aerial-Ground Person Re-Identification
by: Zhang, Pingping, et al.
Published: (2025) -
FirePlace: Geometric Refinements of LLM Common Sense Reasoning for 3D Object Placement
by: Huang, Ian, et al.
Published: (2025) -
UEval: A Benchmark for Unified Multimodal Generation
by: Li, Bo, et al.
Published: (2026) -
EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease
by: Chen, Qiuhui, et al.
Published: (2026)