Enregistré dans:
| Auteurs principaux: | Luo, Sha, Prabhu, Yogesh, Ossowski, Timothy, Chen, Kaiping, Hu, Junjie |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2601.03369 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Prompting Large Vision-Language Models for Compositional Reasoning
par: Ossowski, Timothy, et autres
Publié: (2024)
par: Ossowski, Timothy, et autres
Publié: (2024)
Beyond Words: Enhancing Desire, Emotion, and Sentiment Recognition with Non-Verbal Cues
par: Chen, Wei, et autres
Publié: (2025)
par: Chen, Wei, et autres
Publié: (2025)
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
par: Qi, Yukun, et autres
Publié: (2026)
par: Qi, Yukun, et autres
Publié: (2026)
Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
par: Zhang, Zory, et autres
Publié: (2025)
par: Zhang, Zory, et autres
Publié: (2025)
OLIVE: Object Level In-Context Visual Embeddings
par: Ossowski, Timothy, et autres
Publié: (2024)
par: Ossowski, Timothy, et autres
Publié: (2024)
Video-ToC: Video Tree-of-Cue Reasoning
par: Tan, Qizhong, et autres
Publié: (2026)
par: Tan, Qizhong, et autres
Publié: (2026)
Learning Multimodal Cues of Children's Uncertainty
par: Cheng, Qi, et autres
Publié: (2024)
par: Cheng, Qi, et autres
Publié: (2024)
Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues
par: Kim, Youngmin, et autres
Publié: (2025)
par: Kim, Youngmin, et autres
Publié: (2025)
SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues
par: Hinojosa, Carlos, et autres
Publié: (2026)
par: Hinojosa, Carlos, et autres
Publié: (2026)
Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization
par: Islam, Md Moinul, et autres
Publié: (2025)
par: Islam, Md Moinul, et autres
Publié: (2025)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
par: Ma, David, et autres
Publié: (2025)
par: Ma, David, et autres
Publié: (2025)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
par: Wang, Shengkang, et autres
Publié: (2024)
par: Wang, Shengkang, et autres
Publié: (2024)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
par: Feng, X., et autres
Publié: (2024)
par: Feng, X., et autres
Publié: (2024)
SpurLens: Automatic Detection of Spurious Cues in Multimodal LLMs
par: Hosseini, Parsa, et autres
Publié: (2025)
par: Hosseini, Parsa, et autres
Publié: (2025)
DIFFER: Disentangling Identity Features via Semantic Cues for Clothes-Changing Person Re-ID
par: Liang, Xin, et autres
Publié: (2025)
par: Liang, Xin, et autres
Publié: (2025)
CueBench: Advancing Unified Understanding of Context-Aware Video Anomalies in Real-World
par: Yu, Yating, et autres
Publié: (2025)
par: Yu, Yating, et autres
Publié: (2025)
VRR-QA: Visual Relational Reasoning in Videos Beyond Explicit Cues
par: Swetha, Sirnam, et autres
Publié: (2025)
par: Swetha, Sirnam, et autres
Publié: (2025)
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
par: Zhang, Junyi, et autres
Publié: (2025)
par: Zhang, Junyi, et autres
Publié: (2025)
CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
par: Chen, Kesheng, et autres
Publié: (2026)
par: Chen, Kesheng, et autres
Publié: (2026)
Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs
par: Liu, Xuannan, et autres
Publié: (2025)
par: Liu, Xuannan, et autres
Publié: (2025)
How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning
par: Yang, Luyu, et autres
Publié: (2026)
par: Yang, Luyu, et autres
Publié: (2026)
MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal
par: Nie, Yiqi, et autres
Publié: (2026)
par: Nie, Yiqi, et autres
Publié: (2026)
CameraBench: Benchmarking Visual Reasoning in MLLMs via Photography
par: Fang, I-Sheng, et autres
Publié: (2025)
par: Fang, I-Sheng, et autres
Publié: (2025)
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
par: Wei, Yanbin, et autres
Publié: (2026)
par: Wei, Yanbin, et autres
Publié: (2026)
Heron-Bench: A Benchmark for Evaluating Vision Language Models in Japanese
par: Inoue, Yuichi, et autres
Publié: (2024)
par: Inoue, Yuichi, et autres
Publié: (2024)
LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding
par: Wu, Haoning, et autres
Publié: (2024)
par: Wu, Haoning, et autres
Publié: (2024)
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
par: Yuan, Shenghai, et autres
Publié: (2024)
par: Yuan, Shenghai, et autres
Publié: (2024)
SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World Knowledge
par: Wang, Andong, et autres
Publié: (2024)
par: Wang, Andong, et autres
Publié: (2024)
BRIDGE: Bridging Gaps in Image Captioning Evaluation with Stronger Visual Cues
par: Sarto, Sara, et autres
Publié: (2024)
par: Sarto, Sara, et autres
Publié: (2024)
SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning
par: Xu, Mengya, et autres
Publié: (2025)
par: Xu, Mengya, et autres
Publié: (2025)
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
par: Wang, Zhaowei, et autres
Publié: (2025)
par: Wang, Zhaowei, et autres
Publié: (2025)
RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation
par: Li, Huiqiong, et autres
Publié: (2026)
par: Li, Huiqiong, et autres
Publié: (2026)
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
par: Zhao, Bingchen, et autres
Publié: (2024)
par: Zhao, Bingchen, et autres
Publié: (2024)
GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling
par: Li, Siqi, et autres
Publié: (2025)
par: Li, Siqi, et autres
Publié: (2025)
R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
par: Chen, Kaijie, et autres
Publié: (2025)
par: Chen, Kaijie, et autres
Publié: (2025)
VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning
par: Wang, Zhaozhi, et autres
Publié: (2025)
par: Wang, Zhaozhi, et autres
Publié: (2025)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
par: Li, Chenxu, et autres
Publié: (2025)
par: Li, Chenxu, et autres
Publié: (2025)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
par: Huang, Yipo, et autres
Publié: (2024)
par: Huang, Yipo, et autres
Publié: (2024)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Documents similaires
-
Prompting Large Vision-Language Models for Compositional Reasoning
par: Ossowski, Timothy, et autres
Publié: (2024) -
Beyond Words: Enhancing Desire, Emotion, and Sentiment Recognition with Non-Verbal Cues
par: Chen, Wei, et autres
Publié: (2025) -
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
par: Qi, Yukun, et autres
Publié: (2026) -
Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
par: Zhang, Zory, et autres
Publié: (2025) -
OLIVE: Object Level In-Context Visual Embeddings
par: Ossowski, Timothy, et autres
Publié: (2024)