Burn After Reading: Do Multimodal Large Language Models Truly Capture Order of Events in Image Sequences?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Song, Yingjin, Du, Yupei, Paperno, Denis, Gatt, Albert |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Context-aware Visual Storytelling with Visual Prefix Tuning and Contrastive Learning
par: Song, Yingjin, et autres
Publié: (2024)
par: Song, Yingjin, et autres
Publié: (2024)
From Image Captioning to Visual Storytelling
par: Passadakis, Admitos, et autres
Publié: (2025)
par: Passadakis, Admitos, et autres
Publié: (2025)
Don't Learn, Ground: A Case for Natural Language Inference with Visual Grounding
par: Ignatev, Daniil, et autres
Publié: (2025)
par: Ignatev, Daniil, et autres
Publié: (2025)
Common Objects Out of Context (COOCo): Investigating Multimodal Context and Semantic Scene Violations in Referential Communication
par: Merlo, Filippo, et autres
Publié: (2025)
par: Merlo, Filippo, et autres
Publié: (2025)
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
par: Xu, Yige, et autres
Publié: (2026)
par: Xu, Yige, et autres
Publié: (2026)
Disentangling the Roles of Representation and Selection in Data Pruning
par: Du, Yupei, et autres
Publié: (2025)
par: Du, Yupei, et autres
Publié: (2025)
Do Multimodal Large Language Models Understand Welding?
par: Khvatskii, Grigorii, et autres
Publié: (2025)
par: Khvatskii, Grigorii, et autres
Publié: (2025)
LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?
par: Ye, Maoyuan, et autres
Publié: (2025)
par: Ye, Maoyuan, et autres
Publié: (2025)
FTFT: Efficient and Robust Fine-Tuning by Transferring Training Dynamics
par: Du, Yupei, et autres
Publié: (2023)
par: Du, Yupei, et autres
Publié: (2023)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
par: Liang, Yuci, et autres
Publié: (2024)
par: Liang, Yuci, et autres
Publié: (2024)
The Impact of Image Resolution on Biomedical Multimodal Large Language Models
par: Chen, Liangyu, et autres
Publié: (2025)
par: Chen, Liangyu, et autres
Publié: (2025)
Do Vision Encoders Truly Explain Object Hallucination?: Mitigating Object Hallucination via Simple Fine-Grained CLIPScore
par: Oh, Hongseok, et autres
Publié: (2025)
par: Oh, Hongseok, et autres
Publié: (2025)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
par: Pan, Xichen, et autres
Publié: (2023)
par: Pan, Xichen, et autres
Publié: (2023)
Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions?
par: Xu, Boshen, et autres
Publié: (2024)
par: Xu, Boshen, et autres
Publié: (2024)
Do Composed Image Retrieval Benchmarks Require Multimodal Composition?
par: Attimonelli, Matteo, et autres
Publié: (2026)
par: Attimonelli, Matteo, et autres
Publié: (2026)
ROAP: A Reading-Order and Attention-Prior Pipeline for Optimizing Layout Transformers in Key Information Extraction
par: Xie, Tingwei, et autres
Publié: (2026)
par: Xie, Tingwei, et autres
Publié: (2026)
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
par: Wang, Xiyao, et autres
Publié: (2024)
par: Wang, Xiyao, et autres
Publié: (2024)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
par: Huang, Yipo, et autres
Publié: (2024)
par: Huang, Yipo, et autres
Publié: (2024)
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
par: Zhu, Wenxin, et autres
Publié: (2025)
par: Zhu, Wenxin, et autres
Publié: (2025)
Understanding Multimodal Procedural Knowledge by Sequencing Multimodal Instructional Manuals
par: Wu, Te-Lin, et autres
Publié: (2021)
par: Wu, Te-Lin, et autres
Publié: (2021)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
par: Li, Yifan, et autres
Publié: (2024)
par: Li, Yifan, et autres
Publié: (2024)
RestoreAgent: Autonomous Image Restoration Agent via Multimodal Large Language Models
par: Chen, Haoyu, et autres
Publié: (2024)
par: Chen, Haoyu, et autres
Publié: (2024)
Correlates of Image Memorability in Vision Encoders: Activations, Attention Entropy, Patch Uniformity and Autoencoder Losses
par: Takmaz, Ece, et autres
Publié: (2025)
par: Takmaz, Ece, et autres
Publié: (2025)
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
par: Liu, Ziqiang, et autres
Publié: (2024)
par: Liu, Ziqiang, et autres
Publié: (2024)
Indexing Multimodal Language Models for Large-scale Image Retrieval
par: Tharwat, Bahey, et autres
Publié: (2026)
par: Tharwat, Bahey, et autres
Publié: (2026)
ChatEXAONEPath: An Expert-level Multimodal Large Language Model for Histopathology Using Whole Slide Images
par: Kim, Sangwook, et autres
Publié: (2025)
par: Kim, Sangwook, et autres
Publié: (2025)
Model Composition for Multimodal Large Language Models
par: Chen, Chi, et autres
Publié: (2024)
par: Chen, Chi, et autres
Publié: (2024)
ICM-Assistant: Instruction-tuning Multimodal Large Language Models for Rule-based Explainable Image Content Moderation
par: Wu, Mengyang, et autres
Publié: (2024)
par: Wu, Mengyang, et autres
Publié: (2024)
ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models
par: Villegas, Danae Sánchez, et autres
Publié: (2025)
par: Villegas, Danae Sánchez, et autres
Publié: (2025)
Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
par: Zhao, Haozhe, et autres
Publié: (2024)
par: Zhao, Haozhe, et autres
Publié: (2024)
AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization
par: Du, Yiyang, et autres
Publié: (2025)
par: Du, Yiyang, et autres
Publié: (2025)
Grounding Partially-Defined Events in Multimodal Data
par: Sanders, Kate, et autres
Publié: (2024)
par: Sanders, Kate, et autres
Publié: (2024)
Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images
par: You, Liangliang, et autres
Publié: (2025)
par: You, Liangliang, et autres
Publié: (2025)
Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?
par: Yao, Yang, et autres
Publié: (2025)
par: Yao, Yang, et autres
Publié: (2025)
The Use of Multimodal Large Language Models to Detect Objects from Thermal Images: Transportation Applications
par: Ashqar, Huthaifa I., et autres
Publié: (2024)
par: Ashqar, Huthaifa I., et autres
Publié: (2024)
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
par: Xu, Shilin, et autres
Publié: (2025)
par: Xu, Shilin, et autres
Publié: (2025)
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
par: Zhang, Leixin, et autres
Publié: (2024)
par: Zhang, Leixin, et autres
Publié: (2024)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
par: Chen, Jiaxing, et autres
Publié: (2024)
par: Chen, Jiaxing, et autres
Publié: (2024)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
LLAVADI: What Matters For Multimodal Large Language Models Distillation
par: Xu, Shilin, et autres
Publié: (2024)
par: Xu, Shilin, et autres
Publié: (2024)
Documents similaires
-
Context-aware Visual Storytelling with Visual Prefix Tuning and Contrastive Learning
par: Song, Yingjin, et autres
Publié: (2024) -
From Image Captioning to Visual Storytelling
par: Passadakis, Admitos, et autres
Publié: (2025) -
Don't Learn, Ground: A Case for Natural Language Inference with Visual Grounding
par: Ignatev, Daniil, et autres
Publié: (2025) -
Common Objects Out of Context (COOCo): Investigating Multimodal Context and Semantic Scene Violations in Referential Communication
par: Merlo, Filippo, et autres
Publié: (2025) -
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
par: Xu, Yige, et autres
Publié: (2026)