Beyond Single Frames: Can LMMs Comprehend Temporal and Contextual Narratives in Image Sequences?
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Xiaochen, Xia, Heming, Song, Jialin, Guan, Longyu, Yang, Yixin, Dong, Qingxiu, Luo, Weiyao, Pu, Yifan, Wang, Yiru, Meng, Xiangdi, Li, Wenjie, Sui, Zhifang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Can Large Multimodal Models Uncover Deep Semantics Behind Images?
by: Yang, Yixin, et al.
Published: (2024)
by: Yang, Yixin, et al.
Published: (2024)
Decoding in Geometry: Alleviating Embedding-Space Crowding for Complex Reasoning
by: Yang, Yixin, et al.
Published: (2026)
by: Yang, Yixin, et al.
Published: (2026)
PeriodicLoRA: Breaking the Low-Rank Bottleneck in LoRA Optimization
by: Meng, Xiangdi, et al.
Published: (2024)
by: Meng, Xiangdi, et al.
Published: (2024)
FSM: A Finite State Machine Based Zero-Shot Prompting Paradigm for Multi-Hop Question Answering
by: Wang, Xiaochen, et al.
Published: (2024)
by: Wang, Xiaochen, et al.
Published: (2024)
How Far are LLMs from Being Our Digital Twins? A Benchmark for Persona-Based Behavior Chain Simulation
by: Li, Rui, et al.
Published: (2025)
by: Li, Rui, et al.
Published: (2025)
SG-FSM: A Self-Guiding Zero-Shot Prompting Paradigm for Multi-Hop Question Answering Based on Finite State Machine
by: Wang, Xiaochen, et al.
Published: (2024)
by: Wang, Xiaochen, et al.
Published: (2024)
RICo: Refined In-Context Contribution for Automatic Instruction-Tuning Data Selection
by: Yang, Yixin, et al.
Published: (2025)
by: Yang, Yixin, et al.
Published: (2025)
Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding
by: Xia, Heming, et al.
Published: (2024)
by: Xia, Heming, et al.
Published: (2024)
Beyond Graphs: Can Large Language Models Comprehend Hypergraphs?
by: Feng, Yifan, et al.
Published: (2024)
by: Feng, Yifan, et al.
Published: (2024)
Taking a Deep Breath: Enhancing Language Modeling of Large Language Models with Sentinel Tokens
by: Luo, Weiyao, et al.
Published: (2024)
by: Luo, Weiyao, et al.
Published: (2024)
Self-Boosting Large Language Models with Synthetic Preference Data
by: Dong, Qingxiu, et al.
Published: (2024)
by: Dong, Qingxiu, et al.
Published: (2024)
Contextual AD Narration with Interleaved Multimodal Sequence
by: Wang, Hanlin, et al.
Published: (2024)
by: Wang, Hanlin, et al.
Published: (2024)
SelfBudgeter: Adaptive Token Allocation for Efficient LLM Reasoning
by: Li, Zheng, et al.
Published: (2025)
by: Li, Zheng, et al.
Published: (2025)
How LLMs Comprehend Temporal Meaning in Narratives: A Case Study in Cognitive Evaluation of LLMs
by: de Langis, Karin, et al.
Published: (2025)
by: de Langis, Karin, et al.
Published: (2025)
Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders
by: Fang, Bo, et al.
Published: (2025)
by: Fang, Bo, et al.
Published: (2025)
Reinforcement Pre-Training
by: Dong, Qingxiu, et al.
Published: (2025)
by: Dong, Qingxiu, et al.
Published: (2025)
LLM-REVal: Can We Trust LLM Reviewers Yet?
by: Li, Rui, et al.
Published: (2025)
by: Li, Rui, et al.
Published: (2025)
Towards Harmonized Uncertainty Estimation for Large Language Models
by: Li, Rui, et al.
Published: (2025)
by: Li, Rui, et al.
Published: (2025)
Interior Hessian estimates for Hessian quotient equations in dimension three
by: Jiao, Heming, et al.
Published: (2026)
by: Jiao, Heming, et al.
Published: (2026)
AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization
by: Du, Yiyang, et al.
Published: (2025)
by: Du, Yiyang, et al.
Published: (2025)
Social Story Frames: Contextual Reasoning about Narrative Intent and Reception
by: Mire, Joel, et al.
Published: (2025)
by: Mire, Joel, et al.
Published: (2025)
Exploring Activation Patterns of Parameters in Language Models
by: Wang, Yudong, et al.
Published: (2024)
by: Wang, Yudong, et al.
Published: (2024)
Chain-of-Thought Tokens are Computer Program Variables
by: Zhu, Fangwei, et al.
Published: (2025)
by: Zhu, Fangwei, et al.
Published: (2025)
Reducing Hallucinations in Entity Abstract Summarization with Facts-Template Decomposition
by: Zhu, Fangwei, et al.
Published: (2024)
by: Zhu, Fangwei, et al.
Published: (2024)
CoLT: Reasoning with Chain of Latent Tool Calls
by: Zhu, Fangwei, et al.
Published: (2026)
by: Zhu, Fangwei, et al.
Published: (2026)
Comprehending Columbine
by: Larkin, Ralph
Published: (2017)
by: Larkin, Ralph
Published: (2017)
Tell Codec What Worth Compressing: Semantically Disentangled Image Coding for Machine with LMMs
by: Liu, Jinming, et al.
Published: (2024)
by: Liu, Jinming, et al.
Published: (2024)
SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems
by: Guo, Ziyu, et al.
Published: (2025)
by: Guo, Ziyu, et al.
Published: (2025)
LLaFEA: Frame-Event Complementary Fusion for Fine-Grained Spatiotemporal Understanding in LMMs
by: Zhou, Hanyu, et al.
Published: (2025)
by: Zhou, Hanyu, et al.
Published: (2025)
HauntAttack: When Attack Follows Reasoning as a Shadow
by: Ma, Jingyuan, et al.
Published: (2025)
by: Ma, Jingyuan, et al.
Published: (2025)
Comprehending and Confronting Antisemitism
Published: (2020)
Published: (2020)
Efficient Feature Aggregation and Scale-Aware Regression for Monocular 3D Object Detection
by: Wang, Yifan, et al.
Published: (2024)
by: Wang, Yifan, et al.
Published: (2024)
A Survey on In-context Learning
by: Dong, Qingxiu, et al.
Published: (2022)
by: Dong, Qingxiu, et al.
Published: (2022)
Vinoground: Scrutinizing LMMs over Dense Temporal Reasoning with Short Videos
by: Zhang, Jianrui, et al.
Published: (2024)
by: Zhang, Jianrui, et al.
Published: (2024)
Analyzing Bending Damage Mechanical Properties of Multi‐Layered Wound Composite Pipes
by: Yangyang Wang, et al.
Published: (2025)
by: Yangyang Wang, et al.
Published: (2025)
GRA: Detecting Oriented Objects through Group-wise Rotating and Attention
by: Wang, Jiangshan, et al.
Published: (2024)
by: Wang, Jiangshan, et al.
Published: (2024)
Not All Demonstration Examples are Equally Beneficial: Reweighting Demonstration Examples for In-Context Learning
by: Yang, Zhe, et al.
Published: (2023)
by: Yang, Zhe, et al.
Published: (2023)
Towards Better RL Training Data Utilization via Second-Order Rollout
by: Yang, Zhe, et al.
Published: (2026)
by: Yang, Zhe, et al.
Published: (2026)
Can Large Language Models Always Solve Easy Problems if They Can Solve Harder Ones?
by: Yang, Zhe, et al.
Published: (2024)
by: Yang, Zhe, et al.
Published: (2024)
OBI-Bench: Can LMMs Aid in Study of Ancient Script on Oracle Bones?
by: Chen, Zijian, et al.
Published: (2024)
by: Chen, Zijian, et al.
Published: (2024)
Similar Items
-
Can Large Multimodal Models Uncover Deep Semantics Behind Images?
by: Yang, Yixin, et al.
Published: (2024) -
Decoding in Geometry: Alleviating Embedding-Space Crowding for Complex Reasoning
by: Yang, Yixin, et al.
Published: (2026) -
PeriodicLoRA: Breaking the Low-Rank Bottleneck in LoRA Optimization
by: Meng, Xiangdi, et al.
Published: (2024) -
FSM: A Finite State Machine Based Zero-Shot Prompting Paradigm for Multi-Hop Question Answering
by: Wang, Xiaochen, et al.
Published: (2024) -
How Far are LLMs from Being Our Digital Twins? A Benchmark for Persona-Based Behavior Chain Simulation
by: Li, Rui, et al.
Published: (2025)