MoviePuzzle: Visual Narrative Reasoning through Multimodal Order Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Jianghui, Wang, Yuxuan, Zhao, Dongyan, Zheng, Zilong |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts
par: Wang, Yuxuan, et autres
Publié: (2025)
par: Wang, Yuxuan, et autres
Publié: (2025)
ExoViP: Step-by-step Verification and Exploration with Exoskeleton Modules for Compositional Visual Reasoning
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
Movie101v2: Improved Movie Narration Benchmark
par: Yue, Zihao, et autres
Publié: (2024)
par: Yue, Zihao, et autres
Publié: (2024)
MathSticks: A Benchmark for Visual Symbolic Compositional Reasoning with Matchstick Puzzles
par: Ji, Yuheng, et autres
Publié: (2025)
par: Ji, Yuheng, et autres
Publié: (2025)
Beyond Isolated Facts: Synthesizing Narrative and Grounded Supervision for VideoQA
par: Liang, Jianxin, et autres
Publié: (2025)
par: Liang, Jianxin, et autres
Publié: (2025)
Understanding Multimodal Hallucination with Parameter-Free Representation Alignment
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns
par: Chia, Yew Ken, et autres
Publié: (2024)
par: Chia, Yew Ken, et autres
Publié: (2024)
MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequence
par: Zhao, Canyu, et autres
Publié: (2024)
par: Zhao, Canyu, et autres
Publié: (2024)
ReelWave: Multi-Agentic Movie Sound Generation through Multimodal LLM Conversation
par: Wang, Zixuan, et autres
Publié: (2025)
par: Wang, Zixuan, et autres
Publié: (2025)
Contextual AD Narration with Interleaved Multimodal Sequence
par: Wang, Hanlin, et autres
Publié: (2024)
par: Wang, Hanlin, et autres
Publié: (2024)
Benchmarking Multimodal Mathematical Reasoning with Explicit Visual Dependency
par: Wang, Zhikai, et autres
Publié: (2025)
par: Wang, Zhikai, et autres
Publié: (2025)
DeepDubber-V1: Towards High Quality and Dialogue, Narration, Monologue Adaptive Movie Dubbing Via Multi-Modal Chain-of-Thoughts Reasoning Guidance
par: Zheng, Junjie, et autres
Publié: (2025)
par: Zheng, Junjie, et autres
Publié: (2025)
Are Language Models Puzzle Prodigies? Algorithmic Puzzles Unveil Serious Challenges in Multimodal Reasoning
par: Ghosal, Deepanway, et autres
Publié: (2024)
par: Ghosal, Deepanway, et autres
Publié: (2024)
MovieBench: A Hierarchical Movie Level Dataset for Long Video Generation
par: Wu, Weijia, et autres
Publié: (2024)
par: Wu, Weijia, et autres
Publié: (2024)
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
par: Shangguan, Ziyao, et autres
Publié: (2024)
par: Shangguan, Ziyao, et autres
Publié: (2024)
PuzzleCraft: Exploration-Aware Curriculum Learning for Puzzle-Based RLVR in VLMs
par: Jeddi, Ahmadreza, et autres
Publié: (2025)
par: Jeddi, Ahmadreza, et autres
Publié: (2025)
Reasoning or Pattern Matching? Probing Large Vision-Language Models with Visual Puzzles
par: Lymperaiou, Maria, et autres
Publié: (2026)
par: Lymperaiou, Maria, et autres
Publié: (2026)
Visual Reasoning through Tool-supervised Reinforcement Learning
par: Dong, Qihua, et autres
Publié: (2026)
par: Dong, Qihua, et autres
Publié: (2026)
Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers
par: Yao, Yuxuan, et autres
Publié: (2026)
par: Yao, Yuxuan, et autres
Publié: (2026)
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
par: Zheng, Junjie, et autres
Publié: (2025)
par: Zheng, Junjie, et autres
Publié: (2025)
VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models
par: Ren, Yufan, et autres
Publié: (2025)
par: Ren, Yufan, et autres
Publié: (2025)
HumanSense: From Multimodal Perception to Empathetic Context-Aware Responses through Reasoning MLLMs
par: Qin, Zheng, et autres
Publié: (2025)
par: Qin, Zheng, et autres
Publié: (2025)
Revisiting Visual Understanding in Multimodal Reasoning through a Lens of Image Perturbation
par: Li, Yuting, et autres
Publié: (2025)
par: Li, Yuting, et autres
Publié: (2025)
VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack
par: Zhao, Shiji, et autres
Publié: (2025)
par: Zhao, Shiji, et autres
Publié: (2025)
Teaching Text-to-Image Models to Communicate in Dialog
par: Sun, Xiaowen, et autres
Publié: (2023)
par: Sun, Xiaowen, et autres
Publié: (2023)
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
par: Liu, Daixian, et autres
Publié: (2026)
par: Liu, Daixian, et autres
Publié: (2026)
DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning
par: Majeedi, Abrar, et autres
Publié: (2026)
par: Majeedi, Abrar, et autres
Publié: (2026)
Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning
par: Gong, Xuan, et autres
Publié: (2026)
par: Gong, Xuan, et autres
Publié: (2026)
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
par: Zhan, Yufei, et autres
Publié: (2025)
par: Zhan, Yufei, et autres
Publié: (2025)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
par: Liang, Jianxin, et autres
Publié: (2025)
par: Liang, Jianxin, et autres
Publié: (2025)
Solving Convex Partition Visual Jigsaw Puzzles
par: Ohayon, Yaniv, et autres
Publié: (2025)
par: Ohayon, Yaniv, et autres
Publié: (2025)
VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
par: Movva, Prahitha, et autres
Publié: (2025)
par: Movva, Prahitha, et autres
Publié: (2025)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
par: Shi, Weikang, et autres
Publié: (2025)
par: Shi, Weikang, et autres
Publié: (2025)
Exploring Interpretability for Visual Prompt Tuning with Cross-layer Concepts
par: Wang, Yubin, et autres
Publié: (2025)
par: Wang, Yubin, et autres
Publié: (2025)
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
par: Li, Hengzhi, et autres
Publié: (2025)
par: Li, Hengzhi, et autres
Publié: (2025)
Documents similaires
-
VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models
par: Wang, Yuxuan, et autres
Publié: (2024) -
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
par: Wang, Yuxuan, et autres
Publié: (2024) -
OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts
par: Wang, Yuxuan, et autres
Publié: (2025) -
ExoViP: Step-by-step Verification and Exploration with Exoskeleton Modules for Compositional Visual Reasoning
par: Wang, Yuxuan, et autres
Publié: (2024) -
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering
par: Wang, Yueqian, et autres
Publié: (2024)