Movie101v2: Improved Movie Narration Benchmark
Fuente:
arXiv
Salvato in:
| Autori principali: | Yue, Zihao, Zhang, Yepeng, Wang, Ziheng, Jin, Qin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
di: Zheng, Junjie, et al.
Pubblicazione: (2025)
di: Zheng, Junjie, et al.
Pubblicazione: (2025)
CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing
di: Cong, Gaoxiang, et al.
Pubblicazione: (2026)
di: Cong, Gaoxiang, et al.
Pubblicazione: (2026)
ScreenWriter: Automatic Screenplay Generation and Movie Summarisation
di: Mahon, Louis, et al.
Pubblicazione: (2024)
di: Mahon, Louis, et al.
Pubblicazione: (2024)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
di: Xu, Yichen, et al.
Pubblicazione: (2025)
di: Xu, Yichen, et al.
Pubblicazione: (2025)
Movie Facts and Fibs (MF$^2$): A Benchmark for Long Movie Understanding
di: Zaranis, Emmanouil, et al.
Pubblicazione: (2025)
di: Zaranis, Emmanouil, et al.
Pubblicazione: (2025)
Appear2Meaning: A Cross-Cultural Benchmark for Structured Cultural Metadata Inference from Images
di: Jiang, Yuechen, et al.
Pubblicazione: (2026)
di: Jiang, Yuechen, et al.
Pubblicazione: (2026)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
di: Wang, Xinran, et al.
Pubblicazione: (2026)
di: Wang, Xinran, et al.
Pubblicazione: (2026)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
MovieCORE: COgnitive REasoning in Movies
di: Faure, Gueter Josmy, et al.
Pubblicazione: (2025)
di: Faure, Gueter Josmy, et al.
Pubblicazione: (2025)
Improving Gloss-free Sign Language Translation by Reducing Representation Density
di: Ye, Jinhui, et al.
Pubblicazione: (2024)
di: Ye, Jinhui, et al.
Pubblicazione: (2024)
Movie Trailer Genre Classification Using Multimodal Pretrained Features
di: Sulun, Serkan, et al.
Pubblicazione: (2024)
di: Sulun, Serkan, et al.
Pubblicazione: (2024)
ChronusOmni: Improving Time Awareness of Omni Large Language Models
di: Chen, Yijing, et al.
Pubblicazione: (2025)
di: Chen, Yijing, et al.
Pubblicazione: (2025)
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
di: Wang, Jiapeng, et al.
Pubblicazione: (2024)
di: Wang, Jiapeng, et al.
Pubblicazione: (2024)
COM Kitchens: An Unedited Overhead-view Video Dataset as a Vision-Language Benchmark
di: Maeda, Koki, et al.
Pubblicazione: (2024)
di: Maeda, Koki, et al.
Pubblicazione: (2024)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
di: Yao, Linli, et al.
Pubblicazione: (2023)
di: Yao, Linli, et al.
Pubblicazione: (2023)
Multi-task Prompt Words Learning for Social Media Content Generation
di: Xue, Haochen, et al.
Pubblicazione: (2024)
di: Xue, Haochen, et al.
Pubblicazione: (2024)
Pegasus-v1 Technical Report
di: Jung, Raehyuk, et al.
Pubblicazione: (2024)
di: Jung, Raehyuk, et al.
Pubblicazione: (2024)
FlowDubber: Movie Dubbing with LLM-based Semantic-aware Learning and Flow Matching based Voice Enhancing
di: Cong, Gaoxiang, et al.
Pubblicazione: (2025)
di: Cong, Gaoxiang, et al.
Pubblicazione: (2025)
Video2Roleplay: A Multimodal Dataset and Framework for Video-Guided Role-playing Agents
di: Zhang, Xueqiao, et al.
Pubblicazione: (2025)
di: Zhang, Xueqiao, et al.
Pubblicazione: (2025)
Graph-Driven Multimodal Feature Learning Framework for Apparent Personality Assessment
di: Wang, Kangsheng, et al.
Pubblicazione: (2025)
di: Wang, Kangsheng, et al.
Pubblicazione: (2025)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
di: Luo, Chuwei, et al.
Pubblicazione: (2022)
di: Luo, Chuwei, et al.
Pubblicazione: (2022)
Enhancing Multimodal Misinformation Detection by Replaying the Whole Story from Image Modality Perspective
di: Wang, Bing, et al.
Pubblicazione: (2025)
di: Wang, Bing, et al.
Pubblicazione: (2025)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
di: Geng, Tiantian, et al.
Pubblicazione: (2024)
di: Geng, Tiantian, et al.
Pubblicazione: (2024)
Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos
di: Yu, Jiashuo, et al.
Pubblicazione: (2025)
di: Yu, Jiashuo, et al.
Pubblicazione: (2025)
Multi-Modal Semantic Parsing for the Interpretation of Tombstone Inscriptions
di: Zhang, Xiao, et al.
Pubblicazione: (2025)
di: Zhang, Xiao, et al.
Pubblicazione: (2025)
Harmfully Manipulated Images Matter in Multimodal Misinformation Detection
di: Wang, Bing, et al.
Pubblicazione: (2024)
di: Wang, Bing, et al.
Pubblicazione: (2024)
KeyVideoLLM: Towards Large-scale Video Keyframe Selection
di: Liang, Hao, et al.
Pubblicazione: (2024)
di: Liang, Hao, et al.
Pubblicazione: (2024)
Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring
di: Zhang, Dongxu, et al.
Pubblicazione: (2026)
di: Zhang, Dongxu, et al.
Pubblicazione: (2026)
WordArt Designer API: User-Driven Artistic Typography Synthesis with Large Language Models on ModelScope
di: He, Jun-Yan, et al.
Pubblicazione: (2024)
di: He, Jun-Yan, et al.
Pubblicazione: (2024)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval
di: Wu, Siwei, et al.
Pubblicazione: (2024)
di: Wu, Siwei, et al.
Pubblicazione: (2024)
Hierarchical Textual Knowledge for Enhanced Image Clustering
di: Zhong, Yijie, et al.
Pubblicazione: (2026)
di: Zhong, Yijie, et al.
Pubblicazione: (2026)
V-FAT: Benchmarking Visual Fidelity Against Text-bias
di: Wang, Ziteng, et al.
Pubblicazione: (2026)
di: Wang, Ziteng, et al.
Pubblicazione: (2026)
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
di: Jiang, Jingjing, et al.
Pubblicazione: (2025)
di: Jiang, Jingjing, et al.
Pubblicazione: (2025)
Can't See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMs
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM
di: Ji, Yatai, et al.
Pubblicazione: (2024)
di: Ji, Yatai, et al.
Pubblicazione: (2024)
How Far Are We from Generating Missing Modalities with Foundation Models?
di: Ke, Guanzhou, et al.
Pubblicazione: (2025)
di: Ke, Guanzhou, et al.
Pubblicazione: (2025)
MIPS at SemEval-2024 Task 3: Multimodal Emotion-Cause Pair Extraction in Conversations with Multimodal Language Models
di: Cheng, Zebang, et al.
Pubblicazione: (2024)
di: Cheng, Zebang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
di: Zheng, Junjie, et al.
Pubblicazione: (2025) -
CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing
di: Cong, Gaoxiang, et al.
Pubblicazione: (2026) -
ScreenWriter: Automatic Screenplay Generation and Movie Summarisation
di: Mahon, Louis, et al.
Pubblicazione: (2024) -
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
di: Xu, Yichen, et al.
Pubblicazione: (2025) -
Movie Facts and Fibs (MF$^2$): A Benchmark for Long Movie Understanding
di: Zaranis, Emmanouil, et al.
Pubblicazione: (2025)