Contextual AD Narration with Interleaved Multimodal Sequence
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Hanlin, Tong, Zhan, Zheng, Kecheng, Shen, Yujun, Wang, Limin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning Video Context as Interleaved Multimodal Sequences
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
LeviTor: 3D Trajectory Oriented Image-to-Video Synthesis
por: Wang, Hanlin, et al.
Publicado: (2024)
por: Wang, Hanlin, et al.
Publicado: (2024)
TagAlign: Improving Vision-Language Alignment with Multi-Tag Classification
por: Liu, Qinying, et al.
Publicado: (2023)
por: Liu, Qinying, et al.
Publicado: (2023)
Open-Event Procedure Planning in Instructional Videos
por: Wu, Yilu, et al.
Publicado: (2024)
por: Wu, Yilu, et al.
Publicado: (2024)
PDPP: Projected Diffusion for Procedure Planning in Instructional Videos
por: Wang, Hanlin, et al.
Publicado: (2023)
por: Wang, Hanlin, et al.
Publicado: (2023)
HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives
por: Meng, Yihao, et al.
Publicado: (2025)
por: Meng, Yihao, et al.
Publicado: (2025)
Framer: Interactive Frame Interpolation
por: Wang, Wen, et al.
Publicado: (2024)
por: Wang, Wen, et al.
Publicado: (2024)
UKnow: A Unified Knowledge Protocol with Multimodal Knowledge Graph Datasets for Reasoning and Vision-Language Pre-Training
por: Gong, Biao, et al.
Publicado: (2023)
por: Gong, Biao, et al.
Publicado: (2023)
ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations
por: Wu, Yike, et al.
Publicado: (2025)
por: Wu, Yike, et al.
Publicado: (2025)
Multi-QuAD: Multi-Level Quality-Adaptive Dynamic Network for Reliable Multimodal Classification
por: Shen, Shu, et al.
Publicado: (2024)
por: Shen, Shu, et al.
Publicado: (2024)
Learning Naturally Aggregated Appearance for Efficient 3D Editing
por: Cheng, Ka Leong, et al.
Publicado: (2023)
por: Cheng, Ka Leong, et al.
Publicado: (2023)
CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives
por: Meng, Yihao, et al.
Publicado: (2026)
por: Meng, Yihao, et al.
Publicado: (2026)
MoviePuzzle: Visual Narrative Reasoning through Multimodal Order Learning
por: Wang, Jianghui, et al.
Publicado: (2023)
por: Wang, Jianghui, et al.
Publicado: (2023)
CoDeF: Content Deformation Fields for Temporally Consistent Video Processing
por: Ouyang, Hao, et al.
Publicado: (2023)
por: Ouyang, Hao, et al.
Publicado: (2023)
FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning
por: Ge, Haonan, et al.
Publicado: (2025)
por: Ge, Haonan, et al.
Publicado: (2025)
DreamLIP: Language-Image Pre-training with Long Captions
por: Zheng, Kecheng, et al.
Publicado: (2024)
por: Zheng, Kecheng, et al.
Publicado: (2024)
Mimir: Improving Video Diffusion Models for Precise Text Understanding
por: Tan, Shuai, et al.
Publicado: (2024)
por: Tan, Shuai, et al.
Publicado: (2024)
Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
por: Nie, Ming, et al.
Publicado: (2026)
por: Nie, Ming, et al.
Publicado: (2026)
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
por: Gu, Jiawei, et al.
Publicado: (2025)
por: Gu, Jiawei, et al.
Publicado: (2025)
Cultivating Forensic Reasoning for Generalizable Multimodal Manipulation Detection
por: Zhang, Yuchen, et al.
Publicado: (2026)
por: Zhang, Yuchen, et al.
Publicado: (2026)
DuoGen: Towards General Purpose Interleaved Multimodal Generation
por: Shi, Min, et al.
Publicado: (2026)
por: Shi, Min, et al.
Publicado: (2026)
Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
por: Liu, Chengzhi, et al.
Publicado: (2025)
por: Liu, Chengzhi, et al.
Publicado: (2025)
Vision-Centric Activation and Coordination for Multimodal Large Language Models
por: Wang, Yunnan, et al.
Publicado: (2025)
por: Wang, Yunnan, et al.
Publicado: (2025)
Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners
por: Liu, Qingyang, et al.
Publicado: (2026)
por: Liu, Qingyang, et al.
Publicado: (2026)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
por: Tian, Changyao, et al.
Publicado: (2024)
por: Tian, Changyao, et al.
Publicado: (2024)
SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations
por: Wang, Yunnan, et al.
Publicado: (2026)
por: Wang, Yunnan, et al.
Publicado: (2026)
UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark
por: Li, Yanlin, et al.
Publicado: (2026)
por: Li, Yanlin, et al.
Publicado: (2026)
Learning Human Skill Generators at Key-Step Levels
por: Wu, Yilu, et al.
Publicado: (2025)
por: Wu, Yilu, et al.
Publicado: (2025)
Bringing The Consistency Gap: Explicit Structured Memory for Interleaved Image-Text Generation
por: Lin, Zeteng, et al.
Publicado: (2025)
por: Lin, Zeteng, et al.
Publicado: (2025)
Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning
por: Zeng, Xiangyu, et al.
Publicado: (2026)
por: Zeng, Xiangyu, et al.
Publicado: (2026)
Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks
por: Jin, Jing, et al.
Publicado: (2026)
por: Jin, Jing, et al.
Publicado: (2026)
OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text
por: Li, Qingyun, et al.
Publicado: (2024)
por: Li, Qingyun, et al.
Publicado: (2024)
MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens
por: Ataallah, Kirolos, et al.
Publicado: (2024)
por: Ataallah, Kirolos, et al.
Publicado: (2024)
AniDoc: Animation Creation Made Easier
por: Meng, Yihao, et al.
Publicado: (2024)
por: Meng, Yihao, et al.
Publicado: (2024)
COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training
por: Wang, Alex Jinpeng, et al.
Publicado: (2024)
por: Wang, Alex Jinpeng, et al.
Publicado: (2024)
SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation
por: Tan, Shuai, et al.
Publicado: (2025)
por: Tan, Shuai, et al.
Publicado: (2025)
LoTLIP: Improving Language-Image Pre-training for Long Text Understanding
por: Wu, Wei, et al.
Publicado: (2024)
por: Wu, Wei, et al.
Publicado: (2024)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
por: Lu, Fan, et al.
Publicado: (2024)
por: Lu, Fan, et al.
Publicado: (2024)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
por: Xia, Peng, et al.
Publicado: (2024)
por: Xia, Peng, et al.
Publicado: (2024)
RealSyn: An Effective and Scalable Multimodal Interleaved Document Transformation Paradigm
por: Gu, Tiancheng, et al.
Publicado: (2025)
por: Gu, Tiancheng, et al.
Publicado: (2025)
Ejemplares similares
-
Learning Video Context as Interleaved Multimodal Sequences
por: Lin, Kevin Qinghong, et al.
Publicado: (2024) -
LeviTor: 3D Trajectory Oriented Image-to-Video Synthesis
por: Wang, Hanlin, et al.
Publicado: (2024) -
TagAlign: Improving Vision-Language Alignment with Multi-Tag Classification
por: Liu, Qinying, et al.
Publicado: (2023) -
Open-Event Procedure Planning in Instructional Videos
por: Wu, Yilu, et al.
Publicado: (2024) -
PDPP: Projected Diffusion for Procedure Planning in Instructional Videos
por: Wang, Hanlin, et al.
Publicado: (2023)