Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Haojie, Liang, Zhihao, Fu, Ruibo, Liu, Bingyan, Wen, Zhengqi, Liu, Xuefei, Tao, Jianhua, Liang, Yaling |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Debunk and Infer: Multimodal Fake News Detection via Diffusion-Generated Evidence and LLM Reasoning
par: Yan, Kaiying, et autres
Publié: (2025)
par: Yan, Kaiying, et autres
Publié: (2025)
MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation
par: Zhang, Haojie, et autres
Publié: (2026)
par: Zhang, Haojie, et autres
Publié: (2026)
Exploring the Role of Audio in Multimodal Misinformation Detection
par: Liu, Moyang, et autres
Publié: (2024)
par: Liu, Moyang, et autres
Publié: (2024)
MDPE: A Multimodal Deception Dataset with Personality and Emotional Characteristics
par: Cai, Cong, et autres
Publié: (2024)
par: Cai, Cong, et autres
Publié: (2024)
PSA-MF: Personality-Sentiment Aligned Multi-Level Fusion for Multimodal Sentiment Analysis
par: Xie, Heng, et autres
Publié: (2025)
par: Xie, Heng, et autres
Publié: (2025)
MEMO: Memory-Guided Diffusion for Expressive Talking Video Generation
par: Zheng, Longtao, et autres
Publié: (2024)
par: Zheng, Longtao, et autres
Publié: (2024)
MTPareto: A MultiModal Targeted Pareto Framework for Fake News Detection
par: Yan, Kaiying, et autres
Publié: (2025)
par: Yan, Kaiying, et autres
Publié: (2025)
ConsistTalk: Intensity Controllable Temporally Consistent Talking Head Generation with Diffusion Noise Search
par: Liu, Zhenjie, et autres
Publié: (2025)
par: Liu, Zhenjie, et autres
Publié: (2025)
Exploring Modality Disruption in Multimodal Fake News Detection
par: Liu, Moyang, et autres
Publié: (2025)
par: Liu, Moyang, et autres
Publié: (2025)
Deconfounded Reasoning for Multimodal Fake News Detection via Causal Intervention
par: Liu, Moyang, et autres
Publié: (2025)
par: Liu, Moyang, et autres
Publié: (2025)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
par: Fu, Ruibo, et autres
Publié: (2024)
par: Fu, Ruibo, et autres
Publié: (2024)
ST-GDance++: A Scalable Spatial-Temporal Diffusion for Long-Duration Group Choreography
par: Xu, Jing, et autres
Publié: (2026)
par: Xu, Jing, et autres
Publié: (2026)
DashFusion: Dual-stream Alignment with Hierarchical Bottleneck Fusion for Multimodal Sentiment Analysis
par: Wen, Yuhua, et autres
Publié: (2025)
par: Wen, Yuhua, et autres
Publié: (2025)
LongVie: Multimodal-Guided Controllable Ultra-Long Video Generation
par: Gao, Jianxiong, et autres
Publié: (2025)
par: Gao, Jianxiong, et autres
Publié: (2025)
Realizing Immersive Volumetric Video: A Multimodal Framework for 6-DoF VR Engagement
par: Yang, Zhengxian, et autres
Publié: (2026)
par: Yang, Zhengxian, et autres
Publié: (2026)
LAMIC: Layout-Aware Multi-Image Composition via Scalability of Multimodal Diffusion Transformer
par: Chen, Yuzhuo, et autres
Publié: (2025)
par: Chen, Yuzhuo, et autres
Publié: (2025)
Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory
par: Liu, Jinzhuo, et autres
Publié: (2026)
par: Liu, Jinzhuo, et autres
Publié: (2026)
Fake News Detection and Manipulation Reasoning via Large Vision-Language Models
par: Jin, Ruihan, et autres
Publié: (2024)
par: Jin, Ruihan, et autres
Publié: (2024)
High-Fidelity and Long-Duration Human Image Animation with Diffusion Transformer
par: Zheng, Shen, et autres
Publié: (2025)
par: Zheng, Shen, et autres
Publié: (2025)
OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation
par: Zhao, Lin, et autres
Publié: (2026)
par: Zhao, Lin, et autres
Publié: (2026)
VMonarch: Efficient Video Diffusion Transformers with Structured Attention
par: Liang, Cheng, et autres
Publié: (2026)
par: Liang, Cheng, et autres
Publié: (2026)
MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video Understanding
par: He, Bo, et autres
Publié: (2024)
par: He, Bo, et autres
Publié: (2024)
EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion
par: Wang, Haotian, et autres
Publié: (2024)
par: Wang, Haotian, et autres
Publié: (2024)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
par: Li, Hebeizi, et autres
Publié: (2026)
par: Li, Hebeizi, et autres
Publié: (2026)
LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation
par: Chern, Ethan, et autres
Publié: (2025)
par: Chern, Ethan, et autres
Publié: (2025)
VideoLucy: Deep Memory Backtracking for Long Video Understanding
par: Zuo, Jialong, et autres
Publié: (2025)
par: Zuo, Jialong, et autres
Publié: (2025)
ARLON: Boosting Diffusion Transformers with Autoregressive Models for Long Video Generation
par: Li, Zongyi, et autres
Publié: (2024)
par: Li, Zongyi, et autres
Publié: (2024)
CtrlVDiff: Controllable Video Generation via Unified Multimodal Video Diffusion
par: Xi, Dianbing, et autres
Publié: (2025)
par: Xi, Dianbing, et autres
Publié: (2025)
RELIC: Interactive Video World Model with Long-Horizon Memory
par: Hong, Yicong, et autres
Publié: (2025)
par: Hong, Yicong, et autres
Publié: (2025)
Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis
par: Ding, Yikang, et autres
Publié: (2025)
par: Ding, Yikang, et autres
Publié: (2025)
Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval
par: Yu, Jiwen, et autres
Publié: (2025)
par: Yu, Jiwen, et autres
Publié: (2025)
Exploring Iterative Refinement with Diffusion Models for Video Grounding
par: Liang, Xiao, et autres
Publié: (2023)
par: Liang, Xiao, et autres
Publié: (2023)
Boosting Resolution Generalization of Diffusion Transformers with Randomized Positional Encodings
par: Hou, Liang, et autres
Publié: (2025)
par: Hou, Liang, et autres
Publié: (2025)
EditYourself: Audio-Driven Generation and Manipulation of Talking Head Videos with Diffusion Transformers
par: Flynn, John, et autres
Publié: (2026)
par: Flynn, John, et autres
Publié: (2026)
Understanding Attention Mechanism in Video Diffusion Models
par: Liu, Bingyan, et autres
Publié: (2025)
par: Liu, Bingyan, et autres
Publié: (2025)
REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing
par: Xu, Weihan, et autres
Publié: (2025)
par: Xu, Weihan, et autres
Publié: (2025)
ImViD: Immersive Volumetric Videos for Enhanced VR Engagement
par: Yang, Zhengxian, et autres
Publié: (2025)
par: Yang, Zhengxian, et autres
Publié: (2025)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
par: Xie, Wulin, et autres
Publié: (2025)
par: Xie, Wulin, et autres
Publié: (2025)
DisentTalk: Cross-lingual Talking Face Generation via Semantic Disentangled Diffusion Model
par: Liu, Kangwei, et autres
Publié: (2025)
par: Liu, Kangwei, et autres
Publié: (2025)
Learning Online Scale Transformation for Talking Head Video Generation
par: Hong, Fa-Ting, et autres
Publié: (2024)
par: Hong, Fa-Ting, et autres
Publié: (2024)
Documents similaires
-
Debunk and Infer: Multimodal Fake News Detection via Diffusion-Generated Evidence and LLM Reasoning
par: Yan, Kaiying, et autres
Publié: (2025) -
MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation
par: Zhang, Haojie, et autres
Publié: (2026) -
Exploring the Role of Audio in Multimodal Misinformation Detection
par: Liu, Moyang, et autres
Publié: (2024) -
MDPE: A Multimodal Deception Dataset with Personality and Emotional Characteristics
par: Cai, Cong, et autres
Publié: (2024) -
PSA-MF: Personality-Sentiment Aligned Multi-Level Fusion for Multimodal Sentiment Analysis
par: Xie, Heng, et autres
Publié: (2025)