Salvato in:
| Autori principali: | Wang, Jing, Zhang, Fengzhuo, Li, Xiaoli, Tan, Vincent Y. F., Pang, Tianyu, Du, Chao, Sun, Aixin, Yang, Zhuoran |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2503.10704 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improving Long-Text Alignment for Text-to-Image Diffusion Models
di: Liu, Luping, et al.
Pubblicazione: (2024)
di: Liu, Luping, et al.
Pubblicazione: (2024)
Demystifying the Slash Pattern in Attention: The Role of RoPE
di: Cheng, Yuan, et al.
Pubblicazione: (2026)
di: Cheng, Yuan, et al.
Pubblicazione: (2026)
Does Multimodality Improve Recommender Systems as Expected? A Critical Analysis and Future Directions
di: Zhou, Hongyu, et al.
Pubblicazione: (2025)
di: Zhou, Hongyu, et al.
Pubblicazione: (2025)
VIA: Unified Spatiotemporal Video Adaptation Framework for Global and Local Video Editing
di: Gu, Jing, et al.
Pubblicazione: (2024)
di: Gu, Jing, et al.
Pubblicazione: (2024)
StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion
di: Li, Fengjin, et al.
Pubblicazione: (2025)
di: Li, Fengjin, et al.
Pubblicazione: (2025)
ConCLVD: Controllable Chinese Landscape Video Generation via Diffusion Model
di: Liu, Dingming, et al.
Pubblicazione: (2024)
di: Liu, Dingming, et al.
Pubblicazione: (2024)
Test-Time Backdoor Attacks on Multimodal Large Language Models
di: Lu, Dong, et al.
Pubblicazione: (2024)
di: Lu, Dong, et al.
Pubblicazione: (2024)
VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations
di: Zhao, Baoquan, et al.
Pubblicazione: (2025)
di: Zhao, Baoquan, et al.
Pubblicazione: (2025)
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
di: Sun, Jiahui, et al.
Pubblicazione: (2025)
di: Sun, Jiahui, et al.
Pubblicazione: (2025)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
Benchmarking Large Multimodal Models against Common Corruptions
di: Zhang, Jiawei, et al.
Pubblicazione: (2024)
di: Zhang, Jiawei, et al.
Pubblicazione: (2024)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
di: Li, Yaoru, et al.
Pubblicazione: (2025)
di: Li, Yaoru, et al.
Pubblicazione: (2025)
DAE-Talker: High Fidelity Speech-Driven Talking Face Generation with Diffusion Autoencoder
di: Du, Chenpeng, et al.
Pubblicazione: (2023)
di: Du, Chenpeng, et al.
Pubblicazione: (2023)
Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts
di: Liu, Yi, et al.
Pubblicazione: (2024)
di: Liu, Yi, et al.
Pubblicazione: (2024)
Multi-modal and Metadata Capture Model for Micro Video Popularity Prediction
di: Lu, Jiacheng, et al.
Pubblicazione: (2025)
di: Lu, Jiacheng, et al.
Pubblicazione: (2025)
Cross-Space Synergy: A Unified Framework for Multimodal Emotion Recognition in Conversation
di: Lyu, Xiaosen, et al.
Pubblicazione: (2025)
di: Lyu, Xiaosen, et al.
Pubblicazione: (2025)
Multimodal Semantic Communication for Generative Audio-Driven Video Conferencing
di: Tong, Haonan, et al.
Pubblicazione: (2024)
di: Tong, Haonan, et al.
Pubblicazione: (2024)
FlexCache: Flexible Approximate Cache System for Video Diffusion
di: Sun, Desen, et al.
Pubblicazione: (2024)
di: Sun, Desen, et al.
Pubblicazione: (2024)
Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model Perspective
di: Yuan, Hangjie, et al.
Pubblicazione: (2025)
di: Yuan, Hangjie, et al.
Pubblicazione: (2025)
MMoFusion: Multi-modal Co-Speech Motion Generation with Diffusion Model
di: Wang, Sen, et al.
Pubblicazione: (2024)
di: Wang, Sen, et al.
Pubblicazione: (2024)
DiffCL: A Diffusion-Based Contrastive Learning Framework with Semantic Alignment for Multimodal Recommendations
di: Song, Qiya, et al.
Pubblicazione: (2025)
di: Song, Qiya, et al.
Pubblicazione: (2025)
VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation
di: Luo, Ziyang, et al.
Pubblicazione: (2024)
di: Luo, Ziyang, et al.
Pubblicazione: (2024)
RoSMM: A Robust and Secure Multi-Modal Watermarking Framework for Diffusion Models
di: Fang, ZhongLi, et al.
Pubblicazione: (2025)
di: Fang, ZhongLi, et al.
Pubblicazione: (2025)
Generalized Video Anomaly Event Detection: Systematic Taxonomy and Comparison of Deep Models
di: Liu, Yang, et al.
Pubblicazione: (2023)
di: Liu, Yang, et al.
Pubblicazione: (2023)
X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation
di: Zhou, S. Z., et al.
Pubblicazione: (2025)
di: Zhou, S. Z., et al.
Pubblicazione: (2025)
IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video Generation
di: Lin, Yuanze, et al.
Pubblicazione: (2025)
di: Lin, Yuanze, et al.
Pubblicazione: (2025)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
di: Xu, Yifang, et al.
Pubblicazione: (2025)
di: Xu, Yifang, et al.
Pubblicazione: (2025)
Unified ROI-based Image Compression Paradigm with Generalized Gaussian Model
di: Hu, Kai, et al.
Pubblicazione: (2026)
di: Hu, Kai, et al.
Pubblicazione: (2026)
Exploring Classical Piano Performance Generation with Expressive Music Variational AutoEncoder
di: Luo, Jing, et al.
Pubblicazione: (2025)
di: Luo, Jing, et al.
Pubblicazione: (2025)
StyleSpeaker: Audio-Enhanced Fine-Grained Style Modeling for Speech-Driven 3D Facial Animation
di: Yang, An, et al.
Pubblicazione: (2025)
di: Yang, An, et al.
Pubblicazione: (2025)
TimeLoc: A Unified End-to-End Framework for Precise Timestamp Localization in Long Videos
di: Zhang, Chen-Lin, et al.
Pubblicazione: (2025)
di: Zhang, Chen-Lin, et al.
Pubblicazione: (2025)
Language-oriented Semantic Communication for Image Transmission with Fine-Tuned Diffusion Model
di: Wei, Xinfeng, et al.
Pubblicazione: (2024)
di: Wei, Xinfeng, et al.
Pubblicazione: (2024)
Quality-Aware Dynamic Resolution Adaptation Framework for Adaptive Video Streaming
di: Premkumar, Amritha, et al.
Pubblicazione: (2024)
di: Premkumar, Amritha, et al.
Pubblicazione: (2024)
Loss-resilient Coding of Texture and Depth for Free-viewpoint Video Conferencing
di: Macchiavello, Bruno, et al.
Pubblicazione: (2013)
di: Macchiavello, Bruno, et al.
Pubblicazione: (2013)
Modeling the Popularity of Events on Web by Sparsity and Mutual-Excitation Guided Graph Neural Network
di: Deng, Jiaxin, et al.
Pubblicazione: (2024)
di: Deng, Jiaxin, et al.
Pubblicazione: (2024)
M2ORT: Many-To-One Regression Transformer for Spatial Transcriptomics Prediction from Histopathology Images
di: Wang, Hongyi, et al.
Pubblicazione: (2024)
di: Wang, Hongyi, et al.
Pubblicazione: (2024)
AutoAWG: Adverse Weather Generation with Adaptive Multi-Controls for Automotive Videos
di: Hu, Jiagao, et al.
Pubblicazione: (2026)
di: Hu, Jiagao, et al.
Pubblicazione: (2026)
BanditSpec: Adaptive Speculative Decoding via Bandit Algorithms
di: Hou, Yunlong, et al.
Pubblicazione: (2025)
di: Hou, Yunlong, et al.
Pubblicazione: (2025)
Muon Outperforms Adam in Tail-End Associative Memory Learning
di: Wang, Shuche, et al.
Pubblicazione: (2025)
di: Wang, Shuche, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Improving Long-Text Alignment for Text-to-Image Diffusion Models
di: Liu, Luping, et al.
Pubblicazione: (2024) -
Demystifying the Slash Pattern in Attention: The Role of RoPE
di: Cheng, Yuan, et al.
Pubblicazione: (2026) -
Does Multimodality Improve Recommender Systems as Expected? A Critical Analysis and Future Directions
di: Zhou, Hongyu, et al.
Pubblicazione: (2025) -
VIA: Unified Spatiotemporal Video Adaptation Framework for Global and Local Video Editing
di: Gu, Jing, et al.
Pubblicazione: (2024) -
StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion
di: Li, Fengjin, et al.
Pubblicazione: (2025)