Audio-Sync Video Generation with Multi-Stream Temporal Control
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Weng, Shuchen, Zheng, Haojie, Chang, Zheng, Li, Si, Shi, Boxin, Wang, Xinlong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner
par: Zheng, Haojie, et autres
Publié: (2025)
par: Zheng, Haojie, et autres
Publié: (2025)
InstructAV2AV: Instruction-Guided Audio-Video Joint Editing
par: Zheng, Haojie, et autres
Publié: (2026)
par: Zheng, Haojie, et autres
Publié: (2026)
VIRES: Video Instance Repainting via Sketch and Text Guided Generation
par: Weng, Shuchen, et autres
Publié: (2024)
par: Weng, Shuchen, et autres
Publié: (2024)
L-C4: Language-Based Video Colorization for Creative and Consistent Color
par: Chang, Zheng, et autres
Publié: (2024)
par: Chang, Zheng, et autres
Publié: (2024)
Lighting-grounded Video Generation with Renderer-based Agent Reasoning
par: Cai, Ziqi, et autres
Publié: (2026)
par: Cai, Ziqi, et autres
Publié: (2026)
STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative
par: Zhang, Peixuan, et autres
Publié: (2025)
par: Zhang, Peixuan, et autres
Publié: (2025)
Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors
par: Zhang, Peixuan, et autres
Publié: (2025)
par: Zhang, Peixuan, et autres
Publié: (2025)
Style-Preserving Lip Sync via Audio-Aware Style Reference
par: Zhong, Weizhi, et autres
Publié: (2024)
par: Zhong, Weizhi, et autres
Publié: (2024)
GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents
par: Wang, Yunzhe, et autres
Publié: (2026)
par: Wang, Yunzhe, et autres
Publié: (2026)
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
par: Lin, Junming, et autres
Publié: (2024)
par: Lin, Junming, et autres
Publié: (2024)
VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
par: Liu, Ye, et autres
Publié: (2025)
par: Liu, Ye, et autres
Publié: (2025)
Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification
par: Wang, Xiao, et autres
Publié: (2026)
par: Wang, Xiao, et autres
Publié: (2026)
TempoSyncDiff: Distilled Temporally-Consistent Diffusion for Low-Latency Audio-Driven Talking Head Generation
par: Mazumdar, Soumya, et autres
Publié: (2026)
par: Mazumdar, Soumya, et autres
Publié: (2026)
ReContraster: Making Your Posters Stand Out with Regional Contrast
par: Zhang, Peixuan, et autres
Publié: (2026)
par: Zhang, Peixuan, et autres
Publié: (2026)
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
par: Xie, Yiweng, et autres
Publié: (2026)
par: Xie, Yiweng, et autres
Publié: (2026)
AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation
par: Girish, Sharath, et autres
Publié: (2025)
par: Girish, Sharath, et autres
Publié: (2025)
DreamPolish: Domain Score Distillation With Progressive Geometry Generation
par: Cheng, Yean, et autres
Publié: (2024)
par: Cheng, Yean, et autres
Publié: (2024)
In-Context Sync-LoRA for Portrait Video Editing
par: Polaczek, Sagi, et autres
Publié: (2025)
par: Polaczek, Sagi, et autres
Publié: (2025)
A Benchmark and Multi-Agent System for Instruction-driven Cinematic Video Compilation
par: Zhang, Peixuan, et autres
Publié: (2026)
par: Zhang, Peixuan, et autres
Publié: (2026)
EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion
par: Wang, Haotian, et autres
Publié: (2024)
par: Wang, Haotian, et autres
Publié: (2024)
SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning
par: Cheng, Xin, et autres
Publié: (2026)
par: Cheng, Xin, et autres
Publié: (2026)
Moiré Video Authentication: A Physical Signature Against AI Video Generation
par: Qing, Yuan, et autres
Publié: (2026)
par: Qing, Yuan, et autres
Publié: (2026)
EdgeSync: Faster Edge-model Updating via Adaptive Continuous Learning for Video Data Drift
par: Zhao, Peng, et autres
Publié: (2024)
par: Zhao, Peng, et autres
Publié: (2024)
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
par: Tang, Yolo Yunlong, et autres
Publié: (2024)
par: Tang, Yolo Yunlong, et autres
Publié: (2024)
StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos
par: Lee, Daeun, et autres
Publié: (2025)
par: Lee, Daeun, et autres
Publié: (2025)
CogStream: Context-guided Streaming Video Question Answering
par: Zhao, Zicheng, et autres
Publié: (2025)
par: Zhao, Zicheng, et autres
Publié: (2025)
Towards Visual-Prompt Temporal Answering Grounding in Medical Instructional Video
par: Li, Bin, et autres
Publié: (2022)
par: Li, Bin, et autres
Publié: (2022)
Exploring Audio Hallucination in Egocentric Video Understanding
par: Seth, Ashish, et autres
Publié: (2026)
par: Seth, Ashish, et autres
Publié: (2026)
StyleLipSync: Style-based Personalized Lip-sync Video Generation
par: Ki, Taekyung, et autres
Publié: (2023)
par: Ki, Taekyung, et autres
Publié: (2023)
MOFA-Video: Controllable Image Animation via Generative Motion Field Adaptions in Frozen Image-to-Video Diffusion Model
par: Niu, Muyao, et autres
Publié: (2024)
par: Niu, Muyao, et autres
Publié: (2024)
Apollo: Unified Multi-Task Audio-Video Joint Generation
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
StochSync: Stochastic Diffusion Synchronization for Image Generation in Arbitrary Spaces
par: Yeo, Kyeongmin, et autres
Publié: (2025)
par: Yeo, Kyeongmin, et autres
Publié: (2025)
video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM
par: Sun, Guangzhi, et autres
Publié: (2025)
par: Sun, Guangzhi, et autres
Publié: (2025)
Thinking in Streaming Video
par: Liu, Zikang, et autres
Publié: (2026)
par: Liu, Zikang, et autres
Publié: (2026)
Robust Noisy Label Learning via Two-Stream Sample Distillation
par: Bai, Sihan, et autres
Publié: (2024)
par: Bai, Sihan, et autres
Publié: (2024)
Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding
par: Zheng, Yikai, et autres
Publié: (2026)
par: Zheng, Yikai, et autres
Publié: (2026)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
par: Chen, Xueyi, et autres
Publié: (2025)
par: Chen, Xueyi, et autres
Publié: (2025)
SyncVSR: Data-Efficient Visual Speech Recognition with End-to-End Crossmodal Audio Token Synchronization
par: Ahn, Young Jin, et autres
Publié: (2024)
par: Ahn, Young Jin, et autres
Publié: (2024)
InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions
par: Zhang, Pan, et autres
Publié: (2024)
par: Zhang, Pan, et autres
Publié: (2024)
Affective Image Editing: Shaping Emotional Factors via Text Descriptions
par: Zhang, Peixuan, et autres
Publié: (2025)
par: Zhang, Peixuan, et autres
Publié: (2025)
Documents similaires
-
AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner
par: Zheng, Haojie, et autres
Publié: (2025) -
InstructAV2AV: Instruction-Guided Audio-Video Joint Editing
par: Zheng, Haojie, et autres
Publié: (2026) -
VIRES: Video Instance Repainting via Sketch and Text Guided Generation
par: Weng, Shuchen, et autres
Publié: (2024) -
L-C4: Language-Based Video Colorization for Creative and Consistent Color
par: Chang, Zheng, et autres
Publié: (2024) -
Lighting-grounded Video Generation with Renderer-based Agent Reasoning
par: Cai, Ziqi, et autres
Publié: (2026)