Guardado en:
| Autores principales: | Zhou, Feiyan, Wang, Luyuan, Chen, Shoufa, Wang, Zhe, Liu, Zhiheng, Cong, Yuren, Zhang, Xiaohui, Yang, Fanny, Zeng, Belinda |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2605.18749 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
Semantic Audio-Visual Navigation in Continuous Environments
por: Zeng, Yichen, et al.
Publicado: (2026)
por: Zeng, Yichen, et al.
Publicado: (2026)
VABench: A Comprehensive Benchmark for Audio-Video Generation
por: Hua, Daili, et al.
Publicado: (2025)
por: Hua, Daili, et al.
Publicado: (2025)
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
por: Bai, Detao, et al.
Publicado: (2025)
por: Bai, Detao, et al.
Publicado: (2025)
MOVA: Towards Scalable and Synchronized Video-Audio Generation
por: OpenMOSS Team, et al.
Publicado: (2026)
por: OpenMOSS Team, et al.
Publicado: (2026)
Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching
por: Wang, Yongqi, et al.
Publicado: (2024)
por: Wang, Yongqi, et al.
Publicado: (2024)
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
por: Liu, Chen, et al.
Publicado: (2025)
por: Liu, Chen, et al.
Publicado: (2025)
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
por: Wang, Juncheng, et al.
Publicado: (2025)
por: Wang, Juncheng, et al.
Publicado: (2025)
Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation
por: Zhou, Yupeng, et al.
Publicado: (2026)
por: Zhou, Yupeng, et al.
Publicado: (2026)
Apollo: Unified Multi-Task Audio-Video Joint Generation
por: Wang, Jun, et al.
Publicado: (2026)
por: Wang, Jun, et al.
Publicado: (2026)
Semantics-Aware Human Motion Generation from Audio Instructions
por: Wang, Zi-An, et al.
Publicado: (2025)
por: Wang, Zi-An, et al.
Publicado: (2025)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
por: Yang, Jianxuan, et al.
Publicado: (2025)
por: Yang, Jianxuan, et al.
Publicado: (2025)
FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts
por: Li, You, et al.
Publicado: (2026)
por: Li, You, et al.
Publicado: (2026)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
por: Guo, Yuxin, et al.
Publicado: (2025)
por: Guo, Yuxin, et al.
Publicado: (2025)
Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning
por: Wang, Linge, et al.
Publicado: (2026)
por: Wang, Linge, et al.
Publicado: (2026)
MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video
por: Tateishi, Kazuya, et al.
Publicado: (2026)
por: Tateishi, Kazuya, et al.
Publicado: (2026)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
por: Guo, Xinyue, et al.
Publicado: (2025)
por: Guo, Xinyue, et al.
Publicado: (2025)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
por: Li, Hebeizi, et al.
Publicado: (2026)
por: Li, Hebeizi, et al.
Publicado: (2026)
OmniAudio: Generating Spatial Audio from 360-Degree Video
por: Liu, Huadai, et al.
Publicado: (2025)
por: Liu, Huadai, et al.
Publicado: (2025)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
por: Wang, Zhenzhi, et al.
Publicado: (2025)
por: Wang, Zhenzhi, et al.
Publicado: (2025)
LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
por: Liu, Tengfei, et al.
Publicado: (2026)
por: Liu, Tengfei, et al.
Publicado: (2026)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
por: Chen, Yuheng, et al.
Publicado: (2026)
por: Chen, Yuheng, et al.
Publicado: (2026)
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
por: Shan, Sizhe, et al.
Publicado: (2025)
por: Shan, Sizhe, et al.
Publicado: (2025)
Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence
por: Liao, Junchao, et al.
Publicado: (2026)
por: Liao, Junchao, et al.
Publicado: (2026)
SINGER: Vivid Audio-driven Singing Video Generation with Multi-scale Spectral Diffusion Model
por: Li, Yan, et al.
Publicado: (2024)
por: Li, Yan, et al.
Publicado: (2024)
FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation
por: Tan, Weiting, et al.
Publicado: (2026)
por: Tan, Weiting, et al.
Publicado: (2026)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
por: Yang, Jianxuan, et al.
Publicado: (2026)
por: Yang, Jianxuan, et al.
Publicado: (2026)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
por: Pian, Weiguo, et al.
Publicado: (2026)
por: Pian, Weiguo, et al.
Publicado: (2026)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
por: Liu, Kai, et al.
Publicado: (2026)
por: Liu, Kai, et al.
Publicado: (2026)
Hierarchical Codec Diffusion for Video-to-Speech Generation
por: Ye, Jiaxin, et al.
Publicado: (2026)
por: Ye, Jiaxin, et al.
Publicado: (2026)
End-to-end Audio Deepfake Detection from RAW Waveforms: a RawNet-Based Approach with Cross-Dataset Evaluation
por: Di Pierno, Andrea, et al.
Publicado: (2025)
por: Di Pierno, Andrea, et al.
Publicado: (2025)
JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching
por: Kwon, Mingi, et al.
Publicado: (2025)
por: Kwon, Mingi, et al.
Publicado: (2025)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
por: Liu, Huadai, et al.
Publicado: (2025)
por: Liu, Huadai, et al.
Publicado: (2025)
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
por: Tang, Changli, et al.
Publicado: (2025)
por: Tang, Changli, et al.
Publicado: (2025)
VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection
por: Cheng, Hao, et al.
Publicado: (2025)
por: Cheng, Hao, et al.
Publicado: (2025)
Audio-Guided Visual Perception for Audio-Visual Navigation
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
por: Liu, Chen, et al.
Publicado: (2025)
por: Liu, Chen, et al.
Publicado: (2025)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
por: Yang, Jialiang, et al.
Publicado: (2026)
por: Yang, Jialiang, et al.
Publicado: (2026)
READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation
por: Wang, Haotian, et al.
Publicado: (2025)
por: Wang, Haotian, et al.
Publicado: (2025)
Dual Audio-Centric Modality Coupling for Talking Head Generation
por: Fu, Ao, et al.
Publicado: (2025)
por: Fu, Ao, et al.
Publicado: (2025)
Ejemplares similares
-
Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation
por: Li, Hao, et al.
Publicado: (2025) -
Semantic Audio-Visual Navigation in Continuous Environments
por: Zeng, Yichen, et al.
Publicado: (2026) -
VABench: A Comprehensive Benchmark for Audio-Video Generation
por: Hua, Daili, et al.
Publicado: (2025) -
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
por: Bai, Detao, et al.
Publicado: (2025) -
MOVA: Towards Scalable and Synchronized Video-Audio Generation
por: OpenMOSS Team, et al.
Publicado: (2026)