Omni2Sound: Towards Unified Video-Text-to-Audio Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dai, Yusheng, Chen, Zehua, Jiang, Yuxuan, Gao, Baolong, Ke, Qiuhong, Cai, Jianfei, Zhu, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
par: Pian, Weiguo, et autres
Publié: (2026)
par: Pian, Weiguo, et autres
Publié: (2026)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
par: Wang, Le, et autres
Publié: (2025)
par: Wang, Le, et autres
Publié: (2025)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026)
par: Chen, Yuheng, et autres
Publié: (2026)
Sound Sparks Motion: Audio and Text Tuning for Video Editing
par: Razlighi, AmirHossein Naghi, et autres
Publié: (2026)
par: Razlighi, AmirHossein Naghi, et autres
Publié: (2026)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
par: Liu, Kai, et autres
Publié: (2026)
par: Liu, Kai, et autres
Publié: (2026)
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
par: Su, Yaofeng, et autres
Publié: (2026)
par: Su, Yaofeng, et autres
Publié: (2026)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
par: Li, Hebeizi, et autres
Publié: (2026)
par: Li, Hebeizi, et autres
Publié: (2026)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
par: Cheng, Xize, et autres
Publié: (2024)
par: Cheng, Xize, et autres
Publié: (2024)
Apollo: Unified Multi-Task Audio-Video Joint Generation
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
par: Yang, Jianxuan, et autres
Publié: (2026)
par: Yang, Jianxuan, et autres
Publié: (2026)
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
par: Cheng, Shihao, et autres
Publié: (2026)
par: Cheng, Shihao, et autres
Publié: (2026)
Audio-Visual World Models: Towards Multisensory Imagination in Sight and Sound
par: Wang, Jiahua, et autres
Publié: (2025)
par: Wang, Jiahua, et autres
Publié: (2025)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
par: Yang, Jianxuan, et autres
Publié: (2025)
par: Yang, Jianxuan, et autres
Publié: (2025)
Gotta Hear Them All: Towards Sound Source Aware Audio Generation
par: Guo, Wei, et autres
Publié: (2024)
par: Guo, Wei, et autres
Publié: (2024)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
par: Tian, Zeyue, et autres
Publié: (2026)
par: Tian, Zeyue, et autres
Publié: (2026)
Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence
par: Liao, Junchao, et autres
Publié: (2026)
par: Liao, Junchao, et autres
Publié: (2026)
SeeingSounds: Learning Audio-to-Visual Alignment via Text
par: Carnemolla, Simone, et autres
Publié: (2025)
par: Carnemolla, Simone, et autres
Publié: (2025)
LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
par: Liu, Tengfei, et autres
Publié: (2026)
par: Liu, Tengfei, et autres
Publié: (2026)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
par: Guo, Xinyue, et autres
Publié: (2025)
par: Guo, Xinyue, et autres
Publié: (2025)
IsoSignVid2Aud: Sign Language Video to Audio Conversion without Text Intermediaries
par: Kavediya, Harsh, et autres
Publié: (2025)
par: Kavediya, Harsh, et autres
Publié: (2025)
AccKV: Towards Efficient Audio-Video LLMs Inference via Adaptive-Focusing and Cross-Calibration KV Cache Optimization
par: Jiang, Zhonghua, et autres
Publié: (2025)
par: Jiang, Zhonghua, et autres
Publié: (2025)
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
par: Jiang, Yuxuan, et autres
Publié: (2025)
par: Jiang, Yuxuan, et autres
Publié: (2025)
Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation
par: Li, Chunyu, et autres
Publié: (2026)
par: Li, Chunyu, et autres
Publié: (2026)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
par: Wang, Zhenzhi, et autres
Publié: (2025)
par: Wang, Zhenzhi, et autres
Publié: (2025)
TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation
par: Liu, Xiangyu, et autres
Publié: (2026)
par: Liu, Xiangyu, et autres
Publié: (2026)
Read, Watch and Scream! Sound Generation from Text and Video
par: Jeong, Yujin, et autres
Publié: (2024)
par: Jeong, Yujin, et autres
Publié: (2024)
PAVAS: Physics-Aware Video-to-Audio Synthesis
par: Hyun-Bin, Oh, et autres
Publié: (2025)
par: Hyun-Bin, Oh, et autres
Publié: (2025)
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
par: Liu, Che, et autres
Publié: (2025)
par: Liu, Che, et autres
Publié: (2025)
VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)
par: Guo, Yuxin, et autres
Publié: (2025)
Diffusion Models for Joint Audio-Video Generation
par: La Torre, Alejandro Paredes
Publié: (2026)
par: La Torre, Alejandro Paredes
Publié: (2026)
Sounding that Object: Interactive Object-Aware Image to Audio Generation
par: Li, Tingle, et autres
Publié: (2025)
par: Li, Tingle, et autres
Publié: (2025)
A Study of Dropout-Induced Modality Bias on Robustness to Missing Video Frames for Audio-Visual Speech Recognition
par: Dai, Yusheng, et autres
Publié: (2024)
par: Dai, Yusheng, et autres
Publié: (2024)
Do Joint Audio-Video Generation Models Understand Physics?
par: Cui, Zijun, et autres
Publié: (2026)
par: Cui, Zijun, et autres
Publié: (2026)
Video-to-Audio Generation with Hidden Alignment
par: Xu, Manjie, et autres
Publié: (2024)
par: Xu, Manjie, et autres
Publié: (2024)
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
par: Chen, Zihao, et autres
Publié: (2024)
par: Chen, Zihao, et autres
Publié: (2024)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
par: Li, Yaoru, et autres
Publié: (2025)
par: Li, Yaoru, et autres
Publié: (2025)
FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation
par: Tan, Weiting, et autres
Publié: (2026)
par: Tan, Weiting, et autres
Publié: (2026)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
par: Yang, Qi, et autres
Publié: (2024)
par: Yang, Qi, et autres
Publié: (2024)
Documents similaires
-
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
par: Pian, Weiguo, et autres
Publié: (2026) -
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
par: Wang, Le, et autres
Publié: (2025) -
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026) -
Sound Sparks Motion: Audio and Text Tuning for Video Editing
par: Razlighi, AmirHossein Naghi, et autres
Publié: (2026) -
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
par: Liu, Kai, et autres
Publié: (2026)