Salvato in:
| Autori principali: | Kavediya, Harsh, Nayak, Vighnesh, Sharma, Bheeshm, Palaniappan, Balamurugan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2510.07837 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
di: Pian, Weiguo, et al.
Pubblicazione: (2026)
di: Pian, Weiguo, et al.
Pubblicazione: (2026)
Sound Sparks Motion: Audio and Text Tuning for Video Editing
di: Razlighi, AmirHossein Naghi, et al.
Pubblicazione: (2026)
di: Razlighi, AmirHossein Naghi, et al.
Pubblicazione: (2026)
PAVAS: Physics-Aware Video-to-Audio Synthesis
di: Hyun-Bin, Oh, et al.
Pubblicazione: (2025)
di: Hyun-Bin, Oh, et al.
Pubblicazione: (2025)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
di: Guo, Yuxin, et al.
Pubblicazione: (2025)
di: Guo, Yuxin, et al.
Pubblicazione: (2025)
VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
di: Tian, Zeyue, et al.
Pubblicazione: (2024)
di: Tian, Zeyue, et al.
Pubblicazione: (2024)
Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence
di: Liao, Junchao, et al.
Pubblicazione: (2026)
di: Liao, Junchao, et al.
Pubblicazione: (2026)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
di: Liu, Kai, et al.
Pubblicazione: (2026)
di: Liu, Kai, et al.
Pubblicazione: (2026)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
RASALoRE: Region Aware Spatial Attention with Location-based Random Embeddings for Weakly Supervised Anomaly Detection in Brain MRI Scans
di: Sharma, Bheeshm, et al.
Pubblicazione: (2025)
di: Sharma, Bheeshm, et al.
Pubblicazione: (2025)
AccKV: Towards Efficient Audio-Video LLMs Inference via Adaptive-Focusing and Cross-Calibration KV Cache Optimization
di: Jiang, Zhonghua, et al.
Pubblicazione: (2025)
di: Jiang, Zhonghua, et al.
Pubblicazione: (2025)
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
di: Cheng, Shihao, et al.
Pubblicazione: (2026)
di: Cheng, Shihao, et al.
Pubblicazione: (2026)
Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation
di: Li, Chunyu, et al.
Pubblicazione: (2026)
di: Li, Chunyu, et al.
Pubblicazione: (2026)
Diffusion Models for Joint Audio-Video Generation
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion Transformers
di: Guan, Jiazhi, et al.
Pubblicazione: (2025)
di: Guan, Jiazhi, et al.
Pubblicazione: (2025)
SeeingSounds: Learning Audio-to-Visual Alignment via Text
di: Carnemolla, Simone, et al.
Pubblicazione: (2025)
di: Carnemolla, Simone, et al.
Pubblicazione: (2025)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
di: Yang, Qi, et al.
Pubblicazione: (2024)
di: Yang, Qi, et al.
Pubblicazione: (2024)
On the Audio Hallucinations in Large Audio-Video Language Models
di: Nishimura, Taichi, et al.
Pubblicazione: (2024)
di: Nishimura, Taichi, et al.
Pubblicazione: (2024)
Apollo: Unified Multi-Task Audio-Video Joint Generation
di: Wang, Jun, et al.
Pubblicazione: (2026)
di: Wang, Jun, et al.
Pubblicazione: (2026)
Do Joint Audio-Video Generation Models Understand Physics?
di: Cui, Zijun, et al.
Pubblicazione: (2026)
di: Cui, Zijun, et al.
Pubblicazione: (2026)
Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal
di: Xu, Weihan, et al.
Pubblicazione: (2025)
di: Xu, Weihan, et al.
Pubblicazione: (2025)
Video-to-Audio Generation with Hidden Alignment
di: Xu, Manjie, et al.
Pubblicazione: (2024)
di: Xu, Manjie, et al.
Pubblicazione: (2024)
Temporally Aligned Audio for Video with Autoregression
di: Viertola, Ilpo, et al.
Pubblicazione: (2024)
di: Viertola, Ilpo, et al.
Pubblicazione: (2024)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
di: Araujo, Edson, et al.
Pubblicazione: (2026)
di: Araujo, Edson, et al.
Pubblicazione: (2026)
Audio-Visual World Models: Towards Multisensory Imagination in Sight and Sound
di: Wang, Jiahua, et al.
Pubblicazione: (2025)
di: Wang, Jiahua, et al.
Pubblicazione: (2025)
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
di: Su, Yaofeng, et al.
Pubblicazione: (2026)
di: Su, Yaofeng, et al.
Pubblicazione: (2026)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation
di: Tan, Weiting, et al.
Pubblicazione: (2026)
di: Tan, Weiting, et al.
Pubblicazione: (2026)
SLaM-DiMM: Shared Latent Modeling for Diffusion Based Missing Modality Synthesis in MRI
di: Sandbhor, Bhavesh, et al.
Pubblicazione: (2025)
di: Sandbhor, Bhavesh, et al.
Pubblicazione: (2025)
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
di: Yang, Jialiang, et al.
Pubblicazione: (2026)
di: Yang, Jialiang, et al.
Pubblicazione: (2026)
TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation
di: Liu, Xiangyu, et al.
Pubblicazione: (2026)
di: Liu, Xiangyu, et al.
Pubblicazione: (2026)
SonoWorld: From One Image to a 3D Audio-Visual Scene
di: Jin, Derong, et al.
Pubblicazione: (2026)
di: Jin, Derong, et al.
Pubblicazione: (2026)
Diffusion Models as Masked Audio-Video Learners
di: Nunez, Elvis, et al.
Pubblicazione: (2023)
di: Nunez, Elvis, et al.
Pubblicazione: (2023)
Hear What Matters! Text-conditioned Selective Video-to-Audio Generation
di: Lee, Junwon, et al.
Pubblicazione: (2025)
di: Lee, Junwon, et al.
Pubblicazione: (2025)
READ-Net: Clarifying Emotional Ambiguity via Adaptive Feature Recalibration for Audio-Visual Depression Detection
di: Chen, Chenglizhao, et al.
Pubblicazione: (2026)
di: Chen, Chenglizhao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
di: Dai, Yusheng, et al.
Pubblicazione: (2026) -
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
di: Pian, Weiguo, et al.
Pubblicazione: (2026) -
Sound Sparks Motion: Audio and Text Tuning for Video Editing
di: Razlighi, AmirHossein Naghi, et al.
Pubblicazione: (2026) -
PAVAS: Physics-Aware Video-to-Audio Synthesis
di: Hyun-Bin, Oh, et al.
Pubblicazione: (2025) -
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
di: Guo, Yuxin, et al.
Pubblicazione: (2025)