Enregistré dans:
| Auteurs principaux: | Foti, Pietro, Brendel, Andreas |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2504.08470 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound
par: Liu, Haohe, et autres
Publié: (2024)
par: Liu, Haohe, et autres
Publié: (2024)
MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition
par: Pan, Yu, et autres
Publié: (2023)
par: Pan, Yu, et autres
Publié: (2023)
StyleSpeech: Parameter-efficient Fine Tuning for Pre-trained Controllable Text-to-Speech
par: Lou, Haowei, et autres
Publié: (2024)
par: Lou, Haowei, et autres
Publié: (2024)
Emotion-Aware Speech Generation with Character-Specific Voices for Comics
par: Qian, Zhiwen, et autres
Publié: (2025)
par: Qian, Zhiwen, et autres
Publié: (2025)
Analyzing the Impact of Splicing Artifacts in Partially Fake Speech Signals
par: Negroni, Viola, et autres
Publié: (2024)
par: Negroni, Viola, et autres
Publié: (2024)
GACA-DiT: Diffusion-based Dance-to-Music Generation with Genre-Adaptive Rhythm and Context-Aware Alignment
par: Wang, Jinting, et autres
Publié: (2025)
par: Wang, Jinting, et autres
Publié: (2025)
EmoReg: Directional Latent Vector Modeling for Emotional Intensity Regularization in Diffusion-based Voice Conversion
par: Gudmalwar, Ashishkumar, et autres
Publié: (2024)
par: Gudmalwar, Ashishkumar, et autres
Publié: (2024)
Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
Neural Style Transfer for Audio Spectograms
par: Verma, Prateek, et autres
Publié: (2018)
par: Verma, Prateek, et autres
Publié: (2018)
MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models
par: Zhang, Yixiao, et autres
Publié: (2024)
par: Zhang, Yixiao, et autres
Publié: (2024)
DreamHead: Learning Spatial-Temporal Correspondence via Hierarchical Diffusion for Audio-driven Talking Head Synthesis
par: Hong, Fa-Ting, et autres
Publié: (2024)
par: Hong, Fa-Ting, et autres
Publié: (2024)
LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport
par: Rho, Kyeongha, et autres
Publié: (2025)
par: Rho, Kyeongha, et autres
Publié: (2025)
Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM Approach
par: Zhao, Zijian, et autres
Publié: (2025)
par: Zhao, Zijian, et autres
Publié: (2025)
Recent Advances in Discrete Speech Tokens: A Review
par: Guo, Yiwei, et autres
Publié: (2025)
par: Guo, Yiwei, et autres
Publié: (2025)
BandCondiNet: Parallel Transformers-based Conditional Popular Music Generation with Multi-View Features
par: Luo, Jing, et autres
Publié: (2024)
par: Luo, Jing, et autres
Publié: (2024)
VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs
par: Zhang, Hezhao, et autres
Publié: (2026)
par: Zhang, Hezhao, et autres
Publié: (2026)
Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis
par: Ye, Zhen, et autres
Publié: (2025)
par: Ye, Zhen, et autres
Publié: (2025)
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
par: Biyani, Ishan D., et autres
Publié: (2025)
par: Biyani, Ishan D., et autres
Publié: (2025)
Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition
par: Wu, Linzhi, et autres
Publié: (2026)
par: Wu, Linzhi, et autres
Publié: (2026)
LatentSpeech: Latent Diffusion for Text-To-Speech Generation
par: Lou, Haowei, et autres
Publié: (2024)
par: Lou, Haowei, et autres
Publié: (2024)
LAV: Audio-Driven Dynamic Visual Generation with Neural Compression and StyleGAN2
par: Jung, Jongmin, et autres
Publié: (2025)
par: Jung, Jongmin, et autres
Publié: (2025)
Sequence-to-Sequence Multi-Modal Speech In-Painting
par: Elyaderani, Mahsa Kadkhodaei, et autres
Publié: (2024)
par: Elyaderani, Mahsa Kadkhodaei, et autres
Publié: (2024)
CoComposer: LLM Multi-agent Collaborative Music Composition
par: Xing, Peiwen, et autres
Publié: (2025)
par: Xing, Peiwen, et autres
Publié: (2025)
Learning What To Hear: Boosting Sound-Source Association For Robust Audiovisual Instance Segmentation
par: Seo, Jinbae, et autres
Publié: (2025)
par: Seo, Jinbae, et autres
Publié: (2025)
Deciphering GunType Hierarchy through Acoustic Analysis of Gunshot Recordings
par: Shah, Ankit, et autres
Publié: (2025)
par: Shah, Ankit, et autres
Publié: (2025)
Controllable Video-to-Music Generation with Multiple Time-Varying Conditions
par: Wu, Junxian, et autres
Publié: (2025)
par: Wu, Junxian, et autres
Publié: (2025)
AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models
par: Li, Wenyu, et autres
Publié: (2025)
par: Li, Wenyu, et autres
Publié: (2025)
Embedding Alignment in Code Generation for Audio
par: Kouteili, Sam, et autres
Publié: (2025)
par: Kouteili, Sam, et autres
Publié: (2025)
From Sound to Sight: Towards AI-authored Music Videos
par: Vitasovic, Leo, et autres
Publié: (2025)
par: Vitasovic, Leo, et autres
Publié: (2025)
YuE: Scaling Open Foundation Models for Long-Form Music Generation
par: Yuan, Ruibin, et autres
Publié: (2025)
par: Yuan, Ruibin, et autres
Publié: (2025)
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
par: Jiang, Yuxuan, et autres
Publié: (2025)
par: Jiang, Yuxuan, et autres
Publié: (2025)
Prompt-aware classifier free guidance for diffusion models
par: Zhang, Xuanhao, et autres
Publié: (2025)
par: Zhang, Xuanhao, et autres
Publié: (2025)
Disentangling Score Content and Performance Style for Joint Piano Rendering and Transcription
par: Zeng, Wei, et autres
Publié: (2025)
par: Zeng, Wei, et autres
Publié: (2025)
Exploring Classical Piano Performance Generation with Expressive Music Variational AutoEncoder
par: Luo, Jing, et autres
Publié: (2025)
par: Luo, Jing, et autres
Publié: (2025)
Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
par: Zhang, Kang, et autres
Publié: (2025)
par: Zhang, Kang, et autres
Publié: (2025)
GVMGen: A General Video-to-Music Generation Model with Hierarchical Attentions
par: Zuo, Heda, et autres
Publié: (2025)
par: Zuo, Heda, et autres
Publié: (2025)
Sync-TVA: A Graph-Attention Framework for Multimodal Emotion Recognition with Cross-Modal Fusion
par: Deng, Zeyu, et autres
Publié: (2025)
par: Deng, Zeyu, et autres
Publié: (2025)
MMVA: Multimodal Matching Based on Valence and Arousal across Images, Music, and Musical Captions
par: Choi, Suhwan, et autres
Publié: (2025)
par: Choi, Suhwan, et autres
Publié: (2025)
Index-MSR: A high-efficiency multimodal fusion framework for speech recognition
par: Chen, Jinming, et autres
Publié: (2025)
par: Chen, Jinming, et autres
Publié: (2025)
DeepFake Doctor: Diagnosing and Treating Audio-Video Fake Detection
par: Klemt, Marcel, et autres
Publié: (2025)
par: Klemt, Marcel, et autres
Publié: (2025)
Documents similaires
-
SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound
par: Liu, Haohe, et autres
Publié: (2024) -
MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition
par: Pan, Yu, et autres
Publié: (2023) -
StyleSpeech: Parameter-efficient Fine Tuning for Pre-trained Controllable Text-to-Speech
par: Lou, Haowei, et autres
Publié: (2024) -
Emotion-Aware Speech Generation with Character-Specific Voices for Comics
par: Qian, Zhiwen, et autres
Publié: (2025) -
Analyzing the Impact of Splicing Artifacts in Partially Fake Speech Signals
par: Negroni, Viola, et autres
Publié: (2024)