Zero Shot Audio to Audio Emotion Transfer With Speaker Disentanglement
Fuente:
arXiv
Salvato in:
| Autori principali: | Dutta, Soumya, Ganapathy, Sriram |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Textless and Non-Parallel Speech-to-Speech Emotion Style Transfer
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
HCAM -- Hierarchical Cross Attention Model for Multi-modal Emotion Recognition
di: Dutta, Soumya, et al.
Pubblicazione: (2023)
di: Dutta, Soumya, et al.
Pubblicazione: (2023)
Multi-label Zero-Shot Audio Classification with Temporal Attention
di: Dogan, Duygu, et al.
Pubblicazione: (2024)
di: Dogan, Duygu, et al.
Pubblicazione: (2024)
Listenable Maps for Zero-Shot Audio Classifiers
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
On Class Separability Pitfalls In Audio-Text Contrastive Zero-Shot Learning
di: Tavares, Tiago, et al.
Pubblicazione: (2024)
di: Tavares, Tiago, et al.
Pubblicazione: (2024)
HiddenSpeaker: Generate Imperceptible Unlearnable Audios for Speaker Verification System
di: Zhang, Zhisheng, et al.
Pubblicazione: (2024)
di: Zhang, Zhisheng, et al.
Pubblicazione: (2024)
On the Transferability of Large-Scale Self-Supervision to Few-Shot Audio Classification
di: Heggan, Calum, et al.
Pubblicazione: (2024)
di: Heggan, Calum, et al.
Pubblicazione: (2024)
Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM Inversion
di: Manor, Hila, et al.
Pubblicazione: (2024)
di: Manor, Hila, et al.
Pubblicazione: (2024)
Blind Audio Bandwidth Extension: A Diffusion-Based Zero-Shot Approach
di: Moliner, Eloi, et al.
Pubblicazione: (2023)
di: Moliner, Eloi, et al.
Pubblicazione: (2023)
Learning Disentangled Audio Representations through Controlled Synthesis
di: Brima, Yusuf, et al.
Pubblicazione: (2024)
di: Brima, Yusuf, et al.
Pubblicazione: (2024)
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
Zero-Shot Multi-Lingual Speaker Verification in Clinical Trials
di: Akram, Ali, et al.
Pubblicazione: (2024)
di: Akram, Ali, et al.
Pubblicazione: (2024)
Towards the Next Frontier in Speech Representation Learning Using Disentanglement
di: Krishna, Varun, et al.
Pubblicazione: (2024)
di: Krishna, Varun, et al.
Pubblicazione: (2024)
ABHINAYA -- A System for Speech Emotion Recognition In Naturalistic Conditions Challenge
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
Text-Independent Speaker Identification Using Audio Looping With Margin Based Loss Functions
di: Garcia, Elliot Q C, et al.
Pubblicazione: (2025)
di: Garcia, Elliot Q C, et al.
Pubblicazione: (2025)
Can Quantized Audio Language Models Perform Zero-Shot Spoofing Detection?
di: Dutta, Bikash, et al.
Pubblicazione: (2025)
di: Dutta, Bikash, et al.
Pubblicazione: (2025)
Gaussian Flow Bridges for Audio Domain Transfer with Unpaired Data
di: Moliner, Eloi, et al.
Pubblicazione: (2024)
di: Moliner, Eloi, et al.
Pubblicazione: (2024)
Exploring Meta Information for Audio-based Zero-shot Bird Classification
di: Gebhard, Alexander, et al.
Pubblicazione: (2023)
di: Gebhard, Alexander, et al.
Pubblicazione: (2023)
Leveraging Content and Acoustic Representations for Speech Emotion Recognition
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
A2SB: Audio-to-Audio Schrodinger Bridges
di: Kong, Zhifeng, et al.
Pubblicazione: (2025)
di: Kong, Zhifeng, et al.
Pubblicazione: (2025)
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
di: Primus, Paul, et al.
Pubblicazione: (2025)
di: Primus, Paul, et al.
Pubblicazione: (2025)
LC-Protonets: Multi-Label Few-Shot Learning for World Music Audio Tagging
di: Papaioannou, Charilaos, et al.
Pubblicazione: (2024)
di: Papaioannou, Charilaos, et al.
Pubblicazione: (2024)
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization
di: Singh, Prachi, et al.
Pubblicazione: (2024)
di: Singh, Prachi, et al.
Pubblicazione: (2024)
EmotionCaps: Enhancing Audio Captioning Through Emotion-Augmented Data Generation
di: Manivannan, Mithun, et al.
Pubblicazione: (2024)
di: Manivannan, Mithun, et al.
Pubblicazione: (2024)
Learning Source Disentanglement in Neural Audio Codec
di: Bie, Xiaoyu, et al.
Pubblicazione: (2024)
di: Bie, Xiaoyu, et al.
Pubblicazione: (2024)
The Rarity of Musical Audio Signals Within the Space of Possible Audio Generation
di: Collins, Nick
Pubblicazione: (2024)
di: Collins, Nick
Pubblicazione: (2024)
Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024)
di: Primus, Paul, et al.
Pubblicazione: (2024)
Fusing Audio and Metadata Embeddings Improves Language-based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024)
di: Primus, Paul, et al.
Pubblicazione: (2024)
PAT: Parameter-Free Audio-Text Aligner to Boost Zero-Shot Audio Classification
di: Seth, Ashish, et al.
Pubblicazione: (2024)
di: Seth, Ashish, et al.
Pubblicazione: (2024)
Audio Match Cutting: Finding and Creating Matching Audio Transitions in Movies and Videos
di: Fedorishin, Dennis, et al.
Pubblicazione: (2024)
di: Fedorishin, Dennis, et al.
Pubblicazione: (2024)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
$C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
Unsupervised Composable Representations for Audio
di: Bindi, Giovanni, et al.
Pubblicazione: (2024)
di: Bindi, Giovanni, et al.
Pubblicazione: (2024)
Diffusion Models for Audio Restoration
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)
Multi-bit Audio Watermarking
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
Instabilities in Convnets for Raw Audio
di: Haider, Daniel, et al.
Pubblicazione: (2023)
di: Haider, Daniel, et al.
Pubblicazione: (2023)
Automatic Contextual Audio Denoising
di: Luong, Diep, et al.
Pubblicazione: (2026)
di: Luong, Diep, et al.
Pubblicazione: (2026)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Textless and Non-Parallel Speech-to-Speech Emotion Style Transfer
di: Dutta, Soumya, et al.
Pubblicazione: (2025) -
LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations
di: Dutta, Soumya, et al.
Pubblicazione: (2025) -
HCAM -- Hierarchical Cross Attention Model for Multi-modal Emotion Recognition
di: Dutta, Soumya, et al.
Pubblicazione: (2023) -
Multi-label Zero-Shot Audio Classification with Temporal Attention
di: Dogan, Duygu, et al.
Pubblicazione: (2024) -
Listenable Maps for Zero-Shot Audio Classifiers
di: Paissan, Francesco, et al.
Pubblicazione: (2024)