Efficient Multi-Model Fusion with Adversarial Complementary Representation Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Kang, Zuheng, He, Yayun, Wang, Jianzong, Peng, Junqing, Xiao, Jing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Retrieval-Augmented Audio Deepfake Detection
di: Kang, Zuheng, et al.
Pubblicazione: (2024)
di: Kang, Zuheng, et al.
Pubblicazione: (2024)
Generalized Audio Deepfake Detection Using Frame-level Latent Information Entropy
di: Zhao, Botao, et al.
Pubblicazione: (2025)
di: Zhao, Botao, et al.
Pubblicazione: (2025)
EMO-RL: Emotion-Rule-Based Reinforcement Learning Enhanced Audio-Language Model for Generalized Speech Emotion Recognition
di: Li, Pengcheng, et al.
Pubblicazione: (2025)
di: Li, Pengcheng, et al.
Pubblicazione: (2025)
Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition
di: Yang, Qingran, et al.
Pubblicazione: (2026)
di: Yang, Qingran, et al.
Pubblicazione: (2026)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
di: Deng, Yimin, et al.
Pubblicazione: (2024)
di: Deng, Yimin, et al.
Pubblicazione: (2024)
Alternating Approach-Putt Models for Multi-Stage Speech Enhancement
di: Jeong, Iksoon, et al.
Pubblicazione: (2025)
di: Jeong, Iksoon, et al.
Pubblicazione: (2025)
PoDAR: Power-Disentangled Audio Representation for Generative Modeling
di: Luebs, Alejandro, et al.
Pubblicazione: (2026)
di: Luebs, Alejandro, et al.
Pubblicazione: (2026)
EffiFusion-GAN: Efficient Fusion Generative Adversarial Network for Speech Enhancement
di: Wen, Bin, et al.
Pubblicazione: (2025)
di: Wen, Bin, et al.
Pubblicazione: (2025)
Scaling Self-Supervised Representation Learning for Symbolic Piano Performance
di: Bradshaw, Louis, et al.
Pubblicazione: (2025)
di: Bradshaw, Louis, et al.
Pubblicazione: (2025)
Collaborative Watermarking for Adversarial Speech Synthesis
di: Juvela, Lauri, et al.
Pubblicazione: (2023)
di: Juvela, Lauri, et al.
Pubblicazione: (2023)
Self-Supervised Disentangled Representation Learning for Robust Target Speech Extraction
di: Mu, Zhaoxi, et al.
Pubblicazione: (2023)
di: Mu, Zhaoxi, et al.
Pubblicazione: (2023)
CultureMERT: Continual Pre-Training for Cross-Cultural Music Representation Learning
di: Kanatas, Angelos-Nikolaos, et al.
Pubblicazione: (2025)
di: Kanatas, Angelos-Nikolaos, et al.
Pubblicazione: (2025)
JEPA as a Neural Tokenizer: Learning Robust Speech Representations with Density Adaptive Attention
di: Ioannides, Georgios, et al.
Pubblicazione: (2025)
di: Ioannides, Georgios, et al.
Pubblicazione: (2025)
Investigating Design Choices in Joint-Embedding Predictive Architectures for General Audio Representation Learning
di: Riou, Alain, et al.
Pubblicazione: (2024)
di: Riou, Alain, et al.
Pubblicazione: (2024)
DAISY: Data Adaptive Self-Supervised Early Exit for Speech Representation Models
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2024)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2024)
Whisper in Medusa's Ear: Multi-head Efficient Decoding for Transformer-based ASR
di: Segal-Feldman, Yael, et al.
Pubblicazione: (2024)
di: Segal-Feldman, Yael, et al.
Pubblicazione: (2024)
Soft Clustering Anchors for Self-Supervised Speech Representation Learning in Joint Embedding Prediction Architectures
di: Ioannides, Georgios, et al.
Pubblicazione: (2026)
di: Ioannides, Georgios, et al.
Pubblicazione: (2026)
Multi-Metric Preference Alignment for Generative Speech Restoration
di: Zhang, Junan, et al.
Pubblicazione: (2025)
di: Zhang, Junan, et al.
Pubblicazione: (2025)
AudioGenX: Explainability on Text-to-Audio Generative Models
di: Kang, Hyunju, et al.
Pubblicazione: (2025)
di: Kang, Hyunju, et al.
Pubblicazione: (2025)
Automatic Music Sample Identification with Multi-Track Contrastive Learning
di: Riou, Alain, et al.
Pubblicazione: (2025)
di: Riou, Alain, et al.
Pubblicazione: (2025)
HEAR: Holistic Evaluation of Audio Representations
di: Turian, Joseph, et al.
Pubblicazione: (2022)
di: Turian, Joseph, et al.
Pubblicazione: (2022)
EVA-GAN: Enhanced Various Audio Generation via Scalable Generative Adversarial Networks
di: Liao, Shijia, et al.
Pubblicazione: (2024)
di: Liao, Shijia, et al.
Pubblicazione: (2024)
Multimodal Audio-based Disease Prediction with Transformer-based Hierarchical Fusion Network
di: Cai, Jinjin, et al.
Pubblicazione: (2024)
di: Cai, Jinjin, et al.
Pubblicazione: (2024)
FastVoiceGrad: One-step Diffusion-Based Voice Conversion with Adversarial Conditional Diffusion Distillation
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2024)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2024)
FasterVoiceGrad: Faster One-step Diffusion-Based Voice Conversion with Adversarial Diffusion Conversion Distillation
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
Text-Queried Audio Source Separation via Hierarchical Modeling
di: Yin, Xinlei, et al.
Pubblicazione: (2025)
di: Yin, Xinlei, et al.
Pubblicazione: (2025)
CoDiCodec: Unifying Continuous and Discrete Compressed Representations of Audio
di: Pasini, Marco, et al.
Pubblicazione: (2025)
di: Pasini, Marco, et al.
Pubblicazione: (2025)
Deep Learning-Based Automatic Multi-Level Airway Collapse Monitoring on Obstructive Sleep Apnea Patients
di: Hsu, Ying-Chieh, et al.
Pubblicazione: (2024)
di: Hsu, Ying-Chieh, et al.
Pubblicazione: (2024)
Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework
di: Zhang, Kuiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Kuiyuan, et al.
Pubblicazione: (2025)
PC-MCL: Patient-Consistent Multi-Cycle Learning with multi-label bias correction for respiratory sound classification
di: Jeong, Seung Gyu, et al.
Pubblicazione: (2026)
di: Jeong, Seung Gyu, et al.
Pubblicazione: (2026)
Towards Open Respiratory Acoustic Foundation Models: Pretraining and Benchmarking
di: Zhang, Yuwei, et al.
Pubblicazione: (2024)
di: Zhang, Yuwei, et al.
Pubblicazione: (2024)
AnyEnhance: A Unified Generative Model with Prompt-Guidance and Self-Critic for Voice Enhancement
di: Zhang, Junan, et al.
Pubblicazione: (2025)
di: Zhang, Junan, et al.
Pubblicazione: (2025)
Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning
di: Tuncay, Ludovic, et al.
Pubblicazione: (2025)
di: Tuncay, Ludovic, et al.
Pubblicazione: (2025)
Abstract Sound Fusion with Unconditional Inversion Models
di: Liu, Jing, et al.
Pubblicazione: (2025)
di: Liu, Jing, et al.
Pubblicazione: (2025)
KAD: No More FAD! An Effective and Efficient Evaluation Metric for Audio Generation
di: Chung, Yoonjin, et al.
Pubblicazione: (2025)
di: Chung, Yoonjin, et al.
Pubblicazione: (2025)
LiteASR: Efficient Automatic Speech Recognition with Low-Rank Approximation
di: Kamahori, Keisuke, et al.
Pubblicazione: (2025)
di: Kamahori, Keisuke, et al.
Pubblicazione: (2025)
Efficient and Microphone-Fault-Tolerant 3D Sound Source Localization
di: Yang, Yiyuan, et al.
Pubblicazione: (2025)
di: Yang, Yiyuan, et al.
Pubblicazione: (2025)
Learning Disentangled Speech Representations with Contrastive Learning and Time-Invariant Retrieval
di: Deng, Yimin, et al.
Pubblicazione: (2024)
di: Deng, Yimin, et al.
Pubblicazione: (2024)
Training-Free Multi-Step Audio Source Separation
di: Zang, Yongyi, et al.
Pubblicazione: (2025)
di: Zang, Yongyi, et al.
Pubblicazione: (2025)
Fast Text-to-Audio Generation with Adversarial Post-Training
di: Novack, Zachary, et al.
Pubblicazione: (2025)
di: Novack, Zachary, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Retrieval-Augmented Audio Deepfake Detection
di: Kang, Zuheng, et al.
Pubblicazione: (2024) -
Generalized Audio Deepfake Detection Using Frame-level Latent Information Entropy
di: Zhao, Botao, et al.
Pubblicazione: (2025) -
EMO-RL: Emotion-Rule-Based Reinforcement Learning Enhanced Audio-Language Model for Generalized Speech Emotion Recognition
di: Li, Pengcheng, et al.
Pubblicazione: (2025) -
Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition
di: Yang, Qingran, et al.
Pubblicazione: (2026) -
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
di: Deng, Yimin, et al.
Pubblicazione: (2024)