Salvato in:
| Autori principali: | Hinrichs, Reemt, Ostermann, Jörn |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2502.02424 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scalable Speech Enhancement with Dynamic Channel Pruning
di: Miccini, Riccardo, et al.
Pubblicazione: (2024)
di: Miccini, Riccardo, et al.
Pubblicazione: (2024)
OnDA: On-device Channel Pruning for Efficient Personalized Keyword Spotting
di: Risso, Matteo, et al.
Pubblicazione: (2026)
di: Risso, Matteo, et al.
Pubblicazione: (2026)
Revisit Micro-batch Clipping: Adaptive Data Pruning via Gradient Manipulation
di: Wang, Lun
Pubblicazione: (2024)
di: Wang, Lun
Pubblicazione: (2024)
Music2Latent: Consistency Autoencoders for Latent Audio Compression
di: Pasini, Marco, et al.
Pubblicazione: (2024)
di: Pasini, Marco, et al.
Pubblicazione: (2024)
From Diet to Free Lunch: Estimating Auxiliary Signal Properties using Dynamic Pruning Masks in Speech Enhancement Networks
di: Miccini, Riccardo, et al.
Pubblicazione: (2026)
di: Miccini, Riccardo, et al.
Pubblicazione: (2026)
FLToP CTC: Frame-Level Token Pruning via Relative Threshold for Efficient and Memory-Saving Decoding on Diverse Platforms
di: Shree, Atul, et al.
Pubblicazione: (2025)
di: Shree, Atul, et al.
Pubblicazione: (2025)
Text-Independent Speaker Identification Using Audio Looping With Margin Based Loss Functions
di: Garcia, Elliot Q C, et al.
Pubblicazione: (2025)
di: Garcia, Elliot Q C, et al.
Pubblicazione: (2025)
Can Masked Autoencoders Also Listen to Birds?
di: Rauch, Lukas, et al.
Pubblicazione: (2025)
di: Rauch, Lukas, et al.
Pubblicazione: (2025)
Data-Driven Room Acoustic Modeling Via Differentiable Feedback Delay Networks With Learnable Delay Lines
di: Mezza, Alessandro Ilic, et al.
Pubblicazione: (2024)
di: Mezza, Alessandro Ilic, et al.
Pubblicazione: (2024)
Re-Bottleneck: Latent Re-Structuring for Neural Audio Autoencoders
di: Bralios, Dimitrios, et al.
Pubblicazione: (2025)
di: Bralios, Dimitrios, et al.
Pubblicazione: (2025)
Accented Text-to-Speech Synthesis with a Conditional Variational Autoencoder
di: Melechovsky, Jan, et al.
Pubblicazione: (2022)
di: Melechovsky, Jan, et al.
Pubblicazione: (2022)
wav2pos: Sound Source Localization using Masked Autoencoders
di: Berg, Axel, et al.
Pubblicazione: (2024)
di: Berg, Axel, et al.
Pubblicazione: (2024)
Music Emotion Prediction Using Recurrent Neural Networks
di: Chang, Xinyu, et al.
Pubblicazione: (2024)
di: Chang, Xinyu, et al.
Pubblicazione: (2024)
SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval
di: Lin, Yueqian, et al.
Pubblicazione: (2024)
di: Lin, Yueqian, et al.
Pubblicazione: (2024)
CochCeps-Augment: A Novel Self-Supervised Contrastive Learning Using Cochlear Cepstrum-based Masking for Speech Emotion Recognition
di: Ziogas, Ioannis, et al.
Pubblicazione: (2024)
di: Ziogas, Ioannis, et al.
Pubblicazione: (2024)
Dynamic Gated Recurrent Neural Network for Compute-efficient Speech Enhancement
di: Cheng, Longbiao, et al.
Pubblicazione: (2024)
di: Cheng, Longbiao, et al.
Pubblicazione: (2024)
Vocal Melody Construction for Persian Lyrics Using LSTM Recurrent Neural Networks
di: Jafari, Farshad, et al.
Pubblicazione: (2024)
di: Jafari, Farshad, et al.
Pubblicazione: (2024)
DEMONet: Underwater Acoustic Target Recognition based on Multi-Expert Network and Cross-Temporal Variational Autoencoder
di: Xie, Yuan, et al.
Pubblicazione: (2024)
di: Xie, Yuan, et al.
Pubblicazione: (2024)
Noise-aware Speech Enhancement using Diffusion Probabilistic Model
di: Hu, Yuchen, et al.
Pubblicazione: (2023)
di: Hu, Yuchen, et al.
Pubblicazione: (2023)
ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
Investigation of Time-Frequency Feature Combinations with Histogram Layer Time Delay Neural Networks
di: Mohammadi, Amirmohammad, et al.
Pubblicazione: (2024)
di: Mohammadi, Amirmohammad, et al.
Pubblicazione: (2024)
Synthetic data enables context-aware bioacoustic sound event detection
di: Hoffman, Benjamin, et al.
Pubblicazione: (2025)
di: Hoffman, Benjamin, et al.
Pubblicazione: (2025)
Zero-shot Voice Conversion with Diffusion Transformers
di: Liu, Songting
Pubblicazione: (2024)
di: Liu, Songting
Pubblicazione: (2024)
Zero-Shot Mono-to-Binaural Speech Synthesis
di: Levkovitch, Alon, et al.
Pubblicazione: (2024)
di: Levkovitch, Alon, et al.
Pubblicazione: (2024)
Recurrence-Based Nonlinear Vocal Dynamics as Digital Biomarkers for Depression Detection from Conversational Speech
di: Samanta, Himadri S
Pubblicazione: (2026)
di: Samanta, Himadri S
Pubblicazione: (2026)
Context-aware child-directed speech detection from long-form recordings
di: Charlot, Théo, et al.
Pubblicazione: (2026)
di: Charlot, Théo, et al.
Pubblicazione: (2026)
Transcribing Rhythmic Patterns of the Guitar Track in Polyphonic Music
di: Lukoianov, Aleksandr, et al.
Pubblicazione: (2025)
di: Lukoianov, Aleksandr, et al.
Pubblicazione: (2025)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
AdaPTwin: Low-Cost Adaptive Compression of Product Twins in Transformers
di: Biju, Emil, et al.
Pubblicazione: (2024)
di: Biju, Emil, et al.
Pubblicazione: (2024)
Zero-Shot Multi-Lingual Speaker Verification in Clinical Trials
di: Akram, Ali, et al.
Pubblicazione: (2024)
di: Akram, Ali, et al.
Pubblicazione: (2024)
Embedding-Space Diffusion for Zero-Shot Environmental Sound Classification
di: Sims, Ysobel, et al.
Pubblicazione: (2024)
di: Sims, Ysobel, et al.
Pubblicazione: (2024)
Zero Shot Audio to Audio Emotion Transfer With Speaker Disentanglement
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
Information Retrieval for ZeroSpeech 2021: The Submission by University of Wroclaw
di: Chorowski, Jan, et al.
Pubblicazione: (2021)
di: Chorowski, Jan, et al.
Pubblicazione: (2021)
Multi-label Zero-Shot Audio Classification with Temporal Attention
di: Dogan, Duygu, et al.
Pubblicazione: (2024)
di: Dogan, Duygu, et al.
Pubblicazione: (2024)
Multi-modal Adversarial Training for Zero-Shot Voice Cloning
di: Janiczek, John, et al.
Pubblicazione: (2024)
di: Janiczek, John, et al.
Pubblicazione: (2024)
Audio Processing using Pattern Recognition for Music Genre Classification
di: Chatterjee, Sivangi, et al.
Pubblicazione: (2024)
di: Chatterjee, Sivangi, et al.
Pubblicazione: (2024)
Pruning as Regularization: Sensitivity-Aware One-Shot Pruning in ASR
di: Irigoyen, Julian, et al.
Pubblicazione: (2025)
di: Irigoyen, Julian, et al.
Pubblicazione: (2025)
SepPrune: Structured Pruning for Efficient Deep Speech Separation
di: Li, Yuqi, et al.
Pubblicazione: (2025)
di: Li, Yuqi, et al.
Pubblicazione: (2025)
GE2E-AC: Generalized End-to-End Loss Training for Accent Classification
di: Watanabe, Chihiro, et al.
Pubblicazione: (2024)
di: Watanabe, Chihiro, et al.
Pubblicazione: (2024)
Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings
di: Wisnu, Dyah A. M. G., et al.
Pubblicazione: (2025)
di: Wisnu, Dyah A. M. G., et al.
Pubblicazione: (2025)
Documenti analoghi
-
Scalable Speech Enhancement with Dynamic Channel Pruning
di: Miccini, Riccardo, et al.
Pubblicazione: (2024) -
OnDA: On-device Channel Pruning for Efficient Personalized Keyword Spotting
di: Risso, Matteo, et al.
Pubblicazione: (2026) -
Revisit Micro-batch Clipping: Adaptive Data Pruning via Gradient Manipulation
di: Wang, Lun
Pubblicazione: (2024) -
Music2Latent: Consistency Autoencoders for Latent Audio Compression
di: Pasini, Marco, et al.
Pubblicazione: (2024) -
From Diet to Free Lunch: Estimating Auxiliary Signal Properties using Dynamic Pruning Masks in Speech Enhancement Networks
di: Miccini, Riccardo, et al.
Pubblicazione: (2026)