Guardado en:
| Autores principales: | Stooke, Adam, Prabhavalkar, Rohit, Sim, Khe Chai, Mengibar, Pedro Moreno |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2502.05232 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Hierarchical Recurrent Adapters for Efficient Multi-Task Adaptation of Large Speech Models
por: Munkhdalai, Tsendsuren, et al.
Publicado: (2024)
por: Munkhdalai, Tsendsuren, et al.
Publicado: (2024)
Extreme Encoder Output Frame Rate Reduction: Improving Computational Latencies of Large End-to-End Models
por: Prabhavalkar, Rohit, et al.
Publicado: (2024)
por: Prabhavalkar, Rohit, et al.
Publicado: (2024)
Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration
por: Lou, Haowei, et al.
Publicado: (2024)
por: Lou, Haowei, et al.
Publicado: (2024)
SSPS: Self-Supervised Positive Sampling for Robust Self-Supervised Speaker Verification
por: Lepage, Theo, et al.
Publicado: (2025)
por: Lepage, Theo, et al.
Publicado: (2025)
Label-Looping: Highly Efficient Decoding for Transducers
por: Bataev, Vladimir, et al.
Publicado: (2024)
por: Bataev, Vladimir, et al.
Publicado: (2024)
Piano Transcription by Hierarchical Language Modeling with Pretrained Roll-based Encoders
por: Li, Dichucheng, et al.
Publicado: (2025)
por: Li, Dichucheng, et al.
Publicado: (2025)
Scaling Self-Supervised Representation Learning for Symbolic Piano Performance
por: Bradshaw, Louis, et al.
Publicado: (2025)
por: Bradshaw, Louis, et al.
Publicado: (2025)
SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes
por: Alex, Tony, et al.
Publicado: (2025)
por: Alex, Tony, et al.
Publicado: (2025)
Translation-Equivariant Self-Supervised Learning for Pitch Estimation with Optimal Transport
por: Torres, Bernardo, et al.
Publicado: (2025)
por: Torres, Bernardo, et al.
Publicado: (2025)
Self-Supervised Disentangled Representation Learning for Robust Target Speech Extraction
por: Mu, Zhaoxi, et al.
Publicado: (2023)
por: Mu, Zhaoxi, et al.
Publicado: (2023)
PESTO: Real-Time Pitch Estimation with Self-supervised Transposition-equivariant Objective
por: Riou, Alain, et al.
Publicado: (2025)
por: Riou, Alain, et al.
Publicado: (2025)
DAISY: Data Adaptive Self-Supervised Early Exit for Speech Representation Models
por: Lin, Tzu-Quan, et al.
Publicado: (2024)
por: Lin, Tzu-Quan, et al.
Publicado: (2024)
Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech
por: Fu, Szu-Wei, et al.
Publicado: (2024)
por: Fu, Szu-Wei, et al.
Publicado: (2024)
RNN-Transducer-based Losses for Speech Recognition on Noisy Targets
por: Bataev, Vladimir
Publicado: (2025)
por: Bataev, Vladimir
Publicado: (2025)
DiceHuBERT: Distilling HuBERT with a Self-Supervised Learning Objective
por: Chi, Hyung Gun, et al.
Publicado: (2025)
por: Chi, Hyung Gun, et al.
Publicado: (2025)
EAT: Self-Supervised Pre-Training with Efficient Audio Transformer
por: Chen, Wenxi, et al.
Publicado: (2024)
por: Chen, Wenxi, et al.
Publicado: (2024)
Soft Clustering Anchors for Self-Supervised Speech Representation Learning in Joint Embedding Prediction Architectures
por: Ioannides, Georgios, et al.
Publicado: (2026)
por: Ioannides, Georgios, et al.
Publicado: (2026)
AnyEnhance: A Unified Generative Model with Prompt-Guidance and Self-Critic for Voice Enhancement
por: Zhang, Junan, et al.
Publicado: (2025)
por: Zhang, Junan, et al.
Publicado: (2025)
Pushing the Limits of Beam Search Decoding for Transducer-based ASR models
por: Grigoryan, Lilit, et al.
Publicado: (2025)
por: Grigoryan, Lilit, et al.
Publicado: (2025)
DARNet: Dual Attention Refinement Network with Spatiotemporal Construction for Auditory Attention Detection
por: Yan, Sheng, et al.
Publicado: (2024)
por: Yan, Sheng, et al.
Publicado: (2024)
Speaker Emotion Recognition: Leveraging Self-Supervised Models for Feature Extraction Using Wav2Vec2 and HuBERT
por: Jafarzadeh, Pourya, et al.
Publicado: (2024)
por: Jafarzadeh, Pourya, et al.
Publicado: (2024)
Fast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter
por: Andrusenko, Andrei, et al.
Publicado: (2024)
por: Andrusenko, Andrei, et al.
Publicado: (2024)
Model as Loss: A Self-Consistent Training Paradigm
por: Phaye, Saisamarth Rajesh, et al.
Publicado: (2025)
por: Phaye, Saisamarth Rajesh, et al.
Publicado: (2025)
Cross-Attention with Confidence Weighting for Multi-Channel Audio Alignment
por: Nihal, Ragib Amin, et al.
Publicado: (2025)
por: Nihal, Ragib Amin, et al.
Publicado: (2025)
JEPA as a Neural Tokenizer: Learning Robust Speech Representations with Density Adaptive Attention
por: Ioannides, Georgios, et al.
Publicado: (2025)
por: Ioannides, Georgios, et al.
Publicado: (2025)
Lightweight Self-Supervised Detection of Fundamental Frequency and Accurate Probability of Voicing in Monophonic Music
por: Bitra, Venkat Suprabath, et al.
Publicado: (2026)
por: Bitra, Venkat Suprabath, et al.
Publicado: (2026)
SelfVC: Voice Conversion With Iterative Refinement using Self Transformations
por: Neekhara, Paarth, et al.
Publicado: (2023)
por: Neekhara, Paarth, et al.
Publicado: (2023)
DOA-Aware Audio-Visual Self-Supervised Learning for Sound Event Localization and Detection
por: Fujita, Yoto, et al.
Publicado: (2024)
por: Fujita, Yoto, et al.
Publicado: (2024)
Enhanced Speech Emotion Recognition with Efficient Channel Attention Guided Deep CNN-BiLSTM Framework
por: Kundu, Niloy Kumar, et al.
Publicado: (2024)
por: Kundu, Niloy Kumar, et al.
Publicado: (2024)
Whisfusion: Parallel ASR Decoding via a Diffusion Transformer
por: Kwon, Taeyoun, et al.
Publicado: (2025)
por: Kwon, Taeyoun, et al.
Publicado: (2025)
Masked Audio Generation using a Single Non-Autoregressive Transformer
por: Ziv, Alon, et al.
Publicado: (2024)
por: Ziv, Alon, et al.
Publicado: (2024)
DeepGB-TB: A Risk-Balanced Cross-Attention Gradient-Boosted Convolutional Network for Rapid, Interpretable Tuberculosis Screening
por: Lu, Zhixiang, et al.
Publicado: (2025)
por: Lu, Zhixiang, et al.
Publicado: (2025)
Multimodal Audio-based Disease Prediction with Transformer-based Hierarchical Fusion Network
por: Cai, Jinjin, et al.
Publicado: (2024)
por: Cai, Jinjin, et al.
Publicado: (2024)
MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer
por: Wang, Yuancheng, et al.
Publicado: (2024)
por: Wang, Yuancheng, et al.
Publicado: (2024)
Whisper in Medusa's Ear: Multi-head Efficient Decoding for Transformer-based ASR
por: Segal-Feldman, Yael, et al.
Publicado: (2024)
por: Segal-Feldman, Yael, et al.
Publicado: (2024)
Comparative Analysis of CNN and Transformer Architectures with Heart Cycle Normalization for Automated Phonocardiogram Classification
por: Sondermann, Martin, et al.
Publicado: (2025)
por: Sondermann, Martin, et al.
Publicado: (2025)
Geometry-Aware Optimization for Respiratory Sound Classification: Enhancing Sensitivity with SAM-Optimized Audio Spectrogram Transformers
por: Işık, Atakan, et al.
Publicado: (2025)
por: Işık, Atakan, et al.
Publicado: (2025)
Multi-blank Transducers for Speech Recognition
por: Xu, Hainan, et al.
Publicado: (2022)
por: Xu, Hainan, et al.
Publicado: (2022)
TRAMBA: A Hybrid Transformer and Mamba Architecture for Practical Audio and Bone Conduction Speech Super Resolution and Enhancement on Mobile and Wearable Platforms
por: Sui, Yueyuan, et al.
Publicado: (2024)
por: Sui, Yueyuan, et al.
Publicado: (2024)
Audio Transformers
por: Verma, Prateek, et al.
Publicado: (2021)
por: Verma, Prateek, et al.
Publicado: (2021)
Ejemplares similares
-
Hierarchical Recurrent Adapters for Efficient Multi-Task Adaptation of Large Speech Models
por: Munkhdalai, Tsendsuren, et al.
Publicado: (2024) -
Extreme Encoder Output Frame Rate Reduction: Improving Computational Latencies of Large End-to-End Models
por: Prabhavalkar, Rohit, et al.
Publicado: (2024) -
Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration
por: Lou, Haowei, et al.
Publicado: (2024) -
SSPS: Self-Supervised Positive Sampling for Robust Self-Supervised Speaker Verification
por: Lepage, Theo, et al.
Publicado: (2025) -
Label-Looping: Highly Efficient Decoding for Transducers
por: Bataev, Vladimir, et al.
Publicado: (2024)