Papez: Resource-Efficient Speech Separation with Auditory Working Memory
Fuente:
arXiv
Guardado en:
| Autores principales: | Oh, Hyunseok, Yi, Juheon, Lee, Youngki |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Efficient Training of Self-Supervised Speech Foundation Models on a Compute Budget
por: Liu, Andy T., et al.
Publicado: (2024)
por: Liu, Andy T., et al.
Publicado: (2024)
SupertonicTTS: Towards Highly Efficient and Streamlined Text-to-Speech System
por: Kim, Hyeongju, et al.
Publicado: (2025)
por: Kim, Hyeongju, et al.
Publicado: (2025)
RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching
por: Yang, Jinhyeok, et al.
Publicado: (2026)
por: Yang, Jinhyeok, et al.
Publicado: (2026)
Combining TF-GridNet and Mixture Encoder for Continuous Speech Separation for Meeting Transcription
por: Vieting, Peter, et al.
Publicado: (2023)
por: Vieting, Peter, et al.
Publicado: (2023)
Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement
por: Wang, Chien-Chun, et al.
Publicado: (2026)
por: Wang, Chien-Chun, et al.
Publicado: (2026)
Investigating Disentanglement in a Phoneme-level Speech Codec for Prosody Modeling
por: Karapiperis, Sotirios, et al.
Publicado: (2024)
por: Karapiperis, Sotirios, et al.
Publicado: (2024)
HyperTTS: Parameter Efficient Adaptation in Text to Speech using Hypernetworks
por: Li, Yingting, et al.
Publicado: (2024)
por: Li, Yingting, et al.
Publicado: (2024)
Phir Hera Fairy: An English Fairytaler is a Strong Faker of Fluent Speech in Low-Resource Indian Languages
por: Varadhan, Praveen Srinivasa, et al.
Publicado: (2025)
por: Varadhan, Praveen Srinivasa, et al.
Publicado: (2025)
SSVD-O: Parameter-Efficient Fine-Tuning with Structured SVD for Speech Recognition
por: Wang, Pu, et al.
Publicado: (2026)
por: Wang, Pu, et al.
Publicado: (2026)
Property Neurons in Self-Supervised Speech Transformers
por: Lin, Tzu-Quan, et al.
Publicado: (2024)
por: Lin, Tzu-Quan, et al.
Publicado: (2024)
Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation
por: Duret, Jarod, et al.
Publicado: (2024)
por: Duret, Jarod, et al.
Publicado: (2024)
Length-Aware Rotary Position Embedding for Text-Speech Alignment
por: Kim, Hyeongju, et al.
Publicado: (2025)
por: Kim, Hyeongju, et al.
Publicado: (2025)
SimulTron: On-Device Simultaneous Speech to Speech Translation
por: Agranovich, Alex, et al.
Publicado: (2024)
por: Agranovich, Alex, et al.
Publicado: (2024)
Translatotron 3: Speech to Speech Translation with Monolingual Data
por: Nachmani, Eliya, et al.
Publicado: (2023)
por: Nachmani, Eliya, et al.
Publicado: (2023)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
por: Lin, Hsi-Che, et al.
Publicado: (2024)
por: Lin, Hsi-Che, et al.
Publicado: (2024)
Speech Robust Bench: A Robustness Benchmark For Speech Recognition
por: Shah, Muhammad A., et al.
Publicado: (2024)
por: Shah, Muhammad A., et al.
Publicado: (2024)
Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation
por: Wang, Siyin, et al.
Publicado: (2024)
por: Wang, Siyin, et al.
Publicado: (2024)
Speech Recognition With LLMs Adapted to Disordered Speech Using Reinforcement Learning
por: Nagpal, Chirag, et al.
Publicado: (2024)
por: Nagpal, Chirag, et al.
Publicado: (2024)
Efficient VoIP Communications through LLM-based Real-Time Speech Reconstruction and Call Prioritization for Emergency Services
por: Venkateshperumal, Danush, et al.
Publicado: (2024)
por: Venkateshperumal, Danush, et al.
Publicado: (2024)
SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
por: Wang, Xiaofei, et al.
Publicado: (2023)
por: Wang, Xiaofei, et al.
Publicado: (2023)
Imagine to Hear: Auditory Knowledge Generation can be an Effective Assistant for Language Models
por: Yoo, Suho, et al.
Publicado: (2025)
por: Yoo, Suho, et al.
Publicado: (2025)
Is Smaller Always Faster? Tradeoffs in Compressing Self-Supervised Speech Transformers
por: Lin, Tzu-Quan, et al.
Publicado: (2022)
por: Lin, Tzu-Quan, et al.
Publicado: (2022)
Utilizing Neural Transducers for Two-Stage Text-to-Speech via Semantic Token Prediction
por: Kim, Minchan, et al.
Publicado: (2024)
por: Kim, Minchan, et al.
Publicado: (2024)
CoSTA: Code-Switched Speech Translation using Aligned Speech-Text Interleaving
por: Shankar, Bhavani, et al.
Publicado: (2024)
por: Shankar, Bhavani, et al.
Publicado: (2024)
On the Problem of Text-To-Speech Model Selection for Synthetic Data Generation in Automatic Speech Recognition
por: Rossenbach, Nick, et al.
Publicado: (2024)
por: Rossenbach, Nick, et al.
Publicado: (2024)
The ParlaSpeech Collection of Automatically Generated Speech and Text Datasets from Parliamentary Proceedings
por: Ljubešić, Nikola, et al.
Publicado: (2024)
por: Ljubešić, Nikola, et al.
Publicado: (2024)
Modeling Overlapped Speech with Shuffles
por: Wiesner, Matthew, et al.
Publicado: (2026)
por: Wiesner, Matthew, et al.
Publicado: (2026)
Multiple Choice Learning for Efficient Speech Separation with Many Speakers
por: Perera, David, et al.
Publicado: (2024)
por: Perera, David, et al.
Publicado: (2024)
TTSDS -- Text-to-Speech Distribution Score
por: Minixhofer, Christoph, et al.
Publicado: (2024)
por: Minixhofer, Christoph, et al.
Publicado: (2024)
Textually Pretrained Speech Language Models
por: Hassid, Michael, et al.
Publicado: (2023)
por: Hassid, Michael, et al.
Publicado: (2023)
PAST: Phonetic-Acoustic Speech Tokenizer
por: Har-Tuv, Nadav, et al.
Publicado: (2025)
por: Har-Tuv, Nadav, et al.
Publicado: (2025)
Speech Rhythm-Based Speaker Embeddings Extraction from Phonemes and Phoneme Duration for Multi-Speaker Speech Synthesis
por: Fujita, Kenichi, et al.
Publicado: (2024)
por: Fujita, Kenichi, et al.
Publicado: (2024)
Coupling Speech Encoders with Downstream Text Models
por: Chelba, Ciprian, et al.
Publicado: (2024)
por: Chelba, Ciprian, et al.
Publicado: (2024)
Text to Speech System for Meitei Mayek Script
por: Irengbam, Gangular Singh, et al.
Publicado: (2025)
por: Irengbam, Gangular Singh, et al.
Publicado: (2025)
Generative Pre-training for Speech with Flow Matching
por: Liu, Alexander H., et al.
Publicado: (2023)
por: Liu, Alexander H., et al.
Publicado: (2023)
Adapting Language Balance in Code-Switching Speech
por: Ugan, Enes Yavuz, et al.
Publicado: (2025)
por: Ugan, Enes Yavuz, et al.
Publicado: (2025)
Speculative End-Turn Detector for Efficient Speech Chatbot Assistant
por: Ok, Hyunjong, et al.
Publicado: (2025)
por: Ok, Hyunjong, et al.
Publicado: (2025)
Energy-Based Models with Applications to Speech and Language Processing
por: Ou, Zhijian
Publicado: (2024)
por: Ou, Zhijian
Publicado: (2024)
Disentangling Textual and Acoustic Features of Neural Speech Representations
por: Mohebbi, Hosein, et al.
Publicado: (2024)
por: Mohebbi, Hosein, et al.
Publicado: (2024)
Moonshine: Speech Recognition for Live Transcription and Voice Commands
por: Jeffries, Nat, et al.
Publicado: (2024)
por: Jeffries, Nat, et al.
Publicado: (2024)
Ejemplares similares
-
Efficient Training of Self-Supervised Speech Foundation Models on a Compute Budget
por: Liu, Andy T., et al.
Publicado: (2024) -
SupertonicTTS: Towards Highly Efficient and Streamlined Text-to-Speech System
por: Kim, Hyeongju, et al.
Publicado: (2025) -
RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching
por: Yang, Jinhyeok, et al.
Publicado: (2026) -
Combining TF-GridNet and Mixture Encoder for Continuous Speech Separation for Meeting Transcription
por: Vieting, Peter, et al.
Publicado: (2023) -
Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement
por: Wang, Chien-Chun, et al.
Publicado: (2026)