Neural Speech Extraction with Human Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Itani, Malek, Graves, Ashton, Eskimez, Sefik Emre, Gollakota, Shyamnath |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Knowledge boosting during low-latency inference
di: Srinivas, Vidya, et al.
Pubblicazione: (2024)
di: Srinivas, Vidya, et al.
Pubblicazione: (2024)
TF-MLPNet: Tiny Real-Time Neural Speech Separation
di: Itani, Malek, et al.
Pubblicazione: (2025)
di: Itani, Malek, et al.
Pubblicazione: (2025)
Fine-grained Soundscape Control for Augmented Hearing
di: Oh, Seunghyun, et al.
Pubblicazione: (2026)
di: Oh, Seunghyun, et al.
Pubblicazione: (2026)
Wireless Hearables With Programmable Speech AI Accelerators
di: Itani, Malek, et al.
Pubblicazione: (2025)
di: Itani, Malek, et al.
Pubblicazione: (2025)
Look Once to Hear: Target Speech Hearing with Noisy Examples
di: Veluri, Bandhav, et al.
Pubblicazione: (2024)
di: Veluri, Bandhav, et al.
Pubblicazione: (2024)
Proactive Hearing Assistants that Isolate Egocentric Conversations
di: Hu, Guilin, et al.
Pubblicazione: (2025)
di: Hu, Guilin, et al.
Pubblicazione: (2025)
Target conversation extraction: Source separation using turn-taking dynamics
di: Chen, Tuochao, et al.
Pubblicazione: (2024)
di: Chen, Tuochao, et al.
Pubblicazione: (2024)
SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
di: Wang, Xiaofei, et al.
Pubblicazione: (2023)
di: Wang, Xiaofei, et al.
Pubblicazione: (2023)
Beyond Turn-Based Interfaces: Synchronous LLMs as Full-Duplex Dialogue Agents
di: Veluri, Bandhav, et al.
Pubblicazione: (2024)
di: Veluri, Bandhav, et al.
Pubblicazione: (2024)
Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like
di: Kanda, Naoyuki, et al.
Pubblicazione: (2024)
di: Kanda, Naoyuki, et al.
Pubblicazione: (2024)
Contextual Speech Extraction: Leveraging Textual History as an Implicit Cue for Target Speech Extraction
di: Kim, Minsu, et al.
Pubblicazione: (2025)
di: Kim, Minsu, et al.
Pubblicazione: (2025)
LLAMAPIE: Proactive In-Ear Conversation Assistants
di: Chen, Tuochao, et al.
Pubblicazione: (2025)
di: Chen, Tuochao, et al.
Pubblicazione: (2025)
DDTSE: Discriminative Diffusion Model for Target Speech Extraction
di: Zhang, Leying, et al.
Pubblicazione: (2023)
di: Zhang, Leying, et al.
Pubblicazione: (2023)
Latent-Domain Predictive Neural Speech Coding
di: Jiang, Xue, et al.
Pubblicazione: (2022)
di: Jiang, Xue, et al.
Pubblicazione: (2022)
Quantifying Quanvolutional Neural Networks Robustness for Speech in Healthcare Applications
di: Tran, Ha, et al.
Pubblicazione: (2026)
di: Tran, Ha, et al.
Pubblicazione: (2026)
Dynamic Gated Recurrent Neural Network for Compute-efficient Speech Enhancement
di: Cheng, Longbiao, et al.
Pubblicazione: (2024)
di: Cheng, Longbiao, et al.
Pubblicazione: (2024)
Reverse-Speech-Finder: A Neural Network Backtracking Architecture for Generating Alzheimer's Disease Speech Samples and Improving Diagnosis Performance
di: Li, Victor OK, et al.
Pubblicazione: (2025)
di: Li, Victor OK, et al.
Pubblicazione: (2025)
Ultra-lightweight Neural Differential DSP Vocoder For High Quality Speech Synthesis
di: Agrawal, Prabhav, et al.
Pubblicazione: (2024)
di: Agrawal, Prabhav, et al.
Pubblicazione: (2024)
E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS
di: Eskimez, Sefik Emre, et al.
Pubblicazione: (2024)
di: Eskimez, Sefik Emre, et al.
Pubblicazione: (2024)
Human Feedback Driven Dynamic Speech Emotion Recognition
di: Fedorov, Ilya, et al.
Pubblicazione: (2025)
di: Fedorov, Ilya, et al.
Pubblicazione: (2025)
Over-the-air White-box Attack on the Wav2Vec Speech Recognition Neural Network
di: Alexey, Protopopov
Pubblicazione: (2026)
di: Alexey, Protopopov
Pubblicazione: (2026)
Speech to Speech Synthesis for Voice Impersonation
di: Johnson, Bjorn, et al.
Pubblicazione: (2026)
di: Johnson, Bjorn, et al.
Pubblicazione: (2026)
emoDARTS: Joint Optimisation of CNN & Sequential Neural Network Architectures for Superior Speech Emotion Recognition
di: Rajapakshe, Thejan, et al.
Pubblicazione: (2024)
di: Rajapakshe, Thejan, et al.
Pubblicazione: (2024)
Impact of Speech Mode in Automatic Pathological Speech Detection
di: Sheikh, Shakeel A., et al.
Pubblicazione: (2024)
di: Sheikh, Shakeel A., et al.
Pubblicazione: (2024)
Diffusion Synthesizer for Efficient Multilingual Speech to Speech Translation
di: Hirschkind, Nameer, et al.
Pubblicazione: (2024)
di: Hirschkind, Nameer, et al.
Pubblicazione: (2024)
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
di: Ji, Shengpeng, et al.
Pubblicazione: (2023)
di: Ji, Shengpeng, et al.
Pubblicazione: (2023)
Investigating the Effects of Diffusion-based Conditional Generative Speech Models Used for Speech Enhancement on Dysarthric Speech
di: Reszka, Joanna, et al.
Pubblicazione: (2024)
di: Reszka, Joanna, et al.
Pubblicazione: (2024)
RepCodec: A Speech Representation Codec for Speech Tokenization
di: Huang, Zhichao, et al.
Pubblicazione: (2023)
di: Huang, Zhichao, et al.
Pubblicazione: (2023)
MiSTR: Multi-Modal iEEG-to-Speech Synthesis with Transformer-Based Prosody Prediction and Neural Phase Reconstruction
di: Al-Radhi, Mohammed Salah, et al.
Pubblicazione: (2025)
di: Al-Radhi, Mohammed Salah, et al.
Pubblicazione: (2025)
EARS: An Anechoic Fullband Speech Dataset Benchmarked for Speech Enhancement and Dereverberation
di: Richter, Julius, et al.
Pubblicazione: (2024)
di: Richter, Julius, et al.
Pubblicazione: (2024)
Convolutional Neural Network Achieves Human-level Accuracy in Music Genre Classification
di: Dong, Mingwen
Pubblicazione: (2018)
di: Dong, Mingwen
Pubblicazione: (2018)
Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
Non-intrusive Speech Quality Assessment with Diffusion Models Trained on Clean Speech
di: de Oliveira, Danilo, et al.
Pubblicazione: (2024)
di: de Oliveira, Danilo, et al.
Pubblicazione: (2024)
Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
Learning Disentangled Speech Representations
di: Brima, Yusuf, et al.
Pubblicazione: (2023)
di: Brima, Yusuf, et al.
Pubblicazione: (2023)
Speech Diarization and ASR with GMM
di: Sharma, Aayush Kumar, et al.
Pubblicazione: (2023)
di: Sharma, Aayush Kumar, et al.
Pubblicazione: (2023)
Speech After Gender: A Trans-Feminine Perspective on Next Steps for Speech Science and Technology
di: Netzorg, Robin, et al.
Pubblicazione: (2024)
di: Netzorg, Robin, et al.
Pubblicazione: (2024)
All Neural Low-latency Directional Speech Extraction
di: Pandey, Ashutosh, et al.
Pubblicazione: (2024)
di: Pandey, Ashutosh, et al.
Pubblicazione: (2024)
TRNet: Two-level Refinement Network leveraging Speech Enhancement for Noise Robust Speech Emotion Recognition
di: Chen, Chengxin, et al.
Pubblicazione: (2024)
di: Chen, Chengxin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Knowledge boosting during low-latency inference
di: Srinivas, Vidya, et al.
Pubblicazione: (2024) -
TF-MLPNet: Tiny Real-Time Neural Speech Separation
di: Itani, Malek, et al.
Pubblicazione: (2025) -
Fine-grained Soundscape Control for Augmented Hearing
di: Oh, Seunghyun, et al.
Pubblicazione: (2026) -
Wireless Hearables With Programmable Speech AI Accelerators
di: Itani, Malek, et al.
Pubblicazione: (2025) -
Look Once to Hear: Target Speech Hearing with Noisy Examples
di: Veluri, Bandhav, et al.
Pubblicazione: (2024)