Textless NLP -- Zero Resource Challenge with Low Resource Compute
Fuente:
arXiv
Salvato in:
| Autori principali: | Ramadass, Krithiga, Singh, Abrit Pal, J, Srihari, Kalyani, Sheetal |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Real-Time Textless Dialogue Generation
di: Mai, Long, et al.
Pubblicazione: (2025)
di: Mai, Long, et al.
Pubblicazione: (2025)
Exploring Adapter Design Tradeoffs for Low Resource Music Generation
di: Mehta, Atharva, et al.
Pubblicazione: (2025)
di: Mehta, Atharva, et al.
Pubblicazione: (2025)
A2TTS: TTS for Low Resource Indian Languages
di: Bhadoriya, Ayush Singh, et al.
Pubblicazione: (2025)
di: Bhadoriya, Ayush Singh, et al.
Pubblicazione: (2025)
Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation
di: Duret, Jarod, et al.
Pubblicazione: (2024)
di: Duret, Jarod, et al.
Pubblicazione: (2024)
Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
FlashSpeech: Efficient Zero-Shot Speech Synthesis
di: Ye, Zhen, et al.
Pubblicazione: (2024)
di: Ye, Zhen, et al.
Pubblicazione: (2024)
MoonCast: High-Quality Zero-Shot Podcast Generation
di: Ju, Zeqian, et al.
Pubblicazione: (2025)
di: Ju, Zeqian, et al.
Pubblicazione: (2025)
Enhancing Low-Resource Language and Instruction Following Capabilities of Audio Language Models
di: Manakul, Potsawee, et al.
Pubblicazione: (2024)
di: Manakul, Potsawee, et al.
Pubblicazione: (2024)
Improving Low-Resource Dialect Classification Using Retrieval-based Voice Conversion
di: Fischbach, Lea, et al.
Pubblicazione: (2025)
di: Fischbach, Lea, et al.
Pubblicazione: (2025)
VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild
di: Peng, Puyuan, et al.
Pubblicazione: (2024)
di: Peng, Puyuan, et al.
Pubblicazione: (2024)
Towards Speaker Identification with Minimal Dataset and Constrained Resources using 1D-Convolution Neural Network
di: Shahan, Irfan Nafiz, et al.
Pubblicazione: (2024)
di: Shahan, Irfan Nafiz, et al.
Pubblicazione: (2024)
TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification
di: Anand, Nishit, et al.
Pubblicazione: (2024)
di: Anand, Nishit, et al.
Pubblicazione: (2024)
HQ-SVC: Towards High-Quality Zero-Shot Singing Voice Conversion in Low-Resource Scenarios
di: Bai, Bingsong, et al.
Pubblicazione: (2025)
di: Bai, Bingsong, et al.
Pubblicazione: (2025)
Pareto Data Framework: Steps Towards Resource-Efficient Decision Making Using Minimum Viable Data (MVD)
di: Ahmed, Tashfain, et al.
Pubblicazione: (2024)
di: Ahmed, Tashfain, et al.
Pubblicazione: (2024)
NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
di: Ju, Zeqian, et al.
Pubblicazione: (2024)
di: Ju, Zeqian, et al.
Pubblicazione: (2024)
Efficient Dialect-Aware Modeling and Conditioning for Low-Resource Taiwanese Hakka Speech Processing
di: Peng, An-Ci, et al.
Pubblicazione: (2026)
di: Peng, An-Ci, et al.
Pubblicazione: (2026)
CoVoMix: Advancing Zero-Shot Speech Generation for Human-like Multi-talker Conversations
di: Zhang, Leying, et al.
Pubblicazione: (2024)
di: Zhang, Leying, et al.
Pubblicazione: (2024)
Speak, Edit, Repeat: High-Fidelity Voice Editing and Zero-Shot TTS with Cross-Attentive Mamba
di: Mohammad, Baher, et al.
Pubblicazione: (2025)
di: Mohammad, Baher, et al.
Pubblicazione: (2025)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
di: Song, Zheshu, et al.
Pubblicazione: (2024)
di: Song, Zheshu, et al.
Pubblicazione: (2024)
Task-Lens: Cross-Task Utility Based Speech Dataset Profiling for Low-Resource Indian Languages
di: Sharma, Swati, et al.
Pubblicazione: (2026)
di: Sharma, Swati, et al.
Pubblicazione: (2026)
Can a Machine Distinguish High and Low Amount of Social Creak in Speech?
di: Laukkanen, Anne-Maria, et al.
Pubblicazione: (2024)
di: Laukkanen, Anne-Maria, et al.
Pubblicazione: (2024)
PSLM: Parallel Generation of Text and Speech with LLMs for Low-Latency Spoken Dialogue Systems
di: Mitsui, Kentaro, et al.
Pubblicazione: (2024)
di: Mitsui, Kentaro, et al.
Pubblicazione: (2024)
TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition
di: Yang, Cheng-Yeh, et al.
Pubblicazione: (2026)
di: Yang, Cheng-Yeh, et al.
Pubblicazione: (2026)
Large Language Model Based Generative Error Correction: A Challenge and Baselines for Speech Recognition, Speaker Tagging, and Emotion Recognition
di: Yang, Chao-Han Huck, et al.
Pubblicazione: (2024)
di: Yang, Chao-Han Huck, et al.
Pubblicazione: (2024)
Adaptability of ASR Models on Low-Resource Language: A Comparative Study of Whisper and Wav2Vec-BERT on Bangla
di: Ridoy, Md Sazzadul Islam, et al.
Pubblicazione: (2025)
di: Ridoy, Md Sazzadul Islam, et al.
Pubblicazione: (2025)
XLS-R Deep Learning Model for Multilingual ASR on Low- Resource Languages: Indonesian, Javanese, and Sundanese
di: Arisaputra, Panji, et al.
Pubblicazione: (2024)
di: Arisaputra, Panji, et al.
Pubblicazione: (2024)
Phir Hera Fairy: An English Fairytaler is a Strong Faker of Fluent Speech in Low-Resource Indian Languages
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2025)
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2025)
Enhancing Automatic Speech Recognition Through Integrated Noise Detection Architecture
di: Singh, Karamvir
Pubblicazione: (2025)
di: Singh, Karamvir
Pubblicazione: (2025)
MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer
di: Wang, Yuancheng, et al.
Pubblicazione: (2024)
di: Wang, Yuancheng, et al.
Pubblicazione: (2024)
CTC-based Non-autoregressive Textless Speech-to-Speech Translation
di: Fang, Qingkai, et al.
Pubblicazione: (2024)
di: Fang, Qingkai, et al.
Pubblicazione: (2024)
kNN Retrieval for Simple and Effective Zero-Shot Multi-speaker Text-to-Speech
di: Hajal, Karl El, et al.
Pubblicazione: (2024)
di: Hajal, Karl El, et al.
Pubblicazione: (2024)
Designing Neural Synthesizers for Low-Latency Interaction
di: Caspe, Franco, et al.
Pubblicazione: (2025)
di: Caspe, Franco, et al.
Pubblicazione: (2025)
Papez: Resource-Efficient Speech Separation with Auditory Working Memory
di: Oh, Hyunseok, et al.
Pubblicazione: (2024)
di: Oh, Hyunseok, et al.
Pubblicazione: (2024)
Zero-Shot Speech LLMs for Multi-Aspect Evaluation of L2 Speech: Challenges and Opportunities
di: Parikh, Aditya Kamlesh, et al.
Pubblicazione: (2026)
di: Parikh, Aditya Kamlesh, et al.
Pubblicazione: (2026)
MADUV: The 1st INTERSPEECH Mice Autism Detection via Ultrasound Vocalization Challenge
di: Yang, Zijiang, et al.
Pubblicazione: (2025)
di: Yang, Zijiang, et al.
Pubblicazione: (2025)
Imagined Speech State Classification for Robust Brain-Computer Interface
di: Ko, Byung-Kwan, et al.
Pubblicazione: (2024)
di: Ko, Byung-Kwan, et al.
Pubblicazione: (2024)
LiteASR: Efficient Automatic Speech Recognition with Low-Rank Approximation
di: Kamahori, Keisuke, et al.
Pubblicazione: (2025)
di: Kamahori, Keisuke, et al.
Pubblicazione: (2025)
Recognizing Ornaments in Vocal Indian Art Music with Active Annotation
di: Kumar, Sumit, et al.
Pubblicazione: (2025)
di: Kumar, Sumit, et al.
Pubblicazione: (2025)
What Counts as Real? Speech Restoration and Voice Quality Conversion Pose New Challenges to Deepfake Detection
di: Satish, Shree Harsha Bokkahalli, et al.
Pubblicazione: (2026)
di: Satish, Shree Harsha Bokkahalli, et al.
Pubblicazione: (2026)
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Real-Time Textless Dialogue Generation
di: Mai, Long, et al.
Pubblicazione: (2025) -
Exploring Adapter Design Tradeoffs for Low Resource Music Generation
di: Mehta, Atharva, et al.
Pubblicazione: (2025) -
A2TTS: TTS for Low Resource Indian Languages
di: Bhadoriya, Ayush Singh, et al.
Pubblicazione: (2025) -
Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation
di: Duret, Jarod, et al.
Pubblicazione: (2024) -
Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)