Efficient Long Speech Sequence Modelling for Time-Domain Depression Level Estimation
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Shuanglin, Xie, Zhijie, Naqvi, Syed Mohsen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Frequency-aware Augmentation Network for Mental Disorders Assessment from Audio
di: Li, Shuanglin, et al.
Pubblicazione: (2025)
di: Li, Shuanglin, et al.
Pubblicazione: (2025)
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
di: Yen, Hao, et al.
Pubblicazione: (2024)
di: Yen, Hao, et al.
Pubblicazione: (2024)
FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot
di: Xie, Kun, et al.
Pubblicazione: (2025)
di: Xie, Kun, et al.
Pubblicazione: (2025)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
di: Guo, Haohan, et al.
Pubblicazione: (2024)
di: Guo, Haohan, et al.
Pubblicazione: (2024)
Advanced Long-Content Speech Recognition With Factorized Neural Transducer
di: Gong, Xun, et al.
Pubblicazione: (2024)
di: Gong, Xun, et al.
Pubblicazione: (2024)
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
di: Guo, Hao-Han, et al.
Pubblicazione: (2024)
di: Guo, Hao-Han, et al.
Pubblicazione: (2024)
Unfolding A Few Structures for The Many: Memory-Efficient Compression of Conformer and Speech Foundation Models
di: Li, Zhaoqing, et al.
Pubblicazione: (2025)
di: Li, Zhaoqing, et al.
Pubblicazione: (2025)
A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition
di: Li, Yangze, et al.
Pubblicazione: (2024)
di: Li, Yangze, et al.
Pubblicazione: (2024)
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
Efficient and Robust Long-Form Speech Recognition with Hybrid H3-Conformer
di: Honda, Tomoki, et al.
Pubblicazione: (2024)
di: Honda, Tomoki, et al.
Pubblicazione: (2024)
FleSpeech: Flexibly Controllable Speech Generation with Various Prompts
di: Li, Hanzhao, et al.
Pubblicazione: (2025)
di: Li, Hanzhao, et al.
Pubblicazione: (2025)
A Two-Stage Framework in Cross-Spectrum Domain for Real-Time Speech Enhancement
di: Zhang, Yuewei, et al.
Pubblicazione: (2024)
di: Zhang, Yuewei, et al.
Pubblicazione: (2024)
Weakly Supervised Data Refinement and Flexible Sequence Compression for Efficient Thai LLM-based ASR
di: Shao, Mingchen, et al.
Pubblicazione: (2025)
di: Shao, Mingchen, et al.
Pubblicazione: (2025)
End-to-End Target Speaker Speech Recognition Using Context-Aware Attention Mechanisms for Challenging Enrollment Scenario
di: Ghane, Mohsen, et al.
Pubblicazione: (2025)
di: Ghane, Mohsen, et al.
Pubblicazione: (2025)
Cross-Corpus Validation of Speech Emotion Recognition in Urdu using Domain-Knowledge Acoustic Features
di: Talpur, Unzela, et al.
Pubblicazione: (2025)
di: Talpur, Unzela, et al.
Pubblicazione: (2025)
Long-Context Speech Synthesis with Context-Aware Memory
di: Li, Zhipeng, et al.
Pubblicazione: (2025)
di: Li, Zhipeng, et al.
Pubblicazione: (2025)
EfficientASR: Speech Recognition Network Compression via Attention Redundancy and Chunk-Level FFN Optimization
di: Wang, Jianzong, et al.
Pubblicazione: (2024)
di: Wang, Jianzong, et al.
Pubblicazione: (2024)
From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models
di: Mu, Zhaoxi, et al.
Pubblicazione: (2025)
di: Mu, Zhaoxi, et al.
Pubblicazione: (2025)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
VoiceGuider: Enhancing Out-of-Domain Performance in Parameter-Efficient Speaker-Adaptive Text-to-Speech via Autoguidance
di: Yeom, Jiheum, et al.
Pubblicazione: (2024)
di: Yeom, Jiheum, et al.
Pubblicazione: (2024)
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
di: Wang, Tianrui, et al.
Pubblicazione: (2025)
di: Wang, Tianrui, et al.
Pubblicazione: (2025)
STFTCodec: High-Fidelity Audio Compression through Time-Frequency Domain Representation
di: Feng, Tao, et al.
Pubblicazione: (2025)
di: Feng, Tao, et al.
Pubblicazione: (2025)
EELE: Exploring Efficient and Extensible LoRA Integration in Emotional Text-to-Speech
di: Qi, Xin, et al.
Pubblicazione: (2024)
di: Qi, Xin, et al.
Pubblicazione: (2024)
Phone-Level Prosody Modelling with GMM-Based MDN for Diverse and Controllable Speech Synthesis
di: Du, Chenpeng, et al.
Pubblicazione: (2021)
di: Du, Chenpeng, et al.
Pubblicazione: (2021)
Multichannel Long-Term Streaming Neural Speech Enhancement for Static and Moving Speakers
di: Quan, Changsheng, et al.
Pubblicazione: (2024)
di: Quan, Changsheng, et al.
Pubblicazione: (2024)
Context-Aware Two-Step Training Scheme for Domain Invariant Speech Separation
di: Wang, Wupeng, et al.
Pubblicazione: (2025)
di: Wang, Wupeng, et al.
Pubblicazione: (2025)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
di: Jiang, Yuepeng, et al.
Pubblicazione: (2024)
di: Jiang, Yuepeng, et al.
Pubblicazione: (2024)
MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation
di: Zhao, Shengkui, et al.
Pubblicazione: (2023)
di: Zhao, Shengkui, et al.
Pubblicazione: (2023)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
Outlier Reduction with Gated Attention for Improved Post-training Quantization in Large Sequence-to-sequence Speech Foundation Models
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
In-Materia Speech Recognition
di: Zolfagharinejad, Mohamadreza, et al.
Pubblicazione: (2024)
di: Zolfagharinejad, Mohamadreza, et al.
Pubblicazione: (2024)
StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2024)
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2024)
Improved Remixing Process for Domain Adaptation-Based Speech Enhancement by Mitigating Data Imbalance in Signal-to-Noise Ratio
di: Li, Li, et al.
Pubblicazione: (2024)
di: Li, Li, et al.
Pubblicazione: (2024)
A Domain Adaptation Framework for Speech Recognition Systems with Only Synthetic data
di: Tran, Minh, et al.
Pubblicazione: (2025)
di: Tran, Minh, et al.
Pubblicazione: (2025)
SELM: Enhancing Speech Emotion Recognition for Out-of-Domain Scenarios
di: Bukhari, Hazim, et al.
Pubblicazione: (2024)
di: Bukhari, Hazim, et al.
Pubblicazione: (2024)
State-Space Models in Efficient Whispered and Multi-dialect Speech Recognition
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
di: Wang, Weiqing, et al.
Pubblicazione: (2024)
di: Wang, Weiqing, et al.
Pubblicazione: (2024)
Phoneme-Level Analysis for Person-of-Interest Speech Deepfake Detection
di: Salvi, Davide, et al.
Pubblicazione: (2025)
di: Salvi, Davide, et al.
Pubblicazione: (2025)
On-the-fly Routing for Zero-shot MoE Speaker Adaptation of Speech Foundation Models for Dysarthric Speech Recognition
di: HU, Shujie, et al.
Pubblicazione: (2025)
di: HU, Shujie, et al.
Pubblicazione: (2025)
LLM-ForcedAligner: A Non-Autoregressive and Accurate LLM-Based Forced Aligner for Multilingual and Long-Form Speech
di: Mu, Bingshen, et al.
Pubblicazione: (2026)
di: Mu, Bingshen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
A Frequency-aware Augmentation Network for Mental Disorders Assessment from Audio
di: Li, Shuanglin, et al.
Pubblicazione: (2025) -
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
di: Yen, Hao, et al.
Pubblicazione: (2024) -
FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot
di: Xie, Kun, et al.
Pubblicazione: (2025) -
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
di: Guo, Haohan, et al.
Pubblicazione: (2024) -
Advanced Long-Content Speech Recognition With Factorized Neural Transducer
di: Gong, Xun, et al.
Pubblicazione: (2024)