ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Shu-wen, Tu, Ming, Liu, Andy T., Qu, Xinghua, Lee, Hung-yi, Lu, Lu, Wang, Yuxuan, Wu, Yonghui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Beyond the Labels: Unveiling Text-Dependency in Paralinguistic Speech Recognition Datasets
por: Pešán, Jan, et al.
Publicado: (2024)
por: Pešán, Jan, et al.
Publicado: (2024)
A Large-Scale Evaluation of Speech Foundation Models
por: Yang, Shu-wen, et al.
Publicado: (2024)
por: Yang, Shu-wen, et al.
Publicado: (2024)
Stimulus Modality Matters: Impact of Perceptual Evaluations from Different Modalities on Speech Emotion Recognition System Performance
por: Chou, Huang-Cheng, et al.
Publicado: (2024)
por: Chou, Huang-Cheng, et al.
Publicado: (2024)
SpeechMLC: Speech Multi-label Classification
por: Kim, Miseul, et al.
Publicado: (2025)
por: Kim, Miseul, et al.
Publicado: (2025)
A Speech Production Model for Radar: Connecting Speech Acoustics with Radar-Measured Vibrations
por: Lenz, Isabella, et al.
Publicado: (2025)
por: Lenz, Isabella, et al.
Publicado: (2025)
Binaural Localization Model for Speech in Noise
por: Tokala, Vikas, et al.
Publicado: (2025)
por: Tokala, Vikas, et al.
Publicado: (2025)
Speech-Based Prioritization for Schizophrenia Intervention
por: Premananth, Gowtham, et al.
Publicado: (2025)
por: Premananth, Gowtham, et al.
Publicado: (2025)
Prompt-driven Target Speech Diarization
por: Jiang, Yidi, et al.
Publicado: (2023)
por: Jiang, Yidi, et al.
Publicado: (2023)
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
por: Lin, Guan-Ting, et al.
Publicado: (2023)
por: Lin, Guan-Ting, et al.
Publicado: (2023)
Brain-Informed Speech Separation for Cochlear Implants
por: Gajecki, Tom, et al.
Publicado: (2026)
por: Gajecki, Tom, et al.
Publicado: (2026)
Speech Enhancement based on cascaded two flows
por: Lee, Seonggyu, et al.
Publicado: (2025)
por: Lee, Seonggyu, et al.
Publicado: (2025)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
Towards High-Quality and Efficient Speech Bandwidth Extension with Parallel Amplitude and Phase Prediction
por: Lu, Ye-Xin, et al.
Publicado: (2024)
por: Lu, Ye-Xin, et al.
Publicado: (2024)
FlowSE: Flow Matching-based Speech Enhancement
por: Lee, Seonggyu, et al.
Publicado: (2025)
por: Lee, Seonggyu, et al.
Publicado: (2025)
AffectSpeech: A Large-Scale Emotional Speech Dataset with Fine-Grained Textual Descriptions for Speech Emotion Captioning and Synthesis
por: Qi, Tianhua, et al.
Publicado: (2026)
por: Qi, Tianhua, et al.
Publicado: (2026)
Harmonics to the Rescue: Why Voiced Speech is Not a Wss Process
por: Bologni, Giovanni, et al.
Publicado: (2025)
por: Bologni, Giovanni, et al.
Publicado: (2025)
SELM: Speech Enhancement Using Discrete Tokens and Language Models
por: Wang, Ziqian, et al.
Publicado: (2023)
por: Wang, Ziqian, et al.
Publicado: (2023)
Binaural Speech Enhancement Using Complex Convolutional Recurrent Networks
por: Tokala, Vikas, et al.
Publicado: (2025)
por: Tokala, Vikas, et al.
Publicado: (2025)
Analyzing the Impact of Accent on English Speech: Acoustic and Articulatory Perspectives
por: Premananth, Gowtham, et al.
Publicado: (2025)
por: Premananth, Gowtham, et al.
Publicado: (2025)
The Overview of Segmental Durations Modification Algorithms on Speech Signal Characteristics
por: Jang, Kyeomeun, et al.
Publicado: (2025)
por: Jang, Kyeomeun, et al.
Publicado: (2025)
USDnet: Unsupervised Speech Dereverberation via Neural Forward Filtering
por: Wang, Zhong-Qiu
Publicado: (2024)
por: Wang, Zhong-Qiu
Publicado: (2024)
TTSlow: Slow Down Text-to-Speech with Efficiency Robustness Evaluations
por: Gao, Xiaoxue, et al.
Publicado: (2024)
por: Gao, Xiaoxue, et al.
Publicado: (2024)
Parameter-Efficient Fine-Tuning of Foundation Models for CLP Speech Classification
por: Bhattacharjee, Susmita, et al.
Publicado: (2025)
por: Bhattacharjee, Susmita, et al.
Publicado: (2025)
Exploring Disentangled Neural Speech Codecs from Self-Supervised Representations
por: Aihara, Ryo, et al.
Publicado: (2025)
por: Aihara, Ryo, et al.
Publicado: (2025)
Impact of Microphone Array Mismatches to Learning-based Replay Speech Detection
por: Neri, Michael, et al.
Publicado: (2025)
por: Neri, Michael, et al.
Publicado: (2025)
DeFTAN-II: Efficient Multichannel Speech Enhancement with Subgroup Processing
por: Lee, Dongheon, et al.
Publicado: (2023)
por: Lee, Dongheon, et al.
Publicado: (2023)
Multi-channel Replay Speech Detection using an Adaptive Learnable Beamformer
por: Neri, Michael, et al.
Publicado: (2025)
por: Neri, Michael, et al.
Publicado: (2025)
Entropy-Guided GRVQ for Ultra-Low Bitrate Neural Speech Codec
por: Ren, Yanzhou, et al.
Publicado: (2026)
por: Ren, Yanzhou, et al.
Publicado: (2026)
Semantic Communications for Speech Recognition
por: Weng, Zhenzi, et al.
Publicado: (2021)
por: Weng, Zhenzi, et al.
Publicado: (2021)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
por: Wang, Kuan-Chen, et al.
Publicado: (2024)
por: Wang, Kuan-Chen, et al.
Publicado: (2024)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
por: Huang, Kuan-Po, et al.
Publicado: (2023)
por: Huang, Kuan-Po, et al.
Publicado: (2023)
BanglaNum -- A Public Dataset for Bengali Digit Recognition from Speech
por: Mohammad, Mir Sayeed, et al.
Publicado: (2024)
por: Mohammad, Mir Sayeed, et al.
Publicado: (2024)
Mixture to Mixture: Leveraging Close-talk Mixtures as Weak-supervision for Speech Separation
por: Wang, Zhong-Qiu
Publicado: (2024)
por: Wang, Zhong-Qiu
Publicado: (2024)
FlowSE: Efficient and High-Quality Speech Enhancement via Flow Matching
por: Wang, Ziqian, et al.
Publicado: (2025)
por: Wang, Ziqian, et al.
Publicado: (2025)
HyBeam: Hybrid Microphone-Beamforming Array-Agnostic Speech Enhancement for Wearables
por: Ilan, Yuval Bar, et al.
Publicado: (2025)
por: Ilan, Yuval Bar, et al.
Publicado: (2025)
Zero-Bit Transmission of Adaptive Pre- and De-emphasis Filters for Speech and Audio Coding
por: Piralideh, Niloofar Omidi, et al.
Publicado: (2024)
por: Piralideh, Niloofar Omidi, et al.
Publicado: (2024)
Speak in the Scene: Diffusion-based Acoustic Scene Transfer toward Immersive Speech Generation
por: Kim, Miseul, et al.
Publicado: (2024)
por: Kim, Miseul, et al.
Publicado: (2024)
Independent Feature Enhanced Crossmodal Fusion for Match-Mismatch Classification of Speech Stimulus and EEG Response
por: Fan, Shitong, et al.
Publicado: (2024)
por: Fan, Shitong, et al.
Publicado: (2024)
Speaker and Style Disentanglement of Speech Based on Contrastive Predictive Coding Supported Factorized Variational Autoencoder
por: Xie, Yuying, et al.
Publicado: (2024)
por: Xie, Yuying, et al.
Publicado: (2024)
Singing Voice Graph Modeling for SingFake Detection
por: Chen, Xuanjun, et al.
Publicado: (2024)
por: Chen, Xuanjun, et al.
Publicado: (2024)
Ejemplares similares
-
Beyond the Labels: Unveiling Text-Dependency in Paralinguistic Speech Recognition Datasets
por: Pešán, Jan, et al.
Publicado: (2024) -
A Large-Scale Evaluation of Speech Foundation Models
por: Yang, Shu-wen, et al.
Publicado: (2024) -
Stimulus Modality Matters: Impact of Perceptual Evaluations from Different Modalities on Speech Emotion Recognition System Performance
por: Chou, Huang-Cheng, et al.
Publicado: (2024) -
SpeechMLC: Speech Multi-label Classification
por: Kim, Miseul, et al.
Publicado: (2025) -
A Speech Production Model for Radar: Connecting Speech Acoustics with Radar-Measured Vibrations
por: Lenz, Isabella, et al.
Publicado: (2025)