Enregistré dans:
| Auteur principal: | Dutta, Soumya |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2603.09212 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Leveraging Content and Acoustic Representations for Speech Emotion Recognition
par: Dutta, Soumya, et autres
Publié: (2024)
par: Dutta, Soumya, et autres
Publié: (2024)
LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations
par: Dutta, Soumya, et autres
Publié: (2025)
par: Dutta, Soumya, et autres
Publié: (2025)
HCAM -- Hierarchical Cross Attention Model for Multi-modal Emotion Recognition
par: Dutta, Soumya, et autres
Publié: (2023)
par: Dutta, Soumya, et autres
Publié: (2023)
A Mixture-of-Experts Model for Multimodal Emotion Recognition in Conversations
par: Dutta, Soumya, et autres
Publié: (2026)
par: Dutta, Soumya, et autres
Publié: (2026)
Textless and Non-Parallel Speech-to-Speech Emotion Style Transfer
par: Dutta, Soumya, et autres
Publié: (2025)
par: Dutta, Soumya, et autres
Publié: (2025)
Zero Shot Audio to Audio Emotion Transfer With Speaker Disentanglement
par: Dutta, Soumya, et autres
Publié: (2024)
par: Dutta, Soumya, et autres
Publié: (2024)
Evaluating Emotion Recognition in Spoken Language Models on Emotionally Incongruent Speech
par: Corrêa, Pedro, et autres
Publié: (2025)
par: Corrêa, Pedro, et autres
Publié: (2025)
E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models
par: Xue, Hongfei, et autres
Publié: (2023)
par: Xue, Hongfei, et autres
Publié: (2023)
ABHINAYA -- A System for Speech Emotion Recognition In Naturalistic Conditions Challenge
par: Dutta, Soumya, et autres
Publié: (2025)
par: Dutta, Soumya, et autres
Publié: (2025)
Semantic-Aware Interruption Detection in Spoken Dialogue Systems: Benchmark, Metric, and Model
par: Xia, Kangxiang, et autres
Publié: (2026)
par: Xia, Kangxiang, et autres
Publié: (2026)
DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action
par: Zhang, Haoyang, et autres
Publié: (2026)
par: Zhang, Haoyang, et autres
Publié: (2026)
Identification of Cognitive Decline from Spoken Language through Feature Selection and the Bag of Acoustic Words Model
par: Niemelä, Marko, et autres
Publié: (2024)
par: Niemelä, Marko, et autres
Publié: (2024)
Towards Hierarchical Spoken Language Dysfluency Modeling
par: Lian, Jiachen, et autres
Publié: (2024)
par: Lian, Jiachen, et autres
Publié: (2024)
Spoken Language Corpora Augmentation with Domain-Specific Voice-Cloned Speech
par: Czyżnikiewicz, Mateusz, et autres
Publié: (2024)
par: Czyżnikiewicz, Mateusz, et autres
Publié: (2024)
Who Spoke What When? Evaluating Spoken Language Models for Conversational ASR with Semantic and Overlap-Aware Metrics
par: Tawara, Naohiro, et autres
Publié: (2026)
par: Tawara, Naohiro, et autres
Publié: (2026)
EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Spoken Dialogue Systems
par: Liu, Jingwen, et autres
Publié: (2025)
par: Liu, Jingwen, et autres
Publié: (2025)
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
par: Lin, Guan-Ting, et autres
Publié: (2023)
par: Lin, Guan-Ting, et autres
Publié: (2023)
SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models
par: Chiang, Cheng-Han, et autres
Publié: (2025)
par: Chiang, Cheng-Han, et autres
Publié: (2025)
Scaling Spoken Language Models with Syllabic Speech Tokenization
par: Lee, Nicholas, et autres
Publié: (2025)
par: Lee, Nicholas, et autres
Publié: (2025)
On the use of Performer and Agent Attention for Spoken Language Identification
par: dhiman, Jitendra Kumar, et autres
Publié: (2025)
par: dhiman, Jitendra Kumar, et autres
Publié: (2025)
SAGA-SR: Semantically and Acoustically Guided Audio Super-Resolution
par: Im, Jaekwon, et autres
Publié: (2025)
par: Im, Jaekwon, et autres
Publié: (2025)
Continual Contrastive Spoken Language Understanding
par: Cappellazzo, Umberto, et autres
Publié: (2023)
par: Cappellazzo, Umberto, et autres
Publié: (2023)
HiPPO: Exploring A Novel Hierarchical Pronunciation Assessment Approach for Spoken Languages
par: Yan, Bi-Cheng, et autres
Publié: (2025)
par: Yan, Bi-Cheng, et autres
Publié: (2025)
Prompting Whisper for QA-driven Zero-shot End-to-end Spoken Language Understanding
par: Li, Mohan, et autres
Publié: (2024)
par: Li, Mohan, et autres
Publié: (2024)
ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction
par: Yang, Shu-wen, et autres
Publié: (2025)
par: Yang, Shu-wen, et autres
Publié: (2025)
Spoken Language Modeling with Duration-Penalized Self-Supervised Units
par: Visser, Nicol, et autres
Publié: (2025)
par: Visser, Nicol, et autres
Publié: (2025)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
par: Nakata, Wataru, et autres
Publié: (2024)
par: Nakata, Wataru, et autres
Publié: (2024)
HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement
par: Hussein, Amir, et autres
Publié: (2025)
par: Hussein, Amir, et autres
Publié: (2025)
Acoustic Prompt Tuning: Empowering Large Language Models with Audition Capabilities
par: Liang, Jinhua, et autres
Publié: (2023)
par: Liang, Jinhua, et autres
Publié: (2023)
Finetuning End-to-End Models for Estonian Conversational Spoken Language Translation
par: Sildam, Tiia, et autres
Publié: (2024)
par: Sildam, Tiia, et autres
Publié: (2024)
STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
par: Chiang, Cheng-Han, et autres
Publié: (2025)
par: Chiang, Cheng-Han, et autres
Publié: (2025)
Spoken-Term Discovery using Discrete Speech Units
par: van Niekerk, Benjamin, et autres
Publié: (2024)
par: van Niekerk, Benjamin, et autres
Publié: (2024)
On The Landscape of Spoken Language Models: A Comprehensive Survey
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
Spirit LM: Interleaved Spoken and Written Language Model
par: Nguyen, Tu Anh, et autres
Publié: (2024)
par: Nguyen, Tu Anh, et autres
Publié: (2024)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
par: Arora, Siddhant, et autres
Publié: (2024)
par: Arora, Siddhant, et autres
Publié: (2024)
Long-Form Speech Generation with Spoken Language Models
par: Park, Se Jin, et autres
Publié: (2024)
par: Park, Se Jin, et autres
Publié: (2024)
Keyword Mamba: Spoken Keyword Spotting with State Space Models
par: Ding, Hanyu, et autres
Publié: (2025)
par: Ding, Hanyu, et autres
Publié: (2025)
ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling
par: Visser, Nicol, et autres
Publié: (2026)
par: Visser, Nicol, et autres
Publié: (2026)
SPAR-K: Scheduled Periodic Alternating Early Exit for Spoken Language Models
par: Huang, Hsiao-Ying, et autres
Publié: (2026)
par: Huang, Hsiao-Ying, et autres
Publié: (2026)
Finding Task-specific Subnetworks in Multi-task Spoken Language Understanding Model
par: Futami, Hayato, et autres
Publié: (2024)
par: Futami, Hayato, et autres
Publié: (2024)
Documents similaires
-
Leveraging Content and Acoustic Representations for Speech Emotion Recognition
par: Dutta, Soumya, et autres
Publié: (2024) -
LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations
par: Dutta, Soumya, et autres
Publié: (2025) -
HCAM -- Hierarchical Cross Attention Model for Multi-modal Emotion Recognition
par: Dutta, Soumya, et autres
Publié: (2023) -
A Mixture-of-Experts Model for Multimodal Emotion Recognition in Conversations
par: Dutta, Soumya, et autres
Publié: (2026) -
Textless and Non-Parallel Speech-to-Speech Emotion Style Transfer
par: Dutta, Soumya, et autres
Publié: (2025)