Sentiment Reasoning for Healthcare
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nguyen, Khai-Nguyen, Le-Duc, Khai, Tat, Bach Phan, Le, Duy, Vo-Dang, Long, Hy, Truong-Son |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Real-time Speech Summarization for Medical Conversations
par: Le-Duc, Khai, et autres
Publié: (2024)
par: Le-Duc, Khai, et autres
Publié: (2024)
Medical Spoken Named Entity Recognition
par: Le-Duc, Khai, et autres
Publié: (2024)
par: Le-Duc, Khai, et autres
Publié: (2024)
wav2graph: A Framework for Supervised Learning Knowledge Graph from Speech
par: Le-Duc, Khai, et autres
Publié: (2024)
par: Le-Duc, Khai, et autres
Publié: (2024)
MultiMed: Multilingual Medical Speech Recognition via Attention Encoder Decoder
par: Le-Duc, Khai, et autres
Publié: (2024)
par: Le-Duc, Khai, et autres
Publié: (2024)
MultiMed-ST: Large-scale Many-to-many Multilingual Medical Speech Translation
par: Le-Duc, Khai, et autres
Publié: (2025)
par: Le-Duc, Khai, et autres
Publié: (2025)
OZSpeech: One-step Zero-shot Speech Synthesis with Learned-Prior-Conditioned Flow Matching
par: Huynh-Nguyen, Hieu-Nghia, et autres
Publié: (2025)
par: Huynh-Nguyen, Hieu-Nghia, et autres
Publié: (2025)
VietMed: A Dataset and Benchmark for Automatic Speech Recognition of Vietnamese in the Medical Domain
par: Le-Duc, Khai
Publié: (2024)
par: Le-Duc, Khai
Publié: (2024)
TSPC: A Two-Stage Phoneme-Centric Architecture for code-switching Vietnamese-English Speech Recognition
par: Anh, Tran Nguyen, et autres
Publié: (2025)
par: Anh, Tran Nguyen, et autres
Publié: (2025)
AFSS: Artifact-Focused Self-Synthesis for Mitigating Bias in Audio Deepfake Detection
par: Nguyen-Le, Hai-Son, et autres
Publié: (2026)
par: Nguyen-Le, Hai-Son, et autres
Publié: (2026)
Revisiting Deep Audio-Text Retrieval Through the Lens of Transportation
par: Luong, Manh, et autres
Publié: (2024)
par: Luong, Manh, et autres
Publié: (2024)
Towards Zero-Shot Text-To-Speech for Arabic Dialects
par: Doan, Khai Duy, et autres
Publié: (2024)
par: Doan, Khai Duy, et autres
Publié: (2024)
The Sound of Syntax: Finetuning and Comprehensive Evaluation of Language Models for Speech Pathology
par: Patel, Fagun, et autres
Publié: (2025)
par: Patel, Fagun, et autres
Publié: (2025)
Deepfake Audio Detection Using Spectrogram-based Feature and Ensemble of Deep Learning Models
par: Pham, Lam, et autres
Publié: (2024)
par: Pham, Lam, et autres
Publié: (2024)
AdaCS: Adaptive Normalization for Enhanced Code-Switching ASR
par: Chu, The Chuong, et autres
Publié: (2025)
par: Chu, The Chuong, et autres
Publié: (2025)
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
par: Truong, Duc-Tuan, et autres
Publié: (2024)
par: Truong, Duc-Tuan, et autres
Publié: (2024)
Can we train ASR systems on Code-switch without real code-switch data? Case study for Singapore's languages
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
Multimodal Sentiment Analysis with Missing Modality: A Knowledge-Transfer Approach
par: Liu, Weide, et autres
Publié: (2023)
par: Liu, Weide, et autres
Publié: (2023)
Modality-Invariant Bidirectional Temporal Representation Distillation Network for Missing Multimodal Sentiment Analysis
par: Wang, Xincheng, et autres
Publié: (2025)
par: Wang, Xincheng, et autres
Publié: (2025)
BiosERC: Integrating Biography Speakers Supported by LLMs for ERC Tasks
par: Xue, Jieying, et autres
Publié: (2024)
par: Xue, Jieying, et autres
Publié: (2024)
Dynamic Context-Aware Streaming Pretrained Language Model For Inverse Text Normalization
par: Ho, Luong, et autres
Publié: (2025)
par: Ho, Luong, et autres
Publié: (2025)
Exploring ASR-Based Wav2Vec2 for Automated Speech Disorder Assessment: Insights and Analysis
par: Nguyen, Tuan, et autres
Publié: (2024)
par: Nguyen, Tuan, et autres
Publié: (2024)
Nes2Net: A Lightweight Nested Architecture for Foundation Model Driven Speech Anti-spoofing
par: Liu, Tianchi, et autres
Publié: (2025)
par: Liu, Tianchi, et autres
Publié: (2025)
Exploring and Applying Audio-Based Sentiment Analysis in Music
par: Jhanji, Etash
Publié: (2024)
par: Jhanji, Etash
Publié: (2024)
Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap
par: Nam, KiHyun, et autres
Publié: (2025)
par: Nam, KiHyun, et autres
Publié: (2025)
TransVIP: Speech to Speech Translation System with Voice and Isochrony Preservation
par: Le, Chenyang, et autres
Publié: (2024)
par: Le, Chenyang, et autres
Publié: (2024)
Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning
par: Bhattacharya, Debarpan, et autres
Publié: (2025)
par: Bhattacharya, Debarpan, et autres
Publié: (2025)
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
par: Nguyen, Tan Dat, et autres
Publié: (2024)
par: Nguyen, Tan Dat, et autres
Publié: (2024)
Continuous Learning of Transformer-based Audio Deepfake Detection
par: Le, Tuan Duy Nguyen, et autres
Publié: (2024)
par: Le, Tuan Duy Nguyen, et autres
Publié: (2024)
Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction
par: Yu, Xiaofeng, et autres
Publié: (2026)
par: Yu, Xiaofeng, et autres
Publié: (2026)
ASDA: Audio Spectrogram Differential Attention Mechanism for Self-Supervised Representation Learning
par: Wang, Junyu, et autres
Publié: (2025)
par: Wang, Junyu, et autres
Publié: (2025)
Unbiased Sliced Wasserstein Kernels for High-Quality Audio Captioning
par: Luong, Manh, et autres
Publié: (2025)
par: Luong, Manh, et autres
Publié: (2025)
CSyMR: Benchmarking Compositional Music Information Retrieval in Symbolic Music Reasoning
par: Wang, Boyang, et autres
Publié: (2025)
par: Wang, Boyang, et autres
Publié: (2025)
LeBenchmark 2.0: a Standardized, Replicable and Enhanced Framework for Self-supervised Representations of French Speech
par: Parcollet, Titouan, et autres
Publié: (2023)
par: Parcollet, Titouan, et autres
Publié: (2023)
Sing-On-Your-Beat: Simple Text-Controllable Accompaniment Generations
par: Trinh, Quoc-Huy, et autres
Publié: (2024)
par: Trinh, Quoc-Huy, et autres
Publié: (2024)
A Benchmark for Early-stage Parkinson's Disease Detection from Speech
par: Zhong, Terry Yi, et autres
Publié: (2026)
par: Zhong, Terry Yi, et autres
Publié: (2026)
Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion
par: Akti, Seymanur, et autres
Publié: (2025)
par: Akti, Seymanur, et autres
Publié: (2025)
Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual and Long-Form Speech Recognition Evaluation
par: Srivastav, Vaibhav, et autres
Publié: (2025)
par: Srivastav, Vaibhav, et autres
Publié: (2025)
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
par: Ghosh, Sreyan, et autres
Publié: (2023)
par: Ghosh, Sreyan, et autres
Publié: (2023)
BAT: Learning to Reason about Spatial Sounds with Large Language Models
par: Zheng, Zhisheng, et autres
Publié: (2024)
par: Zheng, Zhisheng, et autres
Publié: (2024)
MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
par: Sakshi, S, et autres
Publié: (2024)
par: Sakshi, S, et autres
Publié: (2024)
Documents similaires
-
Real-time Speech Summarization for Medical Conversations
par: Le-Duc, Khai, et autres
Publié: (2024) -
Medical Spoken Named Entity Recognition
par: Le-Duc, Khai, et autres
Publié: (2024) -
wav2graph: A Framework for Supervised Learning Knowledge Graph from Speech
par: Le-Duc, Khai, et autres
Publié: (2024) -
MultiMed: Multilingual Medical Speech Recognition via Attention Encoder Decoder
par: Le-Duc, Khai, et autres
Publié: (2024) -
MultiMed-ST: Large-scale Many-to-many Multilingual Medical Speech Translation
par: Le-Duc, Khai, et autres
Publié: (2025)