HSDreport: Heart Sound Diagnosis with Echocardiography Reports
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Zihan, Wang, Pingjie, Zhao, Liudan, Yang, Yuchen, Zhang, Ya, Sun, Kun, Sun, Xin, Zhou, Xin, Wang, Yu, Wang, Yanfeng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Generalist Audio Foundation Model for Comprehensive Body Sound Auscultation
par: Wang, Pingjie, et autres
Publié: (2024)
par: Wang, Pingjie, et autres
Publié: (2024)
Semantic-Emotional Resonance Embedding: A Semi-Supervised Paradigm for Cross-Lingual Speech Emotion Recognition
par: Zhao, Ya, et autres
Publié: (2026)
par: Zhao, Ya, et autres
Publié: (2026)
A Comprehensive Survey on Heart Sound Analysis in the Deep Learning Era
par: Ren, Zhao, et autres
Publié: (2023)
par: Ren, Zhao, et autres
Publié: (2023)
MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation
par: Liu, Cheng, et autres
Publié: (2025)
par: Liu, Cheng, et autres
Publié: (2025)
Hierarchical Pooling Structure for Weakly Labeled Sound Event Detection
par: He, Ke-Xin, et autres
Publié: (2019)
par: He, Ke-Xin, et autres
Publié: (2019)
Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition
par: Zhao, Jiaqi, et autres
Publié: (2024)
par: Zhao, Jiaqi, et autres
Publié: (2024)
Learning How to Listen: A Temporal-Frequential Attention Model for Sound Event Detection
par: Shen, Yu-Han, et autres
Publié: (2018)
par: Shen, Yu-Han, et autres
Publié: (2018)
Adaptive Differential Denoising for Respiratory Sounds Classification
par: Dong, Gaoyang, et autres
Publié: (2025)
par: Dong, Gaoyang, et autres
Publié: (2025)
Region-Specific Audio Tagging for Spatial Sound
par: Zhao, Jinzheng, et autres
Publié: (2025)
par: Zhao, Jinzheng, et autres
Publié: (2025)
DualSep: A Light-weight dual-encoder convolutional recurrent network for real-time in-car speech separation
par: Wang, Ziqian, et autres
Publié: (2024)
par: Wang, Ziqian, et autres
Publié: (2024)
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
par: Sun, Haoqin, et autres
Publié: (2024)
par: Sun, Haoqin, et autres
Publié: (2024)
HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models
par: Wang, Shuiyuan, et autres
Publié: (2026)
par: Wang, Shuiyuan, et autres
Publié: (2026)
Online Audio-Visual Autoregressive Speaker Extraction
par: Pan, Zexu, et autres
Publié: (2025)
par: Pan, Zexu, et autres
Publié: (2025)
Enhancing Emotional Text-to-Speech Controllability with Natural Language Guidance through Contrastive Learning and Diffusion Models
par: Jing, Xin, et autres
Publié: (2024)
par: Jing, Xin, et autres
Publié: (2024)
AudioSpa: Spatializing Sound Events with Text
par: Feng, Linfeng, et autres
Publié: (2025)
par: Feng, Linfeng, et autres
Publié: (2025)
IPDnet: A Universal Direct-Path IPD Estimation Network for Sound Source Localization
par: Wang, Yabo, et autres
Publié: (2024)
par: Wang, Yabo, et autres
Publié: (2024)
OpenVoice: Versatile Instant Voice Cloning
par: Qin, Zengyi, et autres
Publié: (2023)
par: Qin, Zengyi, et autres
Publié: (2023)
SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant
par: Hou, Yixuan, et autres
Publié: (2025)
par: Hou, Yixuan, et autres
Publié: (2025)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
par: Dai, Yuhang, et autres
Publié: (2025)
par: Dai, Yuhang, et autres
Publié: (2025)
MeloTrans: A Text to Symbolic Music Generation Model Following Human Composition Habit
par: Wang, Yutian, et autres
Publié: (2024)
par: Wang, Yutian, et autres
Publié: (2024)
SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Robust Singing Voice Transcription Serves Synthesis
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview
par: Liu, Heyang, et autres
Publié: (2024)
par: Liu, Heyang, et autres
Publié: (2024)
DiffSound: Differentiable Modal Sound Rendering and Inverse Rendering for Diverse Inference Tasks
par: Jin, Xutong, et autres
Publié: (2024)
par: Jin, Xutong, et autres
Publié: (2024)
Technical Report of Nomi Team in the Environmental Sound Deepfake Detection Challenge 2026
par: Mawalim, Candy Olivia, et autres
Publié: (2025)
par: Mawalim, Candy Olivia, et autres
Publié: (2025)
Sound Field Reconstruction Using a Compact Acoustics-informed Neural Network
par: Ma, Fei, et autres
Publié: (2024)
par: Ma, Fei, et autres
Publié: (2024)
TSE-PI: Target Sound Extraction under Reverberant Environments with Pitch Information
par: Wang, Yiwen, et autres
Publié: (2024)
par: Wang, Yiwen, et autres
Publié: (2024)
ChildMandarin: A Comprehensive Mandarin Speech Dataset for Young Children Aged 3-5
par: Zhou, Jiaming, et autres
Publié: (2024)
par: Zhou, Jiaming, et autres
Publié: (2024)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Beyond Acoustic Sparsity and Linguistic Bias: A Prompt-Free Paradigm for Mispronunciation Detection and Diagnosis
par: Geng, Haopeng, et autres
Publié: (2026)
par: Geng, Haopeng, et autres
Publié: (2026)
Experimental Results of Underwater Sound Speed Profile Inversion by Few-shot Multi-task Learning
par: Huang, Wei, et autres
Publié: (2023)
par: Huang, Wei, et autres
Publié: (2023)
Whisper-PMFA: Partial Multi-Scale Feature Aggregation for Speaker Verification using Whisper Models
par: Zhao, Yiyang, et autres
Publié: (2024)
par: Zhao, Yiyang, et autres
Publié: (2024)
Hierarchical Control of Emotion Rendering in Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
Hierarchical Emotion Prediction and Control in Text-to-Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
Fine-Grained Quantitative Emotion Editing for Speech Generation
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
Multi-Step Prediction and Control of Hierarchical Emotion Distribution in Text-to-Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2025)
par: Inoue, Sho, et autres
Publié: (2025)
A Self-Training Approach for Whisper to Enhance Long Dysarthric Speech Recognition
par: Wang, Shiyao, et autres
Publié: (2025)
par: Wang, Shiyao, et autres
Publié: (2025)
PB-LRDWWS System for the SLT 2024 Low-Resource Dysarthria Wake-Up Word Spotting Challenge
par: Wang, Shiyao, et autres
Publié: (2024)
par: Wang, Shiyao, et autres
Publié: (2024)
MSU-Bench: Towards Understanding the Conversational Multi-talker Scenarios
par: Wang, Shuai, et autres
Publié: (2025)
par: Wang, Shuai, et autres
Publié: (2025)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
Documents similaires
-
A Generalist Audio Foundation Model for Comprehensive Body Sound Auscultation
par: Wang, Pingjie, et autres
Publié: (2024) -
Semantic-Emotional Resonance Embedding: A Semi-Supervised Paradigm for Cross-Lingual Speech Emotion Recognition
par: Zhao, Ya, et autres
Publié: (2026) -
A Comprehensive Survey on Heart Sound Analysis in the Deep Learning Era
par: Ren, Zhao, et autres
Publié: (2023) -
MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation
par: Liu, Cheng, et autres
Publié: (2025) -
Hierarchical Pooling Structure for Weakly Labeled Sound Event Detection
par: He, Ke-Xin, et autres
Publié: (2019)