Semi-Supervised Diseased Detection from Speech Dialogues with Multi-Level Data Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Xingyuan, Wu, Mengyue |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Semi-Supervised Cognitive State Classification from Speech with Multi-View Pseudo-Labeling
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
Synchronization and Turn-Taking in Full-Duplex Speech Dialogue Models
di: Riera, Pablo, et al.
Pubblicazione: (2026)
di: Riera, Pablo, et al.
Pubblicazione: (2026)
SpeechJudge: Towards Human-Level Judgment for Speech Naturalness
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
Addressing Gradient Misalignment in Data-Augmented Training for Robust Speech Deepfake Detection
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2025)
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2025)
QAMO: Quality-aware Multi-centroid One-class Learning For Speech Deepfake Detection
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2025)
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2025)
Fake Speech Wild: Detecting Deepfake Speech on Social Media Platform
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
Formula-Supervised Sound Event Detection: Pre-Training Without Real Data
di: Shibata, Yuto, et al.
Pubblicazione: (2025)
di: Shibata, Yuto, et al.
Pubblicazione: (2025)
SLM-SS: Speech Language Model for Generative Speech Separation
di: Li, Tianhua, et al.
Pubblicazione: (2026)
di: Li, Tianhua, et al.
Pubblicazione: (2026)
LSZone: A Lightweight Spatial Information Modeling Architecture for Real-time In-car Multi-zone Speech Separation
di: Chen, Jun, et al.
Pubblicazione: (2025)
di: Chen, Jun, et al.
Pubblicazione: (2025)
GSRM: Generative Speech Reward Model for Speech RLHF
di: Shen, Maohao, et al.
Pubblicazione: (2026)
di: Shen, Maohao, et al.
Pubblicazione: (2026)
Self-supervised Speech Models for Word-Level Stuttered Speech Detection
di: Shih, Yi-Jen, et al.
Pubblicazione: (2024)
di: Shih, Yi-Jen, et al.
Pubblicazione: (2024)
Zero-Shot Parkinson's Disease Detection from Speech: Comparing Large Audio and Language Models
di: Kabir, Muhammad Ashad, et al.
Pubblicazione: (2026)
di: Kabir, Muhammad Ashad, et al.
Pubblicazione: (2026)
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
di: Li, Yuxin, et al.
Pubblicazione: (2025)
di: Li, Yuxin, et al.
Pubblicazione: (2025)
Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance
di: Zhang, Yaoyun, et al.
Pubblicazione: (2024)
di: Zhang, Yaoyun, et al.
Pubblicazione: (2024)
MEBM-Speech: Multi-scale Enhanced BrainMagic for Robust MEG Speech Detection
di: Songyi, Li, et al.
Pubblicazione: (2026)
di: Songyi, Li, et al.
Pubblicazione: (2026)
Towards Improving NAM-to-Speech Synthesis Intelligibility using Self-Supervised Speech Models
di: Shah, Neil, et al.
Pubblicazione: (2024)
di: Shah, Neil, et al.
Pubblicazione: (2024)
Emotion Detection in Speech Using Lightweight and Transformer-Based Models: A Comparative and Ablation Study
di: Onyekwelu-Udoka, Lucky, et al.
Pubblicazione: (2025)
di: Onyekwelu-Udoka, Lucky, et al.
Pubblicazione: (2025)
Dynamic Fusion Multimodal Network for SpeechWellness Detection
di: Sun, Wenqiang, et al.
Pubblicazione: (2025)
di: Sun, Wenqiang, et al.
Pubblicazione: (2025)
ArtiFree: Detecting and Reducing Generative Artifacts in Diffusion-based Speech Enhancement
di: Chhaglani, Bhawana, et al.
Pubblicazione: (2025)
di: Chhaglani, Bhawana, et al.
Pubblicazione: (2025)
Semi-Supervised Self-Learning Enhanced Music Emotion Recognition
di: Sun, Yifu, et al.
Pubblicazione: (2024)
di: Sun, Yifu, et al.
Pubblicazione: (2024)
A General Model for Deepfake Speech Detection: Diverse Bonafide Resources or Diverse AI-Based Generators
di: Pham, Lam, et al.
Pubblicazione: (2026)
di: Pham, Lam, et al.
Pubblicazione: (2026)
Multi-Loss Learning for Speech Emotion Recognition with Energy-Adaptive Mixup and Frame-Level Attention
di: Wang, Cong, et al.
Pubblicazione: (2025)
di: Wang, Cong, et al.
Pubblicazione: (2025)
SNAP: Speaker Nulling for Artifact Projection in Speech Deepfake Detection
di: Jung, Kyudan, et al.
Pubblicazione: (2026)
di: Jung, Kyudan, et al.
Pubblicazione: (2026)
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
di: Zhang, Jinming, et al.
Pubblicazione: (2025)
di: Zhang, Jinming, et al.
Pubblicazione: (2025)
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2024)
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2024)
Towards Robust Speech Deepfake Detection via Human-Inspired Reasoning
di: Dvirniak, Artem, et al.
Pubblicazione: (2026)
di: Dvirniak, Artem, et al.
Pubblicazione: (2026)
A Novel Automatic Framework for Speaker Drift Detection in Synthesized Speech
di: Huang, Jia-Hong, et al.
Pubblicazione: (2026)
di: Huang, Jia-Hong, et al.
Pubblicazione: (2026)
Phoneme-Level Feature Discrepancies: A Key to Detecting Sophisticated Speech Deepfakes
di: Zhang, Kuiyuan, et al.
Pubblicazione: (2024)
di: Zhang, Kuiyuan, et al.
Pubblicazione: (2024)
DAISY: Data Adaptive Self-Supervised Early Exit for Speech Representation Models
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2024)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2024)
SlimSpeech: Lightweight and Efficient Text-to-Speech with Slim Rectified Flow
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
di: Guo, Xiaoxuan, et al.
Pubblicazione: (2026)
di: Guo, Xiaoxuan, et al.
Pubblicazione: (2026)
MF-Speech: Achieving Fine-Grained and Compositional Control in Speech Generation via Factor Disentanglement
di: Yu, Xinyue, et al.
Pubblicazione: (2025)
di: Yu, Xinyue, et al.
Pubblicazione: (2025)
Generalizable Speech Deepfake Detection via Information Bottleneck Enhanced Adversarial Alignment
di: Huang, Pu, et al.
Pubblicazione: (2025)
di: Huang, Pu, et al.
Pubblicazione: (2025)
Large Speech Model Enabled Semantic Communication
di: Tian, Yun, et al.
Pubblicazione: (2025)
di: Tian, Yun, et al.
Pubblicazione: (2025)
Tutti: Expressive Multi-Singer Synthesis via Structure-Level Timbre Control and Vocal Texture Modeling
di: Chen, Jiatao, et al.
Pubblicazione: (2026)
di: Chen, Jiatao, et al.
Pubblicazione: (2026)
Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction
di: Li, Xiang, et al.
Pubblicazione: (2026)
di: Li, Xiang, et al.
Pubblicazione: (2026)
DDSP-QbE++: Improving Speech Quality for Speech Anonymisation for Atypical Speech
di: Ghosh, Suhita, et al.
Pubblicazione: (2026)
di: Ghosh, Suhita, et al.
Pubblicazione: (2026)
Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs
di: Xue, Jun, et al.
Pubblicazione: (2026)
di: Xue, Jun, et al.
Pubblicazione: (2026)
Self-Supervised Models for Phoneme Recognition: Applications in Children's Speech for Reading Learning
di: Medin, Lucas Block, et al.
Pubblicazione: (2025)
di: Medin, Lucas Block, et al.
Pubblicazione: (2025)
Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM
di: Wang, Xiong, et al.
Pubblicazione: (2024)
di: Wang, Xiong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Semi-Supervised Cognitive State Classification from Speech with Multi-View Pseudo-Labeling
di: Li, Yuanchao, et al.
Pubblicazione: (2024) -
Synchronization and Turn-Taking in Full-Duplex Speech Dialogue Models
di: Riera, Pablo, et al.
Pubblicazione: (2026) -
SpeechJudge: Towards Human-Level Judgment for Speech Naturalness
di: Zhang, Xueyao, et al.
Pubblicazione: (2025) -
Addressing Gradient Misalignment in Data-Augmented Training for Robust Speech Deepfake Detection
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2025) -
QAMO: Quality-aware Multi-centroid One-class Learning For Speech Deepfake Detection
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2025)