Deep Hierarchical Knowledge Loss for Fault Intensity Diagnosis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sha, Yu, Gou, Shuiping, Liu, Bo, Lu, Haofan, Liu, Ningtao, Fu, Jiahui, Stoecker, Horst, Vnucec, Domagoj, Wetzstein, Nadine, Widl, Andreas, Zhou, Kai |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Review of Machine Learning for Cavitation Intensity Recognition in Complex Industrial Systems
par: Sha, Yu, et autres
Publié: (2025)
par: Sha, Yu, et autres
Publié: (2025)
FC-TTS: Style and Timbre Control in Zero-Shot Text-to-Speech with Disentangled Speech Representations
par: Lee, Yoonhyung, et autres
Publié: (2026)
par: Lee, Yoonhyung, et autres
Publié: (2026)
Enhancing Audio Generation Diversity with Visual Information
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
Deep Dubbing: End-to-End Auto-Audiobook System with Text-to-Timbre and Context-Aware Instruct-TTS
par: Dai, Ziqi, et autres
Publié: (2025)
par: Dai, Ziqi, et autres
Publié: (2025)
An open-source voice type classifier for child-centered daylong recordings
par: Lavechin, Marvin, et autres
Publié: (2020)
par: Lavechin, Marvin, et autres
Publié: (2020)
Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
par: Adelson, Trevor, et autres
Publié: (2026)
par: Adelson, Trevor, et autres
Publié: (2026)
Exploring rhythm formant analysis for Indic language classification
par: Gogoi, Parismita, et autres
Publié: (2024)
par: Gogoi, Parismita, et autres
Publié: (2024)
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
par: Cheng, Zhuangfei, et autres
Publié: (2025)
par: Cheng, Zhuangfei, et autres
Publié: (2025)
Joint Feature and Output Distillation for Low-complexity Acoustic Scene Classification
par: Li, Haowen, et autres
Publié: (2025)
par: Li, Haowen, et autres
Publié: (2025)
Quantifying the effect of speech pathology on automatic and human speaker verification
par: Halpern, Bence Mark, et autres
Publié: (2024)
par: Halpern, Bence Mark, et autres
Publié: (2024)
Boundary Regression for Leitmotif Detection in Music Audio
par: Lee, Sihun, et autres
Publié: (2025)
par: Lee, Sihun, et autres
Publié: (2025)
A Voice-based Triage for Type 2 Diabetes using a Conversational Virtual Assistant in the Home Environment
par: Summoogum, Kelvin, et autres
Publié: (2024)
par: Summoogum, Kelvin, et autres
Publié: (2024)
Dereverberation Using Binary Residual Masking with Time-Domain Consistency
par: Williams, Daniel G.
Publié: (2025)
par: Williams, Daniel G.
Publié: (2025)
BAST: Binaural Audio Spectrogram Transformer for Binaural Sound Localization
par: Kuang, Sheng, et autres
Publié: (2022)
par: Kuang, Sheng, et autres
Publié: (2022)
Automatic Speech Recognition (ASR) for the Diagnosis of pronunciation of Speech Sound Disorders in Korean children
par: Ahn, Taekyung, et autres
Publié: (2024)
par: Ahn, Taekyung, et autres
Publié: (2024)
Representation Loss Minimization with Randomized Selection Strategy for Efficient Environmental Fake Audio Detection
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
A Robust Classification Method using Hybrid Word Embedding for Early Diagnosis of Alzheimer's Disease
par: Li, Yangyang
Publié: (2025)
par: Li, Yangyang
Publié: (2025)
STAR: Speech-to-Audio Generation via Representation Learning
par: Xie, Zeyu, et autres
Publié: (2025)
par: Xie, Zeyu, et autres
Publié: (2025)
M2D-CLAP: Exploring General-purpose Audio-Language Representations Beyond CLAP
par: Niizumi, Daisuke, et autres
Publié: (2025)
par: Niizumi, Daisuke, et autres
Publié: (2025)
FakeSound2: A Benchmark for Explainable and Generalizable Deepfake Sound Detection
par: Xie, Zeyu, et autres
Publié: (2025)
par: Xie, Zeyu, et autres
Publié: (2025)
SynParaSpeech: Automated Synthesis of Paralinguistic Datasets for Speech Generation and Understanding
par: Bai, Bingsong, et autres
Publié: (2025)
par: Bai, Bingsong, et autres
Publié: (2025)
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
Non-Invasive Suicide Risk Prediction Through Speech Analysis
par: Amiriparian, Shahin, et autres
Publié: (2024)
par: Amiriparian, Shahin, et autres
Publié: (2024)
An Empirical Analysis of Speech Self-Supervised Learning at Multiple Resolutions
par: Clark, Theo, et autres
Publié: (2024)
par: Clark, Theo, et autres
Publié: (2024)
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
Towards Multi-Level Transcript Segmentation: LoRA Fine-Tuning for Table-of-Contents Generation
par: Freisinger, Steffen, et autres
Publié: (2026)
par: Freisinger, Steffen, et autres
Publié: (2026)
Investigation into respiratory sound classification for an imbalanced data set using hybrid LSTM-KAN architectures
par: K. V, Nithinkumar, et autres
Publié: (2026)
par: K. V, Nithinkumar, et autres
Publié: (2026)
Whisper Speaker Identification: Leveraging Pre-Trained Multilingual Transformers for Robust Speaker Embeddings
par: Emon, Jakaria Islam, et autres
Publié: (2025)
par: Emon, Jakaria Islam, et autres
Publié: (2025)
CAST-TTS: A Simple Cross-Attention Framework for Unified Timbre Control in TTS
par: Zheng, Zihao, et autres
Publié: (2026)
par: Zheng, Zihao, et autres
Publié: (2026)
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
par: Zheng, Zihao, et autres
Publié: (2025)
par: Zheng, Zihao, et autres
Publié: (2025)
FakeSound: Deepfake General Audio Detection
par: Xie, Zeyu, et autres
Publié: (2024)
par: Xie, Zeyu, et autres
Publié: (2024)
U2++ MoE: Scaling 4.7x parameters with minimal impact on RTF
par: Song, Xingchen, et autres
Publié: (2024)
par: Song, Xingchen, et autres
Publié: (2024)
Beyond Speech and More: Investigating the Emergent Ability of Speech Foundation Models for Classifying Physiological Time-Series Signals
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
SigWavNet: Learning Multiresolution Signal Wavelet Network for Speech Emotion Recognition
par: Nfissi, Alaa, et autres
Publié: (2025)
par: Nfissi, Alaa, et autres
Publié: (2025)
Knowledge Distillation for Real-Time Classification of Early Media in Voice Communications
par: Altwlkany, Kemal, et autres
Publié: (2024)
par: Altwlkany, Kemal, et autres
Publié: (2024)
An Audio-centric Multi-task Learning Framework for Streaming Ads Targeting on Spotify
par: Verma, Shivam, et autres
Publié: (2025)
par: Verma, Shivam, et autres
Publié: (2025)
Deepfake audio as a data augmentation technique for training automatic speech to text transcription models
par: Ferreira, Alexandre R., et autres
Publié: (2023)
par: Ferreira, Alexandre R., et autres
Publié: (2023)
TuneGenie: Reasoning-based LLM agents for preferential music generation
par: Pandey, Amitesh, et autres
Publié: (2025)
par: Pandey, Amitesh, et autres
Publié: (2025)
SW-ASR: A Context-Aware Hybrid ASR Pipeline for Robust Single Word Speech Recognition
par: Sharma, Manali, et autres
Publié: (2026)
par: Sharma, Manali, et autres
Publié: (2026)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Documents similaires
-
A Review of Machine Learning for Cavitation Intensity Recognition in Complex Industrial Systems
par: Sha, Yu, et autres
Publié: (2025) -
FC-TTS: Style and Timbre Control in Zero-Shot Text-to-Speech with Disentangled Speech Representations
par: Lee, Yoonhyung, et autres
Publié: (2026) -
Enhancing Audio Generation Diversity with Visual Information
par: Xie, Zeyu, et autres
Publié: (2024) -
Deep Dubbing: End-to-End Auto-Audiobook System with Text-to-Timbre and Context-Aware Instruct-TTS
par: Dai, Ziqi, et autres
Publié: (2025) -
An open-source voice type classifier for child-centered daylong recordings
par: Lavechin, Marvin, et autres
Publié: (2020)