Abnormal Respiratory Sound Identification Using Audio-Spectrogram Vision Transformer
Fuente:
arXiv
Guardado en:
| Autores principales: | Ariyanti, Whenty, Liu, Kai-Chun, Chen, Kuan-Yu, Tsao, Yu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Robust Assessment of Pathological Voices via Combined Low-Level Descriptors and Foundation Model Representations
por: Ariyanti, Whenty, et al.
Publicado: (2025)
por: Ariyanti, Whenty, et al.
Publicado: (2025)
Patch-Mix Contrastive Learning with Audio Spectrogram Transformer on Respiratory Sound Classification
por: Bae, Sangmin, et al.
Publicado: (2023)
por: Bae, Sangmin, et al.
Publicado: (2023)
Synthesizer Sound Matching Using Audio Spectrogram Transformers
por: Bruford, Fred, et al.
Publicado: (2024)
por: Bruford, Fred, et al.
Publicado: (2024)
Geometry-Aware Optimization for Respiratory Sound Classification: Enhancing Sensitivity with SAM-Optimized Audio Spectrogram Transformers
por: Işık, Atakan, et al.
Publicado: (2025)
por: Işık, Atakan, et al.
Publicado: (2025)
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
por: Feng, Jiu, et al.
Publicado: (2024)
por: Feng, Jiu, et al.
Publicado: (2024)
BAST: Binaural Audio Spectrogram Transformer for Binaural Sound Localization
por: Kuang, Sheng, et al.
Publicado: (2022)
por: Kuang, Sheng, et al.
Publicado: (2022)
Audio Classification of Low Feature Spectrograms Utilizing Convolutional Neural Networks
por: Elias, Noel
Publicado: (2024)
por: Elias, Noel
Publicado: (2024)
FAST: Fast Audio Spectrogram Transformer
por: Naman, Anugunj, et al.
Publicado: (2025)
por: Naman, Anugunj, et al.
Publicado: (2025)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
por: Schmid, Florian, et al.
Publicado: (2024)
por: Schmid, Florian, et al.
Publicado: (2024)
Evaluating CNN with Stacked Feature Representations and Audio Spectrogram Transformer Models for Sound Classification
por: Dehaghania, Parinaz Binandeh, et al.
Publicado: (2026)
por: Dehaghania, Parinaz Binandeh, et al.
Publicado: (2026)
Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
SVSNet+: Enhancing Speaker Voice Similarity Assessment Models with Representations from Speech Foundation Models
por: Yin, Chun, et al.
Publicado: (2024)
por: Yin, Chun, et al.
Publicado: (2024)
Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings
por: Wisnu, Dyah A. M. G., et al.
Publicado: (2025)
por: Wisnu, Dyah A. M. G., et al.
Publicado: (2025)
Audio Geolocation: A Natural Sounds Benchmark
por: Chasmai, Mustafa, et al.
Publicado: (2025)
por: Chasmai, Mustafa, et al.
Publicado: (2025)
HAAQI-Net: A Non-intrusive Neural Music Audio Quality Assessment Model for Hearing Aids
por: Wisnu, Dyah A. M. G., et al.
Publicado: (2024)
por: Wisnu, Dyah A. M. G., et al.
Publicado: (2024)
Lungmix: A Mixup-Based Strategy for Generalization in Respiratory Sound Classification
por: Ge, Shijia, et al.
Publicado: (2024)
por: Ge, Shijia, et al.
Publicado: (2024)
Vision Language Models Are Few-Shot Audio Spectrogram Classifiers
por: Dixit, Satvik, et al.
Publicado: (2024)
por: Dixit, Satvik, et al.
Publicado: (2024)
Adapter Incremental Continual Learning of Efficient Audio Spectrogram Transformers
por: Selvaraj, Nithish Muthuchamy, et al.
Publicado: (2023)
por: Selvaraj, Nithish Muthuchamy, et al.
Publicado: (2023)
ASM: Audio Spectrogram Mixer
por: Ji, Qingfeng, et al.
Publicado: (2024)
por: Ji, Qingfeng, et al.
Publicado: (2024)
Multi-View Spectrogram Transformer for Respiratory Sound Classification
por: He, Wentao, et al.
Publicado: (2023)
por: He, Wentao, et al.
Publicado: (2023)
Audio Simulation for Sound Source Localization in Virtual Evironment
por: Di Yuan, Yi, et al.
Publicado: (2024)
por: Di Yuan, Yi, et al.
Publicado: (2024)
Text-Independent Speaker Identification Using Audio Looping With Margin Based Loss Functions
por: Garcia, Elliot Q C, et al.
Publicado: (2025)
por: Garcia, Elliot Q C, et al.
Publicado: (2025)
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
por: Lin, Meng-Ping, et al.
Publicado: (2025)
por: Lin, Meng-Ping, et al.
Publicado: (2025)
ASGIR: Audio Spectrogram Transformer Guided Classification And Information Retrieval For Birds
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024)
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024)
SoundReactor: Frame-level Online Video-to-Audio Generation
por: Saito, Koichi, et al.
Publicado: (2025)
por: Saito, Koichi, et al.
Publicado: (2025)
RA-QA: A Benchmarking System for Respiratory Audio Question Answering Under Real-World Heterogeneity
por: Bertolino, Gaia A., et al.
Publicado: (2026)
por: Bertolino, Gaia A., et al.
Publicado: (2026)
Cross-Referencing Self-Training Network for Sound Event Detection in Audio Mixtures
por: Park, Sangwook, et al.
Publicado: (2021)
por: Park, Sangwook, et al.
Publicado: (2021)
Non-Intrusive Speech Intelligibility Prediction for Hearing Aids using Whisper and Metadata
por: Zezario, Ryandhimas E., et al.
Publicado: (2023)
por: Zezario, Ryandhimas E., et al.
Publicado: (2023)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
por: Tabassum, Afrina, et al.
Publicado: (2024)
por: Tabassum, Afrina, et al.
Publicado: (2024)
An Enhanced Audio Feature Tailored for Anomalous Sound Detection Based on Pre-trained Models
por: Zhong, Guirui, et al.
Publicado: (2025)
por: Zhong, Guirui, et al.
Publicado: (2025)
XAI-Driven Spectral Analysis of Cough Sounds for Respiratory Disease Characterization
por: Amado-Caballero, Patricia, et al.
Publicado: (2025)
por: Amado-Caballero, Patricia, et al.
Publicado: (2025)
An AI-enabled Bias-Free Respiratory Disease Diagnosis Model using Cough Audio: A Case Study for COVID-19
por: Saeed, Tabish, et al.
Publicado: (2024)
por: Saeed, Tabish, et al.
Publicado: (2024)
From Sound to Setting: AI-Based Equalizer Parameter Prediction for Piano Tone Replication
por: Yu, Song-Ze
Publicado: (2025)
por: Yu, Song-Ze
Publicado: (2025)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
Sample-Constrained Black Box Optimization for Audio Personalization
por: Rajagopalan, Rajalaxmi, et al.
Publicado: (2025)
por: Rajagopalan, Rajalaxmi, et al.
Publicado: (2025)
Enhance Temporal Relations in Audio Captioning with Sound Event Detection
por: Xie, Zeyu, et al.
Publicado: (2023)
por: Xie, Zeyu, et al.
Publicado: (2023)
Deep Learning-based Non-Intrusive Multi-Objective Speech Assessment Model with Cross-Domain Features
por: Zezario, Ryandhimas E., et al.
Publicado: (2021)
por: Zezario, Ryandhimas E., et al.
Publicado: (2021)
Language Model Based Text-to-Audio Generation: Anti-Causally Aligned Collaborative Residual Transformers
por: Wang, Juncheng, et al.
Publicado: (2025)
por: Wang, Juncheng, et al.
Publicado: (2025)
EAViT: External Attention Vision Transformer for Audio Classification
por: Iqbal, Aquib, et al.
Publicado: (2024)
por: Iqbal, Aquib, et al.
Publicado: (2024)
A Practical Guide to Spectrogram Analysis for Audio Signal Processing
por: Khodzhaev, Zulfidin
Publicado: (2024)
por: Khodzhaev, Zulfidin
Publicado: (2024)
Ejemplares similares
-
Towards Robust Assessment of Pathological Voices via Combined Low-Level Descriptors and Foundation Model Representations
por: Ariyanti, Whenty, et al.
Publicado: (2025) -
Patch-Mix Contrastive Learning with Audio Spectrogram Transformer on Respiratory Sound Classification
por: Bae, Sangmin, et al.
Publicado: (2023) -
Synthesizer Sound Matching Using Audio Spectrogram Transformers
por: Bruford, Fred, et al.
Publicado: (2024) -
Geometry-Aware Optimization for Respiratory Sound Classification: Enhancing Sensitivity with SAM-Optimized Audio Spectrogram Transformers
por: Işık, Atakan, et al.
Publicado: (2025) -
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
por: Feng, Jiu, et al.
Publicado: (2024)