Vision Transformer Segmentation for Visual Bird Sound Denoising
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kumar, Sahil, Li, Jialu, Zhang, Youshan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Complex Image-Generative Diffusion Transformer for Audio Denoising
par: Li, Junhui, et autres
Publié: (2024)
par: Li, Junhui, et autres
Publié: (2024)
Diffusion Gaussian Mixture Audio Denoise
par: Wang, Pu, et autres
Publié: (2024)
par: Wang, Pu, et autres
Publié: (2024)
Adaptive Differential Denoising for Respiratory Sounds Classification
par: Dong, Gaoyang, et autres
Publié: (2025)
par: Dong, Gaoyang, et autres
Publié: (2025)
Quantum Fourier Transform Based Denoising: Unitary Filtering for Enhanced Speech Clarity
par: Tripathi, Rajeshwar, et autres
Publié: (2025)
par: Tripathi, Rajeshwar, et autres
Publié: (2025)
Domain-Invariant Representation Learning of Bird Sounds
par: Moummad, Ilyass, et autres
Publié: (2024)
par: Moummad, Ilyass, et autres
Publié: (2024)
ASGIR: Audio Spectrogram Transformer Guided Classification And Information Retrieval For Birds
par: Chaudhuri, Yashwardhan, et autres
Publié: (2024)
par: Chaudhuri, Yashwardhan, et autres
Publié: (2024)
Enhancing Child Vocalization Classification with Phonetically-Tuned Embeddings for Assisting Autism Diagnosis
par: Li, Jialu, et autres
Publié: (2023)
par: Li, Jialu, et autres
Publié: (2023)
Baseline Systems and Evaluation Metrics for Spatial Semantic Segmentation of Sound Scenes
par: Nguyen, Binh Thien, et autres
Publié: (2025)
par: Nguyen, Binh Thien, et autres
Publié: (2025)
SonicVisionLM: Playing Sound with Vision Language Models
par: Xie, Zhifeng, et autres
Publié: (2024)
par: Xie, Zhifeng, et autres
Publié: (2024)
Effective Pre-Training of Audio Transformers for Sound Event Detection
par: Schmid, Florian, et autres
Publié: (2024)
par: Schmid, Florian, et autres
Publié: (2024)
LISTEN: Lightweight Industrial Sound-representable Transformer for Edge Notification
par: Han, Changheon, et autres
Publié: (2025)
par: Han, Changheon, et autres
Publié: (2025)
Speech Denoising with Auditory Models
par: Saddler, Mark R., et autres
Publié: (2020)
par: Saddler, Mark R., et autres
Publié: (2020)
DB3V: A Dialect Dominated Dataset of Bird Vocalisation for Cross-corpus Bird Species Recognition
par: Jing, Xin, et autres
Publié: (2024)
par: Jing, Xin, et autres
Publié: (2024)
Where's That Voice Coming? Continual Learning for Sound Source Localization
par: Xiao, Yang, et autres
Publié: (2024)
par: Xiao, Yang, et autres
Publié: (2024)
Analysis of Self-Supervised Speech Models on Children's Speech and Infant Vocalizations
par: Li, Jialu, et autres
Publié: (2024)
par: Li, Jialu, et autres
Publié: (2024)
Generating Diverse Audio-Visual 360 Soundscapes for Sound Event Localization and Detection
par: Roman, Adrian S., et autres
Publié: (2025)
par: Roman, Adrian S., et autres
Publié: (2025)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
par: Wang, Helin, et autres
Publié: (2024)
par: Wang, Helin, et autres
Publié: (2024)
TF-Mamba: A Time-Frequency Network for Sound Source Localization
par: Xiao, Yang, et autres
Publié: (2024)
par: Xiao, Yang, et autres
Publié: (2024)
UCIL: An Unsupervised Class Incremental Learning Approach for Sound Event Detection
par: Xiao, Yang, et autres
Publié: (2024)
par: Xiao, Yang, et autres
Publié: (2024)
Enforcing Speech Content Privacy in Environmental Sound Recordings using Segment-wise Waveform Reversal
par: Tailleur, Modan, et autres
Publié: (2025)
par: Tailleur, Modan, et autres
Publié: (2025)
Description and Discussion on DCASE 2025 Challenge Task 4: Spatial Semantic Segmentation of Sound Scenes
par: Yasuda, Masahiro, et autres
Publié: (2025)
par: Yasuda, Masahiro, et autres
Publié: (2025)
SoundSil-DS: Deep Denoising and Segmentation of Sound-field Images with Silhouettes
par: Tanigawa, Risako, et autres
Publié: (2024)
par: Tanigawa, Risako, et autres
Publié: (2024)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
par: Schmid, Florian, et autres
Publié: (2024)
par: Schmid, Florian, et autres
Publié: (2024)
Evaluating CNN with Stacked Feature Representations and Audio Spectrogram Transformer Models for Sound Classification
par: Dehaghania, Parinaz Binandeh, et autres
Publié: (2026)
par: Dehaghania, Parinaz Binandeh, et autres
Publié: (2026)
AudioSpa: Spatializing Sound Events with Text
par: Feng, Linfeng, et autres
Publié: (2025)
par: Feng, Linfeng, et autres
Publié: (2025)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
Sound Tagging in Infant-centric Home Soundscapes
par: Khan, Mohammad Nur Hossain, et autres
Publié: (2024)
par: Khan, Mohammad Nur Hossain, et autres
Publié: (2024)
JiTTER: Jigsaw Temporal Transformer for Event Reconstruction for Self-Supervised Sound Event Detection
par: Nam, Hyeonuk, et autres
Publié: (2025)
par: Nam, Hyeonuk, et autres
Publié: (2025)
WildDESED: An LLM-Powered Dataset for Wild Domestic Environment Sound Event Detection System
par: Xiao, Yang, et autres
Publié: (2024)
par: Xiao, Yang, et autres
Publié: (2024)
DiffSound: Differentiable Modal Sound Rendering and Inverse Rendering for Diverse Inference Tasks
par: Jin, Xutong, et autres
Publié: (2024)
par: Jin, Xutong, et autres
Publié: (2024)
Abnormal Respiratory Sound Identification Using Audio-Spectrogram Vision Transformer
par: Ariyanti, Whenty, et autres
Publié: (2024)
par: Ariyanti, Whenty, et autres
Publié: (2024)
SoundLoCD: An Efficient Conditional Discrete Contrastive Latent Diffusion Model for Text-to-Sound Generation
par: Niu, Xinlei, et autres
Publié: (2024)
par: Niu, Xinlei, et autres
Publié: (2024)
Leveraging LLM and Text-Queried Separation for Noise-Robust Sound Event Detection
par: Yin, Han, et autres
Publié: (2024)
par: Yin, Han, et autres
Publié: (2024)
Self-Supervised Learning for Few-Shot Bird Sound Classification
par: Moummad, Ilyass, et autres
Publié: (2023)
par: Moummad, Ilyass, et autres
Publié: (2023)
Leveraging Sound Source Trajectories for Universal Sound Separation
par: Wu, Donghang, et autres
Publié: (2024)
par: Wu, Donghang, et autres
Publié: (2024)
Sound Zone Control Robust To Sound Speed Change
par: Bhattacharjee, Sankha Subhra, et autres
Publié: (2024)
par: Bhattacharjee, Sankha Subhra, et autres
Publié: (2024)
Evaluating Sound Similarity Metrics for Differentiable, Iterative Sound-Matching
par: Salimi, Amir, et autres
Publié: (2025)
par: Salimi, Amir, et autres
Publié: (2025)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
par: Liu, Huadai, et autres
Publié: (2023)
par: Liu, Huadai, et autres
Publié: (2023)
Towards HRTF Personalization using Denoising Diffusion Models
par: Sánchez, Juan Camilo Albarracín, et autres
Publié: (2025)
par: Sánchez, Juan Camilo Albarracín, et autres
Publié: (2025)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
par: Yin, Han, et autres
Publié: (2024)
par: Yin, Han, et autres
Publié: (2024)
Documents similaires
-
Complex Image-Generative Diffusion Transformer for Audio Denoising
par: Li, Junhui, et autres
Publié: (2024) -
Diffusion Gaussian Mixture Audio Denoise
par: Wang, Pu, et autres
Publié: (2024) -
Adaptive Differential Denoising for Respiratory Sounds Classification
par: Dong, Gaoyang, et autres
Publié: (2025) -
Quantum Fourier Transform Based Denoising: Unitary Filtering for Enhanced Speech Clarity
par: Tripathi, Rajeshwar, et autres
Publié: (2025) -
Domain-Invariant Representation Learning of Bird Sounds
par: Moummad, Ilyass, et autres
Publié: (2024)