Cross-Attention with Confidence Weighting for Multi-Channel Audio Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Nihal, Ragib Amin, Yen, Benjamin, Ashizawa, Takeshi, Nakadai, Kazuhiro |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Weakly Supervised Detection and Temporal Localization of Whale Calls in Long-Duration Bioacoustic Data
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2025)
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2025)
Single-Channel Target Speech Extraction Utilizing Distance and Room Clues
di: Shi, Runwu, et al.
Pubblicazione: (2025)
di: Shi, Runwu, et al.
Pubblicazione: (2025)
Unsupervised Single-Channel Audio Separation with Diffusion Source Priors
di: Shi, Runwu, et al.
Pubblicazione: (2025)
di: Shi, Runwu, et al.
Pubblicazione: (2025)
Distance Based Single-Channel Target Speech Extraction
di: Shi, Runwu, et al.
Pubblicazione: (2024)
di: Shi, Runwu, et al.
Pubblicazione: (2024)
Ecologically-Constrained Task Arithmetic for Multi-Taxa Bioacoustic Classifiers Without Shared Data
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2026)
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2026)
XAttnMark: Learning Robust Audio Watermarking with Cross-Attention
di: Liu, Yixin, et al.
Pubblicazione: (2025)
di: Liu, Yixin, et al.
Pubblicazione: (2025)
Training-Free Multi-Step Audio Source Separation
di: Zang, Yongyi, et al.
Pubblicazione: (2025)
di: Zang, Yongyi, et al.
Pubblicazione: (2025)
HyWA: Hypernetwork Weight Adapting Personalized Voice Activity Detection
di: Nejad, Mahsa Ghazvini, et al.
Pubblicazione: (2025)
di: Nejad, Mahsa Ghazvini, et al.
Pubblicazione: (2025)
Guiding Audio Editing with Audio Language Model
di: Lan, Zitong, et al.
Pubblicazione: (2025)
di: Lan, Zitong, et al.
Pubblicazione: (2025)
Multi-Metric Preference Alignment for Generative Speech Restoration
di: Zhang, Junan, et al.
Pubblicazione: (2025)
di: Zhang, Junan, et al.
Pubblicazione: (2025)
Enhanced Speech Emotion Recognition with Efficient Channel Attention Guided Deep CNN-BiLSTM Framework
di: Kundu, Niloy Kumar, et al.
Pubblicazione: (2024)
di: Kundu, Niloy Kumar, et al.
Pubblicazione: (2024)
AudioGenX: Explainability on Text-to-Audio Generative Models
di: Kang, Hyunju, et al.
Pubblicazione: (2025)
di: Kang, Hyunju, et al.
Pubblicazione: (2025)
MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition
di: Wang, He, et al.
Pubblicazione: (2024)
di: Wang, He, et al.
Pubblicazione: (2024)
Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework
di: Zhang, Kuiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Kuiyuan, et al.
Pubblicazione: (2025)
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
HEAR: Holistic Evaluation of Audio Representations
di: Turian, Joseph, et al.
Pubblicazione: (2022)
di: Turian, Joseph, et al.
Pubblicazione: (2022)
DeepGB-TB: A Risk-Balanced Cross-Attention Gradient-Boosted Convolutional Network for Rapid, Interpretable Tuberculosis Screening
di: Lu, Zhixiang, et al.
Pubblicazione: (2025)
di: Lu, Zhixiang, et al.
Pubblicazione: (2025)
Learning Source Disentanglement in Neural Audio Codec
di: Bie, Xiaoyu, et al.
Pubblicazione: (2024)
di: Bie, Xiaoyu, et al.
Pubblicazione: (2024)
TACNET: Temporal Audio Source Counting Network
di: Ahmadnejad, Amirreza, et al.
Pubblicazione: (2023)
di: Ahmadnejad, Amirreza, et al.
Pubblicazione: (2023)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
Exploring and Applying Audio-Based Sentiment Analysis in Music
di: Jhanji, Etash
Pubblicazione: (2024)
di: Jhanji, Etash
Pubblicazione: (2024)
Prompt-guided Precise Audio Editing with Diffusion Models
di: Xu, Manjie, et al.
Pubblicazione: (2024)
di: Xu, Manjie, et al.
Pubblicazione: (2024)
On Temporal Guidance and Iterative Refinement in Audio Source Separation
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
Leveraging Whisper Embeddings for Audio-based Lyrics Matching
di: Mancini, Eleonora, et al.
Pubblicazione: (2025)
di: Mancini, Eleonora, et al.
Pubblicazione: (2025)
Audio-Based Pedestrian Detection in the Presence of Vehicular Noise
di: Kim, Yonghyun, et al.
Pubblicazione: (2025)
di: Kim, Yonghyun, et al.
Pubblicazione: (2025)
A Survey of Deep Learning Audio Generation Methods
di: Božić, Matej, et al.
Pubblicazione: (2024)
di: Božić, Matej, et al.
Pubblicazione: (2024)
Benchmarking Language Modeling for Lossless Compression of Full-Fidelity Audio
di: Long, Phillip, et al.
Pubblicazione: (2026)
di: Long, Phillip, et al.
Pubblicazione: (2026)
Learning Linearity in Audio Consistency Autoencoders via Implicit Regularization
di: Torres, Bernardo, et al.
Pubblicazione: (2025)
di: Torres, Bernardo, et al.
Pubblicazione: (2025)
Text-Queried Audio Source Separation via Hierarchical Modeling
di: Yin, Xinlei, et al.
Pubblicazione: (2025)
di: Yin, Xinlei, et al.
Pubblicazione: (2025)
Sparse Autoencoders Make Audio Foundation Models more Explainable
di: Mariotte, Théo, et al.
Pubblicazione: (2025)
di: Mariotte, Théo, et al.
Pubblicazione: (2025)
PoDAR: Power-Disentangled Audio Representation for Generative Modeling
di: Luebs, Alejandro, et al.
Pubblicazione: (2026)
di: Luebs, Alejandro, et al.
Pubblicazione: (2026)
Evaluating Fake Music Detection Performance Under Audio Augmentations
di: Sroka, Tomasz, et al.
Pubblicazione: (2025)
di: Sroka, Tomasz, et al.
Pubblicazione: (2025)
NatureLM-audio: an Audio-Language Foundation Model for Bioacoustics
di: Robinson, David, et al.
Pubblicazione: (2024)
di: Robinson, David, et al.
Pubblicazione: (2024)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
DARNet: Dual Attention Refinement Network with Spatiotemporal Construction for Auditory Attention Detection
di: Yan, Sheng, et al.
Pubblicazione: (2024)
di: Yan, Sheng, et al.
Pubblicazione: (2024)
SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes
di: Alex, Tony, et al.
Pubblicazione: (2025)
di: Alex, Tony, et al.
Pubblicazione: (2025)
CoDiCodec: Unifying Continuous and Discrete Compressed Representations of Audio
di: Pasini, Marco, et al.
Pubblicazione: (2025)
di: Pasini, Marco, et al.
Pubblicazione: (2025)
KAD: No More FAD! An Effective and Efficient Evaluation Metric for Audio Generation
di: Chung, Yoonjin, et al.
Pubblicazione: (2025)
di: Chung, Yoonjin, et al.
Pubblicazione: (2025)
Thinking While Listening: Simple Test Time Scaling For Audio Classification
di: Verma, Prateek, et al.
Pubblicazione: (2025)
di: Verma, Prateek, et al.
Pubblicazione: (2025)
Open-Amp: Synthetic Data Framework for Audio Effect Foundation Models
di: Wright, Alec, et al.
Pubblicazione: (2024)
di: Wright, Alec, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Weakly Supervised Detection and Temporal Localization of Whale Calls in Long-Duration Bioacoustic Data
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2025) -
Single-Channel Target Speech Extraction Utilizing Distance and Room Clues
di: Shi, Runwu, et al.
Pubblicazione: (2025) -
Unsupervised Single-Channel Audio Separation with Diffusion Source Priors
di: Shi, Runwu, et al.
Pubblicazione: (2025) -
Distance Based Single-Channel Target Speech Extraction
di: Shi, Runwu, et al.
Pubblicazione: (2024) -
Ecologically-Constrained Task Arithmetic for Multi-Taxa Bioacoustic Classifiers Without Shared Data
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2026)