Audio-Image Cross-Modal Retrieval with Onomatopoeic Images
Fuente:
arXiv
Salvato in:
| Autori principali: | Imoto, Keisuke, Kojima, Yamato, Tsuchiya, Takao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
di: Tsubaki, Shunsuke, et al.
Pubblicazione: (2024)
di: Tsubaki, Shunsuke, et al.
Pubblicazione: (2024)
Joint Analysis of Acoustic Scenes and Sound Events Based on Semi-Supervised Training of Sound Events With Partial Labels
di: Imoto, Keisuke
Pubblicazione: (2025)
di: Imoto, Keisuke
Pubblicazione: (2025)
Discriminative Neighborhood Smoothing for Generative Anomalous Sound Detection
di: Fujimura, Takuya, et al.
Pubblicazione: (2024)
di: Fujimura, Takuya, et al.
Pubblicazione: (2024)
Correlation of Fréchet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependant
di: Tailleur, Modan, et al.
Pubblicazione: (2024)
di: Tailleur, Modan, et al.
Pubblicazione: (2024)
SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)
ASDKit: A Toolkit for Comprehensive Evaluation of Anomalous Sound Detection Methods
di: Fujimura, Takuya, et al.
Pubblicazione: (2025)
di: Fujimura, Takuya, et al.
Pubblicazione: (2025)
LEAD Dataset: How Can Labels for Sound Event Detection Vary Depending on Annotators?
di: Koga, Naoki, et al.
Pubblicazione: (2024)
di: Koga, Naoki, et al.
Pubblicazione: (2024)
Improving Audio-Text Retrieval via Hierarchical Cross-Modal Interaction and Auxiliary Captions
di: Xin, Yifei, et al.
Pubblicazione: (2023)
di: Xin, Yifei, et al.
Pubblicazione: (2023)
How Much Does Machine Identity Matter in Anomalous Sound Detection at Test Time?
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2026)
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2026)
Context-Aware Query Refinement for Target Sound Extraction: Handling Partially Matched Queries
di: Sato, Ryo, et al.
Pubblicazione: (2025)
di: Sato, Ryo, et al.
Pubblicazione: (2025)
Cross-Modal Bottleneck Fusion For Noise Robust Audio-Visual Speech Recognition
di: Ok, Seaone, et al.
Pubblicazione: (2026)
di: Ok, Seaone, et al.
Pubblicazione: (2026)
Discrete Tokens Exhibit Interlanguage Speech Intelligibility Benefit: an Analytical Study Towards Accent-robust ASR Only with Native Speech Data
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
Prosodically Enhanced Foreign Accent Simulation by Discrete Token-based Resynthesis Only with Native Speech Corpora
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
Multiscale Matching Driven by Cross-Modal Similarity Consistency for Audio-Text Retrieval
di: Wang, Qian, et al.
Pubblicazione: (2024)
di: Wang, Qian, et al.
Pubblicazione: (2024)
Cross-Modal Denoising: A Novel Training Paradigm for Enhancing Speech-Image Retrieval
di: Zhou, Lifeng, et al.
Pubblicazione: (2024)
di: Zhou, Lifeng, et al.
Pubblicazione: (2024)
AudioNet: Supervised Deep Hashing for Retrieval of Similar Audio Events
di: Dutta, Sagar, et al.
Pubblicazione: (2025)
di: Dutta, Sagar, et al.
Pubblicazione: (2025)
Text-based Audio Retrieval by Learning from Similarities between Audio Captions
di: Xie, Huang, et al.
Pubblicazione: (2024)
di: Xie, Huang, et al.
Pubblicazione: (2024)
What Do Neurons Listen To? A Neuron-level Dissection of a General-purpose Audio Model
di: Kawamura, Takao, et al.
Pubblicazione: (2026)
di: Kawamura, Takao, et al.
Pubblicazione: (2026)
Audio-text Retrieval with Transformer-based Hierarchical Alignment and Disentangled Cross-modal Representation
di: Xin, Yifei, et al.
Pubblicazione: (2024)
di: Xin, Yifei, et al.
Pubblicazione: (2024)
Construction and Analysis of Impression Caption Dataset for Environmental Sounds
di: Okamoto, Yuki, et al.
Pubblicazione: (2024)
di: Okamoto, Yuki, et al.
Pubblicazione: (2024)
Trainingless Adaptation of Pretrained Models for Environmental Sound Classification
di: Tonami, Noriyuki, et al.
Pubblicazione: (2024)
di: Tonami, Noriyuki, et al.
Pubblicazione: (2024)
Handling Domain Shifts for Anomalous Sound Detection: A Review of DCASE-Related Work
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2025)
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2025)
Complex Image-Generative Diffusion Transformer for Audio Denoising
di: Li, Junhui, et al.
Pubblicazione: (2024)
di: Li, Junhui, et al.
Pubblicazione: (2024)
DOA-Aware Audio-Visual Self-Supervised Learning for Sound Event Localization and Detection
di: Fujita, Yoto, et al.
Pubblicazione: (2024)
di: Fujita, Yoto, et al.
Pubblicazione: (2024)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
di: Lin, Jingru, et al.
Pubblicazione: (2026)
di: Lin, Jingru, et al.
Pubblicazione: (2026)
M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries
di: Kim, Minyoung, et al.
Pubblicazione: (2025)
di: Kim, Minyoung, et al.
Pubblicazione: (2025)
Bridging the Modality Gap: Softly Discretizing Audio Representation for LLM-based Automatic Speech Recognition
di: Yang, Mu, et al.
Pubblicazione: (2025)
di: Yang, Mu, et al.
Pubblicazione: (2025)
WaveNeXt 2: ConvNeXt-Based Fast Neural Vocoders With Residual Denoising and Sub-Modeling for GAN and Diffusion Models
di: Zhou, Wangzixi, et al.
Pubblicazione: (2026)
di: Zhou, Wangzixi, et al.
Pubblicazione: (2026)
Description and Discussion on DCASE 2026 Challenge Task 2: Noise-aware Unsupervised Anomalous Sound Detection for Machine Condition Monitoring
di: Nishida, Tomoya, et al.
Pubblicazione: (2026)
di: Nishida, Tomoya, et al.
Pubblicazione: (2026)
Adversarial Deep Metric Learning for Cross-Modal Audio-Text Alignment in Open-Vocabulary Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2025)
di: Jung, Youngmoon, et al.
Pubblicazione: (2025)
Robust Wake Word Spotting With Frame-Level Cross-Modal Attention Based Audio-Visual Conformer
di: Wang, Haoxu, et al.
Pubblicazione: (2024)
di: Wang, Haoxu, et al.
Pubblicazione: (2024)
Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models
di: Li, Longhao, et al.
Pubblicazione: (2026)
di: Li, Longhao, et al.
Pubblicazione: (2026)
Self-Noise Reduction for Capacitive Sensors via Photoelectric DC Servo: Application to Condenser Microphones
di: Obo, Hirotaka, et al.
Pubblicazione: (2026)
di: Obo, Hirotaka, et al.
Pubblicazione: (2026)
Can Hierarchical Cross-Modal Fusion Predict Human Perception of AI Dubbed Content?
di: Dasare, Ashwini, et al.
Pubblicazione: (2026)
di: Dasare, Ashwini, et al.
Pubblicazione: (2026)
ASGIR: Audio Spectrogram Transformer Guided Classification And Information Retrieval For Birds
di: Chaudhuri, Yashwardhan, et al.
Pubblicazione: (2024)
di: Chaudhuri, Yashwardhan, et al.
Pubblicazione: (2024)
InfiniteAudio: Infinite-Length Audio Generation with Consistency
di: Jung, Chaeyoung, et al.
Pubblicazione: (2025)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2025)
When Audio-LLMs Don't Listen: A Cross-Linguistic Study of Modality Arbitration
di: Billa, Jayadev
Pubblicazione: (2026)
di: Billa, Jayadev
Pubblicazione: (2026)
Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models
di: He, Haolin, et al.
Pubblicazione: (2025)
di: He, Haolin, et al.
Pubblicazione: (2025)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
di: Tsubaki, Shunsuke, et al.
Pubblicazione: (2024) -
Joint Analysis of Acoustic Scenes and Sound Events Based on Semi-Supervised Training of Sound Events With Partial Labels
di: Imoto, Keisuke
Pubblicazione: (2025) -
Discriminative Neighborhood Smoothing for Generative Anomalous Sound Detection
di: Fujimura, Takuya, et al.
Pubblicazione: (2024) -
Correlation of Fréchet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependant
di: Tailleur, Modan, et al.
Pubblicazione: (2024) -
SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)