Audio-text Retrieval with Transformer-based Hierarchical Alignment and Disentangled Cross-modal Representation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xin, Yifei, Zhu, Zhihong, Cheng, Xuxin, Yang, Xusheng, Zou, Yuexian |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DiffATR: Diffusion-based Generative Modeling for Audio-Text Retrieval
von: Xin, Yifei, et al.
Veröffentlicht: (2024)
von: Xin, Yifei, et al.
Veröffentlicht: (2024)
Improving Audio-Text Retrieval via Hierarchical Cross-Modal Interaction and Auxiliary Captions
von: Xin, Yifei, et al.
Veröffentlicht: (2023)
von: Xin, Yifei, et al.
Veröffentlicht: (2023)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
von: Yao, Dong, et al.
Veröffentlicht: (2023)
von: Yao, Dong, et al.
Veröffentlicht: (2023)
HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement
von: Hussein, Amir, et al.
Veröffentlicht: (2025)
von: Hussein, Amir, et al.
Veröffentlicht: (2025)
Learning Disentangled Speech Representations with Contrastive Learning and Time-Invariant Retrieval
von: Deng, Yimin, et al.
Veröffentlicht: (2024)
von: Deng, Yimin, et al.
Veröffentlicht: (2024)
ATRI: Mitigating Multilingual Audio Text Retrieval Inconsistencies by Reducing Data Distribution Errors
von: Yin, Yuguo, et al.
Veröffentlicht: (2025)
von: Yin, Yuguo, et al.
Veröffentlicht: (2025)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
von: Jia, Yuhang, et al.
Veröffentlicht: (2025)
von: Jia, Yuhang, et al.
Veröffentlicht: (2025)
Self-Supervised Multi-View Learning for Disentangled Music Audio Representations
von: Wilkins, Julia, et al.
Veröffentlicht: (2024)
von: Wilkins, Julia, et al.
Veröffentlicht: (2024)
Assessing the Alignment of Audio Representations with Timbre Similarity Ratings
von: Tian, Haokun, et al.
Veröffentlicht: (2025)
von: Tian, Haokun, et al.
Veröffentlicht: (2025)
Masked Audio Modeling with CLAP and Multi-Objective Learning
von: Xin, Yifei, et al.
Veröffentlicht: (2024)
von: Xin, Yifei, et al.
Veröffentlicht: (2024)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
von: Lu, Ye-Xin, et al.
Veröffentlicht: (2025)
von: Lu, Ye-Xin, et al.
Veröffentlicht: (2025)
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
von: Tsubaki, Shunsuke, et al.
Veröffentlicht: (2024)
von: Tsubaki, Shunsuke, et al.
Veröffentlicht: (2024)
STAR: Speech-to-Audio Generation via Representation Learning
von: Xie, Zeyu, et al.
Veröffentlicht: (2025)
von: Xie, Zeyu, et al.
Veröffentlicht: (2025)
Conversational Speech Recognition by Learning Audio-textual Cross-modal Contextual Representation
von: Wei, Kun, et al.
Veröffentlicht: (2023)
von: Wei, Kun, et al.
Veröffentlicht: (2023)
ASGIR: Audio Spectrogram Transformer Guided Classification And Information Retrieval For Birds
von: Chaudhuri, Yashwardhan, et al.
Veröffentlicht: (2024)
von: Chaudhuri, Yashwardhan, et al.
Veröffentlicht: (2024)
MINT: Boosting Audio-Language Model via Multi-Target Pre-Training and Instruction Tuning
von: Zhao, Hang, et al.
Veröffentlicht: (2024)
von: Zhao, Hang, et al.
Veröffentlicht: (2024)
AUV: Teaching Audio Universal Vector Quantization with Single Nested Codebook
von: Chen, Yushen, et al.
Veröffentlicht: (2025)
von: Chen, Yushen, et al.
Veröffentlicht: (2025)
Disentangling Hierarchical Features for Anomalous Sound Detection Under Domain Shift
von: Guan, Jian, et al.
Veröffentlicht: (2025)
von: Guan, Jian, et al.
Veröffentlicht: (2025)
Discrete Audio Representations for Automated Audio Captioning
von: Tian, Jingguang, et al.
Veröffentlicht: (2025)
von: Tian, Jingguang, et al.
Veröffentlicht: (2025)
Towards Fusion of Neural Audio Codec-based Representations with Spectral for Heart Murmur Classification via Bandit-based Cross-Attention Mechanism
von: Phukan, Orchid Chetia, et al.
Veröffentlicht: (2025)
von: Phukan, Orchid Chetia, et al.
Veröffentlicht: (2025)
Learning Disentangled Audio Representations through Controlled Synthesis
von: Brima, Yusuf, et al.
Veröffentlicht: (2024)
von: Brima, Yusuf, et al.
Veröffentlicht: (2024)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
von: Sudarsanam, Parthasaarathy, et al.
Veröffentlicht: (2025)
von: Sudarsanam, Parthasaarathy, et al.
Veröffentlicht: (2025)
Continuous Learning of Transformer-based Audio Deepfake Detection
von: Le, Tuan Duy Nguyen, et al.
Veröffentlicht: (2024)
von: Le, Tuan Duy Nguyen, et al.
Veröffentlicht: (2024)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
von: Han, Bing, et al.
Veröffentlicht: (2026)
von: Han, Bing, et al.
Veröffentlicht: (2026)
PhoenixCodec: Taming Neural Speech Coding for Extreme Low-Resource Scenarios
von: Wan, Zixiang, et al.
Veröffentlicht: (2025)
von: Wan, Zixiang, et al.
Veröffentlicht: (2025)
Evaluating CNN with Stacked Feature Representations and Audio Spectrogram Transformer Models for Sound Classification
von: Dehaghania, Parinaz Binandeh, et al.
Veröffentlicht: (2026)
von: Dehaghania, Parinaz Binandeh, et al.
Veröffentlicht: (2026)
Investigating Group Relative Policy Optimization for Diffusion Transformer based Text-to-Audio Generation
von: Gu, Yi, et al.
Veröffentlicht: (2026)
von: Gu, Yi, et al.
Veröffentlicht: (2026)
Streaming Audio Transformers for Online Audio Tagging
von: Dinkel, Heinrich, et al.
Veröffentlicht: (2023)
von: Dinkel, Heinrich, et al.
Veröffentlicht: (2023)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
von: Deng, Yimin, et al.
Veröffentlicht: (2024)
von: Deng, Yimin, et al.
Veröffentlicht: (2024)
Compositional Audio Representation Learning
von: Sridhar, Sripathi, et al.
Veröffentlicht: (2024)
von: Sridhar, Sripathi, et al.
Veröffentlicht: (2024)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
von: Lin, Jingru, et al.
Veröffentlicht: (2026)
von: Lin, Jingru, et al.
Veröffentlicht: (2026)
pyAMPACT: A Score-Audio Alignment Toolkit for Performance Data Estimation and Multi-modal Processing
von: Devaney, Johanna, et al.
Veröffentlicht: (2024)
von: Devaney, Johanna, et al.
Veröffentlicht: (2024)
Generalizable Audio Deepfake Detection via Hierarchical Structure Learning and Feature Whitening in Poincaré sphere
von: Yang, Mingru, et al.
Veröffentlicht: (2025)
von: Yang, Mingru, et al.
Veröffentlicht: (2025)
$\text{M}^3\text{PDB}$: A Multimodal, Multi-Label, Multilingual Prompt Database for Speech Generation
von: Zhu, Boyu, et al.
Veröffentlicht: (2025)
von: Zhu, Boyu, et al.
Veröffentlicht: (2025)
Disentangled Representation Learning for Environment-agnostic Speaker Recognition
von: Nam, KiHyun, et al.
Veröffentlicht: (2024)
von: Nam, KiHyun, et al.
Veröffentlicht: (2024)
Audio Fingerprinting with Holographic Reduced Representations
von: Fujita, Yusuke, et al.
Veröffentlicht: (2024)
von: Fujita, Yusuke, et al.
Veröffentlicht: (2024)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
von: Hai, Jiarui, et al.
Veröffentlicht: (2024)
von: Hai, Jiarui, et al.
Veröffentlicht: (2024)
Do Models Hear Like Us? Probing the Representational Alignment of Audio LLMs and Naturalistic EEG
von: Yang, Haoyun, et al.
Veröffentlicht: (2026)
von: Yang, Haoyun, et al.
Veröffentlicht: (2026)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
von: Gong, Yitian, et al.
Veröffentlicht: (2026)
von: Gong, Yitian, et al.
Veröffentlicht: (2026)
Semi-intrusive audio evaluation: Casting non-intrusive assessment as a multi-modal text prediction task
von: Coldenhoff, Jozef, et al.
Veröffentlicht: (2024)
von: Coldenhoff, Jozef, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
DiffATR: Diffusion-based Generative Modeling for Audio-Text Retrieval
von: Xin, Yifei, et al.
Veröffentlicht: (2024) -
Improving Audio-Text Retrieval via Hierarchical Cross-Modal Interaction and Auxiliary Captions
von: Xin, Yifei, et al.
Veröffentlicht: (2023) -
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
von: Yao, Dong, et al.
Veröffentlicht: (2023) -
HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement
von: Hussein, Amir, et al.
Veröffentlicht: (2025) -
Learning Disentangled Speech Representations with Contrastive Learning and Time-Invariant Retrieval
von: Deng, Yimin, et al.
Veröffentlicht: (2024)