Advancing Multi-grained Alignment for Contrastive Language-Audio Pre-training
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yiming, Guo, Zhifang, Wang, Xiangdong, Liu, Hong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Fine-Grained and Multi-Granular Contrastive Language-Speech Pre-training
di: Yang, Yifan, et al.
Pubblicazione: (2026)
di: Yang, Yifan, et al.
Pubblicazione: (2026)
DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training
di: Liu, Shengqiang, et al.
Pubblicazione: (2024)
di: Liu, Shengqiang, et al.
Pubblicazione: (2024)
CLAPSep: Leveraging Contrastive Pre-trained Model for Multi-Modal Query-Conditioned Target Sound Extraction
di: Ma, Hao, et al.
Pubblicazione: (2024)
di: Ma, Hao, et al.
Pubblicazione: (2024)
Leveraging Language Model Capabilities for Sound Event Detection
di: Wang, Hualei, et al.
Pubblicazione: (2023)
di: Wang, Hualei, et al.
Pubblicazione: (2023)
Prior-agnostic Multi-scale Contrastive Text-Audio Pre-training for Parallelized TTS Frontend Modeling
di: Wang, Quanxiu, et al.
Pubblicazione: (2024)
di: Wang, Quanxiu, et al.
Pubblicazione: (2024)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
Analyzing and Mitigating Inconsistency in Discrete Audio Tokens for Neural Codec Language Models
di: Liu, Wenrui, et al.
Pubblicazione: (2024)
di: Liu, Wenrui, et al.
Pubblicazione: (2024)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
di: Wang, Yuanyuan, et al.
Pubblicazione: (2024)
di: Wang, Yuanyuan, et al.
Pubblicazione: (2024)
A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining
di: Xiao, Feiyang, et al.
Pubblicazione: (2024)
di: Xiao, Feiyang, et al.
Pubblicazione: (2024)
Can Audio Large Language Models Verify Speaker Identity?
di: Ren, Yiming, et al.
Pubblicazione: (2025)
di: Ren, Yiming, et al.
Pubblicazione: (2025)
Domain Adaptation for Contrastive Audio-Language Models
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
LARP: Language Audio Relational Pre-training for Cold-Start Playlist Continuation
di: Salganik, Rebecca, et al.
Pubblicazione: (2024)
di: Salganik, Rebecca, et al.
Pubblicazione: (2024)
SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)
End-to-End Speech Recognition with Pre-trained Masked Language Model
di: Higuchi, Yosuke, et al.
Pubblicazione: (2024)
di: Higuchi, Yosuke, et al.
Pubblicazione: (2024)
Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models
di: Li, Longhao, et al.
Pubblicazione: (2026)
di: Li, Longhao, et al.
Pubblicazione: (2026)
AudioLog: LLMs-Powered Long Audio Logging with Hybrid Token-Semantic Contrastive Learning
di: Bai, Jisheng, et al.
Pubblicazione: (2023)
di: Bai, Jisheng, et al.
Pubblicazione: (2023)
ProLAP: Probabilistic Language-Audio Pre-Training
di: Manabe, Toranosuke, et al.
Pubblicazione: (2025)
di: Manabe, Toranosuke, et al.
Pubblicazione: (2025)
BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writing
di: Wang, Chen, et al.
Pubblicazione: (2023)
di: Wang, Chen, et al.
Pubblicazione: (2023)
Short-Segment Speaker Verification with Pre-trained Models and Multi-Resolution Encoder
di: Myoung, Jisoo, et al.
Pubblicazione: (2025)
di: Myoung, Jisoo, et al.
Pubblicazione: (2025)
MINT: Boosting Audio-Language Model via Multi-Target Pre-Training and Instruction Tuning
di: Zhao, Hang, et al.
Pubblicazione: (2024)
di: Zhao, Hang, et al.
Pubblicazione: (2024)
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
di: Xi, Yu, et al.
Pubblicazione: (2024)
di: Xi, Yu, et al.
Pubblicazione: (2024)
Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models
di: He, Haolin, et al.
Pubblicazione: (2025)
di: He, Haolin, et al.
Pubblicazione: (2025)
Why Pre-trained Models Fail: Feature Entanglement in Multi-modal Depression Detection
di: Zhang, Xiangyu, et al.
Pubblicazione: (2025)
di: Zhang, Xiangyu, et al.
Pubblicazione: (2025)
AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models
di: Bai, Jisheng, et al.
Pubblicazione: (2024)
di: Bai, Jisheng, et al.
Pubblicazione: (2024)
Video-to-Audio Generation with Fine-grained Temporal Semantics
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
Improving Query-by-Vocal Imitation with Contrastive Learning and Audio Pretraining
di: Greif, Jonathan, et al.
Pubblicazione: (2024)
di: Greif, Jonathan, et al.
Pubblicazione: (2024)
SmoothCLAP: Soft-Target Enhanced Contrastive Language\--Audio Pretraining for Affective Computing
di: Jing, Xin, et al.
Pubblicazione: (2026)
di: Jing, Xin, et al.
Pubblicazione: (2026)
Multi-View Based Audio Visual Target Speaker Extraction
di: Yang, Peijun, et al.
Pubblicazione: (2026)
di: Yang, Peijun, et al.
Pubblicazione: (2026)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
di: Chen, Yiming, et al.
Pubblicazione: (2024)
di: Chen, Yiming, et al.
Pubblicazione: (2024)
Audio Deepfake Detection with Self-Supervised WavLM and Multi-Fusion Attentive Classifier
di: Guo, Yinlin, et al.
Pubblicazione: (2023)
di: Guo, Yinlin, et al.
Pubblicazione: (2023)
MorphFader: Enabling Fine-grained Controllable Morphing with Text-to-Audio Models
di: Kamath, Purnima, et al.
Pubblicazione: (2024)
di: Kamath, Purnima, et al.
Pubblicazione: (2024)
Speaker-Conditioned Phrase Break Prediction for Text-to-Speech with Phoneme-Level Pre-trained Language Model
di: Yang, Dong, et al.
Pubblicazione: (2025)
di: Yang, Dong, et al.
Pubblicazione: (2025)
FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition
di: Kim, Jongsuk, et al.
Pubblicazione: (2025)
di: Kim, Jongsuk, et al.
Pubblicazione: (2025)
Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition
di: Yang, Qingran, et al.
Pubblicazione: (2026)
di: Yang, Qingran, et al.
Pubblicazione: (2026)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
ASAudio: A Survey of Advanced Spatial Audio Research
di: Zhu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Zhu, Zhiyuan, et al.
Pubblicazione: (2025)
ACAVCaps: Enabling large-scale training for fine-grained and diverse audio understanding
di: Niu, Yadong, et al.
Pubblicazione: (2026)
di: Niu, Yadong, et al.
Pubblicazione: (2026)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
WavCraft: Audio Editing and Generation with Large Language Models
di: Liang, Jinhua, et al.
Pubblicazione: (2024)
di: Liang, Jinhua, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Towards Fine-Grained and Multi-Granular Contrastive Language-Speech Pre-training
di: Yang, Yifan, et al.
Pubblicazione: (2026) -
DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training
di: Liu, Shengqiang, et al.
Pubblicazione: (2024) -
CLAPSep: Leveraging Contrastive Pre-trained Model for Multi-Modal Query-Conditioned Target Sound Extraction
di: Ma, Hao, et al.
Pubblicazione: (2024) -
Leveraging Language Model Capabilities for Sound Event Detection
di: Wang, Hualei, et al.
Pubblicazione: (2023) -
Prior-agnostic Multi-scale Contrastive Text-Audio Pre-training for Parallelized TTS Frontend Modeling
di: Wang, Quanxiu, et al.
Pubblicazione: (2024)