EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Jaeyeon, Jung, Jaeyoon, Lee, Jinjoo, Woo, Sang Hoon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EnCLAP++: Analyzing the EnCLAP Framework for Optimizing Automated Audio Captioning Performance
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
Expanding on EnCLAP with Auxiliary Retrieval Model for Automated Audio Captioning
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
Text2FX: Harnessing CLAP Embeddings for Text-Guided Audio Effects
di: Chu, Annie, et al.
Pubblicazione: (2024)
di: Chu, Annie, et al.
Pubblicazione: (2024)
Discrete Audio Representations for Automated Audio Captioning
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
HILCodec: High-Fidelity and Lightweight Neural Audio Codec
di: Ahn, Sunghwan, et al.
Pubblicazione: (2024)
di: Ahn, Sunghwan, et al.
Pubblicazione: (2024)
Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
di: Wu, Shih-Lun, et al.
Pubblicazione: (2023)
di: Wu, Shih-Lun, et al.
Pubblicazione: (2023)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
di: Chen, Wenxi, et al.
Pubblicazione: (2024)
di: Chen, Wenxi, et al.
Pubblicazione: (2024)
Towards Neural Audio Codec Source Parsing
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
Codec-Based Deepfake Source Tracing via Neural Audio Codec Taxonomy
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
Masked Audio Modeling with CLAP and Multi-Objective Learning
di: Xin, Yifei, et al.
Pubblicazione: (2024)
di: Xin, Yifei, et al.
Pubblicazione: (2024)
WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
Code Drift: Towards Idempotent Neural Audio Codecs
di: O'Reilly, Patrick, et al.
Pubblicazione: (2024)
di: O'Reilly, Patrick, et al.
Pubblicazione: (2024)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
Combining Audio and Non-Audio Inputs in Evolved Neural Networks for Ovenbird
di: Hernandez, Sergio Poo, et al.
Pubblicazione: (2025)
di: Hernandez, Sergio Poo, et al.
Pubblicazione: (2025)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
ACES: Evaluating Automated Audio Captioning Models on the Semantics of Sounds
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024)
DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning
di: Li, Xiquan, et al.
Pubblicazione: (2024)
di: Li, Xiquan, et al.
Pubblicazione: (2024)
Toward a Sparse and Interpretable Audio Codec
di: Vinyard, John
Pubblicazione: (2025)
di: Vinyard, John
Pubblicazione: (2025)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
ViSAGe: Video-to-Spatial Audio Generation
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
On the Language and Gender Biases in PSTN, VoIP and Neural Audio Codecs
di: Altwlkany, Kemal, et al.
Pubblicazione: (2025)
di: Altwlkany, Kemal, et al.
Pubblicazione: (2025)
UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook
di: Jiang, Yidi, et al.
Pubblicazione: (2025)
di: Jiang, Yidi, et al.
Pubblicazione: (2025)
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
di: Lee, Dongheon, et al.
Pubblicazione: (2024)
di: Lee, Dongheon, et al.
Pubblicazione: (2024)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
DualCodec: A Low-Frame-Rate, Semantically-Enhanced Neural Audio Codec for Speech Generation
di: Li, Jiaqi, et al.
Pubblicazione: (2025)
di: Li, Jiaqi, et al.
Pubblicazione: (2025)
Low-Resource Audio Codec (LRAC): 2025 Challenge Description
di: Wojcicki, Kamil, et al.
Pubblicazione: (2025)
di: Wojcicki, Kamil, et al.
Pubblicazione: (2025)
SNAC: Multi-Scale Neural Audio Codec
di: Siuzdak, Hubert, et al.
Pubblicazione: (2024)
di: Siuzdak, Hubert, et al.
Pubblicazione: (2024)
SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization
di: Wang, Jin, et al.
Pubblicazione: (2025)
di: Wang, Jin, et al.
Pubblicazione: (2025)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
An Intra-BRNN and GB-RVQ Based END-TO-END Neural Audio Codec
di: Xu, Linping, et al.
Pubblicazione: (2024)
di: Xu, Linping, et al.
Pubblicazione: (2024)
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
di: Niu, Zhikang, et al.
Pubblicazione: (2024)
di: Niu, Zhikang, et al.
Pubblicazione: (2024)
Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission
di: Thakur, Nirmalya Mallick, et al.
Pubblicazione: (2025)
di: Thakur, Nirmalya Mallick, et al.
Pubblicazione: (2025)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
Analyzing and Mitigating Inconsistency in Discrete Audio Tokens for Neural Codec Language Models
di: Liu, Wenrui, et al.
Pubblicazione: (2024)
di: Liu, Wenrui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
EnCLAP++: Analyzing the EnCLAP Framework for Optimizing Automated Audio Captioning Performance
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024) -
Expanding on EnCLAP with Auxiliary Retrieval Model for Automated Audio Captioning
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024) -
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025) -
Text2FX: Harnessing CLAP Embeddings for Text-Guided Audio Effects
di: Chu, Annie, et al.
Pubblicazione: (2024) -
Discrete Audio Representations for Automated Audio Captioning
di: Tian, Jingguang, et al.
Pubblicazione: (2025)