TAC: Timestamped Audio Captioning
Fuente:
arXiv
Salvato in:
| Autori principali: | Kumar, Sonal, Seetharaman, Prem, Chen, Ke, Nieto, Oriol, Su, Jiaqi, Wang, Zhepei, Kumar, Rithesh, Manocha, Dinesh, Bryan, Nicholas J., Jin, Zeyu, Salamon, Justin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation
di: Kumar, Sonal, et al.
Pubblicazione: (2024)
di: Kumar, Sonal, et al.
Pubblicazione: (2024)
AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing
di: Chen, William, et al.
Pubblicazione: (2026)
di: Chen, William, et al.
Pubblicazione: (2026)
Generative Audio Extension and Morphing
di: Seetharaman, Prem, et al.
Pubblicazione: (2026)
di: Seetharaman, Prem, et al.
Pubblicazione: (2026)
PromptSep: Generative Audio Separation via Multimodal Prompting
di: Wen, Yutong, et al.
Pubblicazione: (2025)
di: Wen, Yutong, et al.
Pubblicazione: (2025)
Audiocards: Structured Metadata Improves Audio Language Models For Sound Design
di: Sridhar, Sripathi, et al.
Pubblicazione: (2026)
di: Sridhar, Sripathi, et al.
Pubblicazione: (2026)
Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations
di: García, Hugo Flores, et al.
Pubblicazione: (2024)
di: García, Hugo Flores, et al.
Pubblicazione: (2024)
Taming Audio VAEs via Target-KL Regularization
di: Seetharaman, Prem, et al.
Pubblicazione: (2026)
di: Seetharaman, Prem, et al.
Pubblicazione: (2026)
Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models
di: Seth, Ashish, et al.
Pubblicazione: (2026)
di: Seth, Ashish, et al.
Pubblicazione: (2026)
Mix2Morph: Learning Sound Morphing from Noisy Mixes
di: Chu, Annie, et al.
Pubblicazione: (2026)
di: Chu, Annie, et al.
Pubblicazione: (2026)
Code Drift: Towards Idempotent Neural Audio Codecs
di: O'Reilly, Patrick, et al.
Pubblicazione: (2024)
di: O'Reilly, Patrick, et al.
Pubblicazione: (2024)
FLAM: Frame-Wise Language-Audio Modeling
di: Wu, Yusong, et al.
Pubblicazione: (2025)
di: Wu, Yusong, et al.
Pubblicazione: (2025)
Video-Guided Foley Sound Generation with Multimodal Controls
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
RECAP: Retrieval-Augmented Audio Captioning
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
Augment, Drop & Swap: Improving Diversity in LLM Captions for Efficient Music-Text Representation Learning
di: Manco, Ilaria, et al.
Pubblicazione: (2024)
di: Manco, Ilaria, et al.
Pubblicazione: (2024)
PAT: Parameter-Free Audio-Text Aligner to Boost Zero-Shot Audio Classification
di: Seth, Ashish, et al.
Pubblicazione: (2024)
di: Seth, Ashish, et al.
Pubblicazione: (2024)
AV-RIR: Audio-Visual Room Impulse Response Estimation
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
di: Sakshi, S, et al.
Pubblicazione: (2024)
di: Sakshi, S, et al.
Pubblicazione: (2024)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
Rethinking Music Captioning with Music Metadata LLMs
di: Bukey, Irmak, et al.
Pubblicazione: (2026)
di: Bukey, Irmak, et al.
Pubblicazione: (2026)
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
di: Ghosh, Sreyan, et al.
Pubblicazione: (2025)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2025)
Do Audio-Language Models Understand Linguistic Variations?
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2024)
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2024)
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
A Generative-First Neural Audio Autoencoder
di: Casebeer, Jonah, et al.
Pubblicazione: (2026)
di: Casebeer, Jonah, et al.
Pubblicazione: (2026)
DMOSpeech: Direct Metric Optimization via Distilled Diffusion Model in Zero-Shot Speech Synthesis
di: Li, Yingahao Aaron, et al.
Pubblicazione: (2024)
di: Li, Yingahao Aaron, et al.
Pubblicazione: (2024)
Deep Audio Watermarks are Shallow: Limitations of Post-Hoc Watermarking Techniques for Speech
di: O'Reilly, Patrick, et al.
Pubblicazione: (2025)
di: O'Reilly, Patrick, et al.
Pubblicazione: (2025)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
di: Goel, Arushi, et al.
Pubblicazione: (2025)
di: Goel, Arushi, et al.
Pubblicazione: (2025)
The Rhythm In Anything: Audio-Prompted Drums Generation with Masked Language Modeling
di: O'Reilly, Patrick, et al.
Pubblicazione: (2025)
di: O'Reilly, Patrick, et al.
Pubblicazione: (2025)
EH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning
di: Seth, Ashish, et al.
Pubblicazione: (2024)
di: Seth, Ashish, et al.
Pubblicazione: (2024)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning
di: Yang, Chao-Han Huck, et al.
Pubblicazione: (2025)
di: Yang, Chao-Han Huck, et al.
Pubblicazione: (2025)
Do Audio-Visual Large Language Models Really See and Hear?
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2026)
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2026)
Enhance Temporal Relations in Audio Captioning with Sound Event Detection
di: Xie, Zeyu, et al.
Pubblicazione: (2023)
di: Xie, Zeyu, et al.
Pubblicazione: (2023)
On Class Separability Pitfalls In Audio-Text Contrastive Zero-Shot Learning
di: Tavares, Tiago, et al.
Pubblicazione: (2024)
di: Tavares, Tiago, et al.
Pubblicazione: (2024)
TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification
di: Anand, Nishit, et al.
Pubblicazione: (2024)
di: Anand, Nishit, et al.
Pubblicazione: (2024)
Discrete Audio Representations for Automated Audio Captioning
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions
di: Tian, Jinchuan, et al.
Pubblicazione: (2026)
di: Tian, Jinchuan, et al.
Pubblicazione: (2026)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation
di: Kumar, Sonal, et al.
Pubblicazione: (2024) -
AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing
di: Chen, William, et al.
Pubblicazione: (2026) -
Generative Audio Extension and Morphing
di: Seetharaman, Prem, et al.
Pubblicazione: (2026) -
PromptSep: Generative Audio Separation via Multimodal Prompting
di: Wen, Yutong, et al.
Pubblicazione: (2025) -
Audiocards: Structured Metadata Improves Audio Language Models For Sound Design
di: Sridhar, Sripathi, et al.
Pubblicazione: (2026)