AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
Fuente:
arXiv
Guardado en:
| Autores principales: | Kim, Jongsuk, Shin, Jiwon, Kim, Junmo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Improving Text-To-Audio Models with Synthetic Captions
por: Kong, Zhifeng, et al.
Publicado: (2024)
por: Kong, Zhifeng, et al.
Publicado: (2024)
Utilizing Neural Transducers for Two-Stage Text-to-Speech via Semantic Token Prediction
por: Kim, Minchan, et al.
Publicado: (2024)
por: Kim, Minchan, et al.
Publicado: (2024)
FxSearcher: gradient-free text-driven audio transformation
por: Ki, Hojoon, et al.
Publicado: (2025)
por: Ki, Hojoon, et al.
Publicado: (2025)
ETTA: Elucidating the Design Space of Text-to-Audio Models
por: Lee, Sang-gil, et al.
Publicado: (2024)
por: Lee, Sang-gil, et al.
Publicado: (2024)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
por: Takeuchi, Daiki, et al.
Publicado: (2025)
por: Takeuchi, Daiki, et al.
Publicado: (2025)
Exploring Fine-Tuning of Large Audio Language Models for Spoken Language Understanding under Limited Speech Data
por: Choi, Youngwon, et al.
Publicado: (2025)
por: Choi, Youngwon, et al.
Publicado: (2025)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
por: Ghosh, Sreyan, et al.
Publicado: (2025)
por: Ghosh, Sreyan, et al.
Publicado: (2025)
CLAIR-A: Leveraging Large Language Models to Judge Audio Captions
por: Wu, Tsung-Han, et al.
Publicado: (2024)
por: Wu, Tsung-Han, et al.
Publicado: (2024)
ELF: Encoding Speaker-Specific Latent Speech Feature for Speech Synthesis
por: Kong, Jungil, et al.
Publicado: (2023)
por: Kong, Jungil, et al.
Publicado: (2023)
LibriTTS-P: A Corpus with Speaking Style and Speaker Identity Prompts for Text-to-Speech and Style Captioning
por: Kawamura, Masaya, et al.
Publicado: (2024)
por: Kawamura, Masaya, et al.
Publicado: (2024)
Aligning Audio Captions with Human Preferences
por: Hegde, Kartik, et al.
Publicado: (2025)
por: Hegde, Kartik, et al.
Publicado: (2025)
Guiding Frame-Level CTC Alignments Using Self-knowledge Distillation
por: Kim, Eungbeom, et al.
Publicado: (2024)
por: Kim, Eungbeom, et al.
Publicado: (2024)
Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
por: Primus, Paul, et al.
Publicado: (2024)
por: Primus, Paul, et al.
Publicado: (2024)
CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries
por: Munakata, Hokuto, et al.
Publicado: (2025)
por: Munakata, Hokuto, et al.
Publicado: (2025)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
por: Liu, Jizhong, et al.
Publicado: (2024)
por: Liu, Jizhong, et al.
Publicado: (2024)
Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens
por: Manakul, Potsawee, et al.
Publicado: (2026)
por: Manakul, Potsawee, et al.
Publicado: (2026)
PAST: Phonetic-Acoustic Speech Tokenizer
por: Har-Tuv, Nadav, et al.
Publicado: (2025)
por: Har-Tuv, Nadav, et al.
Publicado: (2025)
T-CLAP: Temporal-Enhanced Contrastive Language-Audio Pretraining
por: Yuan, Yi, et al.
Publicado: (2024)
por: Yuan, Yi, et al.
Publicado: (2024)
Cascaded Cross-Modal Transformer for Audio-Textual Classification
por: Ristea, Nicolae-Catalin, et al.
Publicado: (2024)
por: Ristea, Nicolae-Catalin, et al.
Publicado: (2024)
Audio-to-Score Conversion Model Based on Whisper methodology
por: Zhang, Hongyao, et al.
Publicado: (2024)
por: Zhang, Hongyao, et al.
Publicado: (2024)
Token-Weighted RNN-T for Learning from Flawed Data
por: Keren, Gil, et al.
Publicado: (2024)
por: Keren, Gil, et al.
Publicado: (2024)
tinyCLAP: Distilling Constrastive Language-Audio Pretrained Models
por: Paissan, Francesco, et al.
Publicado: (2023)
por: Paissan, Francesco, et al.
Publicado: (2023)
Multiple-Instance, Cascaded Classification for Keyword Spotting in Narrow-Band Audio
por: AbdulKader, Ahmad, et al.
Publicado: (2017)
por: AbdulKader, Ahmad, et al.
Publicado: (2017)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension
por: Yang, Qian, et al.
Publicado: (2024)
por: Yang, Qian, et al.
Publicado: (2024)
DC-Spin: A Speaker-invariant Speech Tokenizer for Spoken Language Models
por: Chang, Heng-Jui, et al.
Publicado: (2024)
por: Chang, Heng-Jui, et al.
Publicado: (2024)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
por: Dixit, Satvik, et al.
Publicado: (2024)
por: Dixit, Satvik, et al.
Publicado: (2024)
Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
Remastering Divide and Remaster: A Cinematic Audio Source Separation Dataset with Multilingual Support
por: Watcharasupat, Karn N., et al.
Publicado: (2024)
por: Watcharasupat, Karn N., et al.
Publicado: (2024)
Lightweight Audio Segmentation for Long-form Speech Translation
por: Lee, Jaesong, et al.
Publicado: (2024)
por: Lee, Jaesong, et al.
Publicado: (2024)
TTSDS -- Text-to-Speech Distribution Score
por: Minixhofer, Christoph, et al.
Publicado: (2024)
por: Minixhofer, Christoph, et al.
Publicado: (2024)
RUMAA: Repeat-Aware Unified Music Audio Analysis for Score-Performance Alignment, Transcription, and Mistake Detection
por: Chang, Sungkyun, et al.
Publicado: (2025)
por: Chang, Sungkyun, et al.
Publicado: (2025)
AlignAtt: Using Attention-based Audio-Translation Alignments as a Guide for Simultaneous Speech Translation
por: Papi, Sara, et al.
Publicado: (2023)
por: Papi, Sara, et al.
Publicado: (2023)
Coupling Speech Encoders with Downstream Text Models
por: Chelba, Ciprian, et al.
Publicado: (2024)
por: Chelba, Ciprian, et al.
Publicado: (2024)
Text to Speech System for Meitei Mayek Script
por: Irengbam, Gangular Singh, et al.
Publicado: (2025)
por: Irengbam, Gangular Singh, et al.
Publicado: (2025)
Enhancing Code-Switching ASR Leveraging Non-Peaky CTC Loss and Deep Language Posterior Injection
por: Yang, Tzu-Ting, et al.
Publicado: (2024)
por: Yang, Tzu-Ting, et al.
Publicado: (2024)
Disentangling Textual and Acoustic Features of Neural Speech Representations
por: Mohebbi, Hosein, et al.
Publicado: (2024)
por: Mohebbi, Hosein, et al.
Publicado: (2024)
Regularizing Learnable Feature Extraction for Automatic Speech Recognition
por: Vieting, Peter, et al.
Publicado: (2025)
por: Vieting, Peter, et al.
Publicado: (2025)
Lightweight Zero-shot Text-to-Speech with Mixture of Adapters
por: Fujita, Kenichi, et al.
Publicado: (2024)
por: Fujita, Kenichi, et al.
Publicado: (2024)
Style Mixture of Experts for Expressive Text-To-Speech Synthesis
por: Jawaid, Ahad, et al.
Publicado: (2024)
por: Jawaid, Ahad, et al.
Publicado: (2024)
Ejemplares similares
-
Improving Text-To-Audio Models with Synthetic Captions
por: Kong, Zhifeng, et al.
Publicado: (2024) -
Utilizing Neural Transducers for Two-Stage Text-to-Speech via Semantic Token Prediction
por: Kim, Minchan, et al.
Publicado: (2024) -
FxSearcher: gradient-free text-driven audio transformation
por: Ki, Hojoon, et al.
Publicado: (2025) -
ETTA: Elucidating the Design Space of Text-to-Audio Models
por: Lee, Sang-gil, et al.
Publicado: (2024) -
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
por: Takeuchi, Daiki, et al.
Publicado: (2025)