Resource-Efficient Reference-Free Evaluation of Audio Captions
Fuente:
arXiv
Guardado en:
| Autores principales: | Mahfuz, Rehana, Guo, Yinyi, Visser, Erik |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Aligning Audio Captions with Human Preferences
por: Hegde, Kartik, et al.
Publicado: (2025)
por: Hegde, Kartik, et al.
Publicado: (2025)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
por: Yuan, Yi, et al.
Publicado: (2024)
por: Yuan, Yi, et al.
Publicado: (2024)
Efficient Video to Audio Mapper with Visual Scene Detection
por: Yi, Mingjing, et al.
Publicado: (2024)
por: Yi, Mingjing, et al.
Publicado: (2024)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts
por: Niu, Xinlei, et al.
Publicado: (2024)
por: Niu, Xinlei, et al.
Publicado: (2024)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
por: Liu, Qianhui, et al.
Publicado: (2024)
por: Liu, Qianhui, et al.
Publicado: (2024)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
por: Li, Xiaolou, et al.
Publicado: (2024)
por: Li, Xiaolou, et al.
Publicado: (2024)
Towards Generating Diverse Audio Captions via Adversarial Training
por: Mei, Xinhao, et al.
Publicado: (2022)
por: Mei, Xinhao, et al.
Publicado: (2022)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
por: Su, Yi, et al.
Publicado: (2025)
por: Su, Yi, et al.
Publicado: (2025)
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
por: Lei, Ke, et al.
Publicado: (2026)
por: Lei, Ke, et al.
Publicado: (2026)
LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport
por: Rho, Kyeongha, et al.
Publicado: (2025)
por: Rho, Kyeongha, et al.
Publicado: (2025)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
por: Huang, Zhiqi, et al.
Publicado: (2024)
por: Huang, Zhiqi, et al.
Publicado: (2024)
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
por: Sridhar, Arvind Krishna, et al.
Publicado: (2024)
por: Sridhar, Arvind Krishna, et al.
Publicado: (2024)
WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research
por: Mei, Xinhao, et al.
Publicado: (2023)
por: Mei, Xinhao, et al.
Publicado: (2023)
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
por: Guo, Hongming, et al.
Publicado: (2024)
por: Guo, Hongming, et al.
Publicado: (2024)
Building Audio-Visual Digital Twins with Smartphones
por: Lan, Zitong, et al.
Publicado: (2025)
por: Lan, Zitong, et al.
Publicado: (2025)
LoVA: Long-form Video-to-Audio Generation
por: Cheng, Xin, et al.
Publicado: (2024)
por: Cheng, Xin, et al.
Publicado: (2024)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
por: Shimada, Kazuki, et al.
Publicado: (2024)
por: Shimada, Kazuki, et al.
Publicado: (2024)
Trusted Fake Audio Detection Based on Dirichlet Distribution
por: Ding, Chi, et al.
Publicado: (2025)
por: Ding, Chi, et al.
Publicado: (2025)
Cinematic Audio Source Separation Using Visual Cues
por: Zhang, Kang, et al.
Publicado: (2026)
por: Zhang, Kang, et al.
Publicado: (2026)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
por: Zhang, Xiaohui, et al.
Publicado: (2024)
por: Zhang, Xiaohui, et al.
Publicado: (2024)
DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training
por: Liu, Shengqiang, et al.
Publicado: (2024)
por: Liu, Shengqiang, et al.
Publicado: (2024)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
por: Zhao, Jinzheng, et al.
Publicado: (2023)
por: Zhao, Jinzheng, et al.
Publicado: (2023)
Audio-Visual Speech Separation via Bottleneck Iterative Network
por: Zhang, Sidong, et al.
Publicado: (2025)
por: Zhang, Sidong, et al.
Publicado: (2025)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025)
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025)
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
por: Yu, Fan, et al.
Publicado: (2024)
por: Yu, Fan, et al.
Publicado: (2024)
Self-Attention and Hybrid Features for Replay and Deep-Fake Audio Detection
por: Huang, Lian, et al.
Publicado: (2024)
por: Huang, Lian, et al.
Publicado: (2024)
POLIPHONE: A Dataset for Smartphone Model Identification from Audio Recordings
por: Salvi, Davide, et al.
Publicado: (2024)
por: Salvi, Davide, et al.
Publicado: (2024)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
por: He, Mao-Kui, et al.
Publicado: (2024)
por: He, Mao-Kui, et al.
Publicado: (2024)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
por: Yao, Dong, et al.
Publicado: (2023)
por: Yao, Dong, et al.
Publicado: (2023)
StereoFoley: Object-Aware Stereo Audio Generation from Video
por: Karchkhadze, Tornike, et al.
Publicado: (2025)
por: Karchkhadze, Tornike, et al.
Publicado: (2025)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
por: Niu, Xinlei, et al.
Publicado: (2025)
por: Niu, Xinlei, et al.
Publicado: (2025)
CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation
por: Oh, Hyunwoo, et al.
Publicado: (2025)
por: Oh, Hyunwoo, et al.
Publicado: (2025)
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
por: Jiang, Yuxuan, et al.
Publicado: (2025)
por: Jiang, Yuxuan, et al.
Publicado: (2025)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
por: Ren, Yong, et al.
Publicado: (2024)
por: Ren, Yong, et al.
Publicado: (2024)
SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
por: Zhang, Liqian, et al.
Publicado: (2024)
por: Zhang, Liqian, et al.
Publicado: (2024)
Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model
por: Chen, Gehui, et al.
Publicado: (2024)
por: Chen, Gehui, et al.
Publicado: (2024)
RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models
por: Jin, Ruinan, et al.
Publicado: (2026)
por: Jin, Ruinan, et al.
Publicado: (2026)
V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation
por: Chan, Nolan, et al.
Publicado: (2026)
por: Chan, Nolan, et al.
Publicado: (2026)
FGAS: Fixed Decoder Network-Based Audio Steganography with Adversarial Perturbation Generation
por: Yan, Jialin, et al.
Publicado: (2025)
por: Yan, Jialin, et al.
Publicado: (2025)
Ejemplares similares
-
Aligning Audio Captions with Human Preferences
por: Hegde, Kartik, et al.
Publicado: (2025) -
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
por: Yuan, Yi, et al.
Publicado: (2024) -
Efficient Video to Audio Mapper with Visual Scene Detection
por: Yi, Mingjing, et al.
Publicado: (2024) -
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
por: Shi, Jiatong, et al.
Publicado: (2024) -
HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts
por: Niu, Xinlei, et al.
Publicado: (2024)