On the Audio Hallucinations in Large Audio-Video Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Nishimura, Taichi, Nakada, Shota, Kondo, Masayoshi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information
por: Nakada, Shota, et al.
Publicado: (2024)
por: Nakada, Shota, et al.
Publicado: (2024)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
por: Yang, Qi, et al.
Publicado: (2024)
por: Yang, Qi, et al.
Publicado: (2024)
Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling
por: Ye, Zhen, et al.
Publicado: (2026)
por: Ye, Zhen, et al.
Publicado: (2026)
Language-based Audio Moment Retrieval
por: Munakata, Hokuto, et al.
Publicado: (2024)
por: Munakata, Hokuto, et al.
Publicado: (2024)
Diffusion Models as Masked Audio-Video Learners
por: Nunez, Elvis, et al.
Publicado: (2023)
por: Nunez, Elvis, et al.
Publicado: (2023)
Large Language Models are Strong Audio-Visual Speech Recognition Learners
por: Cappellazzo, Umberto, et al.
Publicado: (2024)
por: Cappellazzo, Umberto, et al.
Publicado: (2024)
Aligned Better, Listen Better for Audio-Visual Large Language Models
por: Guo, Yuxin, et al.
Publicado: (2025)
por: Guo, Yuxin, et al.
Publicado: (2025)
Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation
por: Tan, Weiting, et al.
Publicado: (2025)
por: Tan, Weiting, et al.
Publicado: (2025)
Video-to-Audio Generation with Hidden Alignment
por: Xu, Manjie, et al.
Publicado: (2024)
por: Xu, Manjie, et al.
Publicado: (2024)
Temporally Aligned Audio for Video with Autoregression
por: Viertola, Ilpo, et al.
Publicado: (2024)
por: Viertola, Ilpo, et al.
Publicado: (2024)
Taming Data and Transformers for Audio Generation
por: Haji-Ali, Moayed, et al.
Publicado: (2024)
por: Haji-Ali, Moayed, et al.
Publicado: (2024)
Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper
por: Chen, Gehui, et al.
Publicado: (2025)
por: Chen, Gehui, et al.
Publicado: (2025)
Bridging Ears and Eyes: Analyzing Audio and Visual Large Language Models to Humans in Visible Sound Recognition and Reducing Their Sensory Gap via Cross-Modal Distillation
por: Jiang, Xilin, et al.
Publicado: (2025)
por: Jiang, Xilin, et al.
Publicado: (2025)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
por: Wang, Le, et al.
Publicado: (2025)
por: Wang, Le, et al.
Publicado: (2025)
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
por: Liu, Che, et al.
Publicado: (2025)
por: Liu, Che, et al.
Publicado: (2025)
Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning
por: Sun, Luoyi, et al.
Publicado: (2023)
por: Sun, Luoyi, et al.
Publicado: (2023)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
por: Rai, Aashish, et al.
Publicado: (2024)
por: Rai, Aashish, et al.
Publicado: (2024)
AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection
por: Oorloff, Trevine, et al.
Publicado: (2024)
por: Oorloff, Trevine, et al.
Publicado: (2024)
Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation
por: Goncalves, Lucas, et al.
Publicado: (2024)
por: Goncalves, Lucas, et al.
Publicado: (2024)
Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching
por: Wang, Yongqi, et al.
Publicado: (2024)
por: Wang, Yongqi, et al.
Publicado: (2024)
VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation
por: Kushwaha, Saksham Singh, et al.
Publicado: (2024)
por: Kushwaha, Saksham Singh, et al.
Publicado: (2024)
Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
por: Low, Chetwin, et al.
Publicado: (2025)
por: Low, Chetwin, et al.
Publicado: (2025)
Audio-Assisted Face Video Restoration with Temporal and Identity Complementary Learning
por: Cao, Yuqin, et al.
Publicado: (2025)
por: Cao, Yuqin, et al.
Publicado: (2025)
VAInpaint: Zero-Shot Video-Audio inpainting framework with LLMs-driven Module
por: Wu, Kam Man, et al.
Publicado: (2025)
por: Wu, Kam Man, et al.
Publicado: (2025)
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
por: Cao, Yuqin, et al.
Publicado: (2025)
por: Cao, Yuqin, et al.
Publicado: (2025)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
por: Ma, Ziyang, et al.
Publicado: (2025)
por: Ma, Ziyang, et al.
Publicado: (2025)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
por: Geng, Tiantian, et al.
Publicado: (2024)
por: Geng, Tiantian, et al.
Publicado: (2024)
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
Weakly-supervised Audio Temporal Forgery Localization via Progressive Audio-language Co-learning Network
por: Wu, Junyan, et al.
Publicado: (2025)
por: Wu, Junyan, et al.
Publicado: (2025)
Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control
por: Li, Bingliang, et al.
Publicado: (2024)
por: Li, Bingliang, et al.
Publicado: (2024)
3D Audio-Visual Segmentation
por: Sokolov, Artem, et al.
Publicado: (2024)
por: Sokolov, Artem, et al.
Publicado: (2024)
Statistics-aware Audio-visual Deepfake Detector
por: Astrid, Marcella, et al.
Publicado: (2024)
por: Astrid, Marcella, et al.
Publicado: (2024)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
por: Du, Jiarong, et al.
Publicado: (2025)
por: Du, Jiarong, et al.
Publicado: (2025)
Resurfacing Paralinguistic Awareness in Large Audio Language Models
por: Yang, Hao, et al.
Publicado: (2026)
por: Yang, Hao, et al.
Publicado: (2026)
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
por: Wang, Junyu, et al.
Publicado: (2025)
por: Wang, Junyu, et al.
Publicado: (2025)
Benchmarking Cross-Domain Audio-Visual Deception Detection
por: Guo, Xiaobao, et al.
Publicado: (2024)
por: Guo, Xiaobao, et al.
Publicado: (2024)
Detecting Audio-Visual Deepfakes with Fine-Grained Inconsistencies
por: Astrid, Marcella, et al.
Publicado: (2024)
por: Astrid, Marcella, et al.
Publicado: (2024)
Audio-Vision Contrastive Learning for Phonological Class Recognition
por: Liu, Daiqi, et al.
Publicado: (2025)
por: Liu, Daiqi, et al.
Publicado: (2025)
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
por: Xu, Le, et al.
Publicado: (2025)
por: Xu, Le, et al.
Publicado: (2025)
Contrastive Conditional Latent Diffusion for Audio-visual Segmentation
por: Mao, Yuxin, et al.
Publicado: (2023)
por: Mao, Yuxin, et al.
Publicado: (2023)
Ejemplares similares
-
DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information
por: Nakada, Shota, et al.
Publicado: (2024) -
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
por: Yang, Qi, et al.
Publicado: (2024) -
Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling
por: Ye, Zhen, et al.
Publicado: (2026) -
Language-based Audio Moment Retrieval
por: Munakata, Hokuto, et al.
Publicado: (2024) -
Diffusion Models as Masked Audio-Video Learners
por: Nunez, Elvis, et al.
Publicado: (2023)