UNQA: Unified No-Reference Quality Assessment for Audio, Image, Video, and Audio-Visual Content
Fuente:
arXiv
Guardado en:
| Autores principales: | Cao, Yuqin, Min, Xiongkuo, Gao, Yixuan, Sun, Wei, Lin, Weisi, Zhai, Guangtao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
por: Cao, Yuqin, et al.
Publicado: (2025)
por: Cao, Yuqin, et al.
Publicado: (2025)
CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing
por: Yue, Xianghu, et al.
Publicado: (2024)
por: Yue, Xianghu, et al.
Publicado: (2024)
Audio-Visual Speaker Diarization: Current Databases, Approaches and Challenges
por: Mingote, Victoria, et al.
Publicado: (2024)
por: Mingote, Victoria, et al.
Publicado: (2024)
Beyond Correlation: Evaluating Multimedia Quality Models with the Constrained Concordance Index
por: Ragano, Alessandro, et al.
Publicado: (2024)
por: Ragano, Alessandro, et al.
Publicado: (2024)
Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
por: Salaj, Ina, et al.
Publicado: (2025)
por: Salaj, Ina, et al.
Publicado: (2025)
Audio-Assisted Face Video Restoration with Temporal and Identity Complementary Learning
por: Cao, Yuqin, et al.
Publicado: (2025)
por: Cao, Yuqin, et al.
Publicado: (2025)
Audio-Visual Quality Assessment for User Generated Content: Database and Method
por: Cao, Yuqin, et al.
Publicado: (2023)
por: Cao, Yuqin, et al.
Publicado: (2023)
Out-Of-Distribution Detection for Audio-visual Generalized Zero-Shot Learning: A General Framework
por: Wen, Liuyuan
Publicado: (2024)
por: Wen, Liuyuan
Publicado: (2024)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
por: Huang, Zhiqi, et al.
Publicado: (2024)
por: Huang, Zhiqi, et al.
Publicado: (2024)
A multi-modal approach for identifying schizophrenia using cross-modal attention
por: Premananth, Gowtham, et al.
Publicado: (2023)
por: Premananth, Gowtham, et al.
Publicado: (2023)
Efficient Video to Audio Mapper with Visual Scene Detection
por: Yi, Mingjing, et al.
Publicado: (2024)
por: Yi, Mingjing, et al.
Publicado: (2024)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
por: Li, Xiaolou, et al.
Publicado: (2024)
por: Li, Xiaolou, et al.
Publicado: (2024)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
por: He, Mao-Kui, et al.
Publicado: (2024)
por: He, Mao-Kui, et al.
Publicado: (2024)
SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
por: Zhang, Liqian, et al.
Publicado: (2024)
por: Zhang, Liqian, et al.
Publicado: (2024)
Resource-Efficient Reference-Free Evaluation of Audio Captions
por: Mahfuz, Rehana, et al.
Publicado: (2024)
por: Mahfuz, Rehana, et al.
Publicado: (2024)
Building Audio-Visual Digital Twins with Smartphones
por: Lan, Zitong, et al.
Publicado: (2025)
por: Lan, Zitong, et al.
Publicado: (2025)
Efficient Face Detection with Audio-Based Region Proposals for Human-Robot Interactions
por: Aris, William, et al.
Publicado: (2023)
por: Aris, William, et al.
Publicado: (2023)
LoVA: Long-form Video-to-Audio Generation
por: Cheng, Xin, et al.
Publicado: (2024)
por: Cheng, Xin, et al.
Publicado: (2024)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
por: Shimada, Kazuki, et al.
Publicado: (2024)
por: Shimada, Kazuki, et al.
Publicado: (2024)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
por: Niu, Xinlei, et al.
Publicado: (2025)
por: Niu, Xinlei, et al.
Publicado: (2025)
Cinematic Audio Source Separation Using Visual Cues
por: Zhang, Kang, et al.
Publicado: (2026)
por: Zhang, Kang, et al.
Publicado: (2026)
Video Soundtrack Generation by Aligning Emotions and Temporal Boundaries
por: Sulun, Serkan, et al.
Publicado: (2025)
por: Sulun, Serkan, et al.
Publicado: (2025)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
por: Zhao, Jinzheng, et al.
Publicado: (2023)
por: Zhao, Jinzheng, et al.
Publicado: (2023)
Audio-Visual Speech Separation via Bottleneck Iterative Network
por: Zhang, Sidong, et al.
Publicado: (2025)
por: Zhang, Sidong, et al.
Publicado: (2025)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
por: Yuan, Yi, et al.
Publicado: (2024)
por: Yuan, Yi, et al.
Publicado: (2024)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025)
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025)
AKVSR: Audio Knowledge Empowered Visual Speech Recognition by Compressing Audio Knowledge of a Pretrained Model
por: Yeo, Jeong Hun, et al.
Publicado: (2023)
por: Yeo, Jeong Hun, et al.
Publicado: (2023)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
por: Su, Yi, et al.
Publicado: (2025)
por: Su, Yi, et al.
Publicado: (2025)
StereoFoley: Object-Aware Stereo Audio Generation from Video
por: Karchkhadze, Tornike, et al.
Publicado: (2025)
por: Karchkhadze, Tornike, et al.
Publicado: (2025)
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
por: Yu, Fan, et al.
Publicado: (2024)
por: Yu, Fan, et al.
Publicado: (2024)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
por: Liu, Qianhui, et al.
Publicado: (2024)
por: Liu, Qianhui, et al.
Publicado: (2024)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
por: Pan, Tianrui, et al.
Publicado: (2024)
por: Pan, Tianrui, et al.
Publicado: (2024)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
por: Ren, Yong, et al.
Publicado: (2024)
por: Ren, Yong, et al.
Publicado: (2024)
V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation
por: Chan, Nolan, et al.
Publicado: (2026)
por: Chan, Nolan, et al.
Publicado: (2026)
Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model
por: Chen, Gehui, et al.
Publicado: (2024)
por: Chen, Gehui, et al.
Publicado: (2024)
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
por: Kwak, Doyeop, et al.
Publicado: (2026)
por: Kwak, Doyeop, et al.
Publicado: (2026)
SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text
por: Liu, Haohe, et al.
Publicado: (2024)
por: Liu, Haohe, et al.
Publicado: (2024)
ecVoice: Audio Text Extraction and Optimization of Video Based on Idioms Similarity Replacement
por: Lin, Jinwei
Publicado: (2024)
por: Lin, Jinwei
Publicado: (2024)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
por: Tian, Wenjie, et al.
Publicado: (2025)
por: Tian, Wenjie, et al.
Publicado: (2025)
DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training
por: Liu, Shengqiang, et al.
Publicado: (2024)
por: Liu, Shengqiang, et al.
Publicado: (2024)
Ejemplares similares
-
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
por: Cao, Yuqin, et al.
Publicado: (2025) -
CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing
por: Yue, Xianghu, et al.
Publicado: (2024) -
Audio-Visual Speaker Diarization: Current Databases, Approaches and Challenges
por: Mingote, Victoria, et al.
Publicado: (2024) -
Beyond Correlation: Evaluating Multimedia Quality Models with the Constrained Concordance Index
por: Ragano, Alessandro, et al.
Publicado: (2024) -
Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
por: Salaj, Ina, et al.
Publicado: (2025)