Scaling Audio-Visual Quality Assessment Dataset via Crowdsourcing
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Renyu, Jin, Jian, Meng, Lili, Liu, Meiqin, Wang, Yilin, Adsumilli, Balu, Lin, Weisi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
YouTube SFV+HDR Quality Dataset
di: Wang, Yilin, et al.
Pubblicazione: (2024)
di: Wang, Yilin, et al.
Pubblicazione: (2024)
Context and Pixel Aware Large Language Model for Video Quality Assessment
di: Wen, Wen, et al.
Pubblicazione: (2025)
di: Wen, Wen, et al.
Pubblicazione: (2025)
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
di: Lu, Yiting, et al.
Pubblicazione: (2025)
di: Lu, Yiting, et al.
Pubblicazione: (2025)
CHUG: Crowdsourced User-Generated HDR Video Quality Dataset
di: Saini, Shreshth, et al.
Pubblicazione: (2025)
di: Saini, Shreshth, et al.
Pubblicazione: (2025)
Dual-Branch Network for Portrait Image Quality Assessment
di: Sun, Wei, et al.
Pubblicazione: (2024)
di: Sun, Wei, et al.
Pubblicazione: (2024)
An Ensemble Approach to Short-form Video Quality Assessment Using Multimodal LLM
di: Wen, Wen, et al.
Pubblicazione: (2024)
di: Wen, Wen, et al.
Pubblicazione: (2024)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
di: Zhou, Jinxing, et al.
Pubblicazione: (2024)
di: Zhou, Jinxing, et al.
Pubblicazione: (2024)
DT-UFC: Universal Large Model Feature Coding via Peaky-to-Balanced Distribution Transformation
di: Gao, Changsheng, et al.
Pubblicazione: (2025)
di: Gao, Changsheng, et al.
Pubblicazione: (2025)
Decoupled Audio-Visual Dataset Distillation
di: Li, Wenyuan, et al.
Pubblicazione: (2025)
di: Li, Wenyuan, et al.
Pubblicazione: (2025)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
di: Guo, Xinyue, et al.
Pubblicazione: (2025)
di: Guo, Xinyue, et al.
Pubblicazione: (2025)
Audio-Visual Quality Assessment for User Generated Content: Database and Method
di: Cao, Yuqin, et al.
Pubblicazione: (2023)
di: Cao, Yuqin, et al.
Pubblicazione: (2023)
QD-PCQA: Quality-Aware Domain Adaptation for Point Cloud Quality Assessment
di: Zhang, Guohua, et al.
Pubblicazione: (2026)
di: Zhang, Guohua, et al.
Pubblicazione: (2026)
Towards Open-Vocabulary Audio-Visual Event Localization
di: Zhou, Jinxing, et al.
Pubblicazione: (2024)
di: Zhou, Jinxing, et al.
Pubblicazione: (2024)
Towards Generalizable Deepfake Detection via Forgery-aware Audio-Visual Adaptation: A Variational Bayesian Approach
di: Nie, Fan, et al.
Pubblicazione: (2025)
di: Nie, Fan, et al.
Pubblicazione: (2025)
G-Refine: A General Quality Refiner for Text-to-Image Generation
di: Li, Chunyi, et al.
Pubblicazione: (2024)
di: Li, Chunyi, et al.
Pubblicazione: (2024)
Scaling and Masking: A New Paradigm of Data Sampling for Image and Video Quality Assessment
di: Liu, Yongxu, et al.
Pubblicazione: (2024)
di: Liu, Yongxu, et al.
Pubblicazione: (2024)
TEn-CATG:Text-Enriched Audio-Visual Video Parsing with Multi-Scale Category-Aware Temporal Graph
di: Chen, Yaru, et al.
Pubblicazione: (2025)
di: Chen, Yaru, et al.
Pubblicazione: (2025)
FakeBench: Probing Explainable Fake Image Detection via Large Multimodal Models
di: Li, Yixuan, et al.
Pubblicazione: (2024)
di: Li, Yixuan, et al.
Pubblicazione: (2024)
SonoWorld: From One Image to a 3D Audio-Visual Scene
di: Jin, Derong, et al.
Pubblicazione: (2026)
di: Jin, Derong, et al.
Pubblicazione: (2026)
AIS 2024 Challenge on Video Quality Assessment of User-Generated Content: Methods and Results
di: Conde, Marcos V., et al.
Pubblicazione: (2024)
di: Conde, Marcos V., et al.
Pubblicazione: (2024)
MDS-VQA: Model-Informed Data Selection for Video Quality Assessment
di: Zou, Jian, et al.
Pubblicazione: (2026)
di: Zou, Jian, et al.
Pubblicazione: (2026)
SequencePAR: Understanding Pedestrian Attributes via A Sequence Generation Paradigm
di: Jin, Jiandong, et al.
Pubblicazione: (2023)
di: Jin, Jiandong, et al.
Pubblicazione: (2023)
Image Quality Assessment: From Human to Machine Preference
di: Li, Chunyi, et al.
Pubblicazione: (2025)
di: Li, Chunyi, et al.
Pubblicazione: (2025)
ESVQA: Perceptual Quality Assessment of Egocentric Spatial Videos
di: Zhu, Xilei, et al.
Pubblicazione: (2024)
di: Zhu, Xilei, et al.
Pubblicazione: (2024)
Unraveling Instance Associations: A Closer Look for Audio-Visual Segmentation
di: Chen, Yuanhong, et al.
Pubblicazione: (2023)
di: Chen, Yuanhong, et al.
Pubblicazione: (2023)
PAME: Self-Supervised Masked Autoencoder for No-Reference Point Cloud Quality Assessment
di: Shan, Ziyu, et al.
Pubblicazione: (2024)
di: Shan, Ziyu, et al.
Pubblicazione: (2024)
MSLIQA: Enhancing Learning Representations for Image Quality Assessment through Multi-Scale Learning
di: Avanaki, Nasim Jamshidi, et al.
Pubblicazione: (2024)
di: Avanaki, Nasim Jamshidi, et al.
Pubblicazione: (2024)
Multi-source Multimodal Progressive Domain Adaption for Audio-Visual Deception Detection
di: Lin, Ronghao, et al.
Pubblicazione: (2025)
di: Lin, Ronghao, et al.
Pubblicazione: (2025)
Perceptual Visual Quality Assessment: Principles, Methods, and Future Directions
di: Zhou, Wei, et al.
Pubblicazione: (2025)
di: Zhou, Wei, et al.
Pubblicazione: (2025)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024)
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
READ-Net: Clarifying Emotional Ambiguity via Adaptive Feature Recalibration for Audio-Visual Depression Detection
di: Chen, Chenglizhao, et al.
Pubblicazione: (2026)
di: Chen, Chenglizhao, et al.
Pubblicazione: (2026)
ESIQA: Perceptual Quality Assessment of Vision-Pro-based Egocentric Spatial Images
di: Zhu, Xilei, et al.
Pubblicazione: (2024)
di: Zhu, Xilei, et al.
Pubblicazione: (2024)
Noise-Tolerant Learning for Audio-Visual Action Recognition
di: Han, Haochen, et al.
Pubblicazione: (2022)
di: Han, Haochen, et al.
Pubblicazione: (2022)
Contrastive Pre-Training with Multi-View Fusion for No-Reference Point Cloud Quality Assessment
di: Shan, Ziyu, et al.
Pubblicazione: (2024)
di: Shan, Ziyu, et al.
Pubblicazione: (2024)
HarmonyIQA: Pioneering Benchmark and Model for Image Harmonization Quality Assessment
di: Xu, Zitong, et al.
Pubblicazione: (2025)
di: Xu, Zitong, et al.
Pubblicazione: (2025)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
di: Chen, Yaru, et al.
Pubblicazione: (2025)
di: Chen, Yaru, et al.
Pubblicazione: (2025)
TraveLLaMA: A Multimodal Travel Assistant with Large-Scale Dataset and Structured Reasoning
di: Chu, Meng, et al.
Pubblicazione: (2025)
di: Chu, Meng, et al.
Pubblicazione: (2025)
Exploring Rich Subjective Quality Information for Image Quality Assessment in the Wild
di: Min, Xiongkuo, et al.
Pubblicazione: (2024)
di: Min, Xiongkuo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
YouTube SFV+HDR Quality Dataset
di: Wang, Yilin, et al.
Pubblicazione: (2024) -
Context and Pixel Aware Large Language Model for Video Quality Assessment
di: Wen, Wen, et al.
Pubblicazione: (2025) -
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
di: Lu, Yiting, et al.
Pubblicazione: (2025) -
CHUG: Crowdsourced User-Generated HDR Video Quality Dataset
di: Saini, Shreshth, et al.
Pubblicazione: (2025) -
Dual-Branch Network for Portrait Image Quality Assessment
di: Sun, Wei, et al.
Pubblicazione: (2024)