Engagement Prediction of Short Videos with Large Multimodal Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sun, Wei, Cao, Linhan, Cao, Yuqin, Zhang, Weixia, Wen, Wen, Zhang, Kaiwei, Chen, Zijian, Lu, Fangfang, Min, Xiongkuo, Zhai, Guangtao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Assessing UHD Image Quality from Aesthetics, Distortions, and Saliency
von: Sun, Wei, et al.
Veröffentlicht: (2024)
von: Sun, Wei, et al.
Veröffentlicht: (2024)
VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning
von: Cao, Linhan, et al.
Veröffentlicht: (2025)
von: Cao, Linhan, et al.
Veröffentlicht: (2025)
QualiRAG: Retrieval-Augmented Generation for Visual Quality Understanding
von: Cao, Linhan, et al.
Veröffentlicht: (2026)
von: Cao, Linhan, et al.
Veröffentlicht: (2026)
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
von: Cao, Yuqin, et al.
Veröffentlicht: (2025)
von: Cao, Yuqin, et al.
Veröffentlicht: (2025)
KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?
von: Wang, Xianfeng, et al.
Veröffentlicht: (2026)
von: Wang, Xianfeng, et al.
Veröffentlicht: (2026)
Efficient Face Image Quality Assessment via Self-training and Knowledge Distillation
von: Sun, Wei, et al.
Veröffentlicht: (2025)
von: Sun, Wei, et al.
Veröffentlicht: (2025)
Mesh Mamba: A Unified State Space Model for Saliency Prediction in Non-Textured and Textured Meshes
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2025)
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2025)
Generalizable Video Quality Assessment via Weak-to-Strong Learning
von: Cao, Linhan, et al.
Veröffentlicht: (2025)
von: Cao, Linhan, et al.
Veröffentlicht: (2025)
Audio-Visual Quality Assessment for User Generated Content: Database and Method
von: Cao, Yuqin, et al.
Veröffentlicht: (2023)
von: Cao, Yuqin, et al.
Veröffentlicht: (2023)
Enhancing Blind Video Quality Assessment with Rich Quality-aware Features
von: Sun, Wei, et al.
Veröffentlicht: (2024)
von: Sun, Wei, et al.
Veröffentlicht: (2024)
Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy
von: Sun, Yinan, et al.
Veröffentlicht: (2025)
von: Sun, Yinan, et al.
Veröffentlicht: (2025)
VQualA 2025 Challenge on Engagement Prediction for Short Videos: Methods and Results
von: Li, Dasong, et al.
Veröffentlicht: (2025)
von: Li, Dasong, et al.
Veröffentlicht: (2025)
Textured Mesh Saliency: Bridging Geometry and Texture for Human Perception in 3D Graphics
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2024)
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2024)
Exploring Rich Subjective Quality Information for Image Quality Assessment in the Wild
von: Min, Xiongkuo, et al.
Veröffentlicht: (2024)
von: Min, Xiongkuo, et al.
Veröffentlicht: (2024)
Analysis of Video Quality Datasets via Design of Minimalistic Video Quality Models
von: Sun, Wei, et al.
Veröffentlicht: (2023)
von: Sun, Wei, et al.
Veröffentlicht: (2023)
CompressedVQA-HDR: Generalized Full-reference and No-reference Quality Assessment Models for Compressed High Dynamic Range Videos
von: Sun, Wei, et al.
Veröffentlicht: (2025)
von: Sun, Wei, et al.
Veröffentlicht: (2025)
AIGIQA-20K: A Large Database for AI-Generated Image Quality Assessment
von: Li, Chunyi, et al.
Veröffentlicht: (2024)
von: Li, Chunyi, et al.
Veröffentlicht: (2024)
LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models
von: Ge, Qihang, et al.
Veröffentlicht: (2024)
von: Ge, Qihang, et al.
Veröffentlicht: (2024)
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
von: Li, Yunhao, et al.
Veröffentlicht: (2026)
von: Li, Yunhao, et al.
Veröffentlicht: (2026)
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
von: Jia, Ziheng, et al.
Veröffentlicht: (2025)
von: Jia, Ziheng, et al.
Veröffentlicht: (2025)
How Does Audio Influence Visual Attention in Omnidirectional Videos? Database and Model
von: Zhu, Yuxin, et al.
Veröffentlicht: (2024)
von: Zhu, Yuxin, et al.
Veröffentlicht: (2024)
How is Visual Attention Influenced by Text Guidance? Database and Model
von: Sun, Yinan, et al.
Veröffentlicht: (2024)
von: Sun, Yinan, et al.
Veröffentlicht: (2024)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
von: Zhang, Yiming, et al.
Veröffentlicht: (2025)
von: Zhang, Yiming, et al.
Veröffentlicht: (2025)
SG-JND: Semantic-Guided Just Noticeable Distortion Predictor For Image Compression
von: Cao, Linhan, et al.
Veröffentlicht: (2024)
von: Cao, Linhan, et al.
Veröffentlicht: (2024)
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
von: Zhang, Zeyu, et al.
Veröffentlicht: (2025)
von: Zhang, Zeyu, et al.
Veröffentlicht: (2025)
Audio-Assisted Face Video Restoration with Temporal and Identity Complementary Learning
von: Cao, Yuqin, et al.
Veröffentlicht: (2025)
von: Cao, Yuqin, et al.
Veröffentlicht: (2025)
Perceptual Video Quality Assessment: A Survey
von: Min, Xiongkuo, et al.
Veröffentlicht: (2024)
von: Min, Xiongkuo, et al.
Veröffentlicht: (2024)
Task-Specific Normalization for Continual Learning of Blind Image Quality Models
von: Zhang, Weixia, et al.
Veröffentlicht: (2021)
von: Zhang, Weixia, et al.
Veröffentlicht: (2021)
GAIA: Rethinking Action Quality Assessment for AI-Generated Videos
von: Chen, Zijian, et al.
Veröffentlicht: (2024)
von: Chen, Zijian, et al.
Veröffentlicht: (2024)
Large Multi-modality Model Assisted AI-Generated Image Quality Assessment
von: Wang, Puyi, et al.
Veröffentlicht: (2024)
von: Wang, Puyi, et al.
Veröffentlicht: (2024)
Just Noticeable Difference for Large Multimodal Models
von: Chen, Zijian, et al.
Veröffentlicht: (2025)
von: Chen, Zijian, et al.
Veröffentlicht: (2025)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
von: Wu, Sijing, et al.
Veröffentlicht: (2026)
von: Wu, Sijing, et al.
Veröffentlicht: (2026)
Benchmarking Multi-dimensional AIGC Video Quality Assessment: A Dataset and Unified Model
von: Zhang, Zhichao, et al.
Veröffentlicht: (2024)
von: Zhang, Zhichao, et al.
Veröffentlicht: (2024)
Exploring Image Quality Assessment from a New Perspective: Pupil Size
von: Gao, Yixuan, et al.
Veröffentlicht: (2025)
von: Gao, Yixuan, et al.
Veröffentlicht: (2025)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
von: Zhang, Zicheng, et al.
Veröffentlicht: (2024)
AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM
von: Wang, Jiarui, et al.
Veröffentlicht: (2024)
von: Wang, Jiarui, et al.
Veröffentlicht: (2024)
TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs
von: Wang, Juntong, et al.
Veröffentlicht: (2025)
von: Wang, Juntong, et al.
Veröffentlicht: (2025)
R-Bench: Are your Large Multimodal Model Robust to Real-world Corruptions?
von: Li, Chunyi, et al.
Veröffentlicht: (2024)
von: Li, Chunyi, et al.
Veröffentlicht: (2024)
VQualA 2025 Challenge on Visual Quality Comparison for Large Multimodal Models: Methods and Results
von: Zhu, Hanwei, et al.
Veröffentlicht: (2025)
von: Zhu, Hanwei, et al.
Veröffentlicht: (2025)
DLADiff: A Dual-Layer Defense Framework against Fine-Tuning and Zero-Shot Customization of Diffusion Models
von: Jia, Jun, et al.
Veröffentlicht: (2025)
von: Jia, Jun, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Assessing UHD Image Quality from Aesthetics, Distortions, and Saliency
von: Sun, Wei, et al.
Veröffentlicht: (2024) -
VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning
von: Cao, Linhan, et al.
Veröffentlicht: (2025) -
QualiRAG: Retrieval-Augmented Generation for Visual Quality Understanding
von: Cao, Linhan, et al.
Veröffentlicht: (2026) -
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
von: Cao, Yuqin, et al.
Veröffentlicht: (2025) -
KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?
von: Wang, Xianfeng, et al.
Veröffentlicht: (2026)