Engagement Prediction of Short Videos with Large Multimodal Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Wei, Cao, Linhan, Cao, Yuqin, Zhang, Weixia, Wen, Wen, Zhang, Kaiwei, Chen, Zijian, Lu, Fangfang, Min, Xiongkuo, Zhai, Guangtao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Assessing UHD Image Quality from Aesthetics, Distortions, and Saliency
por: Sun, Wei, et al.
Publicado: (2024)
por: Sun, Wei, et al.
Publicado: (2024)
VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning
por: Cao, Linhan, et al.
Publicado: (2025)
por: Cao, Linhan, et al.
Publicado: (2025)
QualiRAG: Retrieval-Augmented Generation for Visual Quality Understanding
por: Cao, Linhan, et al.
Publicado: (2026)
por: Cao, Linhan, et al.
Publicado: (2026)
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
por: Cao, Yuqin, et al.
Publicado: (2025)
por: Cao, Yuqin, et al.
Publicado: (2025)
KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?
por: Wang, Xianfeng, et al.
Publicado: (2026)
por: Wang, Xianfeng, et al.
Publicado: (2026)
Efficient Face Image Quality Assessment via Self-training and Knowledge Distillation
por: Sun, Wei, et al.
Publicado: (2025)
por: Sun, Wei, et al.
Publicado: (2025)
Mesh Mamba: A Unified State Space Model for Saliency Prediction in Non-Textured and Textured Meshes
por: Zhang, Kaiwei, et al.
Publicado: (2025)
por: Zhang, Kaiwei, et al.
Publicado: (2025)
Generalizable Video Quality Assessment via Weak-to-Strong Learning
por: Cao, Linhan, et al.
Publicado: (2025)
por: Cao, Linhan, et al.
Publicado: (2025)
Audio-Visual Quality Assessment for User Generated Content: Database and Method
por: Cao, Yuqin, et al.
Publicado: (2023)
por: Cao, Yuqin, et al.
Publicado: (2023)
Enhancing Blind Video Quality Assessment with Rich Quality-aware Features
por: Sun, Wei, et al.
Publicado: (2024)
por: Sun, Wei, et al.
Publicado: (2024)
Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy
por: Sun, Yinan, et al.
Publicado: (2025)
por: Sun, Yinan, et al.
Publicado: (2025)
VQualA 2025 Challenge on Engagement Prediction for Short Videos: Methods and Results
por: Li, Dasong, et al.
Publicado: (2025)
por: Li, Dasong, et al.
Publicado: (2025)
Textured Mesh Saliency: Bridging Geometry and Texture for Human Perception in 3D Graphics
por: Zhang, Kaiwei, et al.
Publicado: (2024)
por: Zhang, Kaiwei, et al.
Publicado: (2024)
Exploring Rich Subjective Quality Information for Image Quality Assessment in the Wild
por: Min, Xiongkuo, et al.
Publicado: (2024)
por: Min, Xiongkuo, et al.
Publicado: (2024)
Analysis of Video Quality Datasets via Design of Minimalistic Video Quality Models
por: Sun, Wei, et al.
Publicado: (2023)
por: Sun, Wei, et al.
Publicado: (2023)
CompressedVQA-HDR: Generalized Full-reference and No-reference Quality Assessment Models for Compressed High Dynamic Range Videos
por: Sun, Wei, et al.
Publicado: (2025)
por: Sun, Wei, et al.
Publicado: (2025)
AIGIQA-20K: A Large Database for AI-Generated Image Quality Assessment
por: Li, Chunyi, et al.
Publicado: (2024)
por: Li, Chunyi, et al.
Publicado: (2024)
LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models
por: Ge, Qihang, et al.
Publicado: (2024)
por: Ge, Qihang, et al.
Publicado: (2024)
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
por: Li, Yunhao, et al.
Publicado: (2026)
por: Li, Yunhao, et al.
Publicado: (2026)
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
por: Jia, Ziheng, et al.
Publicado: (2025)
por: Jia, Ziheng, et al.
Publicado: (2025)
How Does Audio Influence Visual Attention in Omnidirectional Videos? Database and Model
por: Zhu, Yuxin, et al.
Publicado: (2024)
por: Zhu, Yuxin, et al.
Publicado: (2024)
How is Visual Attention Influenced by Text Guidance? Database and Model
por: Sun, Yinan, et al.
Publicado: (2024)
por: Sun, Yinan, et al.
Publicado: (2024)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
por: Zhang, Yiming, et al.
Publicado: (2025)
por: Zhang, Yiming, et al.
Publicado: (2025)
SG-JND: Semantic-Guided Just Noticeable Distortion Predictor For Image Compression
por: Cao, Linhan, et al.
Publicado: (2024)
por: Cao, Linhan, et al.
Publicado: (2024)
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
por: Zhang, Zeyu, et al.
Publicado: (2025)
por: Zhang, Zeyu, et al.
Publicado: (2025)
Audio-Assisted Face Video Restoration with Temporal and Identity Complementary Learning
por: Cao, Yuqin, et al.
Publicado: (2025)
por: Cao, Yuqin, et al.
Publicado: (2025)
Perceptual Video Quality Assessment: A Survey
por: Min, Xiongkuo, et al.
Publicado: (2024)
por: Min, Xiongkuo, et al.
Publicado: (2024)
Task-Specific Normalization for Continual Learning of Blind Image Quality Models
por: Zhang, Weixia, et al.
Publicado: (2021)
por: Zhang, Weixia, et al.
Publicado: (2021)
GAIA: Rethinking Action Quality Assessment for AI-Generated Videos
por: Chen, Zijian, et al.
Publicado: (2024)
por: Chen, Zijian, et al.
Publicado: (2024)
Large Multi-modality Model Assisted AI-Generated Image Quality Assessment
por: Wang, Puyi, et al.
Publicado: (2024)
por: Wang, Puyi, et al.
Publicado: (2024)
Just Noticeable Difference for Large Multimodal Models
por: Chen, Zijian, et al.
Publicado: (2025)
por: Chen, Zijian, et al.
Publicado: (2025)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
por: Wu, Sijing, et al.
Publicado: (2026)
por: Wu, Sijing, et al.
Publicado: (2026)
Benchmarking Multi-dimensional AIGC Video Quality Assessment: A Dataset and Unified Model
por: Zhang, Zhichao, et al.
Publicado: (2024)
por: Zhang, Zhichao, et al.
Publicado: (2024)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
por: Zhang, Zicheng, et al.
Publicado: (2024)
por: Zhang, Zicheng, et al.
Publicado: (2024)
Exploring Image Quality Assessment from a New Perspective: Pupil Size
por: Gao, Yixuan, et al.
Publicado: (2025)
por: Gao, Yixuan, et al.
Publicado: (2025)
AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM
por: Wang, Jiarui, et al.
Publicado: (2024)
por: Wang, Jiarui, et al.
Publicado: (2024)
TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs
por: Wang, Juntong, et al.
Publicado: (2025)
por: Wang, Juntong, et al.
Publicado: (2025)
R-Bench: Are your Large Multimodal Model Robust to Real-world Corruptions?
por: Li, Chunyi, et al.
Publicado: (2024)
por: Li, Chunyi, et al.
Publicado: (2024)
VQualA 2025 Challenge on Visual Quality Comparison for Large Multimodal Models: Methods and Results
por: Zhu, Hanwei, et al.
Publicado: (2025)
por: Zhu, Hanwei, et al.
Publicado: (2025)
DLADiff: A Dual-Layer Defense Framework against Fine-Tuning and Zero-Shot Customization of Diffusion Models
por: Jia, Jun, et al.
Publicado: (2025)
por: Jia, Jun, et al.
Publicado: (2025)
Ejemplares similares
-
Assessing UHD Image Quality from Aesthetics, Distortions, and Saliency
por: Sun, Wei, et al.
Publicado: (2024) -
VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning
por: Cao, Linhan, et al.
Publicado: (2025) -
QualiRAG: Retrieval-Augmented Generation for Visual Quality Understanding
por: Cao, Linhan, et al.
Publicado: (2026) -
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
por: Cao, Yuqin, et al.
Publicado: (2025) -
KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?
por: Wang, Xianfeng, et al.
Publicado: (2026)