A Comprehensive Study of Multimodal Large Language Models for Image Quality Assessment
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, Tianhe, Ma, Kede, Liang, Jie, Yang, Yujiu, Zhang, Lei |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank
by: Wu, Tianhe, et al.
Published: (2025)
by: Wu, Tianhe, et al.
Published: (2025)
Toward Generalized Image Quality Assessment: Relaxing the Perfect Reference Quality Assumption
by: Chen, Du, et al.
Published: (2025)
by: Chen, Du, et al.
Published: (2025)
Diversity-Preserved Distribution Matching Distillation for Fast Visual Synthesis
by: Wu, Tianhe, et al.
Published: (2026)
by: Wu, Tianhe, et al.
Published: (2026)
Task-Specific Normalization for Continual Learning of Blind Image Quality Models
by: Zhang, Weixia, et al.
Published: (2021)
by: Zhang, Weixia, et al.
Published: (2021)
When No-Reference Image Quality Models Meet MAP Estimation in Diffusion Latents
by: Zhang, Weixia, et al.
Published: (2024)
by: Zhang, Weixia, et al.
Published: (2024)
MDS-VQA: Model-Informed Data Selection for Video Quality Assessment
by: Zou, Jian, et al.
Published: (2026)
by: Zou, Jian, et al.
Published: (2026)
ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking
by: Fan, Kanglong, et al.
Published: (2026)
by: Fan, Kanglong, et al.
Published: (2026)
Hiding Images in Diffusion Models by Editing Learned Score Functions
by: Chen, Haoyu, et al.
Published: (2025)
by: Chen, Haoyu, et al.
Published: (2025)
Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment
by: Guo, Yuchen, et al.
Published: (2026)
by: Guo, Yuchen, et al.
Published: (2026)
Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment
by: Chen, Zheng, et al.
Published: (2024)
by: Chen, Zheng, et al.
Published: (2024)
MMRQA: Signal-Enhanced Multimodal Large Language Models for MRI Quality Assessment
by: Jia, Fankai, et al.
Published: (2025)
by: Jia, Fankai, et al.
Published: (2025)
Perceptual Assessment and Optimization of HDR Image Rendering
by: Cao, Peibei, et al.
Published: (2023)
by: Cao, Peibei, et al.
Published: (2023)
VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models
by: Xu, Mingjie, et al.
Published: (2025)
by: Xu, Mingjie, et al.
Published: (2025)
Large Language Models for Multimodal Deformable Image Registration
by: Ma, Mingrui, et al.
Published: (2024)
by: Ma, Mingrui, et al.
Published: (2024)
Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
by: Fu, Pei, et al.
Published: (2025)
by: Fu, Pei, et al.
Published: (2025)
Modular Blind Video Quality Assessment
by: Wen, Wen, et al.
Published: (2024)
by: Wen, Wen, et al.
Published: (2024)
A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models
by: Li, Duo, et al.
Published: (2025)
by: Li, Duo, et al.
Published: (2025)
Next Token Is Enough: Realistic Image Quality and Aesthetic Scoring with Multimodal Large Language Model
by: Li, Mingxing, et al.
Published: (2025)
by: Li, Mingxing, et al.
Published: (2025)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
by: Fu, Chaoyou, et al.
Published: (2023)
by: Fu, Chaoyou, et al.
Published: (2023)
Evaluating Attribute Comprehension in Large Vision-Language Models
by: Zhang, Haiwen, et al.
Published: (2024)
by: Zhang, Haiwen, et al.
Published: (2024)
Learned Scanpaths Aid Blind Panoramic Video Quality Assessment
by: Fan, Kanglong, et al.
Published: (2024)
by: Fan, Kanglong, et al.
Published: (2024)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
by: Wu, Sijing, et al.
Published: (2026)
by: Wu, Sijing, et al.
Published: (2026)
Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective
by: Lei, Lei, et al.
Published: (2025)
by: Lei, Lei, et al.
Published: (2025)
Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models
by: Meng, Chutian, et al.
Published: (2024)
by: Meng, Chutian, et al.
Published: (2024)
HyperSeg: Towards Universal Visual Segmentation with Large Language Model
by: Wei, Cong, et al.
Published: (2024)
by: Wei, Cong, et al.
Published: (2024)
The Unanticipated Asymmetry Between Perceptual Optimization and Assessment
by: Zhang, Jiabei, et al.
Published: (2025)
by: Zhang, Jiabei, et al.
Published: (2025)
LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology
by: Qin, Zhenyue, et al.
Published: (2025)
by: Qin, Zhenyue, et al.
Published: (2025)
Adaptive Image Quality Assessment via Teaching Large Multimodal Model to Compare
by: Zhu, Hanwei, et al.
Published: (2024)
by: Zhu, Hanwei, et al.
Published: (2024)
2AFC Prompting of Large Multimodal Models for Image Quality Assessment
by: Zhu, Hanwei, et al.
Published: (2024)
by: Zhu, Hanwei, et al.
Published: (2024)
Embodied Image Quality Assessment for Robotic Intelligence
by: Zhang, Jianbo, et al.
Published: (2024)
by: Zhang, Jianbo, et al.
Published: (2024)
Q-Doc: Benchmarking Document Image Quality Assessment Capabilities in Multi-modal Large Language Models
by: Huang, Jiaxi, et al.
Published: (2025)
by: Huang, Jiaxi, et al.
Published: (2025)
Frequency-domain Learning with Kernel Prior for Blind Image Deblurring
by: Sun, Jixiang, et al.
Published: (2025)
by: Sun, Jixiang, et al.
Published: (2025)
Image Quality Assessment for Machines: Paradigm, Large-scale Database, and Models
by: Wang, Xiaoqi, et al.
Published: (2025)
by: Wang, Xiaoqi, et al.
Published: (2025)
Self-Supervised AI-Generated Image Detection: A Camera Metadata Perspective
by: Zhong, Nan, et al.
Published: (2025)
by: Zhong, Nan, et al.
Published: (2025)
Assessment of Multimodal Large Language Models in Alignment with Human Values
by: Shi, Zhelun, et al.
Published: (2024)
by: Shi, Zhelun, et al.
Published: (2024)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
by: Liang, Yuci, et al.
Published: (2024)
by: Liang, Yuci, et al.
Published: (2024)
Perceptual Quality Assessment of Virtual Reality Videos in the Wild
by: Wen, Wen, et al.
Published: (2022)
by: Wen, Wen, et al.
Published: (2022)
Urban Safety Perception Assessments via Integrating Multimodal Large Language Models with Street View Images
by: Zhang, Jiaxin, et al.
Published: (2024)
by: Zhang, Jiaxin, et al.
Published: (2024)
Language-Guided Visual Perception Disentanglement for Image Quality Assessment and Conditional Image Generation
by: Yang, Zhichao, et al.
Published: (2025)
by: Yang, Zhichao, et al.
Published: (2025)
VIP: Versatile Image Outpainting Empowered by Multimodal Large Language Model
by: Yang, Jinze, et al.
Published: (2024)
by: Yang, Jinze, et al.
Published: (2024)
Similar Items
-
VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank
by: Wu, Tianhe, et al.
Published: (2025) -
Toward Generalized Image Quality Assessment: Relaxing the Perfect Reference Quality Assumption
by: Chen, Du, et al.
Published: (2025) -
Diversity-Preserved Distribution Matching Distillation for Fast Visual Synthesis
by: Wu, Tianhe, et al.
Published: (2026) -
Task-Specific Normalization for Continual Learning of Blind Image Quality Models
by: Zhang, Weixia, et al.
Published: (2021) -
When No-Reference Image Quality Models Meet MAP Estimation in Diffusion Latents
by: Zhang, Weixia, et al.
Published: (2024)