VisualCritic: Making LMMs Perceive Visual Quality Like Humans
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Zhipeng, Zhang, Zhizheng, Lu, Yiting, Zha, Zheng-Jun, Chen, Zhibo, Guo, Baining |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
par: Huang, Zhipeng, et autres
Publié: (2024)
par: Huang, Zhipeng, et autres
Publié: (2024)
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
par: Lu, Yiting, et autres
Publié: (2025)
par: Lu, Yiting, et autres
Publié: (2025)
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
par: Jia, Ziheng, et autres
Publié: (2025)
par: Jia, Ziheng, et autres
Publié: (2025)
IQA-Spider: Unifying Multi-Granularity Image Quality Assessment with Reasoning, Grounding and Referring
par: Peng, Xinge, et autres
Publié: (2026)
par: Peng, Xinge, et autres
Publié: (2026)
Teaching LMMs for Image Quality Scoring and Interpreting
par: Zhang, Zicheng, et autres
Publié: (2025)
par: Zhang, Zicheng, et autres
Publié: (2025)
DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs
par: Meng, Lingchen, et autres
Publié: (2024)
par: Meng, Lingchen, et autres
Publié: (2024)
WeGen: A Unified Model for Interactive Multimodal Generation as We Chat
par: Huang, Zhipeng, et autres
Publié: (2025)
par: Huang, Zhipeng, et autres
Publié: (2025)
SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing
par: Liang, Sen, et autres
Publié: (2026)
par: Liang, Sen, et autres
Publié: (2026)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
par: Zhang, Zicheng, et autres
Publié: (2024)
par: Zhang, Zicheng, et autres
Publié: (2024)
DyFo: A Training-Free Dynamic Focus Visual Search for Enhancing LMMs in Fine-Grained Visual Understanding
par: Li, Geng, et autres
Publié: (2025)
par: Li, Geng, et autres
Publié: (2025)
Visual-Geometric Collaborative Guidance for Affordance Learning
par: Luo, Hongchen, et autres
Publié: (2024)
par: Luo, Hongchen, et autres
Publié: (2024)
ViCToR: Improving Visual Comprehension via Token Reconstruction for Pretraining LMMs
par: Xie, Yin, et autres
Publié: (2024)
par: Xie, Yin, et autres
Publié: (2024)
Learning to Look before Learning to Like: Incorporating Human Visual Cognition into Aesthetic Quality Assessment
par: Yu, Liwen, et autres
Publié: (2026)
par: Yu, Liwen, et autres
Publié: (2026)
LossAgent: Towards Any Optimization Objectives for Image Processing with LLM Agents
par: Li, Bingchen, et autres
Publié: (2024)
par: Li, Bingchen, et autres
Publié: (2024)
SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems
par: Guo, Ziyu, et autres
Publié: (2025)
par: Guo, Ziyu, et autres
Publié: (2025)
QMamba: On First Exploration of Vision Mamba for Image Quality Assessment
par: Guan, Fengbin, et autres
Publié: (2024)
par: Guan, Fengbin, et autres
Publié: (2024)
Event-based Visual Deformation Measurement
par: Wu, Yuliang, et autres
Publié: (2026)
par: Wu, Yuliang, et autres
Publié: (2026)
VFlowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided Optimization
par: Yang, Sihan, et autres
Publié: (2025)
par: Yang, Sihan, et autres
Publié: (2025)
Tell Codec What Worth Compressing: Semantically Disentangled Image Coding for Machine with LMMs
par: Liu, Jinming, et autres
Publié: (2024)
par: Liu, Jinming, et autres
Publié: (2024)
VAEER: Visual Attention-Inspired Emotion Elicitation Reasoning
par: Man, Fanhang, et autres
Publié: (2025)
par: Man, Fanhang, et autres
Publié: (2025)
Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation
par: Fu, Kang, et autres
Publié: (2026)
par: Fu, Kang, et autres
Publié: (2026)
OmniVaT: Single Domain Generalization for Multimodal Visual-Tactile Learning
par: Qiu, Liuxiang, et autres
Publié: (2026)
par: Qiu, Liuxiang, et autres
Publié: (2026)
FC3DNet: A Fully Connected Encoder-Decoder for Efficient Demoir'eing
par: Du, Zhibo, et autres
Publié: (2024)
par: Du, Zhibo, et autres
Publié: (2024)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
par: Zhu, Jiaying, et autres
Publié: (2025)
par: Zhu, Jiaying, et autres
Publié: (2025)
ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better
par: Zhang, Yuan, et autres
Publié: (2025)
par: Zhang, Yuan, et autres
Publié: (2025)
SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions
par: Tu, Jinzhe, et autres
Publié: (2026)
par: Tu, Jinzhe, et autres
Publié: (2026)
OmniQuality-R: Advancing Reward Models Through All-Encompassing Quality Assessment
par: Lu, Yiting, et autres
Publié: (2025)
par: Lu, Yiting, et autres
Publié: (2025)
Video Quality Assessment Based on Swin TransformerV2 and Coarse to Fine Strategy
par: Yu, Zihao, et autres
Publié: (2024)
par: Yu, Zihao, et autres
Publié: (2024)
InternVQA: Advancing Compressed Video Quality Assessment with Distilling Large Foundation Model
par: Guan, Fengbin, et autres
Publié: (2025)
par: Guan, Fengbin, et autres
Publié: (2025)
TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs
par: Wang, Juntong, et autres
Publié: (2025)
par: Wang, Juntong, et autres
Publié: (2025)
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
par: Duan, Yuchen, et autres
Publié: (2024)
par: Duan, Yuchen, et autres
Publié: (2024)
Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions
par: Sun, Xiaoxiao, et autres
Publié: (2026)
par: Sun, Xiaoxiao, et autres
Publié: (2026)
Visual IRL for Human-Like Robotic Manipulation
par: Asali, Ehsan, et autres
Publié: (2024)
par: Asali, Ehsan, et autres
Publié: (2024)
Priorformer: A UGC-VQA Method with content and distortion priors
par: Pei, Yajing, et autres
Publié: (2024)
par: Pei, Yajing, et autres
Publié: (2024)
CCEdit: Creative and Controllable Video Editing via Diffusion Models
par: Feng, Ruoyu, et autres
Publié: (2023)
par: Feng, Ruoyu, et autres
Publié: (2023)
Hybrid Agents for Image Restoration
par: Li, Bingchen, et autres
Publié: (2025)
par: Li, Bingchen, et autres
Publié: (2025)
Text-guided Visual Prompt DINO for Generic Segmentation
par: Guan, Yuchen, et autres
Publié: (2025)
par: Guan, Yuchen, et autres
Publié: (2025)
Human vs. LMMs: Exploring the Discrepancy in Emoji Interpretation and Usage in Digital Communication
par: Lyu, Hanjia, et autres
Publié: (2024)
par: Lyu, Hanjia, et autres
Publié: (2024)
Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models
par: Zha, Junli, et autres
Publié: (2026)
par: Zha, Junli, et autres
Publié: (2026)
Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth
par: Wu, Yuhuan, et autres
Publié: (2026)
par: Wu, Yuhuan, et autres
Publié: (2026)
Documents similaires
-
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
par: Huang, Zhipeng, et autres
Publié: (2024) -
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
par: Lu, Yiting, et autres
Publié: (2025) -
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
par: Jia, Ziheng, et autres
Publié: (2025) -
IQA-Spider: Unifying Multi-Granularity Image Quality Assessment with Reasoning, Grounding and Referring
par: Peng, Xinge, et autres
Publié: (2026) -
Teaching LMMs for Image Quality Scoring and Interpreting
par: Zhang, Zicheng, et autres
Publié: (2025)