Q-Ground: Image Quality Grounding with Large Multi-modality Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Chaofeng, Yang, Sensen, Wu, Haoning, Liao, Liang, Zhang, Zicheng, Wang, Annan, Sun, Wenxiu, Yan, Qiong, Lin, Weisi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Enhancing Diffusion Models with Text-Encoder Reinforcement Learning
por: Chen, Chaofeng, et al.
Publicado: (2023)
por: Chen, Chaofeng, et al.
Publicado: (2023)
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
por: Wu, Haoning, et al.
Publicado: (2023)
por: Wu, Haoning, et al.
Publicado: (2023)
Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs
por: Zhang, Zicheng, et al.
Publicado: (2024)
por: Zhang, Zicheng, et al.
Publicado: (2024)
Towards Open-ended Visual Quality Comparison
por: Wu, Haoning, et al.
Publicado: (2024)
por: Wu, Haoning, et al.
Publicado: (2024)
Teaching LMMs for Image Quality Scoring and Interpreting
por: Zhang, Zicheng, et al.
Publicado: (2025)
por: Zhang, Zicheng, et al.
Publicado: (2025)
G-Refine: A General Quality Refiner for Text-to-Image Generation
por: Li, Chunyi, et al.
Publicado: (2024)
por: Li, Chunyi, et al.
Publicado: (2024)
Q-Refine: A Perceptual Quality Refiner for AI-Generated Image
por: Li, Chunyi, et al.
Publicado: (2024)
por: Li, Chunyi, et al.
Publicado: (2024)
LMM-PCQA: Assisting Point Cloud Quality Assessment with LMM
por: Zhang, Zicheng, et al.
Publicado: (2024)
por: Zhang, Zicheng, et al.
Publicado: (2024)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
por: Zhang, Zicheng, et al.
Publicado: (2024)
por: Zhang, Zicheng, et al.
Publicado: (2024)
Adaptive Image Quality Assessment via Teaching Large Multimodal Model to Compare
por: Zhu, Hanwei, et al.
Publicado: (2024)
por: Zhu, Hanwei, et al.
Publicado: (2024)
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
por: Lu, Yiting, et al.
Publicado: (2025)
por: Lu, Yiting, et al.
Publicado: (2025)
Large Multi-modality Model Assisted AI-Generated Image Quality Assessment
por: Wang, Puyi, et al.
Publicado: (2024)
por: Wang, Puyi, et al.
Publicado: (2024)
Dual-Branch Network for Portrait Image Quality Assessment
por: Sun, Wei, et al.
Publicado: (2024)
por: Sun, Wei, et al.
Publicado: (2024)
Image Quality Assessment for Machines: Paradigm, Large-scale Database, and Models
por: Wang, Xiaoqi, et al.
Publicado: (2025)
por: Wang, Xiaoqi, et al.
Publicado: (2025)
Grounded Chain-of-Thought for Multimodal Large Language Models
por: Wu, Qiong, et al.
Publicado: (2025)
por: Wu, Qiong, et al.
Publicado: (2025)
MISC: Ultra-low Bitrate Image Semantic Compression Driven by Large Multimodal Model
por: Li, Chunyi, et al.
Publicado: (2024)
por: Li, Chunyi, et al.
Publicado: (2024)
Explore the Hallucination on Low-level Perception for MLLMs
por: Sun, Yinan, et al.
Publicado: (2024)
por: Sun, Yinan, et al.
Publicado: (2024)
Q-Doc: Benchmarking Document Image Quality Assessment Capabilities in Multi-modal Large Language Models
por: Huang, Jiaxi, et al.
Publicado: (2025)
por: Huang, Jiaxi, et al.
Publicado: (2025)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
por: Li, Zhaowei, et al.
Publicado: (2024)
por: Li, Zhaowei, et al.
Publicado: (2024)
VQA$^2$: Visual Question Answering for Video Quality Assessment
por: Jia, Ziheng, et al.
Publicado: (2024)
por: Jia, Ziheng, et al.
Publicado: (2024)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
por: Huang, Yipo, et al.
Publicado: (2024)
por: Huang, Yipo, et al.
Publicado: (2024)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
por: Li, Zeqian, et al.
Publicado: (2025)
por: Li, Zeqian, et al.
Publicado: (2025)
Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment
por: Chen, Zheng, et al.
Publicado: (2024)
por: Chen, Zheng, et al.
Publicado: (2024)
Image Quality Assessment: From Human to Machine Preference
por: Li, Chunyi, et al.
Publicado: (2025)
por: Li, Chunyi, et al.
Publicado: (2025)
A-Bench: Are LMMs Masters at Evaluating AI-generated Images?
por: Zhang, Zicheng, et al.
Publicado: (2024)
por: Zhang, Zicheng, et al.
Publicado: (2024)
ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning
por: Guo, Yuxiang, et al.
Publicado: (2025)
por: Guo, Yuxiang, et al.
Publicado: (2025)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
por: Wu, Sijing, et al.
Publicado: (2026)
por: Wu, Sijing, et al.
Publicado: (2026)
AesExpert: Towards Multi-modality Foundation Model for Image Aesthetics Perception
por: Huang, Yipo, et al.
Publicado: (2024)
por: Huang, Yipo, et al.
Publicado: (2024)
R-Bench: Are your Large Multimodal Model Robust to Real-world Corruptions?
por: Li, Chunyi, et al.
Publicado: (2024)
por: Li, Chunyi, et al.
Publicado: (2024)
Visual Grounding with Multi-modal Conditional Adaptation
por: Yao, Ruilin, et al.
Publicado: (2024)
por: Yao, Ruilin, et al.
Publicado: (2024)
Emergent Visual Grounding in Large Multimodal Models Without Grounding Supervision
por: Cao, Shengcao, et al.
Publicado: (2024)
por: Cao, Shengcao, et al.
Publicado: (2024)
Joint Generative Modeling of Grounded Scene Graphs and Images via Diffusion Models
por: Xu, Bicheng, et al.
Publicado: (2024)
por: Xu, Bicheng, et al.
Publicado: (2024)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
por: Ye, Weihao, et al.
Publicado: (2024)
por: Ye, Weihao, et al.
Publicado: (2024)
From Priors to Perception: Grounding Video-LLMs in Physical Reality
por: Zhao, Zicheng, et al.
Publicado: (2026)
por: Zhao, Zicheng, et al.
Publicado: (2026)
AIGIQA-20K: A Large Database for AI-Generated Image Quality Assessment
por: Li, Chunyi, et al.
Publicado: (2024)
por: Li, Chunyi, et al.
Publicado: (2024)
Cross-modal Causal Relation Alignment for Video Question Grounding
por: Chen, Weixing, et al.
Publicado: (2025)
por: Chen, Weixing, et al.
Publicado: (2025)
MoniRefer: A Real-world Large-scale Multi-modal Dataset based on Roadside Infrastructure for 3D Visual Grounding
por: Yang, Panquan, et al.
Publicado: (2025)
por: Yang, Panquan, et al.
Publicado: (2025)
GMS-3DQA: Projection-based Grid Mini-patch Sampling for 3D Model Quality Assessment
por: Zhang, Zicheng, et al.
Publicado: (2023)
por: Zhang, Zicheng, et al.
Publicado: (2023)
Just Noticeable Difference for Large Multimodal Models
por: Chen, Zijian, et al.
Publicado: (2025)
por: Chen, Zijian, et al.
Publicado: (2025)
Grounding and Enhancing Grid-based Models for Neural Fields
por: Zhao, Zelin, et al.
Publicado: (2024)
por: Zhao, Zelin, et al.
Publicado: (2024)
Ejemplares similares
-
Enhancing Diffusion Models with Text-Encoder Reinforcement Learning
por: Chen, Chaofeng, et al.
Publicado: (2023) -
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
por: Wu, Haoning, et al.
Publicado: (2023) -
Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs
por: Zhang, Zicheng, et al.
Publicado: (2024) -
Towards Open-ended Visual Quality Comparison
por: Wu, Haoning, et al.
Publicado: (2024) -
Teaching LMMs for Image Quality Scoring and Interpreting
por: Zhang, Zicheng, et al.
Publicado: (2025)