Next Token Is Enough: Realistic Image Quality and Aesthetic Scoring with Multimodal Large Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Mingxing, Wang, Rui, Sun, Lei, Bai, Yancheng, Chu, Xiangxiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TEXTS-Diff: TEXTS-Aware Diffusion Model for Real-World Text Image Super-Resolution
di: He, Haodong, et al.
Pubblicazione: (2026)
di: He, Haodong, et al.
Pubblicazione: (2026)
FLUX-Text: A Simple and Advanced Diffusion Transformer Baseline for Scene Text Editing
di: Lan, Rui, et al.
Pubblicazione: (2025)
di: Lan, Rui, et al.
Pubblicazione: (2025)
RAGSR: Regional Attention Guided Diffusion for Image Super-Resolution
di: He, Haodong, et al.
Pubblicazione: (2025)
di: He, Haodong, et al.
Pubblicazione: (2025)
Semantic Context Matters: Improving Conditioning for Autoregressive Models
di: Jin, Dongyang, et al.
Pubblicazione: (2025)
di: Jin, Dongyang, et al.
Pubblicazione: (2025)
SCALAR: Scale-wise Controllable Visual Autoregressive Learning
di: Xu, Ryan, et al.
Pubblicazione: (2025)
di: Xu, Ryan, et al.
Pubblicazione: (2025)
Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions
di: Chen, Lin, et al.
Pubblicazione: (2026)
di: Chen, Lin, et al.
Pubblicazione: (2026)
Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers
di: Chen, Ruidong, et al.
Pubblicazione: (2026)
di: Chen, Ruidong, et al.
Pubblicazione: (2026)
Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective
di: Lei, Lei, et al.
Pubblicazione: (2025)
di: Lei, Lei, et al.
Pubblicazione: (2025)
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
di: Bai, Sule, et al.
Pubblicazione: (2025)
di: Bai, Sule, et al.
Pubblicazione: (2025)
Multimodal Latent Language Modeling with Next-Token Diffusion
di: Sun, Yutao, et al.
Pubblicazione: (2024)
di: Sun, Yutao, et al.
Pubblicazione: (2024)
The Photographer Eye: Teaching Multimodal Large Language Models to Understand Image Aesthetics like Photographers
di: Qi, Daiqing, et al.
Pubblicazione: (2025)
di: Qi, Daiqing, et al.
Pubblicazione: (2025)
DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models
di: Yao, Linli, et al.
Pubblicazione: (2024)
di: Yao, Linli, et al.
Pubblicazione: (2024)
UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment
di: Zhou, Hantao, et al.
Pubblicazione: (2024)
di: Zhou, Hantao, et al.
Pubblicazione: (2024)
A Comprehensive Study of Multimodal Large Language Models for Image Quality Assessment
di: Wu, Tianhe, et al.
Pubblicazione: (2024)
di: Wu, Tianhe, et al.
Pubblicazione: (2024)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
di: Huang, Yipo, et al.
Pubblicazione: (2024)
di: Huang, Yipo, et al.
Pubblicazione: (2024)
USP: Unified Self-Supervised Pretraining for Image Generation and Understanding
di: Chu, Xiangxiang, et al.
Pubblicazione: (2025)
di: Chu, Xiangxiang, et al.
Pubblicazione: (2025)
Teaching Large Language Models to Regress Accurate Image Quality Scores using Score Distribution
di: You, Zhiyuan, et al.
Pubblicazione: (2025)
di: You, Zhiyuan, et al.
Pubblicazione: (2025)
Grounding Everything in Tokens for Multimodal Large Language Models
di: Ren, Xiangxuan, et al.
Pubblicazione: (2025)
di: Ren, Xiangxuan, et al.
Pubblicazione: (2025)
Venus: Benchmarking and Empowering Multimodal Large Language Models for Aesthetic Guidance and Cropping
di: Du, Tianxiang, et al.
Pubblicazione: (2026)
di: Du, Tianxiang, et al.
Pubblicazione: (2026)
Q-Hawkeye: Reliable Visual Policy Optimization for Image Quality Assessment
di: Xie, Wulin, et al.
Pubblicazione: (2026)
di: Xie, Wulin, et al.
Pubblicazione: (2026)
Eevee: Towards Close-up High-resolution Video-based Virtual Try-on
di: Zeng, Jianhao, et al.
Pubblicazione: (2025)
di: Zeng, Jianhao, et al.
Pubblicazione: (2025)
FingER: Content Aware Fine-grained Evaluation with Reasoning for AI-Generated Videos
di: Chen, Rui, et al.
Pubblicazione: (2025)
di: Chen, Rui, et al.
Pubblicazione: (2025)
Elucidating the SNR-t Bias of Diffusion Probabilistic Models
di: Yu, Meng, et al.
Pubblicazione: (2026)
di: Yu, Meng, et al.
Pubblicazione: (2026)
Enhancing Image Aesthetics with Dual-Conditioned Diffusion Models Guided by Multimodal Perception
di: Nan, Xinyu, et al.
Pubblicazione: (2026)
di: Nan, Xinyu, et al.
Pubblicazione: (2026)
Enhanced Motion Forecasting with Plug-and-Play Multimodal Large Language Models
di: Luo, Katie, et al.
Pubblicazione: (2025)
di: Luo, Katie, et al.
Pubblicazione: (2025)
Fine-grained Image Aesthetic Assessment: Learning Discriminative Scores from Relative Ranks
di: Yang, Zhichao, et al.
Pubblicazione: (2026)
di: Yang, Zhichao, et al.
Pubblicazione: (2026)
From Editor to Dense Geometry Estimator
di: Wang, JiYuan, et al.
Pubblicazione: (2025)
di: Wang, JiYuan, et al.
Pubblicazione: (2025)
APDDv2: Aesthetics of Paintings and Drawings Dataset with Artist Labeled Scores and Comments
di: Jin, Xin, et al.
Pubblicazione: (2024)
di: Jin, Xin, et al.
Pubblicazione: (2024)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
di: Wu, Sijing, et al.
Pubblicazione: (2026)
di: Wu, Sijing, et al.
Pubblicazione: (2026)
A Survey of Token Compression for Efficient Multimodal Large Language Models
di: Shao, Kele, et al.
Pubblicazione: (2025)
di: Shao, Kele, et al.
Pubblicazione: (2025)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
di: Tan, Xudong, et al.
Pubblicazione: (2025)
di: Tan, Xudong, et al.
Pubblicazione: (2025)
ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming
di: Zhuang, Jiedong, et al.
Pubblicazione: (2024)
di: Zhuang, Jiedong, et al.
Pubblicazione: (2024)
HiMTok: Learning Hierarchical Mask Tokens for Image Segmentation with Large Multimodal Model
di: Wang, Tao, et al.
Pubblicazione: (2025)
di: Wang, Tao, et al.
Pubblicazione: (2025)
ArtiMuse: Fine-Grained Image Aesthetics Assessment with Joint Scoring and Expert-Level Understanding
di: Cao, Shuo, et al.
Pubblicazione: (2025)
di: Cao, Shuo, et al.
Pubblicazione: (2025)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
di: Zhao, Shiyu, et al.
Pubblicazione: (2024)
di: Zhao, Shiyu, et al.
Pubblicazione: (2024)
OSV: One Step is Enough for High-Quality Image to Video Generation
di: Mao, Xiaofeng, et al.
Pubblicazione: (2024)
di: Mao, Xiaofeng, et al.
Pubblicazione: (2024)
Efficient Visual Transformer by Learnable Token Merging
di: Wang, Yancheng, et al.
Pubblicazione: (2024)
di: Wang, Yancheng, et al.
Pubblicazione: (2024)
Introducing Visual Perception Token into Multimodal Large Language Model
di: Yu, Runpeng, et al.
Pubblicazione: (2025)
di: Yu, Runpeng, et al.
Pubblicazione: (2025)
Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment
di: Guo, Yuchen, et al.
Pubblicazione: (2026)
di: Guo, Yuchen, et al.
Pubblicazione: (2026)
Training Noise Token Pruning
di: Rao, Mingxing, et al.
Pubblicazione: (2024)
di: Rao, Mingxing, et al.
Pubblicazione: (2024)
Documenti analoghi
-
TEXTS-Diff: TEXTS-Aware Diffusion Model for Real-World Text Image Super-Resolution
di: He, Haodong, et al.
Pubblicazione: (2026) -
FLUX-Text: A Simple and Advanced Diffusion Transformer Baseline for Scene Text Editing
di: Lan, Rui, et al.
Pubblicazione: (2025) -
RAGSR: Regional Attention Guided Diffusion for Image Super-Resolution
di: He, Haodong, et al.
Pubblicazione: (2025) -
Semantic Context Matters: Improving Conditioning for Autoregressive Models
di: Jin, Dongyang, et al.
Pubblicazione: (2025) -
SCALAR: Scale-wise Controllable Visual Autoregressive Learning
di: Xu, Ryan, et al.
Pubblicazione: (2025)