Explore the Hallucination on Low-level Perception for MLLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Yinan, Zhang, Zicheng, Wu, Haoning, Liu, Xiaohong, Lin, Weisi, Zhai, Guangtao, Min, Xiongkuo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LMM-PCQA: Assisting Point Cloud Quality Assessment with LMM
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
A-Bench: Are LMMs Masters at Evaluating AI-generated Images?
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
VQA$^2$: Visual Question Answering for Video Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy
di: Sun, Yinan, et al.
Pubblicazione: (2025)
di: Sun, Yinan, et al.
Pubblicazione: (2025)
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
di: Wu, Haoning, et al.
Pubblicazione: (2023)
di: Wu, Haoning, et al.
Pubblicazione: (2023)
MISC: Ultra-low Bitrate Image Semantic Compression Driven by Large Multimodal Model
di: Li, Chunyi, et al.
Pubblicazione: (2024)
di: Li, Chunyi, et al.
Pubblicazione: (2024)
Teaching LMMs for Image Quality Scoring and Interpreting
di: Zhang, Zicheng, et al.
Pubblicazione: (2025)
di: Zhang, Zicheng, et al.
Pubblicazione: (2025)
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
Scaling-up Perceptual Video Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2025)
di: Jia, Ziheng, et al.
Pubblicazione: (2025)
Subjective-Aligned Dataset and Metric for Text-to-Video Quality Assessment
di: Kou, Tengchuan, et al.
Pubblicazione: (2024)
di: Kou, Tengchuan, et al.
Pubblicazione: (2024)
Decoupling Perception and Calibration: Label-Efficient Image Quality Assessment Framework
di: Li, Xinyue, et al.
Pubblicazione: (2026)
di: Li, Xinyue, et al.
Pubblicazione: (2026)
CMC-Bench: Towards a New Paradigm of Visual Signal Compression
di: Li, Chunyi, et al.
Pubblicazione: (2024)
di: Li, Chunyi, et al.
Pubblicazione: (2024)
Q-Refine: A Perceptual Quality Refiner for AI-Generated Image
di: Li, Chunyi, et al.
Pubblicazione: (2024)
di: Li, Chunyi, et al.
Pubblicazione: (2024)
Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation
di: Fu, Kang, et al.
Pubblicazione: (2026)
di: Fu, Kang, et al.
Pubblicazione: (2026)
R-Bench: Are your Large Multimodal Model Robust to Real-world Corruptions?
di: Li, Chunyi, et al.
Pubblicazione: (2024)
di: Li, Chunyi, et al.
Pubblicazione: (2024)
How is Visual Attention Influenced by Text Guidance? Database and Model
di: Sun, Yinan, et al.
Pubblicazione: (2024)
di: Sun, Yinan, et al.
Pubblicazione: (2024)
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2025)
di: Jia, Ziheng, et al.
Pubblicazione: (2025)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
GeoX-Bench: Benchmarking Cross-View Geo-Localization and Pose Estimation Capabilities of Large Multimodal Models
di: Zheng, Yushuo, et al.
Pubblicazione: (2025)
di: Zheng, Yushuo, et al.
Pubblicazione: (2025)
Dual-Branch Network for Portrait Image Quality Assessment
di: Sun, Wei, et al.
Pubblicazione: (2024)
di: Sun, Wei, et al.
Pubblicazione: (2024)
Exploring the Naturalness of AI-Generated Images
di: Chen, Zijian, et al.
Pubblicazione: (2023)
di: Chen, Zijian, et al.
Pubblicazione: (2023)
Find Them All: Unveiling MLLMs for Versatile Person Re-identification
di: Li, Jinhao, et al.
Pubblicazione: (2025)
di: Li, Jinhao, et al.
Pubblicazione: (2025)
LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models
di: Ge, Qihang, et al.
Pubblicazione: (2024)
di: Ge, Qihang, et al.
Pubblicazione: (2024)
GMS-3DQA: Projection-based Grid Mini-patch Sampling for 3D Model Quality Assessment
di: Zhang, Zicheng, et al.
Pubblicazione: (2023)
di: Zhang, Zicheng, et al.
Pubblicazione: (2023)
Refine-IQA: Multi-Stage Reinforcement Finetuning for Perceptual Image Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2025)
di: Jia, Ziheng, et al.
Pubblicazione: (2025)
ELIQ: A Label-Free Framework for Quality Assessment of Evolving AI-Generated Images
di: Li, Xinyue, et al.
Pubblicazione: (2026)
di: Li, Xinyue, et al.
Pubblicazione: (2026)
Image Quality Assessment: From Human to Machine Preference
di: Li, Chunyi, et al.
Pubblicazione: (2025)
di: Li, Chunyi, et al.
Pubblicazione: (2025)
HazeCLIP: Towards Language Guided Real-World Image Dehazing
di: Wang, Ruiyi, et al.
Pubblicazione: (2024)
di: Wang, Ruiyi, et al.
Pubblicazione: (2024)
Multi-Dimensional Quality Assessment for Text-to-3D Assets: Dataset and Model
di: Fu, Kang, et al.
Pubblicazione: (2025)
di: Fu, Kang, et al.
Pubblicazione: (2025)
GOBench: Benchmarking Geometric Optics Generation and Understanding of MLLMs
di: Zhu, Xiaorong, et al.
Pubblicazione: (2025)
di: Zhu, Xiaorong, et al.
Pubblicazione: (2025)
Using GUI Agent for Electronic Design Automation
di: Li, Chunyi, et al.
Pubblicazione: (2025)
di: Li, Chunyi, et al.
Pubblicazione: (2025)
G-Refine: A General Quality Refiner for Text-to-Image Generation
di: Li, Chunyi, et al.
Pubblicazione: (2024)
di: Li, Chunyi, et al.
Pubblicazione: (2024)
No-Reference Point Cloud Quality Assessment via Graph Convolutional Network
di: Chen, Wu, et al.
Pubblicazione: (2024)
di: Chen, Wu, et al.
Pubblicazione: (2024)
UniProcessor: A Text-induced Unified Low-level Image Processor
di: Duan, Huiyu, et al.
Pubblicazione: (2024)
di: Duan, Huiyu, et al.
Pubblicazione: (2024)
Textured Mesh Saliency: Bridging Geometry and Texture for Human Perception in 3D Graphics
di: Zhang, Kaiwei, et al.
Pubblicazione: (2024)
di: Zhang, Kaiwei, et al.
Pubblicazione: (2024)
Exploring Image Quality Assessment from a New Perspective: Pupil Size
di: Gao, Yixuan, et al.
Pubblicazione: (2025)
di: Gao, Yixuan, et al.
Pubblicazione: (2025)
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
di: Li, Yunhao, et al.
Pubblicazione: (2026)
di: Li, Yunhao, et al.
Pubblicazione: (2026)
Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation
di: Huang, Zhe, et al.
Pubblicazione: (2025)
di: Huang, Zhe, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LMM-PCQA: Assisting Point Cloud Quality Assessment with LMM
di: Zhang, Zicheng, et al.
Pubblicazione: (2024) -
A-Bench: Are LMMs Masters at Evaluating AI-generated Images?
di: Zhang, Zicheng, et al.
Pubblicazione: (2024) -
VQA$^2$: Visual Question Answering for Video Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2024) -
Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs
di: Zhang, Zicheng, et al.
Pubblicazione: (2024) -
Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy
di: Sun, Yinan, et al.
Pubblicazione: (2025)