Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sun, Yinan, Min, Xiongkuo, Zhang, Zicheng, Gao, Yixuan, Cao, Yuqin, Zhai, Guangtao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
How is Visual Attention Influenced by Text Guidance? Database and Model
von: Sun, Yinan, et al.
Veröffentlicht: (2024)
von: Sun, Yinan, et al.
Veröffentlicht: (2024)
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
von: Cao, Yuqin, et al.
Veröffentlicht: (2025)
von: Cao, Yuqin, et al.
Veröffentlicht: (2025)
Audio-Visual Quality Assessment for User Generated Content: Database and Method
von: Cao, Yuqin, et al.
Veröffentlicht: (2023)
von: Cao, Yuqin, et al.
Veröffentlicht: (2023)
Explore the Hallucination on Low-level Perception for MLLMs
von: Sun, Yinan, et al.
Veröffentlicht: (2024)
von: Sun, Yinan, et al.
Veröffentlicht: (2024)
Exploring Image Quality Assessment from a New Perspective: Pupil Size
von: Gao, Yixuan, et al.
Veröffentlicht: (2025)
von: Gao, Yixuan, et al.
Veröffentlicht: (2025)
Exploring Rich Subjective Quality Information for Image Quality Assessment in the Wild
von: Min, Xiongkuo, et al.
Veröffentlicht: (2024)
von: Min, Xiongkuo, et al.
Veröffentlicht: (2024)
AIGIQA-20K: A Large Database for AI-Generated Image Quality Assessment
von: Li, Chunyi, et al.
Veröffentlicht: (2024)
von: Li, Chunyi, et al.
Veröffentlicht: (2024)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
von: Zhang, Yiming, et al.
Veröffentlicht: (2025)
von: Zhang, Yiming, et al.
Veröffentlicht: (2025)
Assessing UHD Image Quality from Aesthetics, Distortions, and Saliency
von: Sun, Wei, et al.
Veröffentlicht: (2024)
von: Sun, Wei, et al.
Veröffentlicht: (2024)
How Does Audio Influence Visual Attention in Omnidirectional Videos? Database and Model
von: Zhu, Yuxin, et al.
Veröffentlicht: (2024)
von: Zhu, Yuxin, et al.
Veröffentlicht: (2024)
THQA: A Perceptual Quality Assessment Database for Talking Heads
von: Zhou, Yingjie, et al.
Veröffentlicht: (2024)
von: Zhou, Yingjie, et al.
Veröffentlicht: (2024)
DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation
von: Qian, Jiaying, et al.
Veröffentlicht: (2026)
von: Qian, Jiaying, et al.
Veröffentlicht: (2026)
Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision Content
von: Zhang, Zicheng, et al.
Veröffentlicht: (2025)
von: Zhang, Zicheng, et al.
Veröffentlicht: (2025)
XGC-AVis: Towards Audio-Visual Content Understanding with a Multi-Agent Collaborative System
von: Cao, Yuqin, et al.
Veröffentlicht: (2025)
von: Cao, Yuqin, et al.
Veröffentlicht: (2025)
3DGCQA: A Quality Assessment Database for 3D AI-Generated Contents
von: Zhou, Yingjie, et al.
Veröffentlicht: (2024)
von: Zhou, Yingjie, et al.
Veröffentlicht: (2024)
Mesh Mamba: A Unified State Space Model for Saliency Prediction in Non-Textured and Textured Meshes
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2025)
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2025)
Engagement Prediction of Short Videos with Large Multimodal Models
von: Sun, Wei, et al.
Veröffentlicht: (2025)
von: Sun, Wei, et al.
Veröffentlicht: (2025)
UniProcessor: A Text-induced Unified Low-level Image Processor
von: Duan, Huiyu, et al.
Veröffentlicht: (2024)
von: Duan, Huiyu, et al.
Veröffentlicht: (2024)
Enhancing Blind Video Quality Assessment with Rich Quality-aware Features
von: Sun, Wei, et al.
Veröffentlicht: (2024)
von: Sun, Wei, et al.
Veröffentlicht: (2024)
Multi-Dimensional Quality Assessment for Text-to-3D Assets: Dataset and Model
von: Fu, Kang, et al.
Veröffentlicht: (2025)
von: Fu, Kang, et al.
Veröffentlicht: (2025)
Towards Explainable Partial-AIGC Image Quality Assessment
von: Qian, Jiaying, et al.
Veröffentlicht: (2025)
von: Qian, Jiaying, et al.
Veröffentlicht: (2025)
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
von: Li, Yunhao, et al.
Veröffentlicht: (2026)
von: Li, Yunhao, et al.
Veröffentlicht: (2026)
Large Multi-modality Model Assisted AI-Generated Image Quality Assessment
von: Wang, Puyi, et al.
Veröffentlicht: (2024)
von: Wang, Puyi, et al.
Veröffentlicht: (2024)
Audio-Assisted Face Video Restoration with Temporal and Identity Complementary Learning
von: Cao, Yuqin, et al.
Veröffentlicht: (2025)
von: Cao, Yuqin, et al.
Veröffentlicht: (2025)
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
von: Jia, Ziheng, et al.
Veröffentlicht: (2025)
von: Jia, Ziheng, et al.
Veröffentlicht: (2025)
Quality Assessment for AI Generated Images with Instruction Tuning
von: Wang, Jiarui, et al.
Veröffentlicht: (2024)
von: Wang, Jiarui, et al.
Veröffentlicht: (2024)
KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?
von: Wang, Xianfeng, et al.
Veröffentlicht: (2026)
von: Wang, Xianfeng, et al.
Veröffentlicht: (2026)
UNQA: Unified No-Reference Quality Assessment for Audio, Image, Video, and Audio-Visual Content
von: Cao, Yuqin, et al.
Veröffentlicht: (2024)
von: Cao, Yuqin, et al.
Veröffentlicht: (2024)
Textured Mesh Saliency: Bridging Geometry and Texture for Human Perception in 3D Graphics
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2024)
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2024)
HazeCLIP: Towards Language Guided Real-World Image Dehazing
von: Wang, Ruiyi, et al.
Veröffentlicht: (2024)
von: Wang, Ruiyi, et al.
Veröffentlicht: (2024)
Efficient Face Image Quality Assessment via Self-training and Knowledge Distillation
von: Sun, Wei, et al.
Veröffentlicht: (2025)
von: Sun, Wei, et al.
Veröffentlicht: (2025)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
von: Wu, Sijing, et al.
Veröffentlicht: (2026)
von: Wu, Sijing, et al.
Veröffentlicht: (2026)
GMS-3DQA: Projection-based Grid Mini-patch Sampling for 3D Model Quality Assessment
von: Zhang, Zicheng, et al.
Veröffentlicht: (2023)
von: Zhang, Zicheng, et al.
Veröffentlicht: (2023)
GeoR-Bench: Evaluating Geoscience Visual Reasoning
von: Zheng, Yushuo, et al.
Veröffentlicht: (2026)
von: Zheng, Yushuo, et al.
Veröffentlicht: (2026)
VQA$^2$: Visual Question Answering for Video Quality Assessment
von: Jia, Ziheng, et al.
Veröffentlicht: (2024)
von: Jia, Ziheng, et al.
Veröffentlicht: (2024)
QualiRAG: Retrieval-Augmented Generation for Visual Quality Understanding
von: Cao, Linhan, et al.
Veröffentlicht: (2026)
von: Cao, Linhan, et al.
Veröffentlicht: (2026)
AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM
von: Wang, Jiarui, et al.
Veröffentlicht: (2024)
von: Wang, Jiarui, et al.
Veröffentlicht: (2024)
TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs
von: Wang, Juntong, et al.
Veröffentlicht: (2025)
von: Wang, Juntong, et al.
Veröffentlicht: (2025)
Subjective-Aligned Dataset and Metric for Text-to-Video Quality Assessment
von: Kou, Tengchuan, et al.
Veröffentlicht: (2024)
von: Kou, Tengchuan, et al.
Veröffentlicht: (2024)
EEmo-Logic: A Unified Dataset and Multi-Stage Framework for Comprehensive Image-Evoked Emotion Assessment
von: Gao, Lancheng, et al.
Veröffentlicht: (2026)
von: Gao, Lancheng, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
How is Visual Attention Influenced by Text Guidance? Database and Model
von: Sun, Yinan, et al.
Veröffentlicht: (2024) -
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
von: Cao, Yuqin, et al.
Veröffentlicht: (2025) -
Audio-Visual Quality Assessment for User Generated Content: Database and Method
von: Cao, Yuqin, et al.
Veröffentlicht: (2023) -
Explore the Hallucination on Low-level Perception for MLLMs
von: Sun, Yinan, et al.
Veröffentlicht: (2024) -
Exploring Image Quality Assessment from a New Perspective: Pupil Size
von: Gao, Yixuan, et al.
Veröffentlicht: (2025)