How is Visual Attention Influenced by Text Guidance? Database and Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Yinan, Min, Xiongkuo, Duan, Huiyu, Zhai, Guangtao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Does Audio Influence Visual Attention in Omnidirectional Videos? Database and Model
par: Zhu, Yuxin, et autres
Publié: (2024)
par: Zhu, Yuxin, et autres
Publié: (2024)
Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy
par: Sun, Yinan, et autres
Publié: (2025)
par: Sun, Yinan, et autres
Publié: (2025)
AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM
par: Wang, Jiarui, et autres
Publié: (2024)
par: Wang, Jiarui, et autres
Publié: (2024)
UniProcessor: A Text-induced Unified Low-level Image Processor
par: Duan, Huiyu, et autres
Publié: (2024)
par: Duan, Huiyu, et autres
Publié: (2024)
TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs
par: Wang, Juntong, et autres
Publié: (2025)
par: Wang, Juntong, et autres
Publié: (2025)
Quality Assessment for AI Generated Images with Instruction Tuning
par: Wang, Jiarui, et autres
Publié: (2024)
par: Wang, Jiarui, et autres
Publié: (2024)
TIT-Score: Evaluating Long-Prompt Based Text-to-Image Alignment via Text-to-Image-to-Text Consistency
par: Wang, Juntong, et autres
Publié: (2025)
par: Wang, Juntong, et autres
Publié: (2025)
DynT2I-Eval: A Dynamic Evaluation Framework for Text-to-Image Models
par: Wang, Juntong, et autres
Publié: (2026)
par: Wang, Juntong, et autres
Publié: (2026)
Multi-Dimensional Quality Assessment for Text-to-3D Assets: Dataset and Model
par: Fu, Kang, et autres
Publié: (2025)
par: Fu, Kang, et autres
Publié: (2025)
I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Models
par: Wang, Juntong, et autres
Publié: (2025)
par: Wang, Juntong, et autres
Publié: (2025)
Perceptual Video Quality Assessment: A Survey
par: Min, Xiongkuo, et autres
Publié: (2024)
par: Min, Xiongkuo, et autres
Publié: (2024)
ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning
par: Chen, Honghua, et autres
Publié: (2026)
par: Chen, Honghua, et autres
Publié: (2026)
LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs
par: Wang, Jiarui, et autres
Publié: (2025)
par: Wang, Jiarui, et autres
Publié: (2025)
Audio-Visual Quality Assessment for User Generated Content: Database and Method
par: Cao, Yuqin, et autres
Publié: (2023)
par: Cao, Yuqin, et autres
Publié: (2023)
RGC-VQA: An Exploration Database for Robotic-Generated Video Quality Assessment
par: Jin, Jianing, et autres
Publié: (2025)
par: Jin, Jianing, et autres
Publié: (2025)
EEmo-Logic: A Unified Dataset and Multi-Stage Framework for Comprehensive Image-Evoked Emotion Assessment
par: Gao, Lancheng, et autres
Publié: (2026)
par: Gao, Lancheng, et autres
Publié: (2026)
ESIQA: Perceptual Quality Assessment of Vision-Pro-based Egocentric Spatial Images
par: Zhu, Xilei, et autres
Publié: (2024)
par: Zhu, Xilei, et autres
Publié: (2024)
VTONQA: A Multi-Dimensional Quality Assessment Dataset for Virtual Try-on
par: Wei, Xinyi, et autres
Publié: (2026)
par: Wei, Xinyi, et autres
Publié: (2026)
Preference-Guided Debiasing for No-Reference Enhancement Image Quality Assessment
par: Gao, Shiqi, et autres
Publié: (2026)
par: Gao, Shiqi, et autres
Publié: (2026)
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
par: Li, Yunhao, et autres
Publié: (2026)
par: Li, Yunhao, et autres
Publié: (2026)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
par: Wu, Sijing, et autres
Publié: (2026)
par: Wu, Sijing, et autres
Publié: (2026)
ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs
par: Xu, Zitong, et autres
Publié: (2026)
par: Xu, Zitong, et autres
Publié: (2026)
Mesh Mamba: A Unified State Space Model for Saliency Prediction in Non-Textured and Textured Meshes
par: Zhang, Kaiwei, et autres
Publié: (2025)
par: Zhang, Kaiwei, et autres
Publié: (2025)
GeoR-Bench: Evaluating Geoscience Visual Reasoning
par: Zheng, Yushuo, et autres
Publié: (2026)
par: Zheng, Yushuo, et autres
Publié: (2026)
LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation
par: Wang, Jiarui, et autres
Publié: (2025)
par: Wang, Jiarui, et autres
Publié: (2025)
ESVQA: Perceptual Quality Assessment of Egocentric Spatial Videos
par: Zhu, Xilei, et autres
Publié: (2024)
par: Zhu, Xilei, et autres
Publié: (2024)
AGHI-QA: A Subjective-Aligned Dataset and Metric for AI-Generated Human Images
par: Li, Yunhao, et autres
Publié: (2025)
par: Li, Yunhao, et autres
Publié: (2025)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
par: Zhang, Yiming, et autres
Publié: (2025)
par: Zhang, Yiming, et autres
Publié: (2025)
Exploring Image Quality Assessment from a New Perspective: Pupil Size
par: Gao, Yixuan, et autres
Publié: (2025)
par: Gao, Yixuan, et autres
Publié: (2025)
Quality Assessment and Distortion-aware Saliency Prediction for AI-Generated Omnidirectional Images
par: Yang, Liu, et autres
Publié: (2025)
par: Yang, Liu, et autres
Publié: (2025)
KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?
par: Wang, Xianfeng, et autres
Publié: (2026)
par: Wang, Xianfeng, et autres
Publié: (2026)
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
par: Cao, Yuqin, et autres
Publié: (2025)
par: Cao, Yuqin, et autres
Publié: (2025)
Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs
par: Cai, Zhaolin, et autres
Publié: (2025)
par: Cai, Zhaolin, et autres
Publié: (2025)
ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation
par: Xu, Zitong, et autres
Publié: (2025)
par: Xu, Zitong, et autres
Publié: (2025)
ODI-Bench: Can MLLMs Understand Immersive Omnidirectional Environments?
par: Yang, Liu, et autres
Publié: (2025)
par: Yang, Liu, et autres
Publié: (2025)
Textured Mesh Saliency: Bridging Geometry and Texture for Human Perception in 3D Graphics
par: Zhang, Kaiwei, et autres
Publié: (2024)
par: Zhang, Kaiwei, et autres
Publié: (2024)
Explore the Hallucination on Low-level Perception for MLLMs
par: Sun, Yinan, et autres
Publié: (2024)
par: Sun, Yinan, et autres
Publié: (2024)
HarmonyIQA: Pioneering Benchmark and Model for Image Harmonization Quality Assessment
par: Xu, Zitong, et autres
Publié: (2025)
par: Xu, Zitong, et autres
Publié: (2025)
Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation
par: Fu, Kang, et autres
Publié: (2026)
par: Fu, Kang, et autres
Publié: (2026)
Omni$^2$: Unifying Omnidirectional Image Generation and Editing in an Omni Model
par: Yang, Liu, et autres
Publié: (2025)
par: Yang, Liu, et autres
Publié: (2025)
Documents similaires
-
How Does Audio Influence Visual Attention in Omnidirectional Videos? Database and Model
par: Zhu, Yuxin, et autres
Publié: (2024) -
Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy
par: Sun, Yinan, et autres
Publié: (2025) -
AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM
par: Wang, Jiarui, et autres
Publié: (2024) -
UniProcessor: A Text-induced Unified Low-level Image Processor
par: Duan, Huiyu, et autres
Publié: (2024) -
TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs
par: Wang, Juntong, et autres
Publié: (2025)