Do MLLMs Exhibit Human-like Perceptual Behaviors? HVSBench: A Benchmark for MLLM Alignment with Human Perceptual Behavior
Fuente:
arXiv
Saved in:
| Main Authors: | Lin, Jiaying, Ye, Shuquan, Xu, Dan, Ouyang, Wanli, Lau, Rynson W. H. |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
OpenScan: A Benchmark for Generalized Open-Vocabulary 3D Scene Understanding
by: Zhao, Youjun, et al.
Published: (2024)
by: Zhao, Youjun, et al.
Published: (2024)
Leveraging RGB-D Data with Cross-Modal Context Mining for Glass Surface Detection
by: Lin, Jiaying, et al.
Published: (2022)
by: Lin, Jiaying, et al.
Published: (2022)
Hierarchical Cross-Modal Alignment for Open-Vocabulary 3D Object Detection
by: Zhao, Youjun, et al.
Published: (2025)
by: Zhao, Youjun, et al.
Published: (2025)
Do Vision Transformers See Like Humans? Evaluating their Perceptual Alignment
by: Hernández-Cámara, Pablo, et al.
Published: (2025)
by: Hernández-Cámara, Pablo, et al.
Published: (2025)
MirrorMamba: Towards Scalable and Robust Mirror Detection in Videos
by: Song, Rui, et al.
Published: (2025)
by: Song, Rui, et al.
Published: (2025)
The Perceptual Observatory Characterizing Robustness and Grounding in MLLMs
by: Anvekar, Tejas, et al.
Published: (2025)
by: Anvekar, Tejas, et al.
Published: (2025)
HOComp: Interaction-Aware Human-Object Composition
by: Liang, Dong, et al.
Published: (2025)
by: Liang, Dong, et al.
Published: (2025)
UrbanFeel: A Comprehensive Benchmark for Temporal and Perceptual Understanding of City Scenes through Human Perspective
by: He, Jun, et al.
Published: (2025)
by: He, Jun, et al.
Published: (2025)
MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems
by: Chen, Shuhang, et al.
Published: (2025)
by: Chen, Shuhang, et al.
Published: (2025)
Synthesizing Images on Perceptual Boundaries of ANNs for Uncovering Human Perceptual Variability on Facial Expressions
by: Deng, Haotian, et al.
Published: (2025)
by: Deng, Haotian, et al.
Published: (2025)
Boosting Weakly-Supervised Referring Image Segmentation via Progressive Comprehension
by: Yang, Zaiquan, et al.
Published: (2024)
by: Yang, Zaiquan, et al.
Published: (2024)
VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning
by: Yilmaz, Nilay, et al.
Published: (2025)
by: Yilmaz, Nilay, et al.
Published: (2025)
Delving into Dark Regions for Robust Shadow Detection
by: Guan, Huankang, et al.
Published: (2024)
by: Guan, Huankang, et al.
Published: (2024)
Adaptive Global and Fine-Grained Perceptual Fusion for MLLM Embeddings Compatible with Hard Negative Amplification
by: Hu, Lexiang, et al.
Published: (2026)
by: Hu, Lexiang, et al.
Published: (2026)
TIQA: Human-Aligned Perceptual Text Quality Assessment in Generated Images
by: Koltsov, Kirill, et al.
Published: (2026)
by: Koltsov, Kirill, et al.
Published: (2026)
Human and AI Perceptual Differences in Image Classification Errors
by: Liu, Minghao, et al.
Published: (2023)
by: Liu, Minghao, et al.
Published: (2023)
PP-Motion: Physical-Perceptual Fidelity Evaluation for Human Motion Generation
by: Zhao, Sihan, et al.
Published: (2025)
by: Zhao, Sihan, et al.
Published: (2025)
Perceptual-GS: Scene-adaptive Perceptual Densification for Gaussian Splatting
by: Zhou, Hongbi, et al.
Published: (2025)
by: Zhou, Hongbi, et al.
Published: (2025)
Perceptual Classifiers: Detecting Generative Images using Perceptual Features
by: Durbha, Krishna Srikar, et al.
Published: (2025)
by: Durbha, Krishna Srikar, et al.
Published: (2025)
RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback
by: Yu, Tianyu, et al.
Published: (2023)
by: Yu, Tianyu, et al.
Published: (2023)
VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression
by: Sargent, Kyle, et al.
Published: (2025)
by: Sargent, Kyle, et al.
Published: (2025)
PRISM: Perceptual Recognition for Identifying Standout Moments in Human-Centric Keyframe Extraction
by: Cakmak, Mert Can, et al.
Published: (2025)
by: Cakmak, Mert Can, et al.
Published: (2025)
Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs
by: Wu, Jingze, et al.
Published: (2026)
by: Wu, Jingze, et al.
Published: (2026)
When Does Perceptual Alignment Benefit Vision Representations?
by: Sundaram, Shobhita, et al.
Published: (2024)
by: Sundaram, Shobhita, et al.
Published: (2024)
Perceptual Piercing: Human Visual Cue-based Object Detection in Low Visibility Conditions
by: Kumar, Ashutosh
Published: (2024)
by: Kumar, Ashutosh
Published: (2024)
DHQA-4D: Perceptual Quality Assessment of Dynamic 4D Digital Human
by: Li, Yunhao, et al.
Published: (2025)
by: Li, Yunhao, et al.
Published: (2025)
Vision-Language Models vs Human: Perceptual Image Quality Assessment
by: Mehmood, Imran, et al.
Published: (2026)
by: Mehmood, Imran, et al.
Published: (2026)
Perceptual Asymmetry Between Hue Categories: Evidence from Human Color Categorization
by: Kadyrgali, Elnara, et al.
Published: (2026)
by: Kadyrgali, Elnara, et al.
Published: (2026)
RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension
by: Gao, Tianyi, et al.
Published: (2025)
by: Gao, Tianyi, et al.
Published: (2025)
Correcting Diffusion-Based Perceptual Image Compression with Privileged End-to-End Decoder
by: Ma, Yiyang, et al.
Published: (2024)
by: Ma, Yiyang, et al.
Published: (2024)
MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding
by: Li, Renjie, et al.
Published: (2025)
by: Li, Renjie, et al.
Published: (2025)
Refine-IQA: Multi-Stage Reinforcement Finetuning for Perceptual Image Quality Assessment
by: Jia, Ziheng, et al.
Published: (2025)
by: Jia, Ziheng, et al.
Published: (2025)
Diffusion Model with Perceptual Loss
by: Lin, Shanchuan, et al.
Published: (2023)
by: Lin, Shanchuan, et al.
Published: (2023)
MPJudge: Towards Perceptual Assessment of Music-Induced Paintings
by: Jiang, Shiqi, et al.
Published: (2025)
by: Jiang, Shiqi, et al.
Published: (2025)
Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning
by: Zhang, Chi, et al.
Published: (2025)
by: Zhang, Chi, et al.
Published: (2025)
Color Shift Estimation-and-Correction for Image Enhancement
by: Li, Yiyu, et al.
Published: (2024)
by: Li, Yiyu, et al.
Published: (2024)
LuSh-NeRF: Lighting up and Sharpening NeRFs for Low-light Scenes
by: Qu, Zefan, et al.
Published: (2024)
by: Qu, Zefan, et al.
Published: (2024)
Efficient Perceptual Image Super Resolution: AIM 2025 Study and Benchmark
by: Longarela, Bruno, et al.
Published: (2025)
by: Longarela, Bruno, et al.
Published: (2025)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
by: Cai, Yuxuan, et al.
Published: (2025)
by: Cai, Yuxuan, et al.
Published: (2025)
Latent Guidance in Diffusion Models for Perceptual Evaluations
by: Saini, Shreshth, et al.
Published: (2025)
by: Saini, Shreshth, et al.
Published: (2025)
Similar Items
-
OpenScan: A Benchmark for Generalized Open-Vocabulary 3D Scene Understanding
by: Zhao, Youjun, et al.
Published: (2024) -
Leveraging RGB-D Data with Cross-Modal Context Mining for Glass Surface Detection
by: Lin, Jiaying, et al.
Published: (2022) -
Hierarchical Cross-Modal Alignment for Open-Vocabulary 3D Object Detection
by: Zhao, Youjun, et al.
Published: (2025) -
Do Vision Transformers See Like Humans? Evaluating their Perceptual Alignment
by: Hernández-Cámara, Pablo, et al.
Published: (2025) -
MirrorMamba: Towards Scalable and Robust Mirror Detection in Videos
by: Song, Rui, et al.
Published: (2025)