Evaluating Graphical Perception with Multimodal LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nguyen, Rami Huu, Maeda, Kenichi, Geshvadi, Mahsa, Haehn, Daniel |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Visualizing Uncertainty in Image Guided Surgery a Review
par: Geshvadi, Mahsa
Publié: (2025)
par: Geshvadi, Mahsa
Publié: (2025)
Boostlet.js: Image processing plugins for the web via JavaScript injection
par: Gaibor, Edward, et autres
Publié: (2024)
par: Gaibor, Edward, et autres
Publié: (2024)
Designing a Convolutional Neural Network for High-Accuracy Oral Cavity Squamous Cell Carcinoma (OCSCC) Detection
par: Manikanden, Vishal, et autres
Publié: (2025)
par: Manikanden, Vishal, et autres
Publié: (2025)
Evaluating Graphical Perception Capabilities of Vision Transformers
par: Poonam, Poonam, et autres
Publié: (2026)
par: Poonam, Poonam, et autres
Publié: (2026)
Melanoma Detection with Uncertainty Quantification
par: Kim, SangHyuk, et autres
Publié: (2024)
par: Kim, SangHyuk, et autres
Publié: (2024)
Meta-D: Metadata-Aware Architectures for Brain Tumor Analysis and Missing-Modality Segmentation
par: Kim, SangHyuk, et autres
Publié: (2026)
par: Kim, SangHyuk, et autres
Publié: (2026)
Web-based Melanoma Detection
par: Kim, SangHyuk, et autres
Publié: (2024)
par: Kim, SangHyuk, et autres
Publié: (2024)
Towards Understanding Graphical Perception in Large Multimodal Models
par: Zhang, Kai, et autres
Publié: (2025)
par: Zhang, Kai, et autres
Publié: (2025)
Graphical Perception of Saliency-based Model Explanations
par: Zhao, Yayan, et autres
Publié: (2024)
par: Zhao, Yayan, et autres
Publié: (2024)
Do You See Me : A Multidimensional Benchmark for Evaluating Visual Perception in Multimodal LLMs
par: Kanade, Aditya, et autres
Publié: (2025)
par: Kanade, Aditya, et autres
Publié: (2025)
Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
par: Jain, Jitesh, et autres
Publié: (2024)
par: Jain, Jitesh, et autres
Publié: (2024)
Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs
par: Lu, Jinda, et autres
Publié: (2026)
par: Lu, Jinda, et autres
Publié: (2026)
MRI Plane Orientation Detection using a Context-Aware 2.5D Model
par: Kim, SangHyuk, et autres
Publié: (2025)
par: Kim, SangHyuk, et autres
Publié: (2025)
Localizing Before Answering: A Hallucination Evaluation Benchmark for Grounded Medical Multimodal LLMs
par: Nguyen, Dung, et autres
Publié: (2025)
par: Nguyen, Dung, et autres
Publié: (2025)
Hybrid, Unified and Iterative: A Novel Framework for Text-based Person Anomaly Retrieval
par: Nguyen, Tien-Huy, et autres
Publié: (2025)
par: Nguyen, Tien-Huy, et autres
Publié: (2025)
The Percept-V Challenge: Can Multimodal LLMs Crack Simple Perception Problems?
par: Ghosh, Samrajnee, et autres
Publié: (2025)
par: Ghosh, Samrajnee, et autres
Publié: (2025)
Evaluating and Enhancing Trustworthiness of LLMs in Perception Tasks
par: Dona, Malsha Ashani Mahawatta, et autres
Publié: (2024)
par: Dona, Malsha Ashani Mahawatta, et autres
Publié: (2024)
Empowering LLMs to Understand and Generate Complex Vector Graphics
par: Xing, Ximing, et autres
Publié: (2024)
par: Xing, Ximing, et autres
Publié: (2024)
IGD: Instructional Graphic Design with Multimodal Layer Generation
par: Qu, Yadong, et autres
Publié: (2025)
par: Qu, Yadong, et autres
Publié: (2025)
Beyond Seeing: Evaluating Multimodal LLMs on Tool-Enabled Image Perception, Transformation, and Reasoning
par: Guo, Xingang, et autres
Publié: (2025)
par: Guo, Xingang, et autres
Publié: (2025)
FaceXBench: Evaluating Multimodal LLMs on Face Understanding
par: Narayan, Kartik, et autres
Publié: (2025)
par: Narayan, Kartik, et autres
Publié: (2025)
A Lightweight Moment Retrieval System with Global Re-Ranking and Robust Adaptive Bidirectional Temporal Search
par: Nguyen-Nhu, Tinh-Anh, et autres
Publié: (2025)
par: Nguyen-Nhu, Tinh-Anh, et autres
Publié: (2025)
PaCX-MAE: Physiology-Augmented Chest X-Ray Masked Autoencoder
par: Liu, Yancheng, et autres
Publié: (2026)
par: Liu, Yancheng, et autres
Publié: (2026)
SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
par: Huang, Haoyu, et autres
Publié: (2026)
par: Huang, Haoyu, et autres
Publié: (2026)
VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs
par: Jiang, Tianxiang, et autres
Publié: (2025)
par: Jiang, Tianxiang, et autres
Publié: (2025)
ActiView: Evaluating Active Perception Ability for Multimodal Large Language Models
par: Wang, Ziyue, et autres
Publié: (2024)
par: Wang, Ziyue, et autres
Publié: (2024)
DesignProbe: A Graphic Design Benchmark for Multimodal Large Language Models
par: Lin, Jieru, et autres
Publié: (2024)
par: Lin, Jieru, et autres
Publié: (2024)
Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion
par: Chen, Zhuokun, et autres
Publié: (2024)
par: Chen, Zhuokun, et autres
Publié: (2024)
Graphic Design with Large Multimodal Model
par: Cheng, Yutao, et autres
Publié: (2024)
par: Cheng, Yutao, et autres
Publié: (2024)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
par: Ma, David, et autres
Publié: (2025)
par: Ma, David, et autres
Publié: (2025)
Hyperphantasia: A Benchmark for Evaluating the Mental Visualization Capabilities of Multimodal LLMs
par: Sepehri, Mohammad Shahab, et autres
Publié: (2025)
par: Sepehri, Mohammad Shahab, et autres
Publié: (2025)
EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents
par: Cheng, Zhili, et autres
Publié: (2025)
par: Cheng, Zhili, et autres
Publié: (2025)
Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation
par: Nguyen, Huu Tien, et autres
Publié: (2025)
par: Nguyen, Huu Tien, et autres
Publié: (2025)
A Rigorous Behavior Assessment of CNNs Using a Data-Domain Sampling Regime
par: Jiang, Shuning, et autres
Publié: (2025)
par: Jiang, Shuning, et autres
Publié: (2025)
Textured Mesh Saliency: Bridging Geometry and Texture for Human Perception in 3D Graphics
par: Zhang, Kaiwei, et autres
Publié: (2024)
par: Zhang, Kaiwei, et autres
Publié: (2024)
Low-Field Magnetic Resonance Image Quality Enhancement using a Conditional Flow Matching Model
par: Nguyen, Huu Tien, et autres
Publié: (2025)
par: Nguyen, Huu Tien, et autres
Publié: (2025)
Evaluating Model Performance with Hard-Swish Activation Function Adjustments
par: Pydimarry, Sai Abhinav, et autres
Publié: (2024)
par: Pydimarry, Sai Abhinav, et autres
Publié: (2024)
Towards Efficient and Robust Moment Retrieval System: A Unified Framework for Multi-Granularity Models and Temporal Reranking
par: Tran, Huu-Loc, et autres
Publié: (2025)
par: Tran, Huu-Loc, et autres
Publié: (2025)
Improving Imbalanced Multi-Label Chest X-Ray Diagnosis via CBAM-Enhanced CNN Backbones
par: Huu, Duy Nguyen, et autres
Publié: (2026)
par: Huu, Duy Nguyen, et autres
Publié: (2026)
Momentum-Anchored Multi-Scale Fusion Model for Long-Tailed Chest X-Ray Classification
par: Khuong, Duy Hoang, et autres
Publié: (2026)
par: Khuong, Duy Hoang, et autres
Publié: (2026)
Documents similaires
-
Visualizing Uncertainty in Image Guided Surgery a Review
par: Geshvadi, Mahsa
Publié: (2025) -
Boostlet.js: Image processing plugins for the web via JavaScript injection
par: Gaibor, Edward, et autres
Publié: (2024) -
Designing a Convolutional Neural Network for High-Accuracy Oral Cavity Squamous Cell Carcinoma (OCSCC) Detection
par: Manikanden, Vishal, et autres
Publié: (2025) -
Evaluating Graphical Perception Capabilities of Vision Transformers
par: Poonam, Poonam, et autres
Publié: (2026) -
Melanoma Detection with Uncertainty Quantification
par: Kim, SangHyuk, et autres
Publié: (2024)