VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Mingjie, Chen, Jinpeng, Zhao, Yuzhi, Li, Jason Chun Lok, Qiu, Yue, Du, Zekang, Wu, Mengyang, Zhang, Pingping, Li, Kun, Yang, Hongzheng, Ma, Wenao, Wei, Jiaheng, Li, Qinbin, Liu, Kangcheng, Lei, Wenqiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AesBiasBench: Evaluating Bias and Alignment in Multimodal Language Models for Personalized Image Aesthetic Assessment
por: Li, Kun, et al.
Publicado: (2025)
por: Li, Kun, et al.
Publicado: (2025)
LLaVA-SpaceSGG: Visual Instruct Tuning for Open-vocabulary Scene Graph Generation with Enhanced Spatial Relations
por: Xu, Mingjie, et al.
Publicado: (2024)
por: Xu, Mingjie, et al.
Publicado: (2024)
From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training
por: Xu, Donglai, et al.
Publicado: (2025)
por: Xu, Donglai, et al.
Publicado: (2025)
KG-RAG: Enhancing GUI Agent Decision-Making via Knowledge Graph-Driven Retrieval-Augmented Generation
por: Guan, Ziyi, et al.
Publicado: (2025)
por: Guan, Ziyi, et al.
Publicado: (2025)
CIBER: A Comprehensive Benchmark for Security Evaluation of Code Interpreter Agents
por: Ba, Lei, et al.
Publicado: (2026)
por: Ba, Lei, et al.
Publicado: (2026)
ICM-Assistant: Instruction-tuning Multimodal Large Language Models for Rule-based Explainable Image Content Moderation
por: Wu, Mengyang, et al.
Publicado: (2024)
por: Wu, Mengyang, et al.
Publicado: (2024)
VP-MEL: Visual Prompts Guided Multimodal Entity Linking
por: Mi, Hongze, et al.
Publicado: (2024)
por: Mi, Hongze, et al.
Publicado: (2024)
AutoVP: An Automated Visual Prompting Framework and Benchmark
por: Tsao, Hsi-Ai, et al.
Publicado: (2023)
por: Tsao, Hsi-Ai, et al.
Publicado: (2023)
MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal
por: Nie, Yiqi, et al.
Publicado: (2026)
por: Nie, Yiqi, et al.
Publicado: (2026)
Better Reasoning with Less Data: Enhancing VLMs Through Unified Modality Scoring
por: Xu, Mingjie, et al.
Publicado: (2025)
por: Xu, Mingjie, et al.
Publicado: (2025)
PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension
por: Ouyang, Kun, et al.
Publicado: (2024)
por: Ouyang, Kun, et al.
Publicado: (2024)
DiffVP: Differential Visual Semantic Prompting for LLM-Based CT Report Generation
por: Tian, Yuhe, et al.
Publicado: (2026)
por: Tian, Yuhe, et al.
Publicado: (2026)
SEFE: Superficial and Essential Forgetting Eliminator for Multimodal Continual Instruction Tuning
por: Chen, Jinpeng, et al.
Publicado: (2025)
por: Chen, Jinpeng, et al.
Publicado: (2025)
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
por: Li, Bohao, et al.
Publicado: (2024)
por: Li, Bohao, et al.
Publicado: (2024)
AutoTool: Efficient Tool Selection for Large Language Model Agents
por: Jia, Jingyi, et al.
Publicado: (2025)
por: Jia, Jingyi, et al.
Publicado: (2025)
EEE-Bench: A Comprehensive Multimodal Electrical And Electronics Engineering Benchmark
por: Li, Ming, et al.
Publicado: (2024)
por: Li, Ming, et al.
Publicado: (2024)
EEG-FM-Bench: A Comprehensive Benchmark for the Systematic Evaluation of EEG Foundation Models
por: Xiong, Wei, et al.
Publicado: (2025)
por: Xiong, Wei, et al.
Publicado: (2025)
VP-NTK: Exploring the Benefits of Visual Prompting in Differentially Private Data Synthesis
por: Hsu, Chia-Yi, et al.
Publicado: (2025)
por: Hsu, Chia-Yi, et al.
Publicado: (2025)
MRAMG-Bench: A Comprehensive Benchmark for Advancing Multimodal Retrieval-Augmented Multimodal Generation
por: Yu, Qinhan, et al.
Publicado: (2025)
por: Yu, Qinhan, et al.
Publicado: (2025)
TableBench: A Comprehensive and Complex Benchmark for Table Question Answering
por: Wu, Xianjie, et al.
Publicado: (2024)
por: Wu, Xianjie, et al.
Publicado: (2024)
T2S-Bench & Structure-of-Thought: Benchmarking and Prompting Comprehensive Text-to-Structure Reasoning
por: Wang, Qinsi, et al.
Publicado: (2026)
por: Wang, Qinsi, et al.
Publicado: (2026)
IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
por: Zhang, Tao, et al.
Publicado: (2025)
por: Zhang, Tao, et al.
Publicado: (2025)
Frustratingly Simple Prompting-based Text Denoising
por: Park, Jungyeul, et al.
Publicado: (2024)
por: Park, Jungyeul, et al.
Publicado: (2024)
LoR-VP: Low-Rank Visual Prompting for Efficient Vision Model Adaptation
por: Jin, Can, et al.
Publicado: (2025)
por: Jin, Can, et al.
Publicado: (2025)
Embedded Visual Prompt Tuning
por: Zu, Wenqiang, et al.
Publicado: (2024)
por: Zu, Wenqiang, et al.
Publicado: (2024)
Generalization and Optimization of SGD with Lookahead
por: Li, Kangcheng, et al.
Publicado: (2025)
por: Li, Kangcheng, et al.
Publicado: (2025)
FTII-Bench: A Comprehensive Multimodal Benchmark for Flow Text with Image Insertion
por: Ruan, Jiacheng, et al.
Publicado: (2024)
por: Ruan, Jiacheng, et al.
Publicado: (2024)
MMKE-Bench: A Multimodal Editing Benchmark for Diverse Visual Knowledge
por: Du, Yuntao, et al.
Publicado: (2025)
por: Du, Yuntao, et al.
Publicado: (2025)
CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation
por: Deng, Ruifan, et al.
Publicado: (2025)
por: Deng, Ruifan, et al.
Publicado: (2025)
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
por: Wang, Zixuan, et al.
Publicado: (2026)
por: Wang, Zixuan, et al.
Publicado: (2026)
PACE: Improving Prompt with Actor-Critic Editing for Large Language Model
por: Dong, Yihong, et al.
Publicado: (2023)
por: Dong, Yihong, et al.
Publicado: (2023)
MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing
por: Ma, Haoxuan, et al.
Publicado: (2026)
por: Ma, Haoxuan, et al.
Publicado: (2026)
BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs
por: Wang, Ben, et al.
Publicado: (2026)
por: Wang, Ben, et al.
Publicado: (2026)
VP Lab: a PEFT-Enabled Visual Prompting Laboratory for Semantic Segmentation
por: Avogaro, Niccolo, et al.
Publicado: (2025)
por: Avogaro, Niccolo, et al.
Publicado: (2025)
OT-VP: Optimal Transport-guided Visual Prompting for Test-Time Adaptation
por: Zhang, Yunbei, et al.
Publicado: (2024)
por: Zhang, Yunbei, et al.
Publicado: (2024)
VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research
por: Miao, Tingjia, et al.
Publicado: (2026)
por: Miao, Tingjia, et al.
Publicado: (2026)
PAI-Bench: A Comprehensive Benchmark For Physical AI
por: Zhou, Fengzhe, et al.
Publicado: (2025)
por: Zhou, Fengzhe, et al.
Publicado: (2025)
Saliency-Bench: A Comprehensive Benchmark for Evaluating Visual Explanations
por: Zhang, Yifei, et al.
Publicado: (2023)
por: Zhang, Yifei, et al.
Publicado: (2023)
ViStoryBench: Comprehensive Benchmark Suite for Story Visualization
por: Zhuang, Cailin, et al.
Publicado: (2025)
por: Zhuang, Cailin, et al.
Publicado: (2025)
Ejemplares similares
-
AesBiasBench: Evaluating Bias and Alignment in Multimodal Language Models for Personalized Image Aesthetic Assessment
por: Li, Kun, et al.
Publicado: (2025) -
LLaVA-SpaceSGG: Visual Instruct Tuning for Open-vocabulary Scene Graph Generation with Enhanced Spatial Relations
por: Xu, Mingjie, et al.
Publicado: (2024) -
From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training
por: Xu, Donglai, et al.
Publicado: (2025) -
KG-RAG: Enhancing GUI Agent Decision-Making via Knowledge Graph-Driven Retrieval-Augmented Generation
por: Guan, Ziyi, et al.
Publicado: (2025) -
CIBER: A Comprehensive Benchmark for Security Evaluation of Code Interpreter Agents
por: Ba, Lei, et al.
Publicado: (2026)