MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Shouju, Zhang, Haopeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
di: Liu, Zheyuan, et al.
Pubblicazione: (2026)
di: Liu, Zheyuan, et al.
Pubblicazione: (2026)
EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models
di: Hu, He, et al.
Pubblicazione: (2025)
di: Hu, He, et al.
Pubblicazione: (2025)
TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health
di: Xiong, Zixin, et al.
Pubblicazione: (2026)
di: Xiong, Zixin, et al.
Pubblicazione: (2026)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
TurkBench: A Benchmark for Evaluating Turkish Large Language Models
di: Toraman, Çağrı, et al.
Pubblicazione: (2026)
di: Toraman, Çağrı, et al.
Pubblicazione: (2026)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
di: Deng, Shihan, et al.
Pubblicazione: (2024)
di: Deng, Shihan, et al.
Pubblicazione: (2024)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
di: LI, Yizhi, et al.
Pubblicazione: (2024)
di: LI, Yizhi, et al.
Pubblicazione: (2024)
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models
di: Lai, Peichao, et al.
Pubblicazione: (2025)
di: Lai, Peichao, et al.
Pubblicazione: (2025)
RoleConflictBench: A Benchmark of Role Conflict Scenarios for Evaluating LLMs' Contextual Sensitivity
di: Shin, Jisu, et al.
Pubblicazione: (2025)
di: Shin, Jisu, et al.
Pubblicazione: (2025)
CO-Bench: Benchmarking Language Model Agents in Algorithm Search for Combinatorial Optimization
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Models
di: Yu, Yongan, et al.
Pubblicazione: (2025)
di: Yu, Yongan, et al.
Pubblicazione: (2025)
EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection
di: Xu, Ancheng, et al.
Pubblicazione: (2025)
di: Xu, Ancheng, et al.
Pubblicazione: (2025)
UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
di: Zheng, Yu, et al.
Pubblicazione: (2025)
di: Zheng, Yu, et al.
Pubblicazione: (2025)
JP-TL-Bench: Anchored Pairwise LLM Evaluation for Bidirectional Japanese-English Translation
di: Lin, Leonard, et al.
Pubblicazione: (2026)
di: Lin, Leonard, et al.
Pubblicazione: (2026)
GraphicBench: A Planning Benchmark for Graphic Design with Language Agents
di: Ki, Dayeon, et al.
Pubblicazione: (2025)
di: Ki, Dayeon, et al.
Pubblicazione: (2025)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
di: Liu, Mianxin, et al.
Pubblicazione: (2024)
di: Liu, Mianxin, et al.
Pubblicazione: (2024)
MEMO-Bench: A Multiple Benchmark for Text-to-Image and Multimodal Large Language Models on Human Emotion Analysis
di: Zhou, Yingjie, et al.
Pubblicazione: (2024)
di: Zhou, Yingjie, et al.
Pubblicazione: (2024)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
di: Yang, Shuo, et al.
Pubblicazione: (2025)
di: Yang, Shuo, et al.
Pubblicazione: (2025)
PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology
di: Zhao, Yimin, et al.
Pubblicazione: (2026)
di: Zhao, Yimin, et al.
Pubblicazione: (2026)
IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations
di: Fu, Deqing, et al.
Pubblicazione: (2024)
di: Fu, Deqing, et al.
Pubblicazione: (2024)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
di: Wu, Yao, et al.
Pubblicazione: (2026)
di: Wu, Yao, et al.
Pubblicazione: (2026)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
di: Liu, Junyu, et al.
Pubblicazione: (2026)
di: Liu, Junyu, et al.
Pubblicazione: (2026)
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
di: Liu, Ziqiang, et al.
Pubblicazione: (2024)
di: Liu, Ziqiang, et al.
Pubblicazione: (2024)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
di: Men, Tianyi, et al.
Pubblicazione: (2025)
di: Men, Tianyi, et al.
Pubblicazione: (2025)
KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs
di: Kim, Haechan, et al.
Pubblicazione: (2026)
di: Kim, Haechan, et al.
Pubblicazione: (2026)
BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting
di: Wang, Zhensheng, et al.
Pubblicazione: (2026)
di: Wang, Zhensheng, et al.
Pubblicazione: (2026)
MDIT-Bench: Evaluating the Dual-Implicit Toxicity in Large Multimodal Models
di: Jin, Bohan, et al.
Pubblicazione: (2025)
di: Jin, Bohan, et al.
Pubblicazione: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
di: Ding, Meidan, et al.
Pubblicazione: (2025)
di: Ding, Meidan, et al.
Pubblicazione: (2025)
TaskBench: Benchmarking Large Language Models for Task Automation
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
On Path to Multimodal Historical Reasoning: HistBench and HistAgent
di: Qiu, Jiahao, et al.
Pubblicazione: (2025)
di: Qiu, Jiahao, et al.
Pubblicazione: (2025)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
di: Zhang, Wenjing, et al.
Pubblicazione: (2024)
di: Zhang, Wenjing, et al.
Pubblicazione: (2024)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
di: Cui, Justin, et al.
Pubblicazione: (2024)
di: Cui, Justin, et al.
Pubblicazione: (2024)
ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models
di: Kapadnis, Manav Nitin, et al.
Pubblicazione: (2026)
di: Kapadnis, Manav Nitin, et al.
Pubblicazione: (2026)
Contextual Reinforcement in Multimodal Token Compression for Large Language Models
di: Piero, Naderdel, et al.
Pubblicazione: (2025)
di: Piero, Naderdel, et al.
Pubblicazione: (2025)
COBIAS: Assessing the Contextual Reliability of Bias Benchmarks for Language Models
di: Govil, Priyanshul, et al.
Pubblicazione: (2024)
di: Govil, Priyanshul, et al.
Pubblicazione: (2024)
ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code
di: Tang, Xiangru, et al.
Pubblicazione: (2023)
di: Tang, Xiangru, et al.
Pubblicazione: (2023)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
di: Tang, Zecheng, et al.
Pubblicazione: (2026)
di: Tang, Zecheng, et al.
Pubblicazione: (2026)
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models
di: Lee, Jaeho, et al.
Pubblicazione: (2025)
di: Lee, Jaeho, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
di: Liu, Zheyuan, et al.
Pubblicazione: (2026) -
EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models
di: Hu, He, et al.
Pubblicazione: (2025) -
TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health
di: Xiong, Zixin, et al.
Pubblicazione: (2026) -
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025) -
TurkBench: A Benchmark for Evaluating Turkish Large Language Models
di: Toraman, Çağrı, et al.
Pubblicazione: (2026)