Salvato in:
| Autori principali: | Liu, Yuxuan, Shi, Yuntian, Wang, Kun, Shen, Haoting, Yang, Kun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2602.03263 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension
di: Ouyang, Kun, et al.
Pubblicazione: (2024)
di: Ouyang, Kun, et al.
Pubblicazione: (2024)
Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents
di: Shen, Yiting, et al.
Pubblicazione: (2026)
di: Shen, Yiting, et al.
Pubblicazione: (2026)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams
di: Xu, Qiang, et al.
Pubblicazione: (2026)
di: Xu, Qiang, et al.
Pubblicazione: (2026)
CrossCult-KIBench: A Benchmark for Cross-Cultural Knowledge Insertion in MLLMs
di: Zeng, Zhen, et al.
Pubblicazione: (2026)
di: Zeng, Zhen, et al.
Pubblicazione: (2026)
Pragma-VL: Towards a Pragmatic Arbitration of Safety and Helpfulness in MLLMs
di: Wen, Ming, et al.
Pubblicazione: (2026)
di: Wen, Ming, et al.
Pubblicazione: (2026)
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
di: Li, Caorui, et al.
Pubblicazione: (2025)
di: Li, Caorui, et al.
Pubblicazione: (2025)
SPA-Bench: A Comprehensive Benchmark for SmartPhone Agent Evaluation
di: Chen, Jingxuan, et al.
Pubblicazione: (2024)
di: Chen, Jingxuan, et al.
Pubblicazione: (2024)
CSR-Bench: Benchmarking LLM Agents in Deployment of Computer Science Research Repositories
di: Xiao, Yijia, et al.
Pubblicazione: (2025)
di: Xiao, Yijia, et al.
Pubblicazione: (2025)
From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities
di: Jiang, Shixin, et al.
Pubblicazione: (2024)
di: Jiang, Shixin, et al.
Pubblicazione: (2024)
MileBench: Benchmarking MLLMs in Long Context
di: Song, Dingjie, et al.
Pubblicazione: (2024)
di: Song, Dingjie, et al.
Pubblicazione: (2024)
CityTrajBench: A Unified Benchmark for City-Scale Vehicle Trajectory Generation
di: Zhu, Shibo, et al.
Pubblicazione: (2026)
di: Zhu, Shibo, et al.
Pubblicazione: (2026)
TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs
di: Xu, Pengju, et al.
Pubblicazione: (2025)
di: Xu, Pengju, et al.
Pubblicazione: (2025)
LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing
di: Fein, Daniel, et al.
Pubblicazione: (2025)
di: Fein, Daniel, et al.
Pubblicazione: (2025)
EEG-FM-Bench: A Comprehensive Benchmark for the Systematic Evaluation of EEG Foundation Models
di: Xiong, Wei, et al.
Pubblicazione: (2025)
di: Xiong, Wei, et al.
Pubblicazione: (2025)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
di: Liu, Mianxin, et al.
Pubblicazione: (2024)
di: Liu, Mianxin, et al.
Pubblicazione: (2024)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
di: Zhang, Wenjing, et al.
Pubblicazione: (2024)
di: Zhang, Wenjing, et al.
Pubblicazione: (2024)
ELT-Bench: An End-to-End Benchmark for Evaluating AI Agents on ELT Pipelines
di: Jin, Tengjun, et al.
Pubblicazione: (2025)
di: Jin, Tengjun, et al.
Pubblicazione: (2025)
MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models
di: Yang, Tianzhuo, et al.
Pubblicazione: (2026)
di: Yang, Tianzhuo, et al.
Pubblicazione: (2026)
Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs
di: Anand, Dhruv, et al.
Pubblicazione: (2025)
di: Anand, Dhruv, et al.
Pubblicazione: (2025)
OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences
di: Wen, Ming, et al.
Pubblicazione: (2026)
di: Wen, Ming, et al.
Pubblicazione: (2026)
XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity
di: Choi, Dasol, et al.
Pubblicazione: (2026)
di: Choi, Dasol, et al.
Pubblicazione: (2026)
RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation
di: Jiang, Feng, et al.
Pubblicazione: (2026)
di: Jiang, Feng, et al.
Pubblicazione: (2026)
BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments
di: Li, Yuxuan, et al.
Pubblicazione: (2026)
di: Li, Yuxuan, et al.
Pubblicazione: (2026)
ST-WebAgentBench: A Benchmark for Evaluating Safety and Trustworthiness in Web Agents
di: Levy, Ido, et al.
Pubblicazione: (2024)
di: Levy, Ido, et al.
Pubblicazione: (2024)
MirrorBench: Evaluating Self-centric Intelligence in MLLMs by Introducing a Mirror
di: Guo, Shengyu, et al.
Pubblicazione: (2026)
di: Guo, Shengyu, et al.
Pubblicazione: (2026)
Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment
di: Wang, Kun, et al.
Pubblicazione: (2026)
di: Wang, Kun, et al.
Pubblicazione: (2026)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
di: Fang, Junfeng, et al.
Pubblicazione: (2025)
di: Fang, Junfeng, et al.
Pubblicazione: (2025)
GuardAD: Safeguarding Autonomous Driving MLLMs via Markovian Safety Logic
di: Zhang, Tianyuan, et al.
Pubblicazione: (2026)
di: Zhang, Tianyuan, et al.
Pubblicazione: (2026)
DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation
di: Xie, Sixiong, et al.
Pubblicazione: (2026)
di: Xie, Sixiong, et al.
Pubblicazione: (2026)
Affordance Benchmark for MLLMs
di: Wang, Junying, et al.
Pubblicazione: (2025)
di: Wang, Junying, et al.
Pubblicazione: (2025)
EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs
di: Dai, Yang, et al.
Pubblicazione: (2026)
di: Dai, Yang, et al.
Pubblicazione: (2026)
KidsArtBench: Multi-Dimensional Children's Art Evaluation with Attribute-Aware MLLMs
di: Ye, Mingrui, et al.
Pubblicazione: (2025)
di: Ye, Mingrui, et al.
Pubblicazione: (2025)
UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models
di: Chen, Chen, et al.
Pubblicazione: (2025)
di: Chen, Chen, et al.
Pubblicazione: (2025)
Children's Intelligence Tests Pose Challenges for MLLMs? KidGym: A 2D Grid-Based Reasoning Benchmark for MLLMs
di: Ye, Hengwei, et al.
Pubblicazione: (2026)
di: Ye, Hengwei, et al.
Pubblicazione: (2026)
MatFormBench: A Benchmarking Evaluation Framework for Target-Driven Materials Formulation
di: Wu, Linhan, et al.
Pubblicazione: (2026)
di: Wu, Linhan, et al.
Pubblicazione: (2026)
ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain
di: Zhao, Haochen, et al.
Pubblicazione: (2024)
di: Zhao, Haochen, et al.
Pubblicazione: (2024)
StructBreak: Structural Cognitive Overload-Induced Safety Failures in MLLMs
di: Luo, Yang, et al.
Pubblicazione: (2026)
di: Luo, Yang, et al.
Pubblicazione: (2026)
SciIntegrity-Bench: A Benchmark for Evaluating Academic Integrity in AI Scientist Systems
di: Yang, Zonglin, et al.
Pubblicazione: (2026)
di: Yang, Zonglin, et al.
Pubblicazione: (2026)
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
di: Wang, Siyin, et al.
Pubblicazione: (2024)
di: Wang, Siyin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension
di: Ouyang, Kun, et al.
Pubblicazione: (2024) -
Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents
di: Shen, Yiting, et al.
Pubblicazione: (2026) -
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
di: Zong, Xuanjun, et al.
Pubblicazione: (2025) -
ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams
di: Xu, Qiang, et al.
Pubblicazione: (2026) -
CrossCult-KIBench: A Benchmark for Cross-Cultural Knowledge Insertion in MLLMs
di: Zeng, Zhen, et al.
Pubblicazione: (2026)