MLA-Trust: Benchmarking Trustworthiness of Multimodal LLM Agents in GUI Environments
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Xiao, Chen, Jiawei, Luo, Jun, Fang, Zhengwei, Dong, Yinpeng, Su, Hang, Zhu, Jun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
von: Zhang, Yichi, et al.
Veröffentlicht: (2024)
von: Zhang, Yichi, et al.
Veröffentlicht: (2024)
A Survey on Autonomy-Induced Security Risks in Large Model-Based Agents
von: Su, Hang, et al.
Veröffentlicht: (2025)
von: Su, Hang, et al.
Veröffentlicht: (2025)
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents
von: Ding, Renhua, et al.
Veröffentlicht: (2025)
von: Ding, Renhua, et al.
Veröffentlicht: (2025)
RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations
von: Li, Hanyu, et al.
Veröffentlicht: (2026)
von: Li, Hanyu, et al.
Veröffentlicht: (2026)
OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments
von: Henry, Felix, et al.
Veröffentlicht: (2026)
von: Henry, Felix, et al.
Veröffentlicht: (2026)
Embodied Active Defense: Leveraging Recurrent Feedback to Counter Adversarial Patches
von: Wu, Lingxuan, et al.
Veröffentlicht: (2024)
von: Wu, Lingxuan, et al.
Veröffentlicht: (2024)
Exploring the Transferability of Visual Prompting for Multimodal Large Language Models
von: Zhang, Yichi, et al.
Veröffentlicht: (2024)
von: Zhang, Yichi, et al.
Veröffentlicht: (2024)
TyphoonMLA: A Mixed Naive-Absorb MLA Kernel For Shared Prefix
von: Yüzügüler, Ahmet Caner, et al.
Veröffentlicht: (2025)
von: Yüzügüler, Ahmet Caner, et al.
Veröffentlicht: (2025)
OSUniverse: Benchmark for Multimodal GUI-navigation AI Agents
von: Davydova, Mariya, et al.
Veröffentlicht: (2025)
von: Davydova, Mariya, et al.
Veröffentlicht: (2025)
MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
von: Chen, Ruihan, et al.
Veröffentlicht: (2025)
von: Chen, Ruihan, et al.
Veröffentlicht: (2025)
TrustAgent: Towards Safe and Trustworthy LLM-based Agents
von: Hua, Wenyue, et al.
Veröffentlicht: (2024)
von: Hua, Wenyue, et al.
Veröffentlicht: (2024)
EntWorld: A Holistic Environment and Benchmark for Verifiable Enterprise GUI Agents
von: Mo, Ying, et al.
Veröffentlicht: (2026)
von: Mo, Ying, et al.
Veröffentlicht: (2026)
GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents
von: Chen, Chen, et al.
Veröffentlicht: (2026)
von: Chen, Chen, et al.
Veröffentlicht: (2026)
LLM Agent Framework for Intelligent Change Analysis in Urban Environment using Remote Sensing Imagery
von: Xiao, Zixuan, et al.
Veröffentlicht: (2026)
von: Xiao, Zixuan, et al.
Veröffentlicht: (2026)
GUI-Robust: A Comprehensive Dataset for Testing GUI Agent Robustness in Real-World Anomalies
von: Yang, Jingqi, et al.
Veröffentlicht: (2025)
von: Yang, Jingqi, et al.
Veröffentlicht: (2025)
Alignment Dynamics in LLM Fine-Tuning
von: Huang, Yuhan, et al.
Veröffentlicht: (2026)
von: Huang, Yuhan, et al.
Veröffentlicht: (2026)
ProBench: Benchmarking GUI Agents with Accurate Process Information
von: Yang, Leyang, et al.
Veröffentlicht: (2025)
von: Yang, Leyang, et al.
Veröffentlicht: (2025)
Experience Transfer for Multimodal LLM Agents in Minecraft Game
von: Li, Chenghao, et al.
Veröffentlicht: (2026)
von: Li, Chenghao, et al.
Veröffentlicht: (2026)
GUI Testing Arena: A Unified Benchmark for Advancing Autonomous GUI Testing Agent
von: Zhao, Kangjia, et al.
Veröffentlicht: (2024)
von: Zhao, Kangjia, et al.
Veröffentlicht: (2024)
A Survey on (M)LLM-Based GUI Agents
von: Tang, Fei, et al.
Veröffentlicht: (2025)
von: Tang, Fei, et al.
Veröffentlicht: (2025)
Whisper-MLA: Reducing GPU Memory Consumption of ASR Models based on MHA2MLA Conversion
von: Zhang, Sen, et al.
Veröffentlicht: (2026)
von: Zhang, Sen, et al.
Veröffentlicht: (2026)
MMUEChange: A Generalized LLM Agent Framework for Intelligent Multi-Modal Urban Environment Change Analysis
von: Xiao, Zixuan, et al.
Veröffentlicht: (2026)
von: Xiao, Zixuan, et al.
Veröffentlicht: (2026)
Exploring the Secondary Risks of Large Language Models
von: Chen, Jiawei, et al.
Veröffentlicht: (2025)
von: Chen, Jiawei, et al.
Veröffentlicht: (2025)
Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
Towards Trustworthy Legal AI through LLM Agents and Formal Reasoning
von: Chen, Linze, et al.
Veröffentlicht: (2025)
von: Chen, Linze, et al.
Veröffentlicht: (2025)
Trustworthy Agent Network: Trust in Agent Networks Must Be Baked In, Not Bolted On
von: Yao, Yixiang, et al.
Veröffentlicht: (2026)
von: Yao, Yixiang, et al.
Veröffentlicht: (2026)
Zero-Permission Manipulation: Can We Trust Large Multimodal Model Powered GUI Agents?
von: Qian, Yi, et al.
Veröffentlicht: (2026)
von: Qian, Yi, et al.
Veröffentlicht: (2026)
macOSWorld: A Multilingual Interactive Benchmark for GUI Agents
von: Yang, Pei, et al.
Veröffentlicht: (2025)
von: Yang, Pei, et al.
Veröffentlicht: (2025)
TrustLDM: Benchmarking Trustworthiness in Language Diffusion Models
von: Mo, Yichuan, et al.
Veröffentlicht: (2026)
von: Mo, Yichuan, et al.
Veröffentlicht: (2026)
Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding
von: Wang, Youze, et al.
Veröffentlicht: (2025)
von: Wang, Youze, et al.
Veröffentlicht: (2025)
Quantifying Trust: Financial Risk Management for Trustworthy AI Agents
von: Hua, Wenyue, et al.
Veröffentlicht: (2026)
von: Hua, Wenyue, et al.
Veröffentlicht: (2026)
GUI-GENESIS: Automated Synthesis of Efficient Environments with Verifiable Rewards for GUI Agent Post-Training
von: Cao, Yuan, et al.
Veröffentlicht: (2026)
von: Cao, Yuan, et al.
Veröffentlicht: (2026)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
von: Li, Kai, et al.
Veröffentlicht: (2025)
von: Li, Kai, et al.
Veröffentlicht: (2025)
Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification
von: Zhang, Yichi, et al.
Veröffentlicht: (2026)
von: Zhang, Yichi, et al.
Veröffentlicht: (2026)
PSPA-Bench: A Personalized Benchmark for Smartphone GUI Agent
von: Nie, Hongyi, et al.
Veröffentlicht: (2026)
von: Nie, Hongyi, et al.
Veröffentlicht: (2026)
Mobile-Env: Building Qualified Evaluation Benchmarks for LLM-GUI Interaction
von: Zhang, Danyang, et al.
Veröffentlicht: (2023)
von: Zhang, Danyang, et al.
Veröffentlicht: (2023)
Reinforced Embodied Active Defense: Exploiting Adaptive Interaction for Robust Visual Perception in Adversarial 3D Environments
von: Yang, Xiao, et al.
Veröffentlicht: (2025)
von: Yang, Xiao, et al.
Veröffentlicht: (2025)
Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization
von: Zhu, Jiachen, et al.
Veröffentlicht: (2026)
von: Zhu, Jiachen, et al.
Veröffentlicht: (2026)
META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI
von: Sun, Liangtai, et al.
Veröffentlicht: (2022)
von: Sun, Liangtai, et al.
Veröffentlicht: (2022)
Ähnliche Einträge
-
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
von: Zhang, Yichi, et al.
Veröffentlicht: (2024) -
A Survey on Autonomy-Induced Security Risks in Large Model-Based Agents
von: Su, Hang, et al.
Veröffentlicht: (2025) -
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
von: Zhang, Yichi, et al.
Veröffentlicht: (2025) -
Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents
von: Ding, Renhua, et al.
Veröffentlicht: (2025) -
RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations
von: Li, Hanyu, et al.
Veröffentlicht: (2026)