CUAAudit: Meta-Evaluation of Vision-Language Models as Auditors of Autonomous Computer-Use Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Sumyk, Marta, Kosovan, Oleksandr |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
"Are We Done Yet?": A Vision-Based Judge for Autonomous Task Completion of Computer Use Agents
di: Sumyk, Marta, et al.
Pubblicazione: (2025)
di: Sumyk, Marta, et al.
Pubblicazione: (2025)
Toward Agentic RAG for Ukrainian
di: Sumyk, Marta, et al.
Pubblicazione: (2026)
di: Sumyk, Marta, et al.
Pubblicazione: (2026)
Screen2AX: Vision-Based Approach for Automatic macOS Accessibility Generation
di: Muryn, Viktor, et al.
Pubblicazione: (2025)
di: Muryn, Viktor, et al.
Pubblicazione: (2025)
ParaView-MCP: An Autonomous Visualization Agent with Direct Tool Use
di: Liu, Shusen, et al.
Pubblicazione: (2025)
di: Liu, Shusen, et al.
Pubblicazione: (2025)
ScreenAgent: A Vision Language Model-driven Computer Control Agent
di: Niu, Runliang, et al.
Pubblicazione: (2024)
di: Niu, Runliang, et al.
Pubblicazione: (2024)
Secret Use of Large Language Model (LLM)
di: Zhang, Zhiping, et al.
Pubblicazione: (2024)
di: Zhang, Zhiping, et al.
Pubblicazione: (2024)
AgentLens: Visual Analysis for Agent Behaviors in LLM-based Autonomous Systems
di: Lu, Jiaying, et al.
Pubblicazione: (2024)
di: Lu, Jiaying, et al.
Pubblicazione: (2024)
LiteCUA: Computer as MCP Server for Computer-Use Agent on AIOS
di: Mei, Kai, et al.
Pubblicazione: (2025)
di: Mei, Kai, et al.
Pubblicazione: (2025)
IntentCUA: Learning Intent-level Representations for Skill Abstraction and Multi-Agent Planning in Computer-Use Agents
di: Lee, Seoyoung, et al.
Pubblicazione: (2026)
di: Lee, Seoyoung, et al.
Pubblicazione: (2026)
Layout Generation Agents with Large Language Models
di: Sasazawa, Yuichi, et al.
Pubblicazione: (2024)
di: Sasazawa, Yuichi, et al.
Pubblicazione: (2024)
Human-AI Collaborative Game Testing with Vision Language Models
di: Zhang, Boran, et al.
Pubblicazione: (2025)
di: Zhang, Boran, et al.
Pubblicazione: (2025)
Creating General User Models from Computer Use
di: Shaikh, Omar, et al.
Pubblicazione: (2025)
di: Shaikh, Omar, et al.
Pubblicazione: (2025)
Autonomous Prompt Engineering in Large Language Models
di: Kepel, Daan, et al.
Pubblicazione: (2024)
di: Kepel, Daan, et al.
Pubblicazione: (2024)
TalkToAgent: A Human-centric Explanation of Reinforcement Learning Agents with Large Language Models
di: Kim, Haechang, et al.
Pubblicazione: (2025)
di: Kim, Haechang, et al.
Pubblicazione: (2025)
SAPIEN: Affective Virtual Agents Powered by Large Language Models
di: Hasan, Masum, et al.
Pubblicazione: (2023)
di: Hasan, Masum, et al.
Pubblicazione: (2023)
Embracing AI in Education: Understanding the Surge in Large Language Model Use by Secondary Students
di: Zhu, Tiffany, et al.
Pubblicazione: (2024)
di: Zhu, Tiffany, et al.
Pubblicazione: (2024)
AquaVLM: Improving Underwater Situation Awareness with Mobile Vision Language Models
di: Tian, Beitong, et al.
Pubblicazione: (2025)
di: Tian, Beitong, et al.
Pubblicazione: (2025)
Scenarios in Computing Research: A Systematic Review of the Use of Scenario Methods for Exploring the Future of Computing Technologies in Society
di: Barnett, Julia, et al.
Pubblicazione: (2025)
di: Barnett, Julia, et al.
Pubblicazione: (2025)
Evaluating Environments Using Exploratory Agents
di: Khaleque, Bobby, et al.
Pubblicazione: (2024)
di: Khaleque, Bobby, et al.
Pubblicazione: (2024)
A Comprehensive Survey of Agents for Computer Use: Foundations, Challenges, and Future Directions
di: Sager, Pascal J., et al.
Pubblicazione: (2025)
di: Sager, Pascal J., et al.
Pubblicazione: (2025)
Context-Value-Action Architecture for Value-Driven Large Language Model Agents
di: Zhang, TianZe, et al.
Pubblicazione: (2026)
di: Zhang, TianZe, et al.
Pubblicazione: (2026)
A Multidisciplinary Design and Optimization (MDO) Agent Driven by Large Language Models
di: Guo, Bingkun, et al.
Pubblicazione: (2025)
di: Guo, Bingkun, et al.
Pubblicazione: (2025)
A Multi-Agent Large Language Model Framework for Automated Qualitative Analysis
di: Xu, Qidi, et al.
Pubblicazione: (2025)
di: Xu, Qidi, et al.
Pubblicazione: (2025)
BlenderLLM: Training Large Language Models for Computer-Aided Design with Self-improvement
di: Du, Yuhao, et al.
Pubblicazione: (2024)
di: Du, Yuhao, et al.
Pubblicazione: (2024)
Visual and Cognitive Demands of a Large Language Model-Powered In-vehicle Conversational Agent
di: Monk, Chris, et al.
Pubblicazione: (2026)
di: Monk, Chris, et al.
Pubblicazione: (2026)
Beyond Final Answers: Evaluating Large Language Models for Math Tutoring
di: Gupta, Adit, et al.
Pubblicazione: (2025)
di: Gupta, Adit, et al.
Pubblicazione: (2025)
Meta-Prompting: Enhancing Language Models with Task-Agnostic Scaffolding
di: Suzgun, Mirac, et al.
Pubblicazione: (2024)
di: Suzgun, Mirac, et al.
Pubblicazione: (2024)
Large Language Model Use Impact Locus of Control
di: Fu, Jenny Xiyu, et al.
Pubblicazione: (2025)
di: Fu, Jenny Xiyu, et al.
Pubblicazione: (2025)
Utilizing Vision-Language Models as Action Models for Intent Recognition and Assistance
di: Contreras, Cesar Alan, et al.
Pubblicazione: (2025)
di: Contreras, Cesar Alan, et al.
Pubblicazione: (2025)
A Scoping Review of the Ethical Perspectives on Anthropomorphising Large Language Model-Based Conversational Agents
di: Ferrario, Andrea, et al.
Pubblicazione: (2026)
di: Ferrario, Andrea, et al.
Pubblicazione: (2026)
DisaBench: A Participatory Evaluation Framework for Disability Harms in Language Models
di: Kim, Eugenia, et al.
Pubblicazione: (2026)
di: Kim, Eugenia, et al.
Pubblicazione: (2026)
A Causality-aware Paradigm for Evaluating Creativity of Multimodal Large Language Models
di: Huang, Zhongzhan, et al.
Pubblicazione: (2025)
di: Huang, Zhongzhan, et al.
Pubblicazione: (2025)
Evaluating Usability and Engagement of Large Language Models in Virtual Reality for Traditional Scottish Curling
di: Lau, Ka Hei Carrie, et al.
Pubblicazione: (2024)
di: Lau, Ka Hei Carrie, et al.
Pubblicazione: (2024)
Anticipating User Needs: Insights from Design Fiction on Conversational Agents for Computational Thinking
di: Penney, Jacob, et al.
Pubblicazione: (2023)
di: Penney, Jacob, et al.
Pubblicazione: (2023)
Human-AI Teaming Using Large Language Models: Boosting Brain-Computer Interfacing (BCI) and Brain Research
di: Kapitonova, Maryna, et al.
Pubblicazione: (2024)
di: Kapitonova, Maryna, et al.
Pubblicazione: (2024)
Not There Yet: Evaluating Vision Language Models in Simulating the Visual Perception of People with Low Vision
di: Natalie, Rosiana, et al.
Pubblicazione: (2025)
di: Natalie, Rosiana, et al.
Pubblicazione: (2025)
VisMoDAl: Visual Analytics for Evaluating and Improving Corruption Robustness of Vision-Language Models
di: Wang, Huanchen, et al.
Pubblicazione: (2025)
di: Wang, Huanchen, et al.
Pubblicazione: (2025)
ClickAgent: Enhancing UI Location Capabilities of Autonomous Agents
di: Hoscilowicz, Jakub, et al.
Pubblicazione: (2024)
di: Hoscilowicz, Jakub, et al.
Pubblicazione: (2024)
Lexara: A User-Centered Toolkit for Evaluating Large Language Models for Conversational Visual Analytics
di: Palani, Srishti, et al.
Pubblicazione: (2026)
di: Palani, Srishti, et al.
Pubblicazione: (2026)
AgentEconomist: An End-to-end Agentic System Translating Economic Intuitions into Executable Computational Experiments
di: Chen, Jiaju, et al.
Pubblicazione: (2026)
di: Chen, Jiaju, et al.
Pubblicazione: (2026)
Documenti analoghi
-
"Are We Done Yet?": A Vision-Based Judge for Autonomous Task Completion of Computer Use Agents
di: Sumyk, Marta, et al.
Pubblicazione: (2025) -
Toward Agentic RAG for Ukrainian
di: Sumyk, Marta, et al.
Pubblicazione: (2026) -
Screen2AX: Vision-Based Approach for Automatic macOS Accessibility Generation
di: Muryn, Viktor, et al.
Pubblicazione: (2025) -
ParaView-MCP: An Autonomous Visualization Agent with Direct Tool Use
di: Liu, Shusen, et al.
Pubblicazione: (2025) -
ScreenAgent: A Vision Language Model-driven Computer Control Agent
di: Niu, Runliang, et al.
Pubblicazione: (2024)