WebSuite: Systematically Evaluating Why Web Agents Fail
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Eric, Waldo, Jim |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EmbeWebAgent: Embedding Web Agents into Any Customized UI
par: Ma, Chenyang, et autres
Publié: (2026)
par: Ma, Chenyang, et autres
Publié: (2026)
Five Fatal Assumptions: Why T-Shirt Sizing Systematically Fails for AI Projects
par: Soundaramourty, Raja, et autres
Publié: (2026)
par: Soundaramourty, Raja, et autres
Publié: (2026)
Exploring Autonomous Agents: A Closer Look at Why They Fail When Completing Tasks
par: Lu, Ruofan, et autres
Publié: (2025)
par: Lu, Ruofan, et autres
Publié: (2025)
WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality
par: Li, Chunyang, et autres
Publié: (2025)
par: Li, Chunyang, et autres
Publié: (2025)
WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models
par: Lei, Xinping, et autres
Publié: (2026)
par: Lei, Xinping, et autres
Publié: (2026)
Coherence Collapse: Diagnosing Why Code Agents Fail After Reaching the Right Code
par: Kim, Myeongsoo, et autres
Publié: (2026)
par: Kim, Myeongsoo, et autres
Publié: (2026)
StressWeb: A Diagnostic Benchmark for Web Agent Robustness under Realistic Interaction Variability
par: Bai, Haoyue, et autres
Publié: (2026)
par: Bai, Haoyue, et autres
Publié: (2026)
WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics
par: Liu, Chenxu, et autres
Publié: (2026)
par: Liu, Chenxu, et autres
Publié: (2026)
Multimodal Auto Validation For Self-Refinement in Web Agents
par: Azam, Ruhana, et autres
Publié: (2024)
par: Azam, Ruhana, et autres
Publié: (2024)
ContractSkill: Repairable Contract-Based Skills for Multimodal Web Agents
par: Lu, Zijian, et autres
Publié: (2026)
par: Lu, Zijian, et autres
Publié: (2026)
Why Attention Fails: A Taxonomy of Faults in Attention-Based Neural Networks
par: Jahan, Sigma, et autres
Publié: (2025)
par: Jahan, Sigma, et autres
Publié: (2025)
WebApp1K: A Practical Code-Generation Benchmark for Web App Development
par: Cui, Yi
Publié: (2024)
par: Cui, Yi
Publié: (2024)
AutoWebWorld: Synthesizing Infinite Verifiable Web Environments via Finite State Machines
par: Wu, Yifan, et autres
Publié: (2026)
par: Wu, Yifan, et autres
Publié: (2026)
Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification
par: He, Zehai, et autres
Publié: (2026)
par: He, Zehai, et autres
Publié: (2026)
Evaluating the Use of LLMs for Automated DOM-Level Resolution of Web Performance Issues
par: Peters, Gideon, et autres
Publié: (2026)
par: Peters, Gideon, et autres
Publié: (2026)
WebTestBench: Evaluating Computer-Use Agents towards End-to-End Automated Web Testing
par: Kong, Fanheng, et autres
Publié: (2026)
par: Kong, Fanheng, et autres
Publié: (2026)
Where Do AI Coding Agents Fail? An Empirical Study of Failed Agentic Pull Requests in GitHub
par: Ehsani, Ramtin, et autres
Publié: (2026)
par: Ehsani, Ramtin, et autres
Publié: (2026)
The BrowserGym Ecosystem for Web Agent Research
par: De Chezelles, Thibault Le Sellier, et autres
Publié: (2024)
par: De Chezelles, Thibault Le Sellier, et autres
Publié: (2024)
Automatically Generating Web Applications from Requirements Via Multi-Agent Test-Driven Development
par: Wan, Yuxuan, et autres
Publié: (2025)
par: Wan, Yuxuan, et autres
Publié: (2025)
Cybernaut: Towards Reliable Web Automation
par: Tomar, Ankur, et autres
Publié: (2025)
par: Tomar, Ankur, et autres
Publié: (2025)
LLMs in Web Development: Evaluating LLM-Generated PHP Code Unveiling Vulnerabilities and Limitations
par: Tóth, Rebeka, et autres
Publié: (2024)
par: Tóth, Rebeka, et autres
Publié: (2024)
WebVIA: A Web-based Vision-Language Agentic Framework for Interactive and Verifiable UI-to-Code Generation
par: Xu, Mingde, et autres
Publié: (2025)
par: Xu, Mingde, et autres
Publié: (2025)
Butterfly Effects in Toolchains: A Comprehensive Analysis of Failed Parameter Filling in LLM Tool-Agent Systems
par: Xiong, Qian, et autres
Publié: (2025)
par: Xiong, Qian, et autres
Publié: (2025)
An Executable Benchmarking Suite for Tool-Using Agents
par: Zhong, Zhiqing, et autres
Publié: (2026)
par: Zhong, Zhiqing, et autres
Publié: (2026)
Insights from Benchmarking Frontier Language Models on Web App Code Generation
par: Cui, Yi
Publié: (2024)
par: Cui, Yi
Publié: (2024)
From Ranking to Reasoning: Explainable Web API Recommendation via Semantic Reasoning
par: Xu, Zishuo, et autres
Publié: (2025)
par: Xu, Zishuo, et autres
Publié: (2025)
An Object Web Seminar: A Retrospective on a Technical Dialogue Still Reverberating
par: Cusick, James J.
Publié: (2026)
par: Cusick, James J.
Publié: (2026)
AI Agents for Web Testing: A Case Study in the Wild
par: Ye, Naimeng, et autres
Publié: (2025)
par: Ye, Naimeng, et autres
Publié: (2025)
WALL: A Web Application for Automated Quality Assurance using Large Language Models
par: Abtahi, Seyed Moein, et autres
Publié: (2025)
par: Abtahi, Seyed Moein, et autres
Publié: (2025)
WebChecker: A Versatile EVL Plugin for Validating HTML Pages with Bootstrap Frameworks
par: Cherukuri, Milind
Publié: (2025)
par: Cherukuri, Milind
Publié: (2025)
AccessGuru: Leveraging LLMs to Detect and Correct Web Accessibility Violations in HTML Code
par: Fathallah, Nadeen, et autres
Publié: (2025)
par: Fathallah, Nadeen, et autres
Publié: (2025)
A Dual-Helix Governance Approach Towards Reliable Agentic AI for WebGIS Development
par: Boyuan, et autres
Publié: (2026)
par: Boyuan, et autres
Publié: (2026)
Web Agents Should Adopt the Plan-Then-Execute Paradigm
par: Piet, Julien, et autres
Publié: (2026)
par: Piet, Julien, et autres
Publié: (2026)
A microservice architecture for real-time IoT data processing: A reusable Web of things approach for smart ports
par: Ortiz, Guadalupe, et autres
Publié: (2024)
par: Ortiz, Guadalupe, et autres
Publié: (2024)
AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation
par: Sahoo, Priyam, et autres
Publié: (2026)
par: Sahoo, Priyam, et autres
Publié: (2026)
Why Are AI Agent Involved Pull Requests (Fix-Related) Remain Unmerged? An Empirical Study
par: Alam, Khairul, et autres
Publié: (2026)
par: Alam, Khairul, et autres
Publié: (2026)
LLMs for Qualitative Data Analysis Fail on Security-specificComments in Human Experiments
par: Camporese, Maria, et autres
Publié: (2026)
par: Camporese, Maria, et autres
Publié: (2026)
EvoGPT: Leveraging LLM-Driven Seed Diversity to Improve Search-Based Test Suite Generation
par: Broide, Lior, et autres
Publié: (2025)
par: Broide, Lior, et autres
Publié: (2025)
VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents
par: Guo, JunJia, et autres
Publié: (2026)
par: Guo, JunJia, et autres
Publié: (2026)
A System for Automated Unit Test Generation Using Large Language Models and Assessment of Generated Test Suites
par: Lops, Andrea, et autres
Publié: (2024)
par: Lops, Andrea, et autres
Publié: (2024)
Documents similaires
-
EmbeWebAgent: Embedding Web Agents into Any Customized UI
par: Ma, Chenyang, et autres
Publié: (2026) -
Five Fatal Assumptions: Why T-Shirt Sizing Systematically Fails for AI Projects
par: Soundaramourty, Raja, et autres
Publié: (2026) -
Exploring Autonomous Agents: A Closer Look at Why They Fail When Completing Tasks
par: Lu, Ruofan, et autres
Publié: (2025) -
WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality
par: Li, Chunyang, et autres
Publié: (2025) -
WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models
par: Lei, Xinping, et autres
Publié: (2026)