StressWeb: A Diagnostic Benchmark for Web Agent Robustness under Realistic Interaction Variability
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bai, Haoyue, Wang, Dong, Chen, Long, Hao, Bingguang, Shao, Pengyang, Yang, Yonghui, He, Yicheng, Zhuang, Chenyi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EmbeWebAgent: Embedding Web Agents into Any Customized UI
par: Ma, Chenyang, et autres
Publié: (2026)
par: Ma, Chenyang, et autres
Publié: (2026)
Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification
par: He, Zehai, et autres
Publié: (2026)
par: He, Zehai, et autres
Publié: (2026)
WebSuite: Systematically Evaluating Why Web Agents Fail
par: Li, Eric, et autres
Publié: (2024)
par: Li, Eric, et autres
Publié: (2024)
Are Autonomous Web Agents Good Testers?
par: Chevrot, Antoine, et autres
Publié: (2025)
par: Chevrot, Antoine, et autres
Publié: (2025)
WebMAC: A Multi-Agent Collaborative Framework for Scenario Testing of Web Systems
par: Wan, Zhenyu, et autres
Publié: (2026)
par: Wan, Zhenyu, et autres
Publié: (2026)
APISENSOR: Robust Discovery of Web API from Runtime Traffic Logs
par: Yang, Yanjing, et autres
Publié: (2026)
par: Yang, Yanjing, et autres
Publié: (2026)
WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics
par: Liu, Chenxu, et autres
Publié: (2026)
par: Liu, Chenxu, et autres
Publié: (2026)
WebApp1K: A Practical Code-Generation Benchmark for Web App Development
par: Cui, Yi
Publié: (2024)
par: Cui, Yi
Publié: (2024)
Temac: Multi-Agent Collaboration for Automated Web GUI Testing
par: Liu, Chenxu, et autres
Publié: (2025)
par: Liu, Chenxu, et autres
Publié: (2025)
Debugging WebAssembly? Put some Whamm on it!
par: Gilbert, Elizabeth, et autres
Publié: (2025)
par: Gilbert, Elizabeth, et autres
Publié: (2025)
ContractSkill: Repairable Contract-Based Skills for Multimodal Web Agents
par: Lu, Zijian, et autres
Publié: (2026)
par: Lu, Zijian, et autres
Publié: (2026)
WebSPL: A Software Product Line for Web Applications
par: da Luz, Maicon Azevedo, et autres
Publié: (2024)
par: da Luz, Maicon Azevedo, et autres
Publié: (2024)
Envisioning Future Interactive Web Development: Editing Webpage with Natural Language
par: Dang, Truong Hai, et autres
Publié: (2025)
par: Dang, Truong Hai, et autres
Publié: (2025)
WebVIA: A Web-based Vision-Language Agentic Framework for Interactive and Verifiable UI-to-Code Generation
par: Xu, Mingde, et autres
Publié: (2025)
par: Xu, Mingde, et autres
Publié: (2025)
Multimodal Auto Validation For Self-Refinement in Web Agents
par: Azam, Ruhana, et autres
Publié: (2024)
par: Azam, Ruhana, et autres
Publié: (2024)
AutoWebWorld: Synthesizing Infinite Verifiable Web Environments via Finite State Machines
par: Wu, Yifan, et autres
Publié: (2026)
par: Wu, Yifan, et autres
Publié: (2026)
VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents
par: Guo, JunJia, et autres
Publié: (2026)
par: Guo, JunJia, et autres
Publié: (2026)
WebTestPilot: Agentic End-to-End Web Testing against Natural Language Specification by Inferring Oracles with Symbolized GUI Elements
par: Teoh, Xiwen, et autres
Publié: (2026)
par: Teoh, Xiwen, et autres
Publié: (2026)
The Promise and Pitfalls of WebAssembly: Perspectives from the Industry
par: He, Ningyu, et autres
Publié: (2025)
par: He, Ningyu, et autres
Publié: (2025)
Autonomous Legacy Web Application Upgrades Using a Multi-Agent System
par: Ala-Salmi, Valtteri, et autres
Publié: (2025)
par: Ala-Salmi, Valtteri, et autres
Publié: (2025)
DSCodeBench: A Realistic Benchmark for Data Science Code Generation
par: Ouyang, Shuyin, et autres
Publié: (2025)
par: Ouyang, Shuyin, et autres
Publié: (2025)
Web Element Relocalization in Evolving Web Applications: A Comparative Analysis and Extension Study
par: Kluge, Anton, et autres
Publié: (2025)
par: Kluge, Anton, et autres
Publié: (2025)
WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models
par: Lei, Xinping, et autres
Publié: (2026)
par: Lei, Xinping, et autres
Publié: (2026)
The BrowserGym Ecosystem for Web Agent Research
par: De Chezelles, Thibault Le Sellier, et autres
Publié: (2024)
par: De Chezelles, Thibault Le Sellier, et autres
Publié: (2024)
LLM Agents for Automated Web Vulnerability Reproduction: Are We There Yet?
par: Liu, Bin, et autres
Publié: (2025)
par: Liu, Bin, et autres
Publié: (2025)
Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces
par: Merrill, Mike A., et autres
Publié: (2026)
par: Merrill, Mike A., et autres
Publié: (2026)
Neural Embeddings for Web Testing
par: Kanaththage, Kasun, et autres
Publié: (2023)
par: Kanaththage, Kasun, et autres
Publié: (2023)
An Autonomous RL Agent Methodology for Dynamic Web UI Testing in a BDD Framework
par: Mughal, Ali Hassaan
Publié: (2025)
par: Mughal, Ali Hassaan
Publié: (2025)
Saving SWE-Bench: A Benchmark Mutation Approach for Realistic Agent Evaluation
par: Garg, Spandan, et autres
Publié: (2025)
par: Garg, Spandan, et autres
Publié: (2025)
Agent-Oriented Visual Programming for the Web of Things
par: Burattini, Samuele, et autres
Publié: (2025)
par: Burattini, Samuele, et autres
Publié: (2025)
Development of an Automated Web Application for Efficient Web Scraping: Design and Implementation
par: Dutta, Alok, et autres
Publié: (2025)
par: Dutta, Alok, et autres
Publié: (2025)
CodeCircuit: Toward Inferring LLM-Generated Code Correctness via Attribution Graphs
par: He, Yicheng, et autres
Publié: (2026)
par: He, Yicheng, et autres
Publié: (2026)
Insights from Benchmarking Frontier Language Models on Web App Code Generation
par: Cui, Yi
Publié: (2024)
par: Cui, Yi
Publié: (2024)
WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality
par: Li, Chunyang, et autres
Publié: (2025)
par: Li, Chunyang, et autres
Publié: (2025)
WebTestBench: Evaluating Computer-Use Agents towards End-to-End Automated Web Testing
par: Kong, Fanheng, et autres
Publié: (2026)
par: Kong, Fanheng, et autres
Publié: (2026)
Accessibility Issues in Ad-Driven Web Applications
par: Amjad, Abdul Haddi, et autres
Publié: (2024)
par: Amjad, Abdul Haddi, et autres
Publié: (2024)
Testing Medical Rules Web Services in Practice
par: Laaber, Christoph, et autres
Publié: (2024)
par: Laaber, Christoph, et autres
Publié: (2024)
Research on WebAssembly Runtimes: A Survey
par: Zhang, Yixuan, et autres
Publié: (2024)
par: Zhang, Yixuan, et autres
Publié: (2024)
Do RESTful API Design Rules Have an Impact on the Understandability of Web APIs? A Web-Based Experiment with API Descriptions
par: Bogner, Justus, et autres
Publié: (2023)
par: Bogner, Justus, et autres
Publié: (2023)
Energy Patterns for Web: An Exploratory Study
par: Rani, Pooja, et autres
Publié: (2024)
par: Rani, Pooja, et autres
Publié: (2024)
Documents similaires
-
EmbeWebAgent: Embedding Web Agents into Any Customized UI
par: Ma, Chenyang, et autres
Publié: (2026) -
Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification
par: He, Zehai, et autres
Publié: (2026) -
WebSuite: Systematically Evaluating Why Web Agents Fail
par: Li, Eric, et autres
Publié: (2024) -
Are Autonomous Web Agents Good Testers?
par: Chevrot, Antoine, et autres
Publié: (2025) -
WebMAC: A Multi-Agent Collaborative Framework for Scenario Testing of Web Systems
par: Wan, Zhenyu, et autres
Publié: (2026)