Guardado en:
| Autores principales: | Jia, Hangyi, Qian, Yuxi, Tong, Hanwen, Wu, Xinhui, Chen, Lin, Wei, Feng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2509.09321 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
I-MCTS: Enhancing Agentic AutoML via Introspective Monte Carlo Tree Search
por: Liang, Zujie, et al.
Publicado: (2025)
por: Liang, Zujie, et al.
Publicado: (2025)
The ML.ENERGY Benchmark: Toward Automated Inference Energy Measurement and Optimization
por: Chung, Jae-Won, et al.
Publicado: (2025)
por: Chung, Jae-Won, et al.
Publicado: (2025)
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
por: Yang, Rui, et al.
Publicado: (2026)
por: Yang, Rui, et al.
Publicado: (2026)
WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics
por: Liu, Chenxu, et al.
Publicado: (2026)
por: Liu, Chenxu, et al.
Publicado: (2026)
WIPI: A New Web Threat for LLM-Driven Web Agents
por: Wu, Fangzhou, et al.
Publicado: (2024)
por: Wu, Fangzhou, et al.
Publicado: (2024)
Towards Data-Centric RLHF: Simple Metrics for Preference Dataset Comparison
por: Shen, Judy Hanwen, et al.
Publicado: (2024)
por: Shen, Judy Hanwen, et al.
Publicado: (2024)
DMind Benchmark: Toward a Holistic Assessment of LLM Capabilities across the Web3 Domain
por: Huang, Enhao, et al.
Publicado: (2025)
por: Huang, Enhao, et al.
Publicado: (2025)
Towards Stepwise Domain Knowledge-Driven Reasoning Optimization and Reflection Improvement
por: Liu, Chengyuan, et al.
Publicado: (2025)
por: Liu, Chengyuan, et al.
Publicado: (2025)
Automatic In-Domain Exemplar Construction and LLM-Based Refinement of Multi-LLM Expansions for Query Expansion
por: Li, Minghan, et al.
Publicado: (2026)
por: Li, Minghan, et al.
Publicado: (2026)
HarmonyGuard: Toward Safety and Utility in Web Agents via Adaptive Policy Enhancement and Dual-Objective Optimization
por: Chen, Yurun, et al.
Publicado: (2025)
por: Chen, Yurun, et al.
Publicado: (2025)
MAGNET: Towards Adaptive GUI Agents with Memory-Driven Knowledge Evolution
por: Sun, Libo, et al.
Publicado: (2026)
por: Sun, Libo, et al.
Publicado: (2026)
A Functionality-Grounded Benchmark for Evaluating Web Agents in E-commerce Domains
por: Zhang, Xianren, et al.
Publicado: (2025)
por: Zhang, Xianren, et al.
Publicado: (2025)
WebCanvas: Benchmarking Web Agents in Online Environments
por: Pan, Yichen, et al.
Publicado: (2024)
por: Pan, Yichen, et al.
Publicado: (2024)
A Survey of WebAgents: Towards Next-Generation AI Agents for Web Automation with Large Foundation Models
por: Ning, Liangbo, et al.
Publicado: (2025)
por: Ning, Liangbo, et al.
Publicado: (2025)
PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments
por: Liu, Shuochen, et al.
Publicado: (2026)
por: Liu, Shuochen, et al.
Publicado: (2026)
Towards Sustainable Web Agents: A Plea for Transparency and Dedicated Metrics for Energy Consumption
por: Krupp, Lars, et al.
Publicado: (2025)
por: Krupp, Lars, et al.
Publicado: (2025)
Mango: Multi-Agent Web Navigation via Global-View Optimization
por: Tong, Weixi, et al.
Publicado: (2026)
por: Tong, Weixi, et al.
Publicado: (2026)
VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents
por: Guo, JunJia, et al.
Publicado: (2026)
por: Guo, JunJia, et al.
Publicado: (2026)
Measuring Information Distortion in Hierarchical Ultra long Novel Reconstruction:The Optimal Expansion Ratio
por: Shen, Hanwen, et al.
Publicado: (2025)
por: Shen, Hanwen, et al.
Publicado: (2025)
WAInjectBench: Benchmarking Prompt Injection Detections for Web Agents
por: Liu, Yinuo, et al.
Publicado: (2025)
por: Liu, Yinuo, et al.
Publicado: (2025)
Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks
por: Xu, Kai, et al.
Publicado: (2025)
por: Xu, Kai, et al.
Publicado: (2025)
ST-WebAgentBench: A Benchmark for Evaluating Safety and Trustworthiness in Web Agents
por: Levy, Ido, et al.
Publicado: (2024)
por: Levy, Ido, et al.
Publicado: (2024)
AgentSwing: Adaptive Parallel Context Management Routing for Long-Horizon Web Agents
por: Feng, Zhaopeng, et al.
Publicado: (2026)
por: Feng, Zhaopeng, et al.
Publicado: (2026)
Jenius Agent: Towards Experience-Driven Accuracy Optimization in Real-World Scenarios
por: Xia, Defei, et al.
Publicado: (2026)
por: Xia, Defei, et al.
Publicado: (2026)
Constructing Industrial-Scale Optimization Modeling Benchmark
por: Li, Zhong, et al.
Publicado: (2026)
por: Li, Zhong, et al.
Publicado: (2026)
Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs
por: Chen, Yurun, et al.
Publicado: (2025)
por: Chen, Yurun, et al.
Publicado: (2025)
Code Driven Planning with Domain-Adaptive Critic
por: Tian, Zikang, et al.
Publicado: (2025)
por: Tian, Zikang, et al.
Publicado: (2025)
DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code Generation
por: Zhu, Qiming, et al.
Publicado: (2024)
por: Zhu, Qiming, et al.
Publicado: (2024)
RewardHackingAgents: Benchmarking Evaluation Integrity for LLM ML-Engineering Agents
por: Atinafu, Yonas, et al.
Publicado: (2026)
por: Atinafu, Yonas, et al.
Publicado: (2026)
ReCreate: Reasoning and Creating Domain Agents Driven by Experience
por: Hao, Zhezheng, et al.
Publicado: (2026)
por: Hao, Zhezheng, et al.
Publicado: (2026)
Full-Stack Domain Enhancement for Combustion LLMs: Construction and Optimization
por: Xiao, Quanjia, et al.
Publicado: (2026)
por: Xiao, Quanjia, et al.
Publicado: (2026)
Web Fraud Attacks Against LLM-Driven Multi-Agent Systems
por: Kong, Dezhang, et al.
Publicado: (2025)
por: Kong, Dezhang, et al.
Publicado: (2025)
Cognitive Duality for Adaptive Web Agents
por: Liu, Jiarun, et al.
Publicado: (2025)
por: Liu, Jiarun, et al.
Publicado: (2025)
IGOT: Information Gain Optimized Tokenizer on Domain Adaptive Pretraining
por: Feng, Dawei, et al.
Publicado: (2024)
por: Feng, Dawei, et al.
Publicado: (2024)
StressWeb: A Diagnostic Benchmark for Web Agent Robustness under Realistic Interaction Variability
por: Bai, Haoyue, et al.
Publicado: (2026)
por: Bai, Haoyue, et al.
Publicado: (2026)
Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos
por: Yu, Shoubin, et al.
Publicado: (2026)
por: Yu, Shoubin, et al.
Publicado: (2026)
BuildArena: A Physics-Aligned Interactive Benchmark of LLMs for Engineering Construction
por: Xia, Tian, et al.
Publicado: (2025)
por: Xia, Tian, et al.
Publicado: (2025)
SOP-Agent: Empower General Purpose AI Agent with Domain-Specific SOPs
por: Ye, Anbang, et al.
Publicado: (2025)
por: Ye, Anbang, et al.
Publicado: (2025)
Bilateral Trade Under Heavy-Tailed Valuations: Minimax Regret with Infinite Variance
por: Zhao, Hangyi
Publicado: (2026)
por: Zhao, Hangyi
Publicado: (2026)
Insider Purchase Signals in Microcap Equities: Gradient Boosting Detection of Abnormal Returns
por: Zhao, Hangyi
Publicado: (2026)
por: Zhao, Hangyi
Publicado: (2026)
Ejemplares similares
-
I-MCTS: Enhancing Agentic AutoML via Introspective Monte Carlo Tree Search
por: Liang, Zujie, et al.
Publicado: (2025) -
The ML.ENERGY Benchmark: Toward Automated Inference Energy Measurement and Optimization
por: Chung, Jae-Won, et al.
Publicado: (2025) -
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
por: Yang, Rui, et al.
Publicado: (2026) -
WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics
por: Liu, Chenxu, et al.
Publicado: (2026) -
WIPI: A New Web Threat for LLM-Driven Web Agents
por: Wu, Fangzhou, et al.
Publicado: (2024)