EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Zefang, Quan, Yinzhu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning
por: Quan, Yinzhu, et al.
Publicado: (2024)
por: Quan, Yinzhu, et al.
Publicado: (2024)
InvAgent: A Large Language Model based Multi-Agent System for Inventory Management in Supply Chains
por: Quan, Yinzhu, et al.
Publicado: (2024)
por: Quan, Yinzhu, et al.
Publicado: (2024)
WebArena: A Realistic Web Environment for Building Autonomous Agents
por: Zhou, Shuyan, et al.
Publicado: (2023)
por: Zhou, Shuyan, et al.
Publicado: (2023)
Retrieval of Temporal Event Sequences from Textual Descriptions
por: Liu, Zefang, et al.
Publicado: (2024)
por: Liu, Zefang, et al.
Publicado: (2024)
TPP-LLM: Modeling Temporal Point Processes by Efficiently Fine-Tuning Large Language Models
por: Liu, Zefang, et al.
Publicado: (2024)
por: Liu, Zefang, et al.
Publicado: (2024)
WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks
por: Miyai, Atsuyuki, et al.
Publicado: (2025)
por: Miyai, Atsuyuki, et al.
Publicado: (2025)
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
por: Koh, Jing Yu, et al.
Publicado: (2024)
por: Koh, Jing Yu, et al.
Publicado: (2024)
Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks
por: Jang, Lawrence Keunho, et al.
Publicado: (2026)
por: Jang, Lawrence Keunho, et al.
Publicado: (2026)
SafeArena: Evaluating the Safety of Autonomous Web Agents
por: Tur, Ada Defne, et al.
Publicado: (2025)
por: Tur, Ada Defne, et al.
Publicado: (2025)
EconEvals: Benchmarks and Litmus Tests for Economic Decision-Making by LLM Agents
por: Fish, Sara, et al.
Publicado: (2025)
por: Fish, Sara, et al.
Publicado: (2025)
Temporal Tokenization Strategies for Event Sequence Modeling with Large Language Models
por: Liu, Zefang, et al.
Publicado: (2025)
por: Liu, Zefang, et al.
Publicado: (2025)
AssistantBench: Can Web Agents Solve Realistic and Time-Consuming Tasks?
por: Yoran, Ori, et al.
Publicado: (2024)
por: Yoran, Ori, et al.
Publicado: (2024)
WebCanvas: Benchmarking Web Agents in Online Environments
por: Pan, Yichen, et al.
Publicado: (2024)
por: Pan, Yichen, et al.
Publicado: (2024)
WebOperator: Action-Aware Tree Search for Autonomous Agents in Web Environment
por: Dihan, Mahir Labib, et al.
Publicado: (2025)
por: Dihan, Mahir Labib, et al.
Publicado: (2025)
WebXSkill: Skill Learning for Autonomous Web Agents
por: Wang, Zhaoyang, et al.
Publicado: (2026)
por: Wang, Zhaoyang, et al.
Publicado: (2026)
EconCausal: A Context-Aware Economic Reasoning Benchmark for Large Language Models
por: Lee, Donggyu, et al.
Publicado: (2025)
por: Lee, Donggyu, et al.
Publicado: (2025)
RedTeamCUA: Realistic Adversarial Testing of Computer-Use Agents in Hybrid Web-OS Environments
por: Liao, Zeyi, et al.
Publicado: (2025)
por: Liao, Zeyi, et al.
Publicado: (2025)
EconNLI: Evaluating Large Language Models on Economics Reasoning
por: Guo, Yue, et al.
Publicado: (2024)
por: Guo, Yue, et al.
Publicado: (2024)
Towards a Realistic Long-Term Benchmark for Open-Web Research Agents
por: Mühlbacher, Peter, et al.
Publicado: (2024)
por: Mühlbacher, Peter, et al.
Publicado: (2024)
AfriEconQA: A Benchmark Dataset for African Economic Analysis based on World Bank Reports
por: Ajayi, Edward
Publicado: (2026)
por: Ajayi, Edward
Publicado: (2026)
WebMall -- A Multi-Shop Benchmark for Evaluating Web Agents
por: Peeters, Ralph, et al.
Publicado: (2025)
por: Peeters, Ralph, et al.
Publicado: (2025)
Web Agents with World Models: Learning and Leveraging Environment Dynamics in Web Navigation
por: Chae, Hyungjoo, et al.
Publicado: (2024)
por: Chae, Hyungjoo, et al.
Publicado: (2024)
WebGym: Scaling Training Environments for Visual Web Agents with Realistic Tasks
por: Bai, Hao, et al.
Publicado: (2026)
por: Bai, Hao, et al.
Publicado: (2026)
Multi-Agent Collaboration in Incident Response with Large Language Models
por: Liu, Zefang
Publicado: (2024)
por: Liu, Zefang
Publicado: (2024)
CRMAgent: A Multi-Agent LLM System for E-Commerce CRM Message Template Generation
por: Quan, Yinzhu, et al.
Publicado: (2025)
por: Quan, Yinzhu, et al.
Publicado: (2025)
InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training
por: Zhang, Ziyun, et al.
Publicado: (2026)
por: Zhang, Ziyun, et al.
Publicado: (2026)
WEBSERV: A Full-Stack and RL-Ready Web Environment for Training Web Agents at Scale
por: Lu, Yuxuan, et al.
Publicado: (2025)
por: Lu, Yuxuan, et al.
Publicado: (2025)
EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
por: Li, Mukai, et al.
Publicado: (2025)
por: Li, Mukai, et al.
Publicado: (2025)
Evaluating Language-Model Agents on Realistic Autonomous Tasks
por: Kinniment, Megan, et al.
Publicado: (2023)
por: Kinniment, Megan, et al.
Publicado: (2023)
ClawArena: Benchmarking AI Agents in Evolving Information Environments
por: Ji, Haonian, et al.
Publicado: (2026)
por: Ji, Haonian, et al.
Publicado: (2026)
X-WebAgentBench: A Multilingual Interactive Web Benchmark for Evaluating Global Agentic System
por: Wang, Peng, et al.
Publicado: (2025)
por: Wang, Peng, et al.
Publicado: (2025)
MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks
por: He, Zexue, et al.
Publicado: (2026)
por: He, Zexue, et al.
Publicado: (2026)
Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History
por: Kim, Serin, et al.
Publicado: (2026)
por: Kim, Serin, et al.
Publicado: (2026)
Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos
por: Yu, Shoubin, et al.
Publicado: (2026)
por: Yu, Shoubin, et al.
Publicado: (2026)
Web-Shepherd: Advancing PRMs for Reinforcing Web Agents
por: Chae, Hyungjoo, et al.
Publicado: (2025)
por: Chae, Hyungjoo, et al.
Publicado: (2025)
WebWalker: Benchmarking LLMs in Web Traversal
por: Wu, Jialong, et al.
Publicado: (2025)
por: Wu, Jialong, et al.
Publicado: (2025)
WebExplorer: Explore and Evolve for Training Long-Horizon Web Agents
por: Liu, Junteng, et al.
Publicado: (2025)
por: Liu, Junteng, et al.
Publicado: (2025)
STT-Arena: A More Realistic Environment for Tool-Using with Spatio-Temporal Dynamics
por: Hui, Tingfeng, et al.
Publicado: (2026)
por: Hui, Tingfeng, et al.
Publicado: (2026)
DITING: A Multi-Agent Evaluation Framework for Benchmarking Web Novel Translation
por: Zhang, Enze, et al.
Publicado: (2025)
por: Zhang, Enze, et al.
Publicado: (2025)
OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web
por: Kapoor, Raghav, et al.
Publicado: (2024)
por: Kapoor, Raghav, et al.
Publicado: (2024)
Ejemplares similares
-
EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning
por: Quan, Yinzhu, et al.
Publicado: (2024) -
InvAgent: A Large Language Model based Multi-Agent System for Inventory Management in Supply Chains
por: Quan, Yinzhu, et al.
Publicado: (2024) -
WebArena: A Realistic Web Environment for Building Autonomous Agents
por: Zhou, Shuyan, et al.
Publicado: (2023) -
Retrieval of Temporal Event Sequences from Textual Descriptions
por: Liu, Zefang, et al.
Publicado: (2024) -
TPP-LLM: Modeling Temporal Point Processes by Efficiently Fine-Tuning Large Language Models
por: Liu, Zefang, et al.
Publicado: (2024)