Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Jang, Lawrence Keunho, Koh, Jing Yu, Fried, Daniel, Salakhutdinov, Ruslan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
Multi-Agent Computer Use
di: Koh, Jing Yu, et al.
Pubblicazione: (2026)
di: Koh, Jing Yu, et al.
Pubblicazione: (2026)
Tree Search for Language Model Agents
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
Dissecting Adversarial Robustness of Multimodal LM Agents
di: Wu, Chen Henry, et al.
Pubblicazione: (2024)
di: Wu, Chen Henry, et al.
Pubblicazione: (2024)
Towards a Realistic Long-Term Benchmark for Open-Web Research Agents
di: Mühlbacher, Peter, et al.
Pubblicazione: (2024)
di: Mühlbacher, Peter, et al.
Pubblicazione: (2024)
WebArena: A Realistic Web Environment for Building Autonomous Agents
di: Zhou, Shuyan, et al.
Pubblicazione: (2023)
di: Zhou, Shuyan, et al.
Pubblicazione: (2023)
WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks
di: Miyai, Atsuyuki, et al.
Pubblicazione: (2025)
di: Miyai, Atsuyuki, et al.
Pubblicazione: (2025)
Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks
di: Dalal, Murtaza, et al.
Pubblicazione: (2024)
di: Dalal, Murtaza, et al.
Pubblicazione: (2024)
AgentFold: Long-Horizon Web Agents with Proactive Context Management
di: Ye, Rui, et al.
Pubblicazione: (2025)
di: Ye, Rui, et al.
Pubblicazione: (2025)
OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web
di: Kapoor, Raghav, et al.
Pubblicazione: (2024)
di: Kapoor, Raghav, et al.
Pubblicazione: (2024)
Evaluating Language-Model Agents on Realistic Autonomous Tasks
di: Kinniment, Megan, et al.
Pubblicazione: (2023)
di: Kinniment, Megan, et al.
Pubblicazione: (2023)
Capable but Unreliable: Canonical Path Deviation as a Causal Mechanism of Agent Failure in Long-Horizon Tasks
di: Lee, Wilson Y.
Pubblicazione: (2026)
di: Lee, Wilson Y.
Pubblicazione: (2026)
Training a Generally Curious Agent
di: Tajwar, Fahim, et al.
Pubblicazione: (2025)
di: Tajwar, Fahim, et al.
Pubblicazione: (2025)
RealWebAssist: A Benchmark for Long-Horizon Web Assistance with Real-World Users
di: Ye, Suyu, et al.
Pubblicazione: (2025)
di: Ye, Suyu, et al.
Pubblicazione: (2025)
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
di: Qu, Yuxiao, et al.
Pubblicazione: (2026)
di: Qu, Yuxiao, et al.
Pubblicazione: (2026)
Mem-T: Densifying Rewards for Long-Horizon Memory Agents
di: Yue, Yanwei, et al.
Pubblicazione: (2026)
di: Yue, Yanwei, et al.
Pubblicazione: (2026)
LHAW: Controllable Underspecification for Long-Horizon Tasks
di: Pu, George, et al.
Pubblicazione: (2026)
di: Pu, George, et al.
Pubblicazione: (2026)
Scaling Long-Horizon LLM Agent via Context-Folding
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents
di: Wang, Jiawei, et al.
Pubblicazione: (2025)
di: Wang, Jiawei, et al.
Pubblicazione: (2025)
Self-Regulation and Requesting Interventions
di: Min, So Yeon, et al.
Pubblicazione: (2025)
di: Min, So Yeon, et al.
Pubblicazione: (2025)
Intrinsic Language-Guided Exploration for Complex Long-Horizon Robotic Manipulation Tasks
di: Triantafyllidis, Eleftherios, et al.
Pubblicazione: (2023)
di: Triantafyllidis, Eleftherios, et al.
Pubblicazione: (2023)
Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe
di: Wu, Xixi, et al.
Pubblicazione: (2026)
di: Wu, Xixi, et al.
Pubblicazione: (2026)
Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
di: Wang, Zhenting, et al.
Pubblicazione: (2026)
di: Wang, Zhenting, et al.
Pubblicazione: (2026)
The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
di: Li, Junlong, et al.
Pubblicazione: (2025)
di: Li, Junlong, et al.
Pubblicazione: (2025)
Hybrid-Gym: Training Coding Agents to Generalize Across Tasks
di: Xie, Yiqing, et al.
Pubblicazione: (2026)
di: Xie, Yiqing, et al.
Pubblicazione: (2026)
OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows
di: Wang, Weixuan, et al.
Pubblicazione: (2025)
di: Wang, Weixuan, et al.
Pubblicazione: (2025)
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
Recursive Models for Long-Horizon Reasoning
di: Yang, Chenxiao, et al.
Pubblicazione: (2026)
di: Yang, Chenxiao, et al.
Pubblicazione: (2026)
Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents
di: Zhang, Boxuan, et al.
Pubblicazione: (2025)
di: Zhang, Boxuan, et al.
Pubblicazione: (2025)
Merging Methods for Multilingual Knowledge Editing for Large Language Models: An Empirical Odyssey
di: Lee, Kunil, et al.
Pubblicazione: (2026)
di: Lee, Kunil, et al.
Pubblicazione: (2026)
HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agents
di: Yeo, Woongyeng, et al.
Pubblicazione: (2026)
di: Yeo, Woongyeng, et al.
Pubblicazione: (2026)
OdysseyArena: Benchmarking Large Language Models For Long-Horizon, Active and Inductive Interactions
di: Xu, Fangzhi, et al.
Pubblicazione: (2026)
di: Xu, Fangzhi, et al.
Pubblicazione: (2026)
WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning
di: Wei, Zhepei, et al.
Pubblicazione: (2025)
di: Wei, Zhepei, et al.
Pubblicazione: (2025)
WEBSERV: A Full-Stack and RL-Ready Web Environment for Training Web Agents at Scale
di: Lu, Yuxuan, et al.
Pubblicazione: (2025)
di: Lu, Yuxuan, et al.
Pubblicazione: (2025)
Exposing Limitations of Language Model Agents in Sequential-Task Compositions on the Web
di: Furuta, Hiroki, et al.
Pubblicazione: (2023)
di: Furuta, Hiroki, et al.
Pubblicazione: (2023)
Large Language Models Can Self-Improve At Web Agent Tasks
di: Patel, Ajay, et al.
Pubblicazione: (2024)
di: Patel, Ajay, et al.
Pubblicazione: (2024)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments
di: Liu, Zefang, et al.
Pubblicazione: (2025)
di: Liu, Zefang, et al.
Pubblicazione: (2025)
Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
HEMM: Holistic Evaluation of Multimodal Foundation Models
di: Liang, Paul Pu, et al.
Pubblicazione: (2024)
di: Liang, Paul Pu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
di: Koh, Jing Yu, et al.
Pubblicazione: (2024) -
Multi-Agent Computer Use
di: Koh, Jing Yu, et al.
Pubblicazione: (2026) -
Tree Search for Language Model Agents
di: Koh, Jing Yu, et al.
Pubblicazione: (2024) -
Dissecting Adversarial Robustness of Multimodal LM Agents
di: Wu, Chen Henry, et al.
Pubblicazione: (2024) -
Towards a Realistic Long-Term Benchmark for Open-Web Research Agents
di: Mühlbacher, Peter, et al.
Pubblicazione: (2024)