Revisiting Observation Reduction for Web Agents: Comprehensive Evaluation with a Lightweight Framework
Fuente:
arXiv
Saved in:
| Main Authors: | Enomoto, Masafumi, Obara, Ryoma, Zhang, Haochen, Oyamada, Masafumi |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Read More, Think More: Revisiting Observation Reduction for Web Agents
by: Enomoto, Masafumi, et al.
Published: (2026)
by: Enomoto, Masafumi, et al.
Published: (2026)
LightPAL: Lightweight Passage Retrieval for Open Domain Multi-Document Summarization
by: Enomoto, Masafumi, et al.
Published: (2024)
by: Enomoto, Masafumi, et al.
Published: (2024)
Can a Crow Hatch a Falcon? Lineage Matters in Predicting Large Language Model Performance
by: Tamura, Takuya, et al.
Published: (2025)
by: Tamura, Takuya, et al.
Published: (2025)
LaMDAgent: An Autonomous Framework for Post-Training Pipeline Optimization via LLM Agents
by: Yano, Taro, et al.
Published: (2025)
by: Yano, Taro, et al.
Published: (2025)
cotomi Act: Learning to Automate Work by Watching You
by: Oyamada, Masafumi, et al.
Published: (2026)
by: Oyamada, Masafumi, et al.
Published: (2026)
An Empirical Study of LLM-as-a-Judge: How Design Choices Impact Evaluation Reliability
by: Yamauchi, Yusuke, et al.
Published: (2025)
by: Yamauchi, Yusuke, et al.
Published: (2025)
Jellyfish: A Large Language Model for Data Preprocessing
by: Zhang, Haochen, et al.
Published: (2023)
by: Zhang, Haochen, et al.
Published: (2023)
Effective Harness Engineering for Algorithm Discovery with Coding Agents
by: Ishibashi, Yoichi, et al.
Published: (2026)
by: Ishibashi, Yoichi, et al.
Published: (2026)
Mining Hidden Thoughts from Texts: Evaluating Continual Pretraining with Synthetic Data for LLM Reasoning
by: Ishibashi, Yoichi, et al.
Published: (2025)
by: Ishibashi, Yoichi, et al.
Published: (2025)
Can Large Language Models Invent Algorithms to Improve Themselves?: Algorithm Discovery for Recursive Self-Improvement through Reinforcement Learning
by: Ishibashi, Yoichi, et al.
Published: (2024)
by: Ishibashi, Yoichi, et al.
Published: (2024)
$M^3$ Scaling Law: Optimizing Multi-Epoch, Multi-Lingual, and Multi-Stage Training for Low-Resource Language Models
by: Akimoto, Kosuke, et al.
Published: (2024)
by: Akimoto, Kosuke, et al.
Published: (2024)
Context Quality Matters in Training Fusion-in-Decoder for Extractive Open-Domain Question Answering
by: Akimoto, Kosuke, et al.
Published: (2024)
by: Akimoto, Kosuke, et al.
Published: (2024)
Understanding the Impact of Confidence in Retrieval Augmented Generation: A Case Study in the Medical Domain
by: Ozaki, Shintaro, et al.
Published: (2024)
by: Ozaki, Shintaro, et al.
Published: (2024)
Large Language Models as Data Preprocessors
by: Zhang, Haochen, et al.
Published: (2023)
by: Zhang, Haochen, et al.
Published: (2023)
LineRetriever: Planning-Aware Observation Reduction for Web Agents
by: Kerboua, Imene, et al.
Published: (2025)
by: Kerboua, Imene, et al.
Published: (2025)
On Synthesizing Data for Context Attribution in Question Answering
by: Radevski, Gorjan, et al.
Published: (2025)
by: Radevski, Gorjan, et al.
Published: (2025)
WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks
by: Miyai, Atsuyuki, et al.
Published: (2025)
by: Miyai, Atsuyuki, et al.
Published: (2025)
TimeWarp: Evaluating Web Agents by Revisiting the Past
by: Ishmam, Md Farhan, et al.
Published: (2026)
by: Ishmam, Md Farhan, et al.
Published: (2026)
DITING: A Multi-Agent Evaluation Framework for Benchmarking Web Novel Translation
by: Zhang, Enze, et al.
Published: (2025)
by: Zhang, Enze, et al.
Published: (2025)
Best-of-$\infty$ -- Asymptotic Performance of Test-Time LLM Ensembling
by: Komiyama, Junpei, et al.
Published: (2025)
by: Komiyama, Junpei, et al.
Published: (2025)
UltraEval: A Lightweight Platform for Flexible and Comprehensive Evaluation for LLMs
by: He, Chaoqun, et al.
Published: (2024)
by: He, Chaoqun, et al.
Published: (2024)
Region4Web: Rethinking Observation Space Granularity for Web Agents
by: Kwon, Donguk, et al.
Published: (2026)
by: Kwon, Donguk, et al.
Published: (2026)
Evaluating Structural Generalization in Neural Machine Translation
by: Kumon, Ryoma, et al.
Published: (2024)
by: Kumon, Ryoma, et al.
Published: (2024)
WebMall -- A Multi-Shop Benchmark for Evaluating Web Agents
by: Peeters, Ralph, et al.
Published: (2025)
by: Peeters, Ralph, et al.
Published: (2025)
Constructive Approach to Bidirectional Influence between Qualia Structure and Language Emergence
by: Taniguchi, Tadahiro, et al.
Published: (2024)
by: Taniguchi, Tadahiro, et al.
Published: (2024)
WebUIBench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in WebUI-to-Code
by: Lin, Zhiyu, et al.
Published: (2025)
by: Lin, Zhiyu, et al.
Published: (2025)
Bias Mitigation or Cultural Commonsense? Evaluating LLMs with a Japanese Dataset
by: Yamamoto, Taisei, et al.
Published: (2025)
by: Yamamoto, Taisei, et al.
Published: (2025)
Evaluating Cultural and Social Awareness of LLM Web Agents
by: Qiu, Haoyi, et al.
Published: (2024)
by: Qiu, Haoyi, et al.
Published: (2024)
Comprehensive and Efficient Distillation for Lightweight Sentiment Analysis Models
by: Xie, Guangyu, et al.
Published: (2025)
by: Xie, Guangyu, et al.
Published: (2025)
TRACE: Trajectory-Aware Comprehensive Evaluation for Deep Research Agents
by: Chen, Yanyu, et al.
Published: (2026)
by: Chen, Yanyu, et al.
Published: (2026)
EvalAgent: Discovering Implicit Evaluation Criteria from the Web
by: Wadhwa, Manya, et al.
Published: (2025)
by: Wadhwa, Manya, et al.
Published: (2025)
X-WebAgentBench: A Multilingual Interactive Web Benchmark for Evaluating Global Agentic System
by: Wang, Peng, et al.
Published: (2025)
by: Wang, Peng, et al.
Published: (2025)
When Users Change Their Mind: Evaluating Interruptible Agents in Long-Horizon Web Navigation
by: Zou, Henry Peng, et al.
Published: (2026)
by: Zou, Henry Peng, et al.
Published: (2026)
Direct Quantized Training of Language Models with Stochastic Rounding
by: Zhao, Kaiyan, et al.
Published: (2024)
by: Zhao, Kaiyan, et al.
Published: (2024)
WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
by: Fang, Tianqing, et al.
Published: (2025)
by: Fang, Tianqing, et al.
Published: (2025)
Fine-Grained Analysis of Shared Syntactic Mechanisms in Language Models
by: Kumon, Ryoma, et al.
Published: (2026)
by: Kumon, Ryoma, et al.
Published: (2026)
Analyzing the Inner Workings of Transformers in Compositional Generalization
by: Kumon, Ryoma, et al.
Published: (2025)
by: Kumon, Ryoma, et al.
Published: (2025)
AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories
by: Lù, Xing Han, et al.
Published: (2025)
by: Lù, Xing Han, et al.
Published: (2025)
AI Planning Framework for LLM-Based Web Agents
by: Shahnovsky, Orit, et al.
Published: (2026)
by: Shahnovsky, Orit, et al.
Published: (2026)
Infogent: An Agent-Based Framework for Web Information Aggregation
by: Reddy, Revanth Gangi, et al.
Published: (2024)
by: Reddy, Revanth Gangi, et al.
Published: (2024)
Similar Items
-
Read More, Think More: Revisiting Observation Reduction for Web Agents
by: Enomoto, Masafumi, et al.
Published: (2026) -
LightPAL: Lightweight Passage Retrieval for Open Domain Multi-Document Summarization
by: Enomoto, Masafumi, et al.
Published: (2024) -
Can a Crow Hatch a Falcon? Lineage Matters in Predicting Large Language Model Performance
by: Tamura, Takuya, et al.
Published: (2025) -
LaMDAgent: An Autonomous Framework for Post-Training Pipeline Optimization via LLM Agents
by: Yano, Taro, et al.
Published: (2025) -
cotomi Act: Learning to Automate Work by Watching You
by: Oyamada, Masafumi, et al.
Published: (2026)