Revisiting Observation Reduction for Web Agents: Comprehensive Evaluation with a Lightweight Framework
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Enomoto, Masafumi, Obara, Ryoma, Zhang, Haochen, Oyamada, Masafumi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Read More, Think More: Revisiting Observation Reduction for Web Agents
par: Enomoto, Masafumi, et autres
Publié: (2026)
par: Enomoto, Masafumi, et autres
Publié: (2026)
LightPAL: Lightweight Passage Retrieval for Open Domain Multi-Document Summarization
par: Enomoto, Masafumi, et autres
Publié: (2024)
par: Enomoto, Masafumi, et autres
Publié: (2024)
Can a Crow Hatch a Falcon? Lineage Matters in Predicting Large Language Model Performance
par: Tamura, Takuya, et autres
Publié: (2025)
par: Tamura, Takuya, et autres
Publié: (2025)
LaMDAgent: An Autonomous Framework for Post-Training Pipeline Optimization via LLM Agents
par: Yano, Taro, et autres
Publié: (2025)
par: Yano, Taro, et autres
Publié: (2025)
cotomi Act: Learning to Automate Work by Watching You
par: Oyamada, Masafumi, et autres
Publié: (2026)
par: Oyamada, Masafumi, et autres
Publié: (2026)
An Empirical Study of LLM-as-a-Judge: How Design Choices Impact Evaluation Reliability
par: Yamauchi, Yusuke, et autres
Publié: (2025)
par: Yamauchi, Yusuke, et autres
Publié: (2025)
Jellyfish: A Large Language Model for Data Preprocessing
par: Zhang, Haochen, et autres
Publié: (2023)
par: Zhang, Haochen, et autres
Publié: (2023)
Effective Harness Engineering for Algorithm Discovery with Coding Agents
par: Ishibashi, Yoichi, et autres
Publié: (2026)
par: Ishibashi, Yoichi, et autres
Publié: (2026)
Mining Hidden Thoughts from Texts: Evaluating Continual Pretraining with Synthetic Data for LLM Reasoning
par: Ishibashi, Yoichi, et autres
Publié: (2025)
par: Ishibashi, Yoichi, et autres
Publié: (2025)
Can Large Language Models Invent Algorithms to Improve Themselves?: Algorithm Discovery for Recursive Self-Improvement through Reinforcement Learning
par: Ishibashi, Yoichi, et autres
Publié: (2024)
par: Ishibashi, Yoichi, et autres
Publié: (2024)
$M^3$ Scaling Law: Optimizing Multi-Epoch, Multi-Lingual, and Multi-Stage Training for Low-Resource Language Models
par: Akimoto, Kosuke, et autres
Publié: (2024)
par: Akimoto, Kosuke, et autres
Publié: (2024)
Context Quality Matters in Training Fusion-in-Decoder for Extractive Open-Domain Question Answering
par: Akimoto, Kosuke, et autres
Publié: (2024)
par: Akimoto, Kosuke, et autres
Publié: (2024)
Understanding the Impact of Confidence in Retrieval Augmented Generation: A Case Study in the Medical Domain
par: Ozaki, Shintaro, et autres
Publié: (2024)
par: Ozaki, Shintaro, et autres
Publié: (2024)
Large Language Models as Data Preprocessors
par: Zhang, Haochen, et autres
Publié: (2023)
par: Zhang, Haochen, et autres
Publié: (2023)
LineRetriever: Planning-Aware Observation Reduction for Web Agents
par: Kerboua, Imene, et autres
Publié: (2025)
par: Kerboua, Imene, et autres
Publié: (2025)
On Synthesizing Data for Context Attribution in Question Answering
par: Radevski, Gorjan, et autres
Publié: (2025)
par: Radevski, Gorjan, et autres
Publié: (2025)
WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks
par: Miyai, Atsuyuki, et autres
Publié: (2025)
par: Miyai, Atsuyuki, et autres
Publié: (2025)
TimeWarp: Evaluating Web Agents by Revisiting the Past
par: Ishmam, Md Farhan, et autres
Publié: (2026)
par: Ishmam, Md Farhan, et autres
Publié: (2026)
DITING: A Multi-Agent Evaluation Framework for Benchmarking Web Novel Translation
par: Zhang, Enze, et autres
Publié: (2025)
par: Zhang, Enze, et autres
Publié: (2025)
Best-of-$\infty$ -- Asymptotic Performance of Test-Time LLM Ensembling
par: Komiyama, Junpei, et autres
Publié: (2025)
par: Komiyama, Junpei, et autres
Publié: (2025)
UltraEval: A Lightweight Platform for Flexible and Comprehensive Evaluation for LLMs
par: He, Chaoqun, et autres
Publié: (2024)
par: He, Chaoqun, et autres
Publié: (2024)
Region4Web: Rethinking Observation Space Granularity for Web Agents
par: Kwon, Donguk, et autres
Publié: (2026)
par: Kwon, Donguk, et autres
Publié: (2026)
Evaluating Structural Generalization in Neural Machine Translation
par: Kumon, Ryoma, et autres
Publié: (2024)
par: Kumon, Ryoma, et autres
Publié: (2024)
WebMall -- A Multi-Shop Benchmark for Evaluating Web Agents
par: Peeters, Ralph, et autres
Publié: (2025)
par: Peeters, Ralph, et autres
Publié: (2025)
Constructive Approach to Bidirectional Influence between Qualia Structure and Language Emergence
par: Taniguchi, Tadahiro, et autres
Publié: (2024)
par: Taniguchi, Tadahiro, et autres
Publié: (2024)
WebUIBench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in WebUI-to-Code
par: Lin, Zhiyu, et autres
Publié: (2025)
par: Lin, Zhiyu, et autres
Publié: (2025)
Bias Mitigation or Cultural Commonsense? Evaluating LLMs with a Japanese Dataset
par: Yamamoto, Taisei, et autres
Publié: (2025)
par: Yamamoto, Taisei, et autres
Publié: (2025)
Evaluating Cultural and Social Awareness of LLM Web Agents
par: Qiu, Haoyi, et autres
Publié: (2024)
par: Qiu, Haoyi, et autres
Publié: (2024)
Comprehensive and Efficient Distillation for Lightweight Sentiment Analysis Models
par: Xie, Guangyu, et autres
Publié: (2025)
par: Xie, Guangyu, et autres
Publié: (2025)
TRACE: Trajectory-Aware Comprehensive Evaluation for Deep Research Agents
par: Chen, Yanyu, et autres
Publié: (2026)
par: Chen, Yanyu, et autres
Publié: (2026)
EvalAgent: Discovering Implicit Evaluation Criteria from the Web
par: Wadhwa, Manya, et autres
Publié: (2025)
par: Wadhwa, Manya, et autres
Publié: (2025)
X-WebAgentBench: A Multilingual Interactive Web Benchmark for Evaluating Global Agentic System
par: Wang, Peng, et autres
Publié: (2025)
par: Wang, Peng, et autres
Publié: (2025)
When Users Change Their Mind: Evaluating Interruptible Agents in Long-Horizon Web Navigation
par: Zou, Henry Peng, et autres
Publié: (2026)
par: Zou, Henry Peng, et autres
Publié: (2026)
Direct Quantized Training of Language Models with Stochastic Rounding
par: Zhao, Kaiyan, et autres
Publié: (2024)
par: Zhao, Kaiyan, et autres
Publié: (2024)
WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
par: Fang, Tianqing, et autres
Publié: (2025)
par: Fang, Tianqing, et autres
Publié: (2025)
Fine-Grained Analysis of Shared Syntactic Mechanisms in Language Models
par: Kumon, Ryoma, et autres
Publié: (2026)
par: Kumon, Ryoma, et autres
Publié: (2026)
Analyzing the Inner Workings of Transformers in Compositional Generalization
par: Kumon, Ryoma, et autres
Publié: (2025)
par: Kumon, Ryoma, et autres
Publié: (2025)
AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories
par: Lù, Xing Han, et autres
Publié: (2025)
par: Lù, Xing Han, et autres
Publié: (2025)
AI Planning Framework for LLM-Based Web Agents
par: Shahnovsky, Orit, et autres
Publié: (2026)
par: Shahnovsky, Orit, et autres
Publié: (2026)
Infogent: An Agent-Based Framework for Web Information Aggregation
par: Reddy, Revanth Gangi, et autres
Publié: (2024)
par: Reddy, Revanth Gangi, et autres
Publié: (2024)
Documents similaires
-
Read More, Think More: Revisiting Observation Reduction for Web Agents
par: Enomoto, Masafumi, et autres
Publié: (2026) -
LightPAL: Lightweight Passage Retrieval for Open Domain Multi-Document Summarization
par: Enomoto, Masafumi, et autres
Publié: (2024) -
Can a Crow Hatch a Falcon? Lineage Matters in Predicting Large Language Model Performance
par: Tamura, Takuya, et autres
Publié: (2025) -
LaMDAgent: An Autonomous Framework for Post-Training Pipeline Optimization via LLM Agents
par: Yano, Taro, et autres
Publié: (2025) -
cotomi Act: Learning to Automate Work by Watching You
par: Oyamada, Masafumi, et autres
Publié: (2026)