Towards a Realistic Long-Term Benchmark for Open-Web Research Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Mühlbacher, Peter, Bosse, Nikos I., Phillips, Lawrence |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Bench to the Future: A Pastcasting Benchmark for Forecasting Agents
por: FutureSearch, et al.
Publicado: (2025)
por: FutureSearch, et al.
Publicado: (2025)
From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning Agents
por: Zhang, Weizhi, et al.
Publicado: (2025)
por: Zhang, Weizhi, et al.
Publicado: (2025)
Towards Realistic Synthetic User-Generated Content: A Scaffolding Approach to Generating Online Discussions
por: Balog, Krisztian, et al.
Publicado: (2024)
por: Balog, Krisztian, et al.
Publicado: (2024)
Open Deep Search: Democratizing Search with Open-source Reasoning Agents
por: Alzubi, Salaheddin, et al.
Publicado: (2025)
por: Alzubi, Salaheddin, et al.
Publicado: (2025)
Beyond Static Dialogues: Benchmarking Realistic, Heterogeneous, and Evolving Long-Term Memory
por: Zhang, Han, et al.
Publicado: (2026)
por: Zhang, Han, et al.
Publicado: (2026)
DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data
por: Venus Team, et al.
Publicado: (2026)
por: Venus Team, et al.
Publicado: (2026)
LaMP-QA: A Benchmark for Personalized Long-form Question Answering
por: Salemi, Alireza, et al.
Publicado: (2025)
por: Salemi, Alireza, et al.
Publicado: (2025)
Large Language Models are Learnable Planners for Long-Term Recommendation
por: Shi, Wentao, et al.
Publicado: (2024)
por: Shi, Wentao, et al.
Publicado: (2024)
LiveNewsBench: Evaluating LLM Web Search Capabilities with Freshly Curated News
por: Zhang, Yunfan, et al.
Publicado: (2026)
por: Zhang, Yunfan, et al.
Publicado: (2026)
mFollowIR: a Multilingual Benchmark for Instruction Following in Retrieval
por: Weller, Orion, et al.
Publicado: (2025)
por: Weller, Orion, et al.
Publicado: (2025)
MiroThinker-1.7 & H1: Towards Heavy-Duty Research Agents via Verification
por: MiroMind Team, et al.
Publicado: (2026)
por: MiroMind Team, et al.
Publicado: (2026)
MIRB: Mathematical Information Retrieval Benchmark
por: Ju, Haocheng, et al.
Publicado: (2025)
por: Ju, Haocheng, et al.
Publicado: (2025)
OpenChemIE: An Information Extraction Toolkit For Chemistry Literature
por: Fan, Vincent, et al.
Publicado: (2024)
por: Fan, Vincent, et al.
Publicado: (2024)
Seq vs Seq: An Open Suite of Paired Encoders and Decoders
por: Weller, Orion, et al.
Publicado: (2025)
por: Weller, Orion, et al.
Publicado: (2025)
iAgentBench: Benchmarking Sensemaking Capabilities of Information-Seeking Agents on High-Traffic Topics
por: Dammu, Preetam Prabhu Srikar, et al.
Publicado: (2026)
por: Dammu, Preetam Prabhu Srikar, et al.
Publicado: (2026)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
Segmentation and Processing of German Court Decisions from Open Legal Data
por: Darji, Harshil, et al.
Publicado: (2026)
por: Darji, Harshil, et al.
Publicado: (2026)
FaMTEB: Massive Text Embedding Benchmark in Persian Language
por: Zinvandi, Erfan, et al.
Publicado: (2025)
por: Zinvandi, Erfan, et al.
Publicado: (2025)
Rethinking Legal Judgement Prediction in a Realistic Scenario in the Era of Large Language Models
por: Nigam, Shubham Kumar, et al.
Publicado: (2024)
por: Nigam, Shubham Kumar, et al.
Publicado: (2024)
A Benchmark Suite of Reddit-Derived Datasets for Mental Health Detection
por: Hasan, Khalid, et al.
Publicado: (2026)
por: Hasan, Khalid, et al.
Publicado: (2026)
Exploring Contrastive Learning for Long-Tailed Multi-Label Text Classification
por: Audibert, Alexandre, et al.
Publicado: (2024)
por: Audibert, Alexandre, et al.
Publicado: (2024)
Are Smaller Open-Weight LLMs Closing the Gap to Proprietary Models for Biomedical Question Answering?
por: Stachura, Damian, et al.
Publicado: (2025)
por: Stachura, Damian, et al.
Publicado: (2025)
RAG over Tables: Hierarchical Memory Index, Multi-Stage Retrieval, and Benchmarking
por: Zou, Jiaru, et al.
Publicado: (2025)
por: Zou, Jiaru, et al.
Publicado: (2025)
FLEX: Expert-level False-Less EXecution Metric for Reliable Text-to-SQL Benchmark
por: Kim, Heegyu, et al.
Publicado: (2024)
por: Kim, Heegyu, et al.
Publicado: (2024)
Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks
por: Jang, Lawrence Keunho, et al.
Publicado: (2026)
por: Jang, Lawrence Keunho, et al.
Publicado: (2026)
Retrieval meets Long Context Large Language Models
por: Xu, Peng, et al.
Publicado: (2023)
por: Xu, Peng, et al.
Publicado: (2023)
Mental Multi-class Classification on Social Media: Benchmarking Transformer Architectures against LSTM Models
por: Hasan, Khalid, et al.
Publicado: (2025)
por: Hasan, Khalid, et al.
Publicado: (2025)
Enhancing Q&A Text Retrieval with Ranking Models: Benchmarking, fine-tuning and deploying Rerankers for RAG
por: Moreira, Gabriel de Souza P., et al.
Publicado: (2024)
por: Moreira, Gabriel de Souza P., et al.
Publicado: (2024)
M3: A Multi-Task Mixed-Objective Learning Framework for Open-Domain Multi-Hop Dense Sentence Retrieval
por: Bai, Yang, et al.
Publicado: (2024)
por: Bai, Yang, et al.
Publicado: (2024)
AD-Bench: A Real-World, Trajectory-Aware Advertising Analytics Benchmark for LLM Agents
por: Hu, Lingxiang, et al.
Publicado: (2026)
por: Hu, Lingxiang, et al.
Publicado: (2026)
CoMAC: Conversational Agent for Multi-Source Auxiliary Context with Sparse and Symmetric Latent Interactions
por: Liu, Junfeng, et al.
Publicado: (2025)
por: Liu, Junfeng, et al.
Publicado: (2025)
NyayaRAG: Realistic Legal Judgment Prediction with RAG under the Indian Common Law System
por: Nigam, Shubham Kumar, et al.
Publicado: (2025)
por: Nigam, Shubham Kumar, et al.
Publicado: (2025)
Segment First, Retrieve Better: Realistic Legal Search via Rhetorical Role-Based Queries
por: Nigam, Shubham Kumar, et al.
Publicado: (2025)
por: Nigam, Shubham Kumar, et al.
Publicado: (2025)
GraphRAG on Consumer Hardware: Benchmarking Local LLMs for Healthcare EHR Schema Retrieval
por: Fernandes, Peter, et al.
Publicado: (2026)
por: Fernandes, Peter, et al.
Publicado: (2026)
Verif.ai: Towards an Open-Source Scientific Generative Question-Answering System with Referenced and Verifiable Answers
por: Košprdić, Miloš, et al.
Publicado: (2024)
por: Košprdić, Miloš, et al.
Publicado: (2024)
Evolution of ESG-focused DLT Research: An NLP Analysis of the Literature
por: Cruz, Walter Hernandez, et al.
Publicado: (2023)
por: Cruz, Walter Hernandez, et al.
Publicado: (2023)
RAIR: A Rule-Aware Benchmark Uniting Challenging Long-Tail and Visual Salience Subset for E-commerce Relevance Assessment
por: Lu, Chenji, et al.
Publicado: (2025)
por: Lu, Chenji, et al.
Publicado: (2025)
A Breadth-First Catalog of Text Processing, Speech Processing and Multimodal Research in South Asian Languages
por: Gupta, Pranav
Publicado: (2024)
por: Gupta, Pranav
Publicado: (2024)
NANOGPT: A Query-Driven Large Language Model Retrieval-Augmented Generation System for Nanotechnology Research
por: Chandrasekhar, Achuth, et al.
Publicado: (2025)
por: Chandrasekhar, Achuth, et al.
Publicado: (2025)
Towards Robust Evaluation: A Comprehensive Taxonomy of Datasets and Metrics for Open Domain Question Answering in the Era of Large Language Models
por: Srivastava, Akchay, et al.
Publicado: (2024)
por: Srivastava, Akchay, et al.
Publicado: (2024)
Ejemplares similares
-
Bench to the Future: A Pastcasting Benchmark for Forecasting Agents
por: FutureSearch, et al.
Publicado: (2025) -
From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning Agents
por: Zhang, Weizhi, et al.
Publicado: (2025) -
Towards Realistic Synthetic User-Generated Content: A Scaffolding Approach to Generating Online Discussions
por: Balog, Krisztian, et al.
Publicado: (2024) -
Open Deep Search: Democratizing Search with Open-source Reasoning Agents
por: Alzubi, Salaheddin, et al.
Publicado: (2025) -
Beyond Static Dialogues: Benchmarking Realistic, Heterogeneous, and Evolving Long-Term Memory
por: Zhang, Han, et al.
Publicado: (2026)