Wiki Live Challenge: Challenging Deep Research Agents with Expert-Level Wikipedia Articles
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Shaohan, Xu, Benfeng, Zhang, Licheng, Du, Mingxuan, Zhu, Chiwei, Wang, Xiaorui, Mao, Zhendong, Zhang, Yongdong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents
por: Zhu, Chiwei, et al.
Publicado: (2026)
por: Zhu, Chiwei, et al.
Publicado: (2026)
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
por: Du, Mingxuan, et al.
Publicado: (2025)
por: Du, Mingxuan, et al.
Publicado: (2025)
DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report
por: Li, Ruizhe, et al.
Publicado: (2026)
por: Li, Ruizhe, et al.
Publicado: (2026)
WildGraphBench: Benchmarking GraphRAG with Wild-Source Corpora
por: Wang, Pengyu, et al.
Publicado: (2026)
por: Wang, Pengyu, et al.
Publicado: (2026)
A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces
por: Du, Mingxuan, et al.
Publicado: (2026)
por: Du, Mingxuan, et al.
Publicado: (2026)
From Real to Synthetic: Synthesizing Millions of Diversified and Complicated User Instructions with Attributed Grounding
por: Zhu, Chiwei, et al.
Publicado: (2025)
por: Zhu, Chiwei, et al.
Publicado: (2025)
Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking
por: Chen, Yihan, et al.
Publicado: (2025)
por: Chen, Yihan, et al.
Publicado: (2025)
Automated Creativity Evaluation for Large Language Models: A Reference-Based Approach
por: Li, Ruizhe, et al.
Publicado: (2025)
por: Li, Ruizhe, et al.
Publicado: (2025)
MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools
por: Guo, Zikang, et al.
Publicado: (2025)
por: Guo, Zikang, et al.
Publicado: (2025)
DACL-RAG: Data Augmentation Strategy with Curriculum Learning for Retrieval-Augmented Generation
por: Wang, Shaohan, et al.
Publicado: (2025)
por: Wang, Shaohan, et al.
Publicado: (2025)
ExpertPrompting: Instructing Large Language Models to be Distinguished Experts
por: Xu, Benfeng, et al.
Publicado: (2023)
por: Xu, Benfeng, et al.
Publicado: (2023)
An Index-based Approach for Efficient and Effective Web Content Extraction
por: Chen, Yihan, et al.
Publicado: (2025)
por: Chen, Yihan, et al.
Publicado: (2025)
Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability
por: Zhu, Chiwei, et al.
Publicado: (2025)
por: Zhu, Chiwei, et al.
Publicado: (2025)
MIRROR: Multi-agent Intra- and Inter-Reflection for Optimized Reasoning in Tool Learning
por: Guo, Zikang, et al.
Publicado: (2025)
por: Guo, Zikang, et al.
Publicado: (2025)
Benchmarking Large Language Models on Controllable Generation under Diversified Instructions
por: Chen, Yihan, et al.
Publicado: (2024)
por: Chen, Yihan, et al.
Publicado: (2024)
Wiki-Quantities and Wiki-Measurements: Datasets of Quantities and their Measurement Context from Wikipedia
por: Göpfert, Jan, et al.
Publicado: (2025)
por: Göpfert, Jan, et al.
Publicado: (2025)
Align Documents to Questions: Question-Oriented Document Rewriting for Retrieval-Augmented Generation
por: Li, Jiaang, et al.
Publicado: (2026)
por: Li, Jiaang, et al.
Publicado: (2026)
Leveraging Robust Optimization for LLM Alignment under Distribution Shifts
por: Zhu, Mingye, et al.
Publicado: (2025)
por: Zhu, Mingye, et al.
Publicado: (2025)
Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models
por: Zhang, Huatian, et al.
Publicado: (2026)
por: Zhang, Huatian, et al.
Publicado: (2026)
ELDER: Enhancing Lifelong Model Editing with Mixture-of-LoRA
por: Li, Jiaang, et al.
Publicado: (2024)
por: Li, Jiaang, et al.
Publicado: (2024)
Feature-Adaptive and Data-Scalable In-Context Learning
por: Li, Jiahao, et al.
Publicado: (2024)
por: Li, Jiahao, et al.
Publicado: (2024)
WikiChat: Stopping the Hallucination of Large Language Model Chatbots by Few-Shot Grounding on Wikipedia
por: Semnani, Sina J., et al.
Publicado: (2023)
por: Semnani, Sina J., et al.
Publicado: (2023)
WikiGap: Promoting Epistemic Equity by Surfacing Knowledge Gaps Between English Wikipedia and other Language Editions
por: Wang, Zining, et al.
Publicado: (2025)
por: Wang, Zining, et al.
Publicado: (2025)
Leveraging Importance Sampling to Detach Alignment Modules from Large Language Models
por: Liu, Yi, et al.
Publicado: (2025)
por: Liu, Yi, et al.
Publicado: (2025)
Wiki-TabNER: Integrating Named Entity Recognition into Wikipedia Tables
por: Koleva, Aneta, et al.
Publicado: (2024)
por: Koleva, Aneta, et al.
Publicado: (2024)
WikiSQE: A Large-Scale Dataset for Sentence Quality Estimation in Wikipedia
por: Ando, Kenichiro, et al.
Publicado: (2023)
por: Ando, Kenichiro, et al.
Publicado: (2023)
ViWikiFC: Fact-Checking for Vietnamese Wikipedia-Based Textual Knowledge Source
por: Le, Hung Tuan, et al.
Publicado: (2024)
por: Le, Hung Tuan, et al.
Publicado: (2024)
SearchAttack: Red-Teaming LLMs against Knowledge-to-Action Threats under Online Web Search
por: Yan, Yu, et al.
Publicado: (2026)
por: Yan, Yu, et al.
Publicado: (2026)
WikiVideo: Article Generation from Multiple Videos
por: Martin, Alexander, et al.
Publicado: (2025)
por: Martin, Alexander, et al.
Publicado: (2025)
Mind2Report: A Cognitive Deep Research Agent for Expert-Level Commercial Report Synthesis
por: Cheng, Mingyue, et al.
Publicado: (2026)
por: Cheng, Mingyue, et al.
Publicado: (2026)
LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries
por: Yin, Ming, et al.
Publicado: (2025)
por: Yin, Ming, et al.
Publicado: (2025)
ASL STEM Wiki: Dataset and Benchmark for Interpreting STEM Articles
por: Yin, Kayo, et al.
Publicado: (2024)
por: Yin, Kayo, et al.
Publicado: (2024)
WikiAutoGen: Towards Multi-Modal Wikipedia-Style Article Generation
por: Yang, Zhongyu, et al.
Publicado: (2025)
por: Yang, Zhongyu, et al.
Publicado: (2025)
Wikipedia is Not a Dictionary, Delete! Text Classification as a Proxy for Analysing Wiki Deletion Discussions
por: Borkakoty, Hsuvas, et al.
Publicado: (2025)
por: Borkakoty, Hsuvas, et al.
Publicado: (2025)
Hoaxpedia: A Unified Wikipedia Hoax Articles Dataset
por: Borkakoty, Hsuvas, et al.
Publicado: (2024)
por: Borkakoty, Hsuvas, et al.
Publicado: (2024)
Assisting in Writing Wikipedia-like Articles From Scratch with Large Language Models
por: Shao, Yijia, et al.
Publicado: (2024)
por: Shao, Yijia, et al.
Publicado: (2024)
Multi-Head Mixture-of-Experts
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
WikiContradict: A Benchmark for Evaluating LLMs on Real-World Knowledge Conflicts from Wikipedia
por: Hou, Yufang, et al.
Publicado: (2024)
por: Hou, Yufang, et al.
Publicado: (2024)
Mixture of LoRA Experts
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder
por: Liu, Dengcan, et al.
Publicado: (2025)
por: Liu, Dengcan, et al.
Publicado: (2025)
Ejemplares similares
-
FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents
por: Zhu, Chiwei, et al.
Publicado: (2026) -
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
por: Du, Mingxuan, et al.
Publicado: (2025) -
DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report
por: Li, Ruizhe, et al.
Publicado: (2026) -
WildGraphBench: Benchmarking GraphRAG with Wild-Source Corpora
por: Wang, Pengyu, et al.
Publicado: (2026) -
A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces
por: Du, Mingxuan, et al.
Publicado: (2026)