AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery
Fuente:
arXiv
Saved in:
| Main Authors: | Xiong, Lei, Luo, Kun, Xia, Ziyi, Zhang, Wenbo, Yao, Jin-Ge, Liu, Zheng, Shao, Jingying, Chen, Jianlyu, Qian, Hongjin, Yang, Xi, Yu, Qian, Li, Hao, Yue, Chen, Du, Xiaan, Wang, Yuyang, Liu, Yesheng, Xu, Haiyu, Dou, Zhicheng |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DeepXiv-SDK: An Agentic Data Interface for Scientific Literature
by: Qian, Hongjin, et al.
Published: (2026)
by: Qian, Hongjin, et al.
Published: (2026)
HawkBench: Investigating Resilience of RAG Methods on Stratified Information-Seeking Tasks
by: Qian, Hongjin, et al.
Published: (2025)
by: Qian, Hongjin, et al.
Published: (2025)
Open Data Synthesis For Deep Research
by: Xia, Ziyi, et al.
Published: (2025)
by: Xia, Ziyi, et al.
Published: (2025)
Boosting Long-Context Management via Query-Guided Activation Refilling
by: Qian, Hongjin, et al.
Published: (2024)
by: Qian, Hongjin, et al.
Published: (2024)
Grounding Language Model with Chunking-Free In-Context Retrieval
by: Qian, Hongjin, et al.
Published: (2024)
by: Qian, Hongjin, et al.
Published: (2024)
AgentFugue: Agent Scaling for Long-Horizon Tasks through Collective Reasoning
by: Hu, Yuyang, et al.
Published: (2026)
by: Hu, Yuyang, et al.
Published: (2026)
SAM: State-Adaptive Memory for Long-Horizon Reasoning Agent
by: Hu, Yuyang, et al.
Published: (2026)
by: Hu, Yuyang, et al.
Published: (2026)
Trustworthiness in Retrieval-Augmented Generation Systems: A Survey
by: Zhou, Yujia, et al.
Published: (2024)
by: Zhou, Yujia, et al.
Published: (2024)
LiveLongBench: Tackling Long-Context Understanding for Spoken Texts from Live Streams
by: Wu, Yongxuan, et al.
Published: (2025)
by: Wu, Yongxuan, et al.
Published: (2025)
Extending Llama-3's Context Ten-Fold Overnight
by: Zhang, Peitian, et al.
Published: (2024)
by: Zhang, Peitian, et al.
Published: (2024)
Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench
by: Lin, Fenfen, et al.
Published: (2025)
by: Lin, Fenfen, et al.
Published: (2025)
Are Long-LLMs A Necessity For Long-Context Tasks?
by: Qian, Hongjin, et al.
Published: (2024)
by: Qian, Hongjin, et al.
Published: (2024)
Single LLM, Multiple Roles: A Unified Retrieval-Augmented Generation Framework Using Role-Specific Token Optimization
by: Zhu, Yutao, et al.
Published: (2025)
by: Zhu, Yutao, et al.
Published: (2025)
MetaAgent: Toward Self-Evolving Agent via Tool Meta-Learning
by: Qian, Hongjin, et al.
Published: (2025)
by: Qian, Hongjin, et al.
Published: (2025)
Model-Document Protocol for AI Search
by: Qian, Hongjin, et al.
Published: (2025)
by: Qian, Hongjin, et al.
Published: (2025)
Scent of Knowledge: Optimizing Search-Enhanced Reasoning with Information Foraging
by: Qian, Hongjin, et al.
Published: (2025)
by: Qian, Hongjin, et al.
Published: (2025)
MemoRAG: Boosting Long Context Processing with Global Memory-Enhanced Retrieval Augmentation
by: Qian, Hongjin, et al.
Published: (2024)
by: Qian, Hongjin, et al.
Published: (2024)
FinSight: Towards Real-World Financial Deep Research
by: Jin, Jiajie, et al.
Published: (2025)
by: Jin, Jiajie, et al.
Published: (2025)
Auto-Discovery-Bench: Diagnosing Structured State Tracking in Oracle-Guided Discovery
by: Chen, Tingting, et al.
Published: (2025)
by: Chen, Tingting, et al.
Published: (2025)
Towards A Generalist Code Embedding Model Based On Massive Data Synthesis
by: Li, Chaofan, et al.
Published: (2025)
by: Li, Chaofan, et al.
Published: (2025)
PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers
by: Xiong, Lei, et al.
Published: (2026)
by: Xiong, Lei, et al.
Published: (2026)
InfoFlow: Reinforcing Search Agent Via Reward Density Optimization
by: Luo, Kun, et al.
Published: (2025)
by: Luo, Kun, et al.
Published: (2025)
MemoBrain: Executive Memory as an Agentic Brain for Reasoning
by: Qian, Hongjin, et al.
Published: (2026)
by: Qian, Hongjin, et al.
Published: (2026)
AutoIE: An Automated Framework for Information Extraction from Scientific Literature
by: Liu, Yangyang, et al.
Published: (2024)
by: Liu, Yangyang, et al.
Published: (2024)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
by: Yuan, Huaying, et al.
Published: (2025)
by: Yuan, Huaying, et al.
Published: (2025)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
by: Yuan, Huaying, et al.
Published: (2025)
by: Yuan, Huaying, et al.
Published: (2025)
DFlash: Block Diffusion for Flash Speculative Decoding
by: Chen, Jian, et al.
Published: (2026)
by: Chen, Jian, et al.
Published: (2026)
AIR-Bench: Automated Heterogeneous Information Retrieval Benchmark
by: Chen, Jianlyu, et al.
Published: (2024)
by: Chen, Jianlyu, et al.
Published: (2024)
MR$^2$-Bench: Going Beyond Matching to Reasoning in Multimodal Retrieval
by: Zhou, Junjie, et al.
Published: (2025)
by: Zhou, Junjie, et al.
Published: (2025)
Does RAG Really Perform Bad For Long-Context Processing?
by: Luo, Kun, et al.
Published: (2025)
by: Luo, Kun, et al.
Published: (2025)
AutoResearch AI: Towards AI-Powered Research Automation for Scientific Discovery
by: Tie, Guiyao, et al.
Published: (2026)
by: Tie, Guiyao, et al.
Published: (2026)
SciGPT: A Large Language Model for Scientific Literature Understanding and Knowledge Discovery
by: She, Fengyu, et al.
Published: (2025)
by: She, Fengyu, et al.
Published: (2025)
Making Text Embedders Few-Shot Learners
by: Li, Chaofan, et al.
Published: (2024)
by: Li, Chaofan, et al.
Published: (2024)
HiRA: A Hierarchical Reasoning Framework for Decoupled Planning and Execution in Deep Search
by: Jin, Jiajie, et al.
Published: (2025)
by: Jin, Jiajie, et al.
Published: (2025)
Figures as Interfaces: Toward LLM-Native Artifacts for Scientific Discovery
by: Wang, Yifang, et al.
Published: (2026)
by: Wang, Yifang, et al.
Published: (2026)
Memory Matters More: Event-Centric Memory as a Logic Map for Agent Searching and Reasoning
by: Hu, Yuyang, et al.
Published: (2026)
by: Hu, Yuyang, et al.
Published: (2026)
ReasonEmbed: Enhanced Text Embeddings for Reasoning-Intensive Document Retrieval
by: Chen, Jianlyu, et al.
Published: (2025)
by: Chen, Jianlyu, et al.
Published: (2025)
AutoDiscovery: Open-ended Scientific Discovery via Bayesian Surprise
by: Agarwal, Dhruv, et al.
Published: (2025)
by: Agarwal, Dhruv, et al.
Published: (2025)
A Novel Methodology in Credit Spread Prediction Based on Ensemble Learning and Feature Selection
by: Shao, Yu, et al.
Published: (2024)
by: Shao, Yu, et al.
Published: (2024)
WebThinker: Empowering Large Reasoning Models with Deep Research Capability
by: Li, Xiaoxi, et al.
Published: (2025)
by: Li, Xiaoxi, et al.
Published: (2025)
Similar Items
-
DeepXiv-SDK: An Agentic Data Interface for Scientific Literature
by: Qian, Hongjin, et al.
Published: (2026) -
HawkBench: Investigating Resilience of RAG Methods on Stratified Information-Seeking Tasks
by: Qian, Hongjin, et al.
Published: (2025) -
Open Data Synthesis For Deep Research
by: Xia, Ziyi, et al.
Published: (2025) -
Boosting Long-Context Management via Query-Guided Activation Refilling
by: Qian, Hongjin, et al.
Published: (2024) -
Grounding Language Model with Chunking-Free In-Context Retrieval
by: Qian, Hongjin, et al.
Published: (2024)