ResearchArena: Benchmarking Large Language Models' Ability to Collect and Organize Information as Research Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kang, Hao, Xiong, Chenyan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information
par: Huang, Youcheng, et autres
Publié: (2025)
par: Huang, Youcheng, et autres
Publié: (2025)
Benchmarking Prompt Sensitivity in Large Language Models
par: Razavi, Amirhossein, et autres
Publié: (2025)
par: Razavi, Amirhossein, et autres
Publié: (2025)
ScIRGen: Synthesize Realistic and Large-Scale RAG Dataset for Scientific Research
par: Lin, Junyong, et autres
Publié: (2025)
par: Lin, Junyong, et autres
Publié: (2025)
Exploring the Implicit Semantic Ability of Multimodal Large Language Models: A Pilot Study on Entity Set Expansion
par: Wang, Hebin, et autres
Publié: (2024)
par: Wang, Hebin, et autres
Publié: (2024)
Large Language Models Empowered Personalized Web Agents
par: Cai, Hongru, et autres
Publié: (2024)
par: Cai, Hongru, et autres
Publié: (2024)
Large Language Model Agent for Fake News Detection
par: Li, Xinyi, et autres
Publié: (2024)
par: Li, Xinyi, et autres
Publié: (2024)
WideSeek: Advancing Wide Research via Multi-Agent Scaling
par: Huang, Ziyang, et autres
Publié: (2026)
par: Huang, Ziyang, et autres
Publié: (2026)
Towards Personalized Deep Research: Benchmarks and Evaluations
par: Liang, Yuan, et autres
Publié: (2025)
par: Liang, Yuan, et autres
Publié: (2025)
CoSearchAgent: A Lightweight Collaborative Search Agent with Large Language Models
par: Gong, Peiyuan, et autres
Publié: (2024)
par: Gong, Peiyuan, et autres
Publié: (2024)
Retrieval Models Aren't Tool-Savvy: Benchmarking Tool Retrieval for Large Language Models
par: Shi, Zhengliang, et autres
Publié: (2025)
par: Shi, Zhengliang, et autres
Publié: (2025)
MizanQA: Benchmarking Large Language Models on Moroccan Legal Question Answering
par: Bahaj, Adil, et autres
Publié: (2025)
par: Bahaj, Adil, et autres
Publié: (2025)
Benchmarking Large Language Models on Reference Extraction and Parsing in the Social Sciences and Humanities
par: Zhu, Yurui, et autres
Publié: (2026)
par: Zhu, Yurui, et autres
Publié: (2026)
URAG: A Benchmark for Uncertainty Quantification in Retrieval-Augmented Large Language Models
par: Nguyen, Vinh, et autres
Publié: (2026)
par: Nguyen, Vinh, et autres
Publié: (2026)
Evaluating improvements on using Large Language Models (LLMs) for property extraction in the Open Research Knowledge Graph (ORKG)
par: Schaftner, Sandra
Publié: (2025)
par: Schaftner, Sandra
Publié: (2025)
WebThinker: Empowering Large Reasoning Models with Deep Research Capability
par: Li, Xiaoxi, et autres
Publié: (2025)
par: Li, Xiaoxi, et autres
Publié: (2025)
Argus: Evidence Assembly for Scalable Deep Research Agents
par: Zhang, Zhen, et autres
Publié: (2026)
par: Zhang, Zhen, et autres
Publié: (2026)
OAEI-LLM: A Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching
par: Qiang, Zhangcheng, et autres
Publié: (2024)
par: Qiang, Zhangcheng, et autres
Publié: (2024)
Enhancing Question Answering for Enterprise Knowledge Bases using Large Language Models
par: Jiang, Feihu, et autres
Publié: (2024)
par: Jiang, Feihu, et autres
Publié: (2024)
Improving Medical Reasoning through Retrieval and Self-Reflection with Retrieval-Augmented Large Language Models
par: Jeong, Minbyul, et autres
Publié: (2024)
par: Jeong, Minbyul, et autres
Publié: (2024)
Self-Retrieval: End-to-End Information Retrieval with One Large Language Model
par: Tang, Qiaoyu, et autres
Publié: (2024)
par: Tang, Qiaoyu, et autres
Publié: (2024)
Faux Polyglot: A Study on Information Disparity in Multilingual Large Language Models
par: Sharma, Nikhil, et autres
Publié: (2024)
par: Sharma, Nikhil, et autres
Publié: (2024)
AssistRAG: Boosting the Potential of Large Language Models with an Intelligent Information Assistant
par: Zhou, Yujia, et autres
Publié: (2024)
par: Zhou, Yujia, et autres
Publié: (2024)
Unsupervised Information Refinement Training of Large Language Models for Retrieval-Augmented Generation
par: Xu, Shicheng, et autres
Publié: (2024)
par: Xu, Shicheng, et autres
Publié: (2024)
BEIR-PL: Zero Shot Information Retrieval Benchmark for the Polish Language
par: Wojtasik, Konrad, et autres
Publié: (2023)
par: Wojtasik, Konrad, et autres
Publié: (2023)
Self-Manager: Parallel Agent Loop for Long-form Deep Research
par: Xu, Yilong, et autres
Publié: (2026)
par: Xu, Yilong, et autres
Publié: (2026)
Use of Retrieval-Augmented Large Language Model Agent for Long-Form COVID-19 Fact-Checking
par: Huang, Jingyi, et autres
Publié: (2025)
par: Huang, Jingyi, et autres
Publié: (2025)
StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization
par: Wang, Ziliang, et autres
Publié: (2025)
par: Wang, Ziliang, et autres
Publié: (2025)
Benchmarking Information Retrieval Models on Complex Retrieval Tasks
par: Killingback, Julian, et autres
Publié: (2025)
par: Killingback, Julian, et autres
Publié: (2025)
Statements: Universal Information Extraction from Tables with Large Language Models for ESG KPIs
par: Mishra, Lokesh, et autres
Publié: (2024)
par: Mishra, Lokesh, et autres
Publié: (2024)
Table Meets LLM: Can Large Language Models Understand Structured Table Data? A Benchmark and Empirical Study
par: Sui, Yuan, et autres
Publié: (2023)
par: Sui, Yuan, et autres
Publié: (2023)
Evaluating the External and Parametric Knowledge Fusion of Large Language Models
par: Zhang, Hao, et autres
Publié: (2024)
par: Zhang, Hao, et autres
Publié: (2024)
A Multi-Stage Validation Framework for Trustworthy Large-scale Clinical Information Extraction using Large Language Models
par: Mahbub, Maria, et autres
Publié: (2026)
par: Mahbub, Maria, et autres
Publié: (2026)
MILL: Mutual Verification with Large Language Models for Zero-Shot Query Expansion
par: Jia, Pengyue, et autres
Publié: (2023)
par: Jia, Pengyue, et autres
Publié: (2023)
ProductAgent: Benchmarking Conversational Product Search Agent with Asking Clarification Questions
par: Ye, Jingheng, et autres
Publié: (2024)
par: Ye, Jingheng, et autres
Publié: (2024)
Breaking the Barrier: Utilizing Large Language Models for Industrial Recommendation Systems through an Inferential Knowledge Graph
par: Zhao, Qian, et autres
Publié: (2024)
par: Zhao, Qian, et autres
Publié: (2024)
A Survey of Graph Retrieval-Augmented Generation for Customized Large Language Models
par: Zhang, Qinggang, et autres
Publié: (2025)
par: Zhang, Qinggang, et autres
Publié: (2025)
HeCiX: Integrating Knowledge Graphs and Large Language Models for Biomedical Research
par: Kulkarni, Prerana Sanjay, et autres
Publié: (2024)
par: Kulkarni, Prerana Sanjay, et autres
Publié: (2024)
On the Capacity of Citation Generation by Large Language Models
par: Qian, Haosheng, et autres
Publié: (2024)
par: Qian, Haosheng, et autres
Publié: (2024)
XRec: Large Language Models for Explainable Recommendation
par: Ma, Qiyao, et autres
Publié: (2024)
par: Ma, Qiyao, et autres
Publié: (2024)
Large Language Models as Narrative-Driven Recommenders
par: Eberhard, Lukas, et autres
Publié: (2024)
par: Eberhard, Lukas, et autres
Publié: (2024)
Documents similaires
-
Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information
par: Huang, Youcheng, et autres
Publié: (2025) -
Benchmarking Prompt Sensitivity in Large Language Models
par: Razavi, Amirhossein, et autres
Publié: (2025) -
ScIRGen: Synthesize Realistic and Large-Scale RAG Dataset for Scientific Research
par: Lin, Junyong, et autres
Publié: (2025) -
Exploring the Implicit Semantic Ability of Multimodal Large Language Models: A Pilot Study on Entity Set Expansion
par: Wang, Hebin, et autres
Publié: (2024) -
Large Language Models Empowered Personalized Web Agents
par: Cai, Hongru, et autres
Publié: (2024)