ForeSci: Evaluating LLM Agents for Forward-Looking AI Research Judgment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tian, Qiuyu, Liu, Zequn, Xia, Yingce, Yin, Haojie, Kong, Youyong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
STAGE: A Full-Screenplay Benchmark for Reasoning over Evolving Storie
par: Tian, Qiuyu, et autres
Publié: (2026)
par: Tian, Qiuyu, et autres
Publié: (2026)
Deciphering Scientific Reasoning Steps from Outcome Data for Molecule Optimization
par: Liu, Zequn, et autres
Publié: (2026)
par: Liu, Zequn, et autres
Publié: (2026)
Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents
par: Shi, Yaorui, et autres
Publié: (2025)
par: Shi, Yaorui, et autres
Publié: (2025)
Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments
par: Li, Yuran, et autres
Publié: (2025)
par: Li, Yuran, et autres
Publié: (2025)
Analytic Drift Resister for Non-Exemplar Continual Graph Learning
par: Song, Lei, et autres
Publié: (2026)
par: Song, Lei, et autres
Publié: (2026)
Looking Forward: Challenges and Opportunities in Agentic AI Reliability
par: Xing, Liudong, et autres
Publié: (2025)
par: Xing, Liudong, et autres
Publié: (2025)
Beyond Static Summarization: Proactive Memory Extraction for LLM Agents
par: Yang, Chengyuan, et autres
Publié: (2026)
par: Yang, Chengyuan, et autres
Publié: (2026)
NeuroAgent: LLM Agents for Multimodal Neuroimaging Analysis and Research
par: Zhong, Lujia, et autres
Publié: (2026)
par: Zhong, Lujia, et autres
Publié: (2026)
Agent-as-a-Service based on Agent Network
par: Zhu, Yuhan, et autres
Publié: (2025)
par: Zhu, Yuhan, et autres
Publié: (2025)
InnovatorBench: Evaluating Agents' Ability to Conduct Innovative LLM Research
par: Wu, Yunze, et autres
Publié: (2025)
par: Wu, Yunze, et autres
Publié: (2025)
Beyond Surface Judgments: Human-Grounded Risk Evaluation of LLM-Generated Disinformation
par: Xu, Zonghuan, et autres
Publié: (2026)
par: Xu, Zonghuan, et autres
Publié: (2026)
Through the Looking-Glass: AI-Mediated Video Communication Reduces Interpersonal Trust and Confidence in Judgments
par: Fernández, Nelson Navajas, et autres
Publié: (2026)
par: Fernández, Nelson Navajas, et autres
Publié: (2026)
Who's Your Judge? On the Detectability of LLM-Generated Judgments
par: Li, Dawei, et autres
Publié: (2025)
par: Li, Dawei, et autres
Publié: (2025)
Trust Region Preference Approximation: A simple and stable reinforcement learning algorithm for LLM reasoning
par: Su, Xuerui, et autres
Publié: (2025)
par: Su, Xuerui, et autres
Publié: (2025)
SciIntegrity-Bench: A Benchmark for Evaluating Academic Integrity in AI Scientist Systems
par: Yang, Zonglin, et autres
Publié: (2026)
par: Yang, Zonglin, et autres
Publié: (2026)
Look Before You Leap: Autonomous Exploration for LLM Agents
par: Ye, Ziang, et autres
Publié: (2026)
par: Ye, Ziang, et autres
Publié: (2026)
Deep Research Bench: Evaluating AI Web Research Agents
par: FutureSearch, et autres
Publié: (2025)
par: FutureSearch, et autres
Publié: (2025)
ReGal: A First Look at PPO-based Legal AI for Judgment Prediction and Summarization in India
par: Nigam, Shubham Kumar, et autres
Publié: (2025)
par: Nigam, Shubham Kumar, et autres
Publié: (2025)
Autonomous LLM Agents & CTFs: A Second Look
par: Bouchari, Youness, et autres
Publié: (2026)
par: Bouchari, Youness, et autres
Publié: (2026)
AI-Assisted Requirements Engineering: An Empirical Evaluation Relative to Expert Judgment
par: Levy, Oz, et autres
Publié: (2026)
par: Levy, Oz, et autres
Publié: (2026)
SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning
par: Zheng, Tianshi, et autres
Publié: (2026)
par: Zheng, Tianshi, et autres
Publié: (2026)
Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination
par: Zheng, Haojie, et autres
Publié: (2024)
par: Zheng, Haojie, et autres
Publié: (2024)
Finetuning Generative Large Language Models with Discrimination Instructions for Knowledge Graph Completion
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
ResearchGym: Evaluating Language Model Agents on Real-World AI Research
par: Garikaparthi, Aniketh, et autres
Publié: (2026)
par: Garikaparthi, Aniketh, et autres
Publié: (2026)
The Veln(ia)s is in the Details: Evaluating LLM Judgment on Latvian and Lithuanian Short Answer Matching
par: Kostiuk, Yevhen, et autres
Publié: (2025)
par: Kostiuk, Yevhen, et autres
Publié: (2025)
DataSciBench: An LLM Agent Benchmark for Data Science
par: Zhang, Dan, et autres
Publié: (2025)
par: Zhang, Dan, et autres
Publié: (2025)
ForeAct: Steering Your VLA with Efficient Visual Foresight Planning
par: Zhang, Zhuoyang, et autres
Publié: (2026)
par: Zhang, Zhuoyang, et autres
Publié: (2026)
LLM-based Agent Simulation for Maternal Health Interventions: Uncertainty Estimation and Decision-focused Evaluation
par: Martinson, Sarah, et autres
Publié: (2025)
par: Martinson, Sarah, et autres
Publié: (2025)
ActMem: Bridging the Gap Between Memory Retrieval and Reasoning in LLM Agents
par: Zhang, Xiaohui, et autres
Publié: (2026)
par: Zhang, Xiaohui, et autres
Publié: (2026)
QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI
par: Veysi, Marjan, et autres
Publié: (2026)
par: Veysi, Marjan, et autres
Publié: (2026)
Evaluating Multi-Turn Bargain Skills in LLM-Based Seller Agent
par: Wang, Issue Yishu, et autres
Publié: (2025)
par: Wang, Issue Yishu, et autres
Publié: (2025)
SciCode: A Research Coding Benchmark Curated by Scientists
par: Tian, Minyang, et autres
Publié: (2024)
par: Tian, Minyang, et autres
Publié: (2024)
From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge
par: Li, Dawei, et autres
Publié: (2024)
par: Li, Dawei, et autres
Publié: (2024)
Evaluating Stochasticity in Deep Research Agents
par: Zhai, Haotian, et autres
Publié: (2026)
par: Zhai, Haotian, et autres
Publié: (2026)
12 Angry AI Agents: Evaluating Multi-Agent LLM Decision-Making Through Cinematic Jury Deliberation
par: Ersoz, Ahmet Bahaddin
Publié: (2026)
par: Ersoz, Ahmet Bahaddin
Publié: (2026)
SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents
par: Ai, Kuangshi, et autres
Publié: (2026)
par: Ai, Kuangshi, et autres
Publié: (2026)
Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning
par: Zheng, Han, et autres
Publié: (2026)
par: Zheng, Han, et autres
Publié: (2026)
SciTrust 2.0: A Comprehensive Framework for Evaluating Trustworthiness of Large Language Models in Scientific Applications
par: Herron, Emily, et autres
Publié: (2025)
par: Herron, Emily, et autres
Publié: (2025)
Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey
par: Zhu, Jiachen, et autres
Publié: (2025)
par: Zhu, Jiachen, et autres
Publié: (2025)
A Vision for Auto Research with LLM Agents
par: Liu, Chengwei, et autres
Publié: (2025)
par: Liu, Chengwei, et autres
Publié: (2025)
Documents similaires
-
STAGE: A Full-Screenplay Benchmark for Reasoning over Evolving Storie
par: Tian, Qiuyu, et autres
Publié: (2026) -
Deciphering Scientific Reasoning Steps from Outcome Data for Molecule Optimization
par: Liu, Zequn, et autres
Publié: (2026) -
Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents
par: Shi, Yaorui, et autres
Publié: (2025) -
Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments
par: Li, Yuran, et autres
Publié: (2025) -
Analytic Drift Resister for Non-Exemplar Continual Graph Learning
par: Song, Lei, et autres
Publié: (2026)