InnoEval: On Research Idea Evaluation as a Knowledge-Grounded, Multi-Perspective Reasoning Problem
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qiao, Shuofei, Wei, Yunxiang, Wang, Xuehai, Wu, Bin, Xue, Boyang, Zhang, Ningyu, Rahmani, Hossein A., Wang, Yanshan, Zhang, Qiang, Ding, Keyan, Pan, Jeff Z., Chen, Huajun, Yilmaz, Emine |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
InnoGym: Benchmarking the Innovation Potential of AI Agents
par: Zhang, Jintian, et autres
Publié: (2025)
par: Zhang, Jintian, et autres
Publié: (2025)
SciAtlas: A Large-Scale Knowledge Graph for Automated Scientific Research
par: Qiao, Shuofei, et autres
Publié: (2026)
par: Qiao, Shuofei, et autres
Publié: (2026)
KnowRL: Exploring Knowledgeable Reinforcement Learning for Factuality
par: Ren, Baochang, et autres
Publié: (2025)
par: Ren, Baochang, et autres
Publié: (2025)
Aligning Agentic World Models via Knowledgeable Experience Learning
par: Ren, Baochang, et autres
Publié: (2026)
par: Ren, Baochang, et autres
Publié: (2026)
Making Language Models Better Tool Learners with Execution Feedback
par: Qiao, Shuofei, et autres
Publié: (2023)
par: Qiao, Shuofei, et autres
Publié: (2023)
InstructIE: A Bilingual Instruction-based Information Extraction Dataset
par: Gui, Honghao, et autres
Publié: (2023)
par: Gui, Honghao, et autres
Publié: (2023)
Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis
par: Qiu, Zhisong, et autres
Publié: (2026)
par: Qiu, Zhisong, et autres
Publié: (2026)
Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems
par: Chen, Yinzhu, et autres
Publié: (2026)
par: Chen, Yinzhu, et autres
Publié: (2026)
Beyond Internal Data: Constructing Complete Datasets for Fairness Testing
par: Ramineni, Varsha, et autres
Publié: (2025)
par: Ramineni, Varsha, et autres
Publié: (2025)
Beyond Internal Data: Bounding and Estimating Fairness from Incomplete Data
par: Ramineni, Varsha, et autres
Publié: (2025)
par: Ramineni, Varsha, et autres
Publié: (2025)
JudgeBlender: Ensembling Judgments for Automatic Relevance Assessment
par: Rahmani, Hossein A., et autres
Publié: (2024)
par: Rahmani, Hossein A., et autres
Publié: (2024)
Clarifying the Path to User Satisfaction: An Investigation into Clarification Usefulness
par: Rahmani, Hossein A., et autres
Publié: (2024)
par: Rahmani, Hossein A., et autres
Publié: (2024)
Self-Correcting Large Language Models: Generation vs. Multiple Choice
par: Rahmani, Hossein A., et autres
Publié: (2025)
par: Rahmani, Hossein A., et autres
Publié: (2025)
Benchmarking Agentic Workflow Generation
par: Qiao, Shuofei, et autres
Publié: (2024)
par: Qiao, Shuofei, et autres
Publié: (2024)
LLMs for Knowledge Graph Construction and Reasoning: Recent Capabilities and Future Opportunities
par: Zhu, Yuqi, et autres
Publié: (2023)
par: Zhu, Yuqi, et autres
Publié: (2023)
Memp: Exploring Agent Procedural Memory
par: Fang, Runnan, et autres
Publié: (2025)
par: Fang, Runnan, et autres
Publié: (2025)
LightThinker: Thinking Step-by-Step Compression
par: Zhang, Jintian, et autres
Publié: (2025)
par: Zhang, Jintian, et autres
Publié: (2025)
AutoAct: Automatic Agent Learning from Scratch for QA via Self-Planning
par: Qiao, Shuofei, et autres
Publié: (2024)
par: Qiao, Shuofei, et autres
Publié: (2024)
Knowledge Mechanisms in Large Language Models: A Survey and Perspective
par: Wang, Mengru, et autres
Publié: (2024)
par: Wang, Mengru, et autres
Publié: (2024)
Why Do Open-Source LLMs Struggle with Data Analysis? A Systematic Empirical Study
par: Zhu, Yuqi, et autres
Publié: (2025)
par: Zhu, Yuqi, et autres
Publié: (2025)
Towards Understanding Bias in Synthetic Data for Evaluation
par: Rahmani, Hossein A., et autres
Publié: (2025)
par: Rahmani, Hossein A., et autres
Publié: (2025)
Synthetic Test Collections for Retrieval Evaluation
par: Rahmani, Hossein A., et autres
Publié: (2024)
par: Rahmani, Hossein A., et autres
Publié: (2024)
Understanding the Role of User Profile in the Personalization of Large Language Models
par: Wu, Bin, et autres
Publié: (2024)
par: Wu, Bin, et autres
Publié: (2024)
SynDL: A Large-Scale Synthetic Test Collection for Passage Retrieval
par: Rahmani, Hossein A., et autres
Publié: (2024)
par: Rahmani, Hossein A., et autres
Publié: (2024)
LightThinker++: From Reasoning Compression to Memory Management
par: Zhu, Yuqi, et autres
Publié: (2026)
par: Zhu, Yuqi, et autres
Publié: (2026)
Scaling Generalist Data-Analytic Agents
par: Qiao, Shuofei, et autres
Publié: (2025)
par: Qiao, Shuofei, et autres
Publié: (2025)
KnowAgent: Knowledge-Augmented Planning for LLM-Based Agents
par: Zhu, Yuqi, et autres
Publié: (2024)
par: Zhu, Yuqi, et autres
Publié: (2024)
Agent Planning with World Knowledge Model
par: Qiao, Shuofei, et autres
Publié: (2024)
par: Qiao, Shuofei, et autres
Publié: (2024)
SynWorld: Virtual Scenario Synthesis for Agentic Action Knowledge Refinement
par: Fang, Runnan, et autres
Publié: (2025)
par: Fang, Runnan, et autres
Publié: (2025)
Agentic Knowledgeable Self-awareness
par: Qiao, Shuofei, et autres
Publié: (2025)
par: Qiao, Shuofei, et autres
Publié: (2025)
Report on the 1st Workshop on Large Language Model for Evaluation in Information Retrieval (LLM4Eval 2024) at SIGIR 2024
par: Rahmani, Hossein A., et autres
Publié: (2024)
par: Rahmani, Hossein A., et autres
Publié: (2024)
ZJUKLAB at SemEval-2025 Task 4: Unlearning via Model Merging
par: Xu, Haoming, et autres
Publié: (2025)
par: Xu, Haoming, et autres
Publié: (2025)
ScholarEval: Research Idea Evaluation Grounded in Literature
par: Moussa, Hanane Nour, et autres
Publié: (2025)
par: Moussa, Hanane Nour, et autres
Publié: (2025)
OceanGym: A Benchmark Environment for Underwater Embodied Agents
par: Xue, Yida, et autres
Publié: (2025)
par: Xue, Yida, et autres
Publié: (2025)
PREF: Reference-Free Evaluation of Personalised Text Generation in LLMs
par: Fu, Xiao, et autres
Publié: (2025)
par: Fu, Xiao, et autres
Publié: (2025)
The Role of Digital Transformation in Women's Employment
par: Yılmaz, Emine
Publié: (2025)
par: Yılmaz, Emine
Publié: (2025)
LightMem: Lightweight and Efficient Memory-Augmented Generation
par: Fang, Jizhan, et autres
Publié: (2025)
par: Fang, Jizhan, et autres
Publié: (2025)
What Makes AI Research Replicable? Executable Knowledge Graphs as Scientific Knowledge Representations
par: Luo, Yujie, et autres
Publié: (2025)
par: Luo, Yujie, et autres
Publié: (2025)
SciKnowEval: Evaluating Multi-level Scientific Knowledge of Large Language Models
par: Feng, Kehua, et autres
Publié: (2024)
par: Feng, Kehua, et autres
Publié: (2024)
AutoMind: Adaptive Knowledgeable Agent for Automated Data Science
par: Ou, Yixin, et autres
Publié: (2025)
par: Ou, Yixin, et autres
Publié: (2025)
Documents similaires
-
InnoGym: Benchmarking the Innovation Potential of AI Agents
par: Zhang, Jintian, et autres
Publié: (2025) -
SciAtlas: A Large-Scale Knowledge Graph for Automated Scientific Research
par: Qiao, Shuofei, et autres
Publié: (2026) -
KnowRL: Exploring Knowledgeable Reinforcement Learning for Factuality
par: Ren, Baochang, et autres
Publié: (2025) -
Aligning Agentic World Models via Knowledgeable Experience Learning
par: Ren, Baochang, et autres
Publié: (2026) -
Making Language Models Better Tool Learners with Execution Feedback
par: Qiao, Shuofei, et autres
Publié: (2023)