DIAGPaper: Diagnosing Valid and Specific Weaknesses in Scientific Papers via Multi-Agent Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Zou, Zhuoyang, Ansari, Abolfazl, Zhang, Delvin Ce, Lee, Dongwon, Yin, Wenpeng |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
M2-Verify: A Large-Scale Multidomain Benchmark for Checking Multimodal Claim Consistency
by: Ansari, Abolfazl, et al.
Published: (2026)
by: Ansari, Abolfazl, et al.
Published: (2026)
CORRECT: Context- and Reference-Augmented Reasoning and Prompting for Fact-Checking
by: Zhang, Delvin Ce, et al.
Published: (2025)
by: Zhang, Delvin Ce, et al.
Published: (2025)
Echoes of Automation: The Increasing Use of LLMs in Newsmaking
by: Ansari, Abolfazl, et al.
Published: (2025)
by: Ansari, Abolfazl, et al.
Published: (2025)
SUA: Stealthy Multimodal Large Language Model Unlearning Attack
by: Zhang, Xianren, et al.
Published: (2025)
by: Zhang, Xianren, et al.
Published: (2025)
Moltbook Moderation: Uncovering Hidden Intent Through Multi-Turn Dialogue
by: Al-Lawati, Ali, et al.
Published: (2026)
by: Al-Lawati, Ali, et al.
Published: (2026)
Unmasking Fake Careers: Detecting Machine-Generated Career Trajectories via Multi-layer Heterogeneous Graphs
by: Yamashita, Michiharu, et al.
Published: (2025)
by: Yamashita, Michiharu, et al.
Published: (2025)
When Misinformation Speaks and Converses: Rethinking Fact-Checking in Audio Platforms
by: Chun, Chaewan, et al.
Published: (2026)
by: Chun, Chaewan, et al.
Published: (2026)
MAD: A Benchmark for Multi-Turn Audio Dialogue Fact-Checking
by: Chun, Chaewan, et al.
Published: (2025)
by: Chun, Chaewan, et al.
Published: (2025)
XDomainBench: Diagnosing Reasoning Collapse in High-Dimensional Scientific Knowledge Composition
by: Zhiren, Gong, et al.
Published: (2026)
by: Zhiren, Gong, et al.
Published: (2026)
FutureWeaver: Planning Test-Time Compute for Multi-Agent Systems with Modularized Collaboration
by: Jung, Dongwon, et al.
Published: (2025)
by: Jung, Dongwon, et al.
Published: (2025)
Discourse-Aware Scientific Paper Recommendation via QA-Style Summarization and Multi-Level Contrastive Learning
by: Wang, Shenghua, et al.
Published: (2025)
by: Wang, Shenghua, et al.
Published: (2025)
Temporal UI State Inconsistency in Desktop GUI Agents: Formalizing and Defending Against TOCTOU Attacks on Computer-Use Agents
by: Xu, Wenpeng
Published: (2026)
by: Xu, Wenpeng
Published: (2026)
Improving LLM Reasoning with Multi-Agent Tree-of-Thought Validator Agent
by: Haji, Fatemeh, et al.
Published: (2024)
by: Haji, Fatemeh, et al.
Published: (2024)
Weak-Link Optimization for Multi-Agent Reasoning and Collaboration
by: Bian, Haoyu, et al.
Published: (2026)
by: Bian, Haoyu, et al.
Published: (2026)
FASTopic: Pretrained Transformer is a Fast, Adaptive, Stable, and Transferable Topic Model
by: Wu, Xiaobao, et al.
Published: (2024)
by: Wu, Xiaobao, et al.
Published: (2024)
Hypformer: Exploring Efficient Transformer Fully in Hyperbolic Space
by: Yang, Menglin, et al.
Published: (2024)
by: Yang, Menglin, et al.
Published: (2024)
Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning
by: Tang, Xiangru, et al.
Published: (2025)
by: Tang, Xiangru, et al.
Published: (2025)
Staircase Streaming for Low-Latency Multi-Agent Inference
by: Wang, Junlin, et al.
Published: (2025)
by: Wang, Junlin, et al.
Published: (2025)
MEVER: Multi-Modal and Explainable Claim Verification with Graph-based Evidence Retrieval
by: Zhang, Delvin Ce, et al.
Published: (2026)
by: Zhang, Delvin Ce, et al.
Published: (2026)
CGBench: Benchmarking Language Model Scientific Reasoning for Clinical Genetics Research
by: Queen, Owen, et al.
Published: (2025)
by: Queen, Owen, et al.
Published: (2025)
SciAgent: A Unified Multi-Agent System for Generalistic Scientific Reasoning
by: Li, Xuchen, et al.
Published: (2025)
by: Li, Xuchen, et al.
Published: (2025)
Science Across Languages: Assessing LLM Multilingual Translation of Scientific Papers
by: Kleidermacher, Hannah Calzi, et al.
Published: (2025)
by: Kleidermacher, Hannah Calzi, et al.
Published: (2025)
PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature
by: Wang, Daoyu, et al.
Published: (2025)
by: Wang, Daoyu, et al.
Published: (2025)
CollabStory: Multi-LLM Collaborative Story Generation and Authorship Analysis
by: Venkatraman, Saranya, et al.
Published: (2024)
by: Venkatraman, Saranya, et al.
Published: (2024)
OrchMAS: Orchestrated Reasoning with Multi Collaborative Heterogeneous Scientific Expert Structured Agents
by: Feng, Yichao, et al.
Published: (2026)
by: Feng, Yichao, et al.
Published: (2026)
PosterGen: Aesthetic-Aware Multi-Modal Paper-to-Poster Generation via Multi-Agent LLMs
by: Zhang, Zhilin, et al.
Published: (2025)
by: Zhang, Zhilin, et al.
Published: (2025)
Orcust: Stepwise-Feedback Reinforcement Learning for GUI Agent
by: Lu, Junyu, et al.
Published: (2025)
by: Lu, Junyu, et al.
Published: (2025)
Code Execution as Grounded Supervision for LLM Reasoning
by: Jung, Dongwon, et al.
Published: (2025)
by: Jung, Dongwon, et al.
Published: (2025)
MACPO: Weak-to-Strong Alignment via Multi-Agent Contrastive Preference Optimization
by: Lyu, Yougang, et al.
Published: (2024)
by: Lyu, Yougang, et al.
Published: (2024)
PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers
by: Xiong, Lei, et al.
Published: (2026)
by: Xiong, Lei, et al.
Published: (2026)
PaperSearchQA: Learning to Search and Reason over Scientific Papers with RLVR
by: Burgess, James, et al.
Published: (2026)
by: Burgess, James, et al.
Published: (2026)
Enhancing News Recommendation with Hierarchical LLM Prompting
by: Kieu, Hai-Dang, et al.
Published: (2025)
by: Kieu, Hai-Dang, et al.
Published: (2025)
An Adversary-Resistant Multi-Agent LLM System via Credibility Scoring
by: Ebrahimi, Sana, et al.
Published: (2025)
by: Ebrahimi, Sana, et al.
Published: (2025)
Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning
by: Yin, Ming, et al.
Published: (2025)
by: Yin, Ming, et al.
Published: (2025)
Paper2Agent: Reimagining Research Papers As Interactive and Reliable AI Agents
by: Miao, Jiacheng, et al.
Published: (2025)
by: Miao, Jiacheng, et al.
Published: (2025)
Weak-for-Strong: Training Weak Meta-Agent to Harness Strong Executors
by: Nie, Fan, et al.
Published: (2025)
by: Nie, Fan, et al.
Published: (2025)
ReFuGe: Feature Generation for Prediction Tasks on Relational Databases with LLM Agents
by: Kim, Kyungho, et al.
Published: (2026)
by: Kim, Kyungho, et al.
Published: (2026)
COMPACT: Common-token Optimized Model Pruning Across Channels and Tokens
by: Kwek, Eugene, et al.
Published: (2025)
by: Kwek, Eugene, et al.
Published: (2025)
Spatial-Agent: Agentic Geo-spatial Reasoning with Scientific Core Concepts
by: Bao, Riyang, et al.
Published: (2026)
by: Bao, Riyang, et al.
Published: (2026)
OMNIFLOW: A Physics-Grounded Multimodal Agent for Generalized Scientific Reasoning
by: Wu, Hao, et al.
Published: (2026)
by: Wu, Hao, et al.
Published: (2026)
Similar Items
-
M2-Verify: A Large-Scale Multidomain Benchmark for Checking Multimodal Claim Consistency
by: Ansari, Abolfazl, et al.
Published: (2026) -
CORRECT: Context- and Reference-Augmented Reasoning and Prompting for Fact-Checking
by: Zhang, Delvin Ce, et al.
Published: (2025) -
Echoes of Automation: The Increasing Use of LLMs in Newsmaking
by: Ansari, Abolfazl, et al.
Published: (2025) -
SUA: Stealthy Multimodal Large Language Model Unlearning Attack
by: Zhang, Xianren, et al.
Published: (2025) -
Moltbook Moderation: Uncovering Hidden Intent Through Multi-Turn Dialogue
by: Al-Lawati, Ali, et al.
Published: (2026)