MMReview: A Multidisciplinary and Multimodal Benchmark for LLM-Based Peer Review Automation
Fuente:
arXiv
Saved in:
| Main Authors: | Gao, Xian, Ruan, Jiacheng, Zhang, Zongyun, Gao, Jingsheng, Liu, Ting, Fu, Yuzhuo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ReviewAgents: Bridging the Gap Between Human and AI-Generated Paper Reviews
by: Gao, Xian, et al.
Published: (2025)
by: Gao, Xian, et al.
Published: (2025)
GoAI: Enhancing AI Students' Learning Paths and Idea Generation via Graph of AI Ideas
by: Gao, Xian, et al.
Published: (2025)
by: Gao, Xian, et al.
Published: (2025)
From Motion Signals to Insights: A Unified Framework for Student Behavior Analysis and Feedback in Physical Education Classes
by: Gao, Xian, et al.
Published: (2025)
by: Gao, Xian, et al.
Published: (2025)
MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models
by: Ruan, Jiacheng, et al.
Published: (2025)
by: Ruan, Jiacheng, et al.
Published: (2025)
BasketHAR: A Multimodal Dataset for Human Activity Recognition and Sport Analysis in Basketball Training Scenarios
by: Gao, Xian, et al.
Published: (2026)
by: Gao, Xian, et al.
Published: (2026)
OnlineMate: An LLM-Based Multi-Agent Companion System for Cognitive Support in Online Learning
by: Gao, Xian, et al.
Published: (2025)
by: Gao, Xian, et al.
Published: (2025)
EIAD: Explainable Industrial Anomaly Detection Via Multi-Modal Large Language Models
by: Zhang, Zongyun, et al.
Published: (2025)
by: Zhang, Zongyun, et al.
Published: (2025)
SmartRAG: Jointly Learn RAG-Related Tasks From the Environment Feedback
by: Gao, Jingsheng, et al.
Published: (2024)
by: Gao, Jingsheng, et al.
Published: (2024)
iDAT: inverse Distillation Adapter-Tuning
by: Ruan, Jiacheng, et al.
Published: (2024)
by: Ruan, Jiacheng, et al.
Published: (2024)
Understanding Robustness of Parameter-Efficient Tuning for Image Classification
by: Ruan, Jiacheng, et al.
Published: (2024)
by: Ruan, Jiacheng, et al.
Published: (2024)
Oceanship: A Large-Scale Dataset for Underwater Audio Target Recognition
by: Li, Zeyu, et al.
Published: (2024)
by: Li, Zeyu, et al.
Published: (2024)
VLRMBench: A Comprehensive and Challenging Benchmark for Vision-Language Reward Models
by: Ruan, Jiacheng, et al.
Published: (2025)
by: Ruan, Jiacheng, et al.
Published: (2025)
ARA: Adaptive Rank Allocation for Efficient Large Language Model SVD Compression
by: Xv, Lin, et al.
Published: (2025)
by: Xv, Lin, et al.
Published: (2025)
PRISM: A Multi-Dimensional Benchmark for Evaluating LLM Peer Reviewers
by: Loc, Ngoc Phan Phuoc, et al.
Published: (2026)
by: Loc, Ngoc Phan Phuoc, et al.
Published: (2026)
Aspect-Guided Multi-Level Perturbation Analysis of Large Language Models in Automated Peer Review
by: Li, Jiatao, et al.
Published: (2025)
by: Li, Jiatao, et al.
Published: (2025)
PRAIB: Peer Review AI Benchmark of Behaviour of LLM-Assisted Reviewing
by: Żurawicki, Krzysztof, et al.
Published: (2026)
by: Żurawicki, Krzysztof, et al.
Published: (2026)
From Replication to Redesign: Exploring Pairwise Comparisons for LLM-Based Peer Review
by: Zhang, Yaohui, et al.
Published: (2025)
by: Zhang, Yaohui, et al.
Published: (2025)
Is Your Paper Being Reviewed by an LLM? Benchmarking AI Text Detection in Peer Review
by: Yu, Sungduk, et al.
Published: (2025)
by: Yu, Sungduk, et al.
Published: (2025)
ReviewGuard: Enhancing Deficient Peer Review Detection via LLM-Driven Data Augmentation
by: Zhang, Haoxuan, et al.
Published: (2025)
by: Zhang, Haoxuan, et al.
Published: (2025)
ATLAS: A High-Difficulty, Multidisciplinary Benchmark for Frontier Scientific Reasoning
by: Liu, Hongwei, et al.
Published: (2025)
by: Liu, Hongwei, et al.
Published: (2025)
Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents
by: Luo, Yaxin, et al.
Published: (2025)
by: Luo, Yaxin, et al.
Published: (2025)
AgentReview: Exploring Peer Review Dynamics with LLM Agents
by: Jin, Yiqiao, et al.
Published: (2024)
by: Jin, Yiqiao, et al.
Published: (2024)
Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee Discussions
by: Zhao, Ruochen, et al.
Published: (2024)
by: Zhao, Ruochen, et al.
Published: (2024)
Reviewing the Reviewer: Elevating Peer Review Quality through LLM-Guided Feedback
by: Purkayastha, Sukannya, et al.
Published: (2026)
by: Purkayastha, Sukannya, et al.
Published: (2026)
Learning Multi-axis Representation in Frequency Domain for Medical Image Segmentation
by: Ruan, Jiacheng, et al.
Published: (2023)
by: Ruan, Jiacheng, et al.
Published: (2023)
Peer Review as A Multi-Turn and Long-Context Dialogue with Role-Based Interactions
by: Tan, Cheng, et al.
Published: (2024)
by: Tan, Cheng, et al.
Published: (2024)
Structured Prompting and LLM Ensembling for Multimodal Conversational Aspect-based Sentiment Analysis
by: Gao, Zhiqiang, et al.
Published: (2025)
by: Gao, Zhiqiang, et al.
Published: (2025)
Multimodal Peer Review Simulation with Actionable To-Do Recommendations for Community-Aware Manuscript Revisions
by: Hong, Mengze, et al.
Published: (2025)
by: Hong, Mengze, et al.
Published: (2025)
TreeReview: A Dynamic Tree of Questions Framework for Deep and Efficient LLM-based Scientific Peer Review
by: Chang, Yuan, et al.
Published: (2025)
by: Chang, Yuan, et al.
Published: (2025)
PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review
by: Tu, Songjun, et al.
Published: (2026)
by: Tu, Songjun, et al.
Published: (2026)
Benchmark on Peer Review Toxic Detection: A Challenging Task with a New Dataset
by: Luo, Man, et al.
Published: (2025)
by: Luo, Man, et al.
Published: (2025)
Sphinx: Benchmarking and Modeling for LLM-Driven Pull Request Review
by: Zhang, Daoan, et al.
Published: (2026)
by: Zhang, Daoan, et al.
Published: (2026)
MM-CamObj: A Comprehensive Multimodal Dataset for Camouflaged Object Scenarios
by: Ruan, Jiacheng, et al.
Published: (2024)
by: Ruan, Jiacheng, et al.
Published: (2024)
DESIGNER: Design-Logic-Guided Multidisciplinary Data Synthesis for LLM Reasoning
by: Liu, Weize, et al.
Published: (2025)
by: Liu, Weize, et al.
Published: (2025)
OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems
by: He, Chaoqun, et al.
Published: (2024)
by: He, Chaoqun, et al.
Published: (2024)
XFacta: Contemporary, Real-World Dataset and Evaluation for Multimodal Misinformation Detection with Multimodal LLMs
by: Xiao, Yuzhuo, et al.
Published: (2025)
by: Xiao, Yuzhuo, et al.
Published: (2025)
PRE: A Peer Review Based Large Language Model Evaluator
by: Chu, Zhumin, et al.
Published: (2024)
by: Chu, Zhumin, et al.
Published: (2024)
GODBench: A Benchmark for Multimodal Large Language Models in Video Comment Art
by: Lei, Yiming, et al.
Published: (2025)
by: Lei, Yiming, et al.
Published: (2025)
Automated Peer Reviewing in Paper SEA: Standardization, Evaluation, and Analysis
by: Yu, Jianxiang, et al.
Published: (2024)
by: Yu, Jianxiang, et al.
Published: (2024)
LLM-based NLG Evaluation: Current Status and Challenges
by: Gao, Mingqi, et al.
Published: (2024)
by: Gao, Mingqi, et al.
Published: (2024)
Similar Items
-
ReviewAgents: Bridging the Gap Between Human and AI-Generated Paper Reviews
by: Gao, Xian, et al.
Published: (2025) -
GoAI: Enhancing AI Students' Learning Paths and Idea Generation via Graph of AI Ideas
by: Gao, Xian, et al.
Published: (2025) -
From Motion Signals to Insights: A Unified Framework for Student Behavior Analysis and Feedback in Physical Education Classes
by: Gao, Xian, et al.
Published: (2025) -
MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models
by: Ruan, Jiacheng, et al.
Published: (2025) -
BasketHAR: A Multimodal Dataset for Human Activity Recognition and Sport Analysis in Basketball Training Scenarios
by: Gao, Xian, et al.
Published: (2026)