THEMIS: Towards Holistic Evaluation of MLLMs for Scientific Paper Fraud Forensics
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Tzu-Yen, Zhang, Bo, Tang, Zichen, Ding, Junpeng, Tian, Haolin, Li, Yuanze, Hao, Zhuodi, Ding, Zixin, Wang, Zirui, Yu, Xinyu, Peng, Shiyao, Zhao, Yizhuo, Jiang, Ruomeng, Huang, Yiling, Zhao, Peizhi, Chen, Jiayuan, Tan, Weisheng, Gao, Haocheng, Liu, Yang, Liu, Jiacheng, Yang, Zhongjun, Huang, Jiayu, E, Haihong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic Images
par: Zhang, Bo, et autres
Publié: (2026)
par: Zhang, Bo, et autres
Publié: (2026)
Not Search, But Scan: Benchmarking MLLMs on Scan-Oriented Academic Paper Reasoning
par: Li, Rongjin, et autres
Publié: (2026)
par: Li, Rongjin, et autres
Publié: (2026)
Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning
par: Ding, Junpeng, et autres
Publié: (2026)
par: Ding, Junpeng, et autres
Publié: (2026)
FinMMDocR: Benchmarking Financial Multimodal Reasoning with Scenario Awareness, Document Understanding, and Multi-Step Computation
par: Tang, Zichen, et autres
Publié: (2025)
par: Tang, Zichen, et autres
Publié: (2025)
NeocorRAG: Less Irrelevant Information, More Explicit Evidence, and More Effective Recall via Evidence Chains
par: Peng, Shiyao, et autres
Publié: (2026)
par: Peng, Shiyao, et autres
Publié: (2026)
RoadMapper: A Multi-Agent System for Roadmap Generation of Solving Complex Research Problems
par: Liu, Jiacheng, et autres
Publié: (2026)
par: Liu, Jiacheng, et autres
Publié: (2026)
FinMMR: Make Financial Numerical Reasoning More Multimodal, Comprehensive, and Challenging
par: Tang, Zichen, et autres
Publié: (2025)
par: Tang, Zichen, et autres
Publié: (2025)
PEACE: Empowering Geologic Map Holistic Understanding with MLLMs
par: Huang, Yangyu, et autres
Publié: (2025)
par: Huang, Yangyu, et autres
Publié: (2025)
SkillGen: Learning Domain Skills for In-Context Sequential Decision Making
par: Ding, Ruomeng, et autres
Publié: (2025)
par: Ding, Ruomeng, et autres
Publié: (2025)
3Description: An Intuitive Human-AI Collaborative 3D Modeling Approach
par: Cai, Zhuodi
Publié: (2025)
par: Cai, Zhuodi
Publié: (2025)
Ride the Wave: Precision-Allocated Sparse Attention for Smooth Video Generation
par: Zhang, Wentai, et autres
Publié: (2026)
par: Zhang, Wentai, et autres
Publié: (2026)
4D-CAT: Synthesis of 4D Coronary Artery Trees from Systole and Diastole
par: Hu, Daosong, et autres
Publié: (2024)
par: Hu, Daosong, et autres
Publié: (2024)
THEMIS: Towards Practical Intellectual Property Protection for Post-Deployment On-Device Deep Learning Models
par: Huang, Yujin, et autres
Publié: (2025)
par: Huang, Yujin, et autres
Publié: (2025)
SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions
par: Tu, Jinzhe, et autres
Publié: (2026)
par: Tu, Jinzhe, et autres
Publié: (2026)
Real-world Troublemaker: A 5G Cloud-controlled Track Testing Framework for Automated Driving Systems in Safety-critical Interaction Scenarios
par: Zhang, Xinrui, et autres
Publié: (2025)
par: Zhang, Xinrui, et autres
Publié: (2025)
Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs
par: Yang, Rui, et autres
Publié: (2024)
par: Yang, Rui, et autres
Publié: (2024)
Improved gray prediction parameter identification sliding mode current control of experimental advanced superconducting tokamak fast control power supply
par: Zhao Chen, et autres
Publié: (2024)
par: Zhao Chen, et autres
Publié: (2024)
YNTP-100: A Benchmark for Your Next Token Prediction with 100 People
par: Ding, Shiyao, et autres
Publié: (2025)
par: Ding, Shiyao, et autres
Publié: (2025)
RETRACTED: Causal relationship between inflammatory skin diseases and breast cancer: A bidirectional Mendelian randomization study
par: Yiling Yang, et autres
Publié: (2024)
par: Yiling Yang, et autres
Publié: (2024)
3DGS-IEval-15K: A Large-scale Image Quality Evaluation Database for 3D Gaussian-Splatting
par: Xing, Yuke, et autres
Publié: (2025)
par: Xing, Yuke, et autres
Publié: (2025)
SoccerMaster: A Vision Foundation Model for Soccer Understanding
par: Yang, Haolin, et autres
Publié: (2025)
par: Yang, Haolin, et autres
Publié: (2025)
FinanceReasoning: Benchmarking Financial Numerical Reasoning More Credible, Comprehensive and Challenging
par: Tang, Zichen, et autres
Publié: (2025)
par: Tang, Zichen, et autres
Publié: (2025)
A Benchmark for Ultra-High-Resolution Remote Sensing MLLMs
par: Dang, Yunkai, et autres
Publié: (2025)
par: Dang, Yunkai, et autres
Publié: (2025)
Distill Visual Chart Reasoning Ability from LLMs to MLLMs
par: He, Wei, et autres
Publié: (2024)
par: He, Wei, et autres
Publié: (2024)
ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization
par: Wang, Youqi, et autres
Publié: (2026)
par: Wang, Youqi, et autres
Publié: (2026)
Solution‐Processed Bi 2 S 3 Nanostructures for Flexible Memory and Neuromorphic Computing
par: Sayali Shrishail Harke, et autres
Publié: (2025)
par: Sayali Shrishail Harke, et autres
Publié: (2025)
Dense Connector for MLLMs
par: Yao, Huanjin, et autres
Publié: (2024)
par: Yao, Huanjin, et autres
Publié: (2024)
GRACE: Reinforcement Learning for Grounded Response and Abstention under Contextual Evidence
par: Zhao, Yibo, et autres
Publié: (2026)
par: Zhao, Yibo, et autres
Publié: (2026)
The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning
par: Chen, Renmiao, et autres
Publié: (2026)
par: Chen, Renmiao, et autres
Publié: (2026)
Human-Machine Ritual: Synergic Performance through Real-Time Motion Recognition
par: Cai, Zhuodi, et autres
Publié: (2025)
par: Cai, Zhuodi, et autres
Publié: (2025)
OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference
par: Zhao, Xiangyu, et autres
Publié: (2025)
par: Zhao, Xiangyu, et autres
Publié: (2025)
SA-MixNet: Structure-aware Mixup and Invariance Learning for Scribble-supervised Road Extraction in Remote Sensing Images
par: Feng, Jie, et autres
Publié: (2024)
par: Feng, Jie, et autres
Publié: (2024)
Distributed TD Tracking with Linear Function Approximation over Directed Communication Networks
par: Yang, Haocheng, et autres
Publié: (2026)
par: Yang, Haocheng, et autres
Publié: (2026)
Task Vectors, Learned Not Extracted: Performance Gains and Mechanistic Insight
par: Yang, Haolin, et autres
Publié: (2025)
par: Yang, Haolin, et autres
Publié: (2025)
Automated Multi-level Preference for MLLMs
par: Zhang, Mengxi, et autres
Publié: (2024)
par: Zhang, Mengxi, et autres
Publié: (2024)
SELU: Self-Learning Embodied MLLMs in Unknown Environments
par: Li, Boyu, et autres
Publié: (2024)
par: Li, Boyu, et autres
Publié: (2024)
SCI-Reason: A Dataset with Chain-of-Thought Rationales for Complex Multimodal Reasoning in Academic Areas
par: Ma, Chenghao, et autres
Publié: (2025)
par: Ma, Chenghao, et autres
Publié: (2025)
CICV5G: A 5G Communication Delay Dataset for PnC in Cloud-based Intelligent Connected Vehicles
par: Zhang, Xinrui, et autres
Publié: (2025)
par: Zhang, Xinrui, et autres
Publié: (2025)
Discovery of an orally bioavailable pyridone-based BRD4 inhibitor with potent antitumor efficacy in colorectal cancer.
par: Fang, Zhangyun, et autres
Publié: (2026)
par: Fang, Zhangyun, et autres
Publié: (2026)
Virial Theorem and Its Applications in Instability of Two-Phase Water-Wave
par: Yang, Haocheng
Publié: (2024)
par: Yang, Haocheng
Publié: (2024)
Documents similaires
-
AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic Images
par: Zhang, Bo, et autres
Publié: (2026) -
Not Search, But Scan: Benchmarking MLLMs on Scan-Oriented Academic Paper Reasoning
par: Li, Rongjin, et autres
Publié: (2026) -
Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning
par: Ding, Junpeng, et autres
Publié: (2026) -
FinMMDocR: Benchmarking Financial Multimodal Reasoning with Scenario Awareness, Document Understanding, and Multi-Step Computation
par: Tang, Zichen, et autres
Publié: (2025) -
NeocorRAG: Less Irrelevant Information, More Explicit Evidence, and More Effective Recall via Evidence Chains
par: Peng, Shiyao, et autres
Publié: (2026)