Classroom Final Exam: An Instructor-Tested Reasoning Benchmark
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gao, Chongyang, Yang, Diji, Zhou, Shuyan, Yan, Xichen, Song, Luchuan, Li, Shuo, Chen, Kezhen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning
par: Ding, Junpeng, et autres
Publié: (2026)
par: Ding, Junpeng, et autres
Publié: (2026)
FinMMDocR: Benchmarking Financial Multimodal Reasoning with Scenario Awareness, Document Understanding, and Multi-Step Computation
par: Tang, Zichen, et autres
Publié: (2025)
par: Tang, Zichen, et autres
Publié: (2025)
A Survey on Industrial Anomalies Synthesis
par: Wang, Yanshu, et autres
Publié: (2025)
par: Wang, Yanshu, et autres
Publié: (2025)
FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation
par: Zhang, Chenxi, et autres
Publié: (2026)
par: Zhang, Chenxi, et autres
Publié: (2026)
SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?
par: Wasi, Azmine Toushik, et autres
Publié: (2026)
par: Wasi, Azmine Toushik, et autres
Publié: (2026)
Human Semantic Representations of Social Interactions from Moving Shapes
par: Yun, Yiling, et autres
Publié: (2025)
par: Yun, Yiling, et autres
Publié: (2025)
Exploiting DINOv3-Based Self-Supervised Features for Robust Few-Shot Medical Image Segmentation
par: Xu, Guoping, et autres
Publié: (2026)
par: Xu, Guoping, et autres
Publié: (2026)
FinanceReasoning: Benchmarking Financial Numerical Reasoning More Credible, Comprehensive and Challenging
par: Tang, Zichen, et autres
Publié: (2025)
par: Tang, Zichen, et autres
Publié: (2025)
ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering
par: Kaur, Rachneet, et autres
Publié: (2025)
par: Kaur, Rachneet, et autres
Publié: (2025)
UCFE: A User-Centric Financial Expertise Benchmark for Large Language Models
par: Yang, Yuzhe, et autres
Publié: (2024)
par: Yang, Yuzhe, et autres
Publié: (2024)
FCMBench-Video: Benchmarking Document Video Intelligence
par: Cui, Runze, et autres
Publié: (2026)
par: Cui, Runze, et autres
Publié: (2026)
FinMMR: Make Financial Numerical Reasoning More Multimodal, Comprehensive, and Challenging
par: Tang, Zichen, et autres
Publié: (2025)
par: Tang, Zichen, et autres
Publié: (2025)
LLMs as World Models: Data-Driven and Human-Centered Pre-Event Simulation for Disaster Impact Assessment
par: Li, Lingyao, et autres
Publié: (2025)
par: Li, Lingyao, et autres
Publié: (2025)
Spatial Priming Outperforms Semantic Prompting: A Grid-Based Approach to Improving LLM Accuracy on Chart Data Extraction
par: Lazarev, Andrei, et autres
Publié: (2026)
par: Lazarev, Andrei, et autres
Publié: (2026)
ReXVQA: A Large-scale Visual Question Answering Benchmark for Generalist Chest X-ray Understanding
par: Pal, Ankit, et autres
Publié: (2025)
par: Pal, Ankit, et autres
Publié: (2025)
neuralCAD-Edit: An Expert Benchmark for Multimodal-Instructed 3D CAD Model Editing
par: Perrett, Toby, et autres
Publié: (2026)
par: Perrett, Toby, et autres
Publié: (2026)
Enhanced User Interaction in Operating Systems through Machine Learning Language Models
par: Zhang, Chenwei, et autres
Publié: (2024)
par: Zhang, Chenwei, et autres
Publié: (2024)
All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection
par: Jiang, Yuechen, et autres
Publié: (2026)
par: Jiang, Yuechen, et autres
Publié: (2026)
FinBoardBench: Benchmarking Dynamic Wealth Management and Strategic Financial Reasoning of LLMs via Board Game Simulations
par: Hu, Xuesi, et autres
Publié: (2026)
par: Hu, Xuesi, et autres
Publié: (2026)
MetaGen: A DSL, Database, and Benchmark for VLM-Assisted Metamaterial Generation
par: Makatura, Liane, et autres
Publié: (2025)
par: Makatura, Liane, et autres
Publié: (2025)
GaussianCAD: Robust Self-Supervised CAD Reconstruction from Three Orthographic Views Using 3D Gaussian Splatting
par: Zhou, Zheng, et autres
Publié: (2025)
par: Zhou, Zheng, et autres
Publié: (2025)
FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications
par: Yang, Yehui, et autres
Publié: (2026)
par: Yang, Yehui, et autres
Publié: (2026)
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
par: Liu, Fuxiao, et autres
Publié: (2023)
par: Liu, Fuxiao, et autres
Publié: (2023)
Improving Unsupervised Task-driven Models of Ventral Visual Stream via Relative Position Predictivity
par: Rong, Dazhong, et autres
Publié: (2025)
par: Rong, Dazhong, et autres
Publié: (2025)
COph100: A comprehensive fundus image registration dataset from infants constituting the "RIDIRP" database
par: Hu, Yan, et autres
Publié: (2025)
par: Hu, Yan, et autres
Publié: (2025)
FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback
par: Wu, Xueqing, et autres
Publié: (2025)
par: Wu, Xueqing, et autres
Publié: (2025)
GLObal Building heights for Urban Studies (UT-GLOBUS) for city- and street- scale urban simulations: Development and first applications
par: Kamath, Harsh G., et autres
Publié: (2022)
par: Kamath, Harsh G., et autres
Publié: (2022)
VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding
par: Yu, Haorui, et autres
Publié: (2026)
par: Yu, Haorui, et autres
Publié: (2026)
LoLI-Street: Benchmarking Low-Light Image Enhancement and Beyond
par: Islam, Md Tanvir, et autres
Publié: (2024)
par: Islam, Md Tanvir, et autres
Publié: (2024)
ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
par: Liu, Yujie, et autres
Publié: (2025)
par: Liu, Yujie, et autres
Publié: (2025)
Open-FinLLMs: Open Multimodal Large Language Models for Financial Applications
par: Huang, Jimin, et autres
Publié: (2024)
par: Huang, Jimin, et autres
Publié: (2024)
PLMM: Personal Large Language Models on Mobile Devices
par: Gong, Yuanhao
Publié: (2023)
par: Gong, Yuanhao
Publié: (2023)
Learning from String Sequences
par: Lindsay, David, et autres
Publié: (2024)
par: Lindsay, David, et autres
Publié: (2024)
INTERACT: An AI-Driven Extended Reality Framework for Accesible Communication Featuring Real-Time Sign Language Interpretation and Emotion Recognition
par: Tantaroudas, Nikolaos D., et autres
Publié: (2026)
par: Tantaroudas, Nikolaos D., et autres
Publié: (2026)
Beyond Turing Test: Can GPT-4 Sway Experts' Decisions?
par: Takayanagi, Takehiro, et autres
Publié: (2024)
par: Takayanagi, Takehiro, et autres
Publié: (2024)
Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models
par: Wu, Xiaojun, et autres
Publié: (2024)
par: Wu, Xiaojun, et autres
Publié: (2024)
BatSort: Enhanced Battery Classification with Transfer Learning for Battery Sorting and Recycling
par: Zhao, Yunyi, et autres
Publié: (2024)
par: Zhao, Yunyi, et autres
Publié: (2024)
DDI-CoCo: A Dataset For Understanding The Effect Of Color Contrast In Machine-Assisted Skin Disease Detection
par: Chiu, Ming-Chang, et autres
Publié: (2024)
par: Chiu, Ming-Chang, et autres
Publié: (2024)
Evolutionary computing-based image segmentation method to detect defects and features in Additive Friction Stir Deposition Process
par: Mishra, Akshansh, et autres
Publié: (2025)
par: Mishra, Akshansh, et autres
Publié: (2025)
Predict Patient Self-reported Race from Skin Histological Images
par: Chen, Shengjia, et autres
Publié: (2025)
par: Chen, Shengjia, et autres
Publié: (2025)
Documents similaires
-
Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning
par: Ding, Junpeng, et autres
Publié: (2026) -
FinMMDocR: Benchmarking Financial Multimodal Reasoning with Scenario Awareness, Document Understanding, and Multi-Step Computation
par: Tang, Zichen, et autres
Publié: (2025) -
A Survey on Industrial Anomalies Synthesis
par: Wang, Yanshu, et autres
Publié: (2025) -
FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation
par: Zhang, Chenxi, et autres
Publié: (2026) -
SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?
par: Wasi, Azmine Toushik, et autres
Publié: (2026)