UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Xin, Xu, Qiyun, Xiao, Tong, Chen, Tianhao, Yan, Yuchen, Zhang, Jiaxin, Diao, Shizhe, Yang, Can, Wang, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UGMathBench: A Diverse and Dynamic Benchmark for Undergraduate-Level Mathematical Reasoning with Large Language Models
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
Can We Verify Step by Step for Incorrect Answer Detection?
di: Xu, Xin, et al.
Pubblicazione: (2024)
di: Xu, Xin, et al.
Pubblicazione: (2024)
Progressive Residual Warmup for Language Model Pretraining
di: Chen, Tianhao, et al.
Pubblicazione: (2026)
di: Chen, Tianhao, et al.
Pubblicazione: (2026)
ConstraintChecker: A Plugin for Large Language Models to Reason on Commonsense Knowledge Bases
di: Do, Quyet V., et al.
Pubblicazione: (2024)
di: Do, Quyet V., et al.
Pubblicazione: (2024)
ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
di: Liu, Mingjie, et al.
Pubblicazione: (2025)
di: Liu, Mingjie, et al.
Pubblicazione: (2025)
VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models
di: Yan, Yuchen, et al.
Pubblicazione: (2025)
di: Yan, Yuchen, et al.
Pubblicazione: (2025)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
di: Li, Ce, et al.
Pubblicazione: (2025)
di: Li, Ce, et al.
Pubblicazione: (2025)
S^3cMath: Spontaneous Step-level Self-correction Makes Large Language Models Better Mathematical Reasoners
di: Yan, Yuchen, et al.
Pubblicazione: (2024)
di: Yan, Yuchen, et al.
Pubblicazione: (2024)
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
di: Xu, Hainiu, et al.
Pubblicazione: (2024)
di: Xu, Hainiu, et al.
Pubblicazione: (2024)
Double-Checker: Enhancing Reasoning of Slow-Thinking LLMs via Self-Critical Fine-Tuning
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
LISA: Layerwise Importance Sampling for Memory-Efficient Large Language Model Fine-Tuning
di: Pan, Rui, et al.
Pubblicazione: (2024)
di: Pan, Rui, et al.
Pubblicazione: (2024)
LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
LMFlow: An Extensible Toolkit for Finetuning and Inference of Large Foundation Models
di: Diao, Shizhe, et al.
Pubblicazione: (2023)
di: Diao, Shizhe, et al.
Pubblicazione: (2023)
CodeGraph: Enhancing Graph Reasoning of LLMs with Code
di: Cai, Qiaolong, et al.
Pubblicazione: (2024)
di: Cai, Qiaolong, et al.
Pubblicazione: (2024)
A Survey on Large Language Models for Mathematical Reasoning
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2025)
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2025)
How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning
di: Yang, Luyu, et al.
Pubblicazione: (2026)
di: Yang, Luyu, et al.
Pubblicazione: (2026)
VeraCT Scan: Retrieval-Augmented Fake News Detection with Justifiable Reasoning
di: Niu, Cheng, et al.
Pubblicazione: (2024)
di: Niu, Cheng, et al.
Pubblicazione: (2024)
PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models
di: Xu, Yinggan, et al.
Pubblicazione: (2025)
di: Xu, Yinggan, et al.
Pubblicazione: (2025)
Do Large Language Models Excel in Complex Logical Reasoning with Formal Language?
di: Jiang, Jin, et al.
Pubblicazione: (2025)
di: Jiang, Jin, et al.
Pubblicazione: (2025)
Large Language Models in the Clinic: A Comprehensive Benchmark
di: Liu, Fenglin, et al.
Pubblicazione: (2024)
di: Liu, Fenglin, et al.
Pubblicazione: (2024)
MedHallu: A Comprehensive Benchmark for Detecting Medical Hallucinations in Large Language Models
di: Pandit, Shrey, et al.
Pubblicazione: (2025)
di: Pandit, Shrey, et al.
Pubblicazione: (2025)
Teaching LLMs According to Their Aptitude: Adaptive Reasoning for Mathematical Problem Solving
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models
di: Yang, Wanqi, et al.
Pubblicazione: (2025)
di: Yang, Wanqi, et al.
Pubblicazione: (2025)
Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language Models
di: Yan, Yuchen, et al.
Pubblicazione: (2025)
di: Yan, Yuchen, et al.
Pubblicazione: (2025)
Enhance Reasoning for Large Language Models in the Game Werewolf
di: Wu, Shuang, et al.
Pubblicazione: (2024)
di: Wu, Shuang, et al.
Pubblicazione: (2024)
Implicit Reasoning in Large Language Models: A Comprehensive Survey
di: Li, Jindong, et al.
Pubblicazione: (2025)
di: Li, Jindong, et al.
Pubblicazione: (2025)
DLLMQuant: Quantizing Diffusion-based Large Language Models
di: Xu, Chen, et al.
Pubblicazione: (2025)
di: Xu, Chen, et al.
Pubblicazione: (2025)
GraCoRe: Benchmarking Graph Comprehension and Complex Reasoning in Large Language Models
di: Yuan, Zike, et al.
Pubblicazione: (2024)
di: Yuan, Zike, et al.
Pubblicazione: (2024)
Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers
di: Chen, Xin, et al.
Pubblicazione: (2026)
di: Chen, Xin, et al.
Pubblicazione: (2026)
MA-LoT: Model-Collaboration Lean-based Long Chain-of-Thought Reasoning enhances Formal Theorem Proving
di: Wang, Ruida, et al.
Pubblicazione: (2025)
di: Wang, Ruida, et al.
Pubblicazione: (2025)
MedAdapter: Efficient Test-Time Adaptation of Large Language Models towards Medical Reasoning
di: Shi, Wenqi, et al.
Pubblicazione: (2024)
di: Shi, Wenqi, et al.
Pubblicazione: (2024)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
di: Guo, Pei-Fu, et al.
Pubblicazione: (2026)
di: Guo, Pei-Fu, et al.
Pubblicazione: (2026)
NUMCoT: Numerals and Units of Measurement in Chain-of-Thought Reasoning using Large Language Models
di: Xu, Ancheng, et al.
Pubblicazione: (2024)
di: Xu, Ancheng, et al.
Pubblicazione: (2024)
GAUSS: Benchmarking Structured Mathematical Skills for Large Language Models
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
Think-on-Graph 2.0: Deep and Faithful Large Language Model Reasoning with Knowledge-guided Retrieval Augmented Generation
di: Ma, Shengjie, et al.
Pubblicazione: (2024)
di: Ma, Shengjie, et al.
Pubblicazione: (2024)
Local Success Does Not Compose: Benchmarking Large Language Models for Compositional Formal Verification
di: Xu, Xu, et al.
Pubblicazione: (2025)
di: Xu, Xu, et al.
Pubblicazione: (2025)
Are Large Language Models Really Good Logical Reasoners? A Comprehensive Evaluation and Beyond
di: Xu, Fangzhi, et al.
Pubblicazione: (2023)
di: Xu, Fangzhi, et al.
Pubblicazione: (2023)
CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery
di: Song, Xiaoshuai, et al.
Pubblicazione: (2024)
di: Song, Xiaoshuai, et al.
Pubblicazione: (2024)
Unlocking the Potential: Benchmarking Large Language Models in Water Engineering and Research
di: Xu, Boyan, et al.
Pubblicazione: (2024)
di: Xu, Boyan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
UGMathBench: A Diverse and Dynamic Benchmark for Undergraduate-Level Mathematical Reasoning with Large Language Models
di: Xu, Xin, et al.
Pubblicazione: (2025) -
Can We Verify Step by Step for Incorrect Answer Detection?
di: Xu, Xin, et al.
Pubblicazione: (2024) -
Progressive Residual Warmup for Language Model Pretraining
di: Chen, Tianhao, et al.
Pubblicazione: (2026) -
ConstraintChecker: A Plugin for Large Language Models to Reason on Commonsense Knowledge Bases
di: Do, Quyet V., et al.
Pubblicazione: (2024) -
ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
di: Liu, Mingjie, et al.
Pubblicazione: (2025)