PHYSICS: Benchmarking Foundation Models on University-Level Physics Problem Solving
Fuente:
arXiv
Salvato in:
| Autori principali: | Feng, Kaiyue, Zhao, Yilun, Liu, Yixin, Yang, Tianyu, Zhao, Chen, Sous, John, Cohan, Arman |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
di: Li, Chuhan, et al.
Pubblicazione: (2024)
di: Li, Chuhan, et al.
Pubblicazione: (2024)
SUCEA: Reasoning-Intensive Retrieval for Adversarial Fact-checking through Claim Decomposition and Editing
di: Liu, Hongjun, et al.
Pubblicazione: (2025)
di: Liu, Hongjun, et al.
Pubblicazione: (2025)
PuzzlePlex: Benchmarking Foundation Models on Reasoning and Planning with Puzzles
di: Long, Yitao, et al.
Pubblicazione: (2025)
di: Long, Yitao, et al.
Pubblicazione: (2025)
Investigating Data Contamination in Modern Benchmarks for Large Language Models
di: Deng, Chunyuan, et al.
Pubblicazione: (2023)
di: Deng, Chunyuan, et al.
Pubblicazione: (2023)
ANCHOR: Branch-Point Data Generation for GUI Agents
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)
AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
di: Liu, Yixin, et al.
Pubblicazione: (2025)
di: Liu, Yixin, et al.
Pubblicazione: (2025)
Step-level Optimization for Efficient Computer-use Agents
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)
A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning
di: Yang, Tianyu, et al.
Pubblicazione: (2026)
di: Yang, Tianyu, et al.
Pubblicazione: (2026)
Benchmarking Foundation Models with Retrieval-Augmented Generation in Olympic-Level Physics Problem Solving
di: Zheng, Shunfeng, et al.
Pubblicazione: (2025)
di: Zheng, Shunfeng, et al.
Pubblicazione: (2025)
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
di: Shangguan, Ziyao, et al.
Pubblicazione: (2024)
di: Shangguan, Ziyao, et al.
Pubblicazione: (2024)
ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain
di: Zhao, Haochen, et al.
Pubblicazione: (2024)
di: Zhao, Haochen, et al.
Pubblicazione: (2024)
Calibrating Long-form Generations from Large Language Models
di: Huang, Yukun, et al.
Pubblicazione: (2024)
di: Huang, Yukun, et al.
Pubblicazione: (2024)
SciMDR: Advancing Scientific Multimodal Document Reasoning
di: Chen, Ziyu, et al.
Pubblicazione: (2026)
di: Chen, Ziyu, et al.
Pubblicazione: (2026)
ReIFE: Re-evaluating Instruction-Following Evaluation
di: Liu, Yixin, et al.
Pubblicazione: (2024)
di: Liu, Yixin, et al.
Pubblicazione: (2024)
ResearchGym: Evaluating Language Model Agents on Real-World AI Research
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2026)
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2026)
One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs
di: Dunefsky, Jacob, et al.
Pubblicazione: (2025)
di: Dunefsky, Jacob, et al.
Pubblicazione: (2025)
MedAgents: Large Language Models as Collaborators for Zero-shot Medical Reasoning
di: Tang, Xiangru, et al.
Pubblicazione: (2023)
di: Tang, Xiangru, et al.
Pubblicazione: (2023)
OpenComputer: Verifiable Software Worlds for Computer-Use Agents
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)
RbtAct: Rebuttal as Supervision for Actionable Review Feedback Generation
di: Wu, Sihong, et al.
Pubblicazione: (2026)
di: Wu, Sihong, et al.
Pubblicazione: (2026)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving
di: Zhou, Xiyuan, et al.
Pubblicazione: (2025)
di: Zhou, Xiyuan, et al.
Pubblicazione: (2025)
COMAL: A Convergent Meta-Algorithm for Aligning LLMs with General Preferences
di: Liu, Yixin, et al.
Pubblicazione: (2024)
di: Liu, Yixin, et al.
Pubblicazione: (2024)
Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future
di: Wu, Sihong, et al.
Pubblicazione: (2026)
di: Wu, Sihong, et al.
Pubblicazione: (2026)
MIMIR: A Streamlined Platform for Personalized Agent Tuning in Domain Expertise
di: Deng, Chunyuan, et al.
Pubblicazione: (2024)
di: Deng, Chunyuan, et al.
Pubblicazione: (2024)
ChemAgent: Self-updating Library in Large Language Models Improves Chemical Reasoning
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
Judging with Many Minds: Do More Perspectives Mean Less Prejudice? On Bias Amplifications and Resistance in Multi-Agent Based LLM-as-Judge
di: Ma, Chiyu, et al.
Pubblicazione: (2025)
di: Ma, Chiyu, et al.
Pubblicazione: (2025)
Re-evaluating Automatic LLM System Ranking for Alignment with Human Preference
di: Gao, Mingqi, et al.
Pubblicazione: (2024)
di: Gao, Mingqi, et al.
Pubblicazione: (2024)
On the Benefits of Fine-Grained Loss Truncation: A Case Study on Factuality in Summarization
di: Flores, Lorenzo Jaime Yu, et al.
Pubblicazione: (2024)
di: Flores, Lorenzo Jaime Yu, et al.
Pubblicazione: (2024)
ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code
di: Tang, Xiangru, et al.
Pubblicazione: (2023)
di: Tang, Xiangru, et al.
Pubblicazione: (2023)
Step-Back Profiling: Distilling User History for Personalized Scientific Writing
di: Tang, Xiangru, et al.
Pubblicazione: (2024)
di: Tang, Xiangru, et al.
Pubblicazione: (2024)
References Improve LLM Alignment in Non-Verifiable Domains
di: Shi, Kejian, et al.
Pubblicazione: (2026)
di: Shi, Kejian, et al.
Pubblicazione: (2026)
MMVU: Measuring Expert-Level Multi-Discipline Video Understanding
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
MIR: Methodology Inspiration Retrieval for Scientific Research Problems
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2025)
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2025)
AlphaResearch: Accelerating New Algorithm Discovery with Language Models
di: Yu, Zhaojian, et al.
Pubblicazione: (2025)
di: Yu, Zhaojian, et al.
Pubblicazione: (2025)
Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
Survey on Evaluation of LLM-based Agents
di: Yehudai, Asaf, et al.
Pubblicazione: (2025)
di: Yehudai, Asaf, et al.
Pubblicazione: (2025)
Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving
di: Gao, Songyang, et al.
Pubblicazione: (2025)
di: Gao, Songyang, et al.
Pubblicazione: (2025)
RouterRetriever: Routing over a Mixture of Expert Embedding Models
di: Lee, Hyunji, et al.
Pubblicazione: (2024)
di: Lee, Hyunji, et al.
Pubblicazione: (2024)
Bayesian Calibration of Win Rate Estimation with LLM Evaluators
di: Gao, Yicheng, et al.
Pubblicazione: (2024)
di: Gao, Yicheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
di: Li, Chuhan, et al.
Pubblicazione: (2024) -
SUCEA: Reasoning-Intensive Retrieval for Adversarial Fact-checking through Claim Decomposition and Editing
di: Liu, Hongjun, et al.
Pubblicazione: (2025) -
PuzzlePlex: Benchmarking Foundation Models on Reasoning and Planning with Puzzles
di: Long, Yitao, et al.
Pubblicazione: (2025) -
Investigating Data Contamination in Modern Benchmarks for Large Language Models
di: Deng, Chunyuan, et al.
Pubblicazione: (2023) -
ANCHOR: Branch-Point Data Generation for GUI Agents
di: Wei, Jinbiao, et al.
Pubblicazione: (2026)