PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Yinggan, Liu, Yue, Gao, Zhiqiang, Peng, Changnan, Luo, Di |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PhySense: Sensor Placement Optimization for Accurate Physics Sensing
di: Ma, Yuezhou, et al.
Pubblicazione: (2025)
di: Ma, Yuezhou, et al.
Pubblicazione: (2025)
Advancing AI-Scientist Understanding: Multi-Agent LLMs with Interpretable Physics Reasoning
di: Xu, Yinggan, et al.
Pubblicazione: (2025)
di: Xu, Yinggan, et al.
Pubblicazione: (2025)
Benchmarking Benchmark Leakage in Large Language Models
di: Xu, Ruijie, et al.
Pubblicazione: (2024)
di: Xu, Ruijie, et al.
Pubblicazione: (2024)
Principled Data Selection for Alignment: The Hidden Risks of Difficult Examples
di: Gao, Chengqian, et al.
Pubblicazione: (2025)
di: Gao, Chengqian, et al.
Pubblicazione: (2025)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
Mitigating Hallucinations in Large Language Models via Causal Reasoning
di: Li, Yuangang, et al.
Pubblicazione: (2025)
di: Li, Yuangang, et al.
Pubblicazione: (2025)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
di: Chung, Tsz Ting, et al.
Pubblicazione: (2025)
di: Chung, Tsz Ting, et al.
Pubblicazione: (2025)
LLMSurgeon: Diagnosing Data Mixture of Large Language Models
di: Luo, Yaxin, et al.
Pubblicazione: (2026)
di: Luo, Yaxin, et al.
Pubblicazione: (2026)
BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation
di: Xu, Peng, et al.
Pubblicazione: (2024)
di: Xu, Peng, et al.
Pubblicazione: (2024)
Benchmarking the Medical Understanding and Reasoning of Large Language Models in Arabic Healthcare Tasks
di: AlDahoul, Nouar, et al.
Pubblicazione: (2025)
di: AlDahoul, Nouar, et al.
Pubblicazione: (2025)
CausalVLBench: Benchmarking Visual Causal Reasoning in Large Vision-Language Models
di: Komanduri, Aneesh, et al.
Pubblicazione: (2025)
di: Komanduri, Aneesh, et al.
Pubblicazione: (2025)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
di: Huang, Jiameng, et al.
Pubblicazione: (2025)
di: Huang, Jiameng, et al.
Pubblicazione: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
The Role of Deductive and Inductive Reasoning in Large Language Models
di: Cai, Chengkun, et al.
Pubblicazione: (2024)
di: Cai, Chengkun, et al.
Pubblicazione: (2024)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
di: Wang, Yiping, et al.
Pubblicazione: (2025)
di: Wang, Yiping, et al.
Pubblicazione: (2025)
PhyGround: Benchmarking Physical Reasoning in Generative World Models
di: Lin, Juyi, et al.
Pubblicazione: (2026)
di: Lin, Juyi, et al.
Pubblicazione: (2026)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
di: Wang, Wentian, et al.
Pubblicazione: (2024)
di: Wang, Wentian, et al.
Pubblicazione: (2024)
$T^2$ of Thoughts: Temperature Tree Elicits Reasoning in Large Language Models
di: Cai, Chengkun, et al.
Pubblicazione: (2024)
di: Cai, Chengkun, et al.
Pubblicazione: (2024)
Towards Reasoning-Preserving Unlearning in Multimodal Large Language Models
di: Li, Hongji, et al.
Pubblicazione: (2025)
di: Li, Hongji, et al.
Pubblicazione: (2025)
Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs
di: Microsoft, et al.
Pubblicazione: (2025)
di: Microsoft, et al.
Pubblicazione: (2025)
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
Benchmarking the Capabilities of Large Language Models in Transportation System Engineering: Accuracy, Consistency, and Reasoning Behaviors
di: Syed, Usman, et al.
Pubblicazione: (2024)
di: Syed, Usman, et al.
Pubblicazione: (2024)
ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models
di: Düzkar, Kemal
Pubblicazione: (2026)
di: Düzkar, Kemal
Pubblicazione: (2026)
Large Language Model Cascades with Mixture of Thoughts Representations for Cost-efficient Reasoning
di: Yue, Murong, et al.
Pubblicazione: (2023)
di: Yue, Murong, et al.
Pubblicazione: (2023)
Accelerating Diffusion Large Language Models with SlowFast Sampling: The Three Golden Principles
di: Wei, Qingyan, et al.
Pubblicazione: (2025)
di: Wei, Qingyan, et al.
Pubblicazione: (2025)
Instruction Following by Principled Boosting Attention of Large Language Models
di: Guardieiro, Vitoria, et al.
Pubblicazione: (2025)
di: Guardieiro, Vitoria, et al.
Pubblicazione: (2025)
Large Language and Reasoning Models are Shallow Disjunctive Reasoners
di: Khalid, Irtaza, et al.
Pubblicazione: (2025)
di: Khalid, Irtaza, et al.
Pubblicazione: (2025)
Offline Learning and Forgetting for Reasoning with Large Language Models
di: Ni, Tianwei, et al.
Pubblicazione: (2025)
di: Ni, Tianwei, et al.
Pubblicazione: (2025)
Large Language Model Reasoning Failures
di: Song, Peiyang, et al.
Pubblicazione: (2026)
di: Song, Peiyang, et al.
Pubblicazione: (2026)
Unveiling Causal Reasoning in Large Language Models: Reality or Mirage?
di: Chi, Haoang, et al.
Pubblicazione: (2025)
di: Chi, Haoang, et al.
Pubblicazione: (2025)
AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
di: Luo, Haipeng, et al.
Pubblicazione: (2025)
di: Luo, Haipeng, et al.
Pubblicazione: (2025)
Towards Understanding Multi-Round Large Language Model Reasoning: Approximability, Learnability and Generalizability
di: Xu, Chenhui, et al.
Pubblicazione: (2025)
di: Xu, Chenhui, et al.
Pubblicazione: (2025)
BioCoder: A Benchmark for Bioinformatics Code Generation with Large Language Models
di: Tang, Xiangru, et al.
Pubblicazione: (2023)
di: Tang, Xiangru, et al.
Pubblicazione: (2023)
SSR: Socratic Self-Refine for Large Language Model Reasoning
di: Shi, Haizhou, et al.
Pubblicazione: (2025)
di: Shi, Haizhou, et al.
Pubblicazione: (2025)
Principled Detection of Hallucinations in Large Language Models via Multiple Testing
di: Li, Jiawei, et al.
Pubblicazione: (2025)
di: Li, Jiawei, et al.
Pubblicazione: (2025)
AECBench: A Hierarchical Benchmark for Knowledge Evaluation of Large Language Models in the AEC Field
di: Liang, Chen, et al.
Pubblicazione: (2025)
di: Liang, Chen, et al.
Pubblicazione: (2025)
Method-Based Reasoning for Large Language Models: Extraction, Reuse, and Continuous Improvement
di: Su, Hong
Pubblicazione: (2025)
di: Su, Hong
Pubblicazione: (2025)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
di: Gui, Jiayi, et al.
Pubblicazione: (2024)
di: Gui, Jiayi, et al.
Pubblicazione: (2024)
MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models
di: Peng, Shuai, et al.
Pubblicazione: (2024)
di: Peng, Shuai, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PhySense: Sensor Placement Optimization for Accurate Physics Sensing
di: Ma, Yuezhou, et al.
Pubblicazione: (2025) -
Advancing AI-Scientist Understanding: Multi-Agent LLMs with Interpretable Physics Reasoning
di: Xu, Yinggan, et al.
Pubblicazione: (2025) -
Benchmarking Benchmark Leakage in Large Language Models
di: Xu, Ruijie, et al.
Pubblicazione: (2024) -
Principled Data Selection for Alignment: The Hidden Risks of Difficult Examples
di: Gao, Chengqian, et al.
Pubblicazione: (2025) -
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)