Enregistré dans:
| Auteurs principaux: | Sun, Zhishen, Dai, Guang, Ye, Haishan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2511.08055 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Numerical Sensitivity and Robustness: Exploring the Flaws of Mathematical Reasoning in Large Language Models
par: Sun, Zhishen, et autres
Publié: (2025)
par: Sun, Zhishen, et autres
Publié: (2025)
ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning
par: Sun, Zhishen, et autres
Publié: (2026)
par: Sun, Zhishen, et autres
Publié: (2026)
Evaluating the Reasoning Abilities of LLMs on Underrepresented Mathematics Competition Problems
par: Golladay, Samuel, et autres
Publié: (2025)
par: Golladay, Samuel, et autres
Publié: (2025)
From $O(mn)$ to $O(r^2)$: Two-Sided Low-Rank Communication for Adam in Distributed Training with Memory Efficiency
par: Dang, Sizhe, et autres
Publié: (2026)
par: Dang, Sizhe, et autres
Publié: (2026)
Exposing the Achilles' Heel: Evaluating LLMs Ability to Handle Mistakes in Mathematical Reasoning
par: Singh, Joykirat, et autres
Publié: (2024)
par: Singh, Joykirat, et autres
Publié: (2024)
Inductive or Deductive? Rethinking the Fundamental Reasoning Abilities of LLMs
par: Cheng, Kewei, et autres
Publié: (2024)
par: Cheng, Kewei, et autres
Publié: (2024)
CogMath: Assessing LLMs' Authentic Mathematical Ability from a Human Cognitive Perspective
par: Liu, Jiayu, et autres
Publié: (2025)
par: Liu, Jiayu, et autres
Publié: (2025)
MAR:Multi-Agent Reflexion Improves Reasoning Abilities in LLMs
par: Ozer, Onat, et autres
Publié: (2025)
par: Ozer, Onat, et autres
Publié: (2025)
Multilingual Mathematical Reasoning: Advancing Open-Source LLMs in Hindi and English
par: Anand, Avinash, et autres
Publié: (2024)
par: Anand, Avinash, et autres
Publié: (2024)
FZOO: Fast Zeroth-Order Optimizer for Fine-Tuning Large Language Models towards Adam-Scale Speed
par: Dang, Sizhe, et autres
Publié: (2025)
par: Dang, Sizhe, et autres
Publié: (2025)
Quantization Meets Reasoning: Exploring and Mitigating Degradation of Low-Bit LLMs in Mathematical Reasoning
par: Li, Zhen, et autres
Publié: (2025)
par: Li, Zhen, et autres
Publié: (2025)
Improving LLMs' Generalized Reasoning Abilities by Graph Problems
par: Zhang, Qifan, et autres
Publié: (2025)
par: Zhang, Qifan, et autres
Publié: (2025)
Diversity of Thought Improves Reasoning Abilities of LLMs
par: Naik, Ranjita, et autres
Publié: (2023)
par: Naik, Ranjita, et autres
Publié: (2023)
RADAR: Reasoning-Ability and Difficulty-Aware Routing for Reasoning LLMs
par: Fernandez, Nigel, et autres
Publié: (2025)
par: Fernandez, Nigel, et autres
Publié: (2025)
ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints
par: Xu, Rui, et autres
Publié: (2025)
par: Xu, Rui, et autres
Publié: (2025)
Enhancing Reasoning Abilities of Small LLMs with Cognitive Alignment
par: Cai, Wenrui, et autres
Publié: (2025)
par: Cai, Wenrui, et autres
Publié: (2025)
Can LLMs Reliably Simulate Real Students' Abilities in Mathematics and Reading Comprehension?
par: Srivatsa, KV Aditya, et autres
Publié: (2025)
par: Srivatsa, KV Aditya, et autres
Publié: (2025)
Enhancing Mathematical Reasoning in LLMs with Background Operators
par: Chen, Jiajun, et autres
Publié: (2024)
par: Chen, Jiajun, et autres
Publié: (2024)
Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems
par: Borazjanizadeh, Nasim, et autres
Publié: (2024)
par: Borazjanizadeh, Nasim, et autres
Publié: (2024)
How Trustworthy are Open-Source LLMs? An Assessment under Malicious Demonstrations Shows their Vulnerabilities
par: Mo, Lingbo, et autres
Publié: (2023)
par: Mo, Lingbo, et autres
Publié: (2023)
Reasoning with LLMs for Zero-Shot Vulnerability Detection
par: Zibaeirad, Arastoo, et autres
Publié: (2025)
par: Zibaeirad, Arastoo, et autres
Publié: (2025)
HERMES: Towards Efficient and Verifiable Mathematical Reasoning in LLMs
par: Ospanov, Azim, et autres
Publié: (2025)
par: Ospanov, Azim, et autres
Publié: (2025)
Boosting Vulnerability Detection of LLMs via Curriculum Preference Optimization with Synthetic Reasoning Data
par: Wen, Xin-Cheng, et autres
Publié: (2025)
par: Wen, Xin-Cheng, et autres
Publié: (2025)
Guarded Repair for Harm-Aware Post-hoc Replacement of LLM Mathematical Reasoning
par: Xia, Haizhou
Publié: (2026)
par: Xia, Haizhou
Publié: (2026)
Embedding Self-Correction as an Inherent Ability in Large Language Models for Enhanced Mathematical Reasoning
par: Gao, Kuofeng, et autres
Publié: (2024)
par: Gao, Kuofeng, et autres
Publié: (2024)
SAAS: Solving Ability Amplification Strategy for Enhanced Mathematical Reasoning in Large Language Models
par: Kim, Hyeonwoo, et autres
Publié: (2024)
par: Kim, Hyeonwoo, et autres
Publié: (2024)
Can MLLMs Absorb Math Reasoning Abilities from LLMs as Free Lunch?
par: Hu, Yijie, et autres
Publié: (2025)
par: Hu, Yijie, et autres
Publié: (2025)
Improving Multimodal LLMs Ability In Geometry Problem Solving, Reasoning, And Multistep Scoring
par: Anand, Avinash, et autres
Publié: (2024)
par: Anand, Avinash, et autres
Publié: (2024)
Weight Patching: Toward Source-Level Mechanistic Localization in LLMs
par: Sun, Chenghao, et autres
Publié: (2026)
par: Sun, Chenghao, et autres
Publié: (2026)
QED: An Open-Source Multi-Agent System for Generating Mathematical Proofs on Open Problems
par: An, Chenyang, et autres
Publié: (2026)
par: An, Chenyang, et autres
Publié: (2026)
Harnessing the Power of LLMs in Source Code Vulnerability Detection
par: Mahyari, Andrew A
Publié: (2024)
par: Mahyari, Andrew A
Publié: (2024)
EmboTeam: Grounding LLM Reasoning into Reactive Behavior Trees via PDDL for Embodied Multi-Robot Collaboration
par: Zeng, Haishan, et autres
Publié: (2026)
par: Zeng, Haishan, et autres
Publié: (2026)
An Empirical Study of Data Ability Boundary in LLMs' Math Reasoning
par: Chen, Zui, et autres
Publié: (2024)
par: Chen, Zui, et autres
Publié: (2024)
Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization
par: Liu, Jiacai, et autres
Publié: (2024)
par: Liu, Jiacai, et autres
Publié: (2024)
Towards Understanding The Calibration Benefits of Sharpness-Aware Minimization
par: Tan, Chengli, et autres
Publié: (2025)
par: Tan, Chengli, et autres
Publié: (2025)
Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning
par: Wang, Jiayu, et autres
Publié: (2025)
par: Wang, Jiayu, et autres
Publié: (2025)
ReasonAgain: Using Extractable Symbolic Programs to Evaluate Mathematical Reasoning
par: Yu, Xiaodong, et autres
Publié: (2024)
par: Yu, Xiaodong, et autres
Publié: (2024)
Tables as Texts or Images: Evaluating the Table Reasoning Ability of LLMs and MLLMs
par: Deng, Naihao, et autres
Publié: (2024)
par: Deng, Naihao, et autres
Publié: (2024)
Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs
par: Zheng, Xiang, et autres
Publié: (2026)
par: Zheng, Xiang, et autres
Publié: (2026)
An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems
par: Hao, Yuren, et autres
Publié: (2025)
par: Hao, Yuren, et autres
Publié: (2025)
Documents similaires
-
Numerical Sensitivity and Robustness: Exploring the Flaws of Mathematical Reasoning in Large Language Models
par: Sun, Zhishen, et autres
Publié: (2025) -
ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning
par: Sun, Zhishen, et autres
Publié: (2026) -
Evaluating the Reasoning Abilities of LLMs on Underrepresented Mathematics Competition Problems
par: Golladay, Samuel, et autres
Publié: (2025) -
From $O(mn)$ to $O(r^2)$: Two-Sided Low-Rank Communication for Adam in Distributed Training with Memory Efficiency
par: Dang, Sizhe, et autres
Publié: (2026) -
Exposing the Achilles' Heel: Evaluating LLMs Ability to Handle Mistakes in Mathematical Reasoning
par: Singh, Joykirat, et autres
Publié: (2024)