Frontier LLMs Still Struggle with Simple Reasoning Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Malek, Alan, Ge, Jiawei, Lazic, Nevena, Jin, Chi, György, András, Szepesvári, Csaba |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond Statistical Learning: Exact Learning Is Essential for General Intelligence
par: György, András, et autres
Publié: (2025)
par: György, András, et autres
Publié: (2025)
To See the Unseen: on the Generalization Ability of Transformers in Symbolic Reasoning
par: Lazić, Nevena, et autres
Publié: (2026)
par: Lazić, Nevena, et autres
Publié: (2026)
To Believe or Not to Believe Your LLM
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)
Mitigating LLM Hallucinations via Conformal Abstention
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024)
Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT?
par: Sun, Yiyou, et autres
Publié: (2025)
par: Sun, Yiyou, et autres
Publié: (2025)
Can LLMs Help Uncover Insights about LLMs? A Large-Scale, Evolving Literature Analysis of Frontier LLMs
par: Park, Jungsoo, et autres
Publié: (2025)
par: Park, Jungsoo, et autres
Publié: (2025)
SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses
par: Jiang, Dongwei, et autres
Publié: (2024)
par: Jiang, Dongwei, et autres
Publié: (2024)
MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations
par: Huang, Kaixuan, et autres
Publié: (2025)
par: Huang, Kaixuan, et autres
Publié: (2025)
Learning to Reason at the Frontier of Learnability
par: Foster, Thomas, et autres
Publié: (2025)
par: Foster, Thomas, et autres
Publié: (2025)
Learning from Relevant Subgoals in Successful Dialogs using Iterative Training for Task-oriented Dialog Systems
par: Kaiser, Magdalena, et autres
Publié: (2024)
par: Kaiser, Magdalena, et autres
Publié: (2024)
When Reasoning Hurts: Source-Aware Evaluation of Frontier LLMs for Clinical SOAP Note Generation
par: Faisal, Faizan
Publié: (2026)
par: Faisal, Faizan
Publié: (2026)
All Code, No Thought: Current Language Models Struggle to Reason in Ciphered Language
par: Guo, Shiyuan, et autres
Publié: (2025)
par: Guo, Shiyuan, et autres
Publié: (2025)
Batched Contextual Reinforcement: A Task-Scaling Law for Efficient Reasoning
par: Yang, Bangji, et autres
Publié: (2026)
par: Yang, Bangji, et autres
Publié: (2026)
Alice in Wonderland: Simple Tasks Showing Complete Reasoning Breakdown in State-Of-the-Art Large Language Models
par: Nezhurina, Marianna, et autres
Publié: (2024)
par: Nezhurina, Marianna, et autres
Publié: (2024)
Can LLMs Follow Simple Rules?
par: Mu, Norman, et autres
Publié: (2023)
par: Mu, Norman, et autres
Publié: (2023)
Probabilities of Chat LLMs Are Miscalibrated but Still Predict Correctness on Multiple-Choice Q&A
par: Plaut, Benjamin, et autres
Publié: (2024)
par: Plaut, Benjamin, et autres
Publié: (2024)
Transformers Struggle to Learn to Search
par: Saparov, Abulhair, et autres
Publié: (2024)
par: Saparov, Abulhair, et autres
Publié: (2024)
Balancing optimism and pessimism in offline-to-online learning
par: Sentenac, Flore, et autres
Publié: (2025)
par: Sentenac, Flore, et autres
Publié: (2025)
MolReasoner: Toward Effective and Interpretable Reasoning for Molecular LLMs
par: Zhao, Guojiang, et autres
Publié: (2025)
par: Zhao, Guojiang, et autres
Publié: (2025)
Principled Fine-tuning of LLMs from User-Edits: A Medley of Preference, Supervision, and Reward
par: Misra, Dipendra, et autres
Publié: (2026)
par: Misra, Dipendra, et autres
Publié: (2026)
Large Language Models Are Bad Dice Players: LLMs Struggle to Generate Random Numbers from Statistical Distributions
par: Zhao, Minda, et autres
Publié: (2026)
par: Zhao, Minda, et autres
Publié: (2026)
Long-Context LLMs Meet RAG: Overcoming Challenges for Long Inputs in RAG
par: Jin, Bowen, et autres
Publié: (2024)
par: Jin, Bowen, et autres
Publié: (2024)
Catch Me If You Can? Not Yet: LLMs Still Struggle to Imitate the Implicit Writing Styles of Everyday Authors
par: Wang, Zhengxiang, et autres
Publié: (2025)
par: Wang, Zhengxiang, et autres
Publié: (2025)
MegaScience: Pushing the Frontiers of Post-Training Datasets for Science Reasoning
par: Fan, Run-Ze, et autres
Publié: (2025)
par: Fan, Run-Ze, et autres
Publié: (2025)
Simple Policy Gradients for Reasoning with Diffusion Language Models
par: Zhan, Anthony
Publié: (2025)
par: Zhan, Anthony
Publié: (2025)
Active Task Disambiguation with LLMs
par: Kobalczyk, Katarzyna, et autres
Publié: (2025)
par: Kobalczyk, Katarzyna, et autres
Publié: (2025)
AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling
par: Liu, Zihan, et autres
Publié: (2024)
par: Liu, Zihan, et autres
Publié: (2024)
Self-Training Meets Consistency: Improving LLMs' Reasoning with Consistency-Driven Rationale Evaluation
par: Lee, Jaehyeok, et autres
Publié: (2024)
par: Lee, Jaehyeok, et autres
Publié: (2024)
Whitening Not Recommended for Classification Tasks in LLMs
par: Forooghi, Ali, et autres
Publié: (2024)
par: Forooghi, Ali, et autres
Publié: (2024)
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
par: Ramesh, Shyam Sundhar, et autres
Publié: (2026)
par: Ramesh, Shyam Sundhar, et autres
Publié: (2026)
ScaLearn: Simple and Highly Parameter-Efficient Task Transfer by Learning to Scale
par: Frohmann, Markus, et autres
Publié: (2023)
par: Frohmann, Markus, et autres
Publié: (2023)
Early Signs of Steganographic Capabilities in Frontier LLMs
par: Zolkowski, Artur, et autres
Publié: (2025)
par: Zolkowski, Artur, et autres
Publié: (2025)
Everything Everywhere All at Once: LLMs can In-Context Learn Multiple Tasks in Superposition
par: Xiong, Zheyang, et autres
Publié: (2024)
par: Xiong, Zheyang, et autres
Publié: (2024)
Layerwise Recall and the Geometry of Interwoven Knowledge in LLMs
par: Lei, Ge, et autres
Publié: (2025)
par: Lei, Ge, et autres
Publié: (2025)
Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization
par: Kawakami, Wataru, et autres
Publié: (2025)
par: Kawakami, Wataru, et autres
Publié: (2025)
Rewarding Graph Reasoning Process makes LLMs more Generalized Reasoners
par: Peng, Miao, et autres
Publié: (2025)
par: Peng, Miao, et autres
Publié: (2025)
Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning
par: Yuan, Yurun, et autres
Publié: (2025)
par: Yuan, Yurun, et autres
Publié: (2025)
Prompt Repetition Improves Non-Reasoning LLMs
par: Leviathan, Yaniv, et autres
Publié: (2025)
par: Leviathan, Yaniv, et autres
Publié: (2025)
Reverse Thinking Makes LLMs Stronger Reasoners
par: Chen, Justin Chih-Yao, et autres
Publié: (2024)
par: Chen, Justin Chih-Yao, et autres
Publié: (2024)
Universal Reasoner: A Single, Composable Plug-and-Play Reasoner for Frozen LLMs
par: Kim, Jaemin, et autres
Publié: (2025)
par: Kim, Jaemin, et autres
Publié: (2025)
Documents similaires
-
Beyond Statistical Learning: Exact Learning Is Essential for General Intelligence
par: György, András, et autres
Publié: (2025) -
To See the Unseen: on the Generalization Ability of Transformers in Symbolic Reasoning
par: Lazić, Nevena, et autres
Publié: (2026) -
To Believe or Not to Believe Your LLM
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024) -
Mitigating LLM Hallucinations via Conformal Abstention
par: Yadkori, Yasin Abbasi, et autres
Publié: (2024) -
Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT?
par: Sun, Yiyou, et autres
Publié: (2025)