Can LLMs Do Rocket Science? Exploring the Limits of Complex Reasoning with GTOC 12
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | del Campo, Iñaki, Cuervo, Pablo, Rodriguez-Fernandez, Victor, Armellin, Roberto, Yarndley, Jack |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AI Predicts AGI: Leveraging AGI Forecasting and Peer Review to Explore LLMs' Complex Reasoning Capabilities
par: Davide, Fabrizio, et autres
Publié: (2024)
par: Davide, Fabrizio, et autres
Publié: (2024)
Can LLMs Compute with Reasons?
par: Sandilya, Harshit, et autres
Publié: (2024)
par: Sandilya, Harshit, et autres
Publié: (2024)
Do Language Models Mirror Human Confidence? Exploring Psychological Insights to Address Overconfidence in LLMs
par: Xu, Chenjun, et autres
Publié: (2025)
par: Xu, Chenjun, et autres
Publié: (2025)
Evaluating the Limitations of Local LLMs in Solving Complex Programming Challenges
par: Matotek, Kadin, et autres
Publié: (2025)
par: Matotek, Kadin, et autres
Publié: (2025)
Can AI Assist in Olympiad Coding
par: Ren, Samuel
Publié: (2025)
par: Ren, Samuel
Publié: (2025)
PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions
par: Dai, Song, et autres
Publié: (2025)
par: Dai, Song, et autres
Publié: (2025)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
par: Saji, Alan, et autres
Publié: (2025)
par: Saji, Alan, et autres
Publié: (2025)
Evaluating Relational Reasoning in LLMs with REL
par: Fesser, Lukas, et autres
Publié: (2026)
par: Fesser, Lukas, et autres
Publié: (2026)
Can AI Read Between The Lines? Benchmarking LLMs On Financial Nuance
par: Kubica, Dominick, et autres
Publié: (2025)
par: Kubica, Dominick, et autres
Publié: (2025)
KisMATH: Do LLMs Have Knowledge of Implicit Structures in Mathematical Reasoning?
par: Saha, Soumadeep, et autres
Publié: (2025)
par: Saha, Soumadeep, et autres
Publié: (2025)
The Limits of Obliviate: Evaluating Unlearning in LLMs via Stimulus-Knowledge Entanglement-Behavior Framework
par: Shah, Aakriti, et autres
Publié: (2025)
par: Shah, Aakriti, et autres
Publié: (2025)
Can LLM Graph Reasoning Generalize beyond Pattern Memorization?
par: Zhang, Yizhuo, et autres
Publié: (2024)
par: Zhang, Yizhuo, et autres
Publié: (2024)
When Models Can't Follow: Testing Instruction Adherence Across 256 LLMs
par: Young, Richard J., et autres
Publié: (2025)
par: Young, Richard J., et autres
Publié: (2025)
OpenAI Cribbed Our Tax Example, But Can GPT-4 Really Do Tax?
par: Blair-Stanek, Andrew, et autres
Publié: (2023)
par: Blair-Stanek, Andrew, et autres
Publié: (2023)
Can LLMs Identify Tax Abuse?
par: Blair-Stanek, Andrew, et autres
Publié: (2025)
par: Blair-Stanek, Andrew, et autres
Publié: (2025)
Thinking Machines: Mathematical Reasoning in the Age of LLMs
par: Asperti, Andrea, et autres
Publié: (2025)
par: Asperti, Andrea, et autres
Publié: (2025)
Overclocking LLM Reasoning: Monitoring and Controlling Thinking Path Lengths in LLMs
par: Eisenstadt, Roy, et autres
Publié: (2025)
par: Eisenstadt, Roy, et autres
Publié: (2025)
R-Genie: Reasoning-Guided Generative Image Editing
par: Zhang, Dong, et autres
Publié: (2025)
par: Zhang, Dong, et autres
Publié: (2025)
MAWARITH: A Dataset and Benchmark for Legal Inheritance Reasoning with LLMs
par: Bouchekif, Abdessalam, et autres
Publié: (2026)
par: Bouchekif, Abdessalam, et autres
Publié: (2026)
LLMs and the Human Condition
par: Wallis, Peter
Publié: (2024)
par: Wallis, Peter
Publié: (2024)
Temporal Referential Consistency: Do LLMs Favor Sequences Over Absolute Time References?
par: Bajpai, Ashutosh, et autres
Publié: (2025)
par: Bajpai, Ashutosh, et autres
Publié: (2025)
SweEval: Do LLMs Really Swear? A Safety Benchmark for Testing Limits for Enterprise Use
par: Patel, Hitesh Laxmichand, et autres
Publié: (2025)
par: Patel, Hitesh Laxmichand, et autres
Publié: (2025)
Benefits and Limitations of Communication in Multi-Agent Reasoning
par: Rizvi-Martel, Michael, et autres
Publié: (2025)
par: Rizvi-Martel, Michael, et autres
Publié: (2025)
When Reasoning Fails: Evaluating 'Thinking' LLMs for Stock Prediction
par: Sodha, Rakeshkumar H
Publié: (2025)
par: Sodha, Rakeshkumar H
Publié: (2025)
Do LLMs Game Formalization? Evaluating Faithfulness in Logical Reasoning
par: Kim, Kyuhee, et autres
Publié: (2026)
par: Kim, Kyuhee, et autres
Publié: (2026)
Reasoning-Based AI for Startup Evaluation (R.A.I.S.E.): A Memory-Augmented, Multi-Step Decision Framework
par: Preuveneers, Jack, et autres
Publié: (2025)
par: Preuveneers, Jack, et autres
Publié: (2025)
Comparing the Performance of LLMs in RAG-based Question-Answering: A Case Study in Computer Science Literature
par: Dayarathne, Ranul, et autres
Publié: (2025)
par: Dayarathne, Ranul, et autres
Publié: (2025)
ReaGeo: Reasoning-Enhanced End-to-End Geocoding with LLMs
par: Cui, Jian, et autres
Publié: (2026)
par: Cui, Jian, et autres
Publié: (2026)
Do LLMs Truly Understand When a Precedent Is Overruled?
par: Zhang, Li, et autres
Publié: (2025)
par: Zhang, Li, et autres
Publié: (2025)
Universal Adversarial Attack on Aligned Multimodal LLMs
par: Rahmatullaev, Temurbek, et autres
Publié: (2025)
par: Rahmatullaev, Temurbek, et autres
Publié: (2025)
Improving LLMs with a knowledge from databases
par: Máša, Petr
Publié: (2025)
par: Máša, Petr
Publié: (2025)
PropXplain: Can LLMs Enable Explainable Propaganda Detection?
par: Hasanain, Maram, et autres
Publié: (2025)
par: Hasanain, Maram, et autres
Publié: (2025)
Natural Language as Policies: Reasoning for Coordinate-Level Embodied Control with LLMs
par: Mikami, Yusuke, et autres
Publié: (2024)
par: Mikami, Yusuke, et autres
Publié: (2024)
From Benchmarking to Reasoning: A Dual-Aspect, Large-Scale Evaluation of LLMs on Vietnamese Legal Text
par: Le, Van-Truong
Publié: (2026)
par: Le, Van-Truong
Publié: (2026)
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
par: Ashuach, Tomer, et autres
Publié: (2025)
par: Ashuach, Tomer, et autres
Publié: (2025)
Layer-Aware Embedding Fusion for LLMs in Text Classifications
par: Gwak, Jiho, et autres
Publié: (2025)
par: Gwak, Jiho, et autres
Publié: (2025)
How Clued up are LLMs? Evaluating Multi-Step Deductive Reasoning in a Text-Based Game Environment
par: Ansell, Rebecca, et autres
Publié: (2026)
par: Ansell, Rebecca, et autres
Publié: (2026)
Overcoming the Generalization Limits of SLM Finetuning for Shape-Based Extraction of Datatype and Object Properties
par: Ringwald, Célian, et autres
Publié: (2025)
par: Ringwald, Célian, et autres
Publié: (2025)
Contextual Integrity in LLMs via Reasoning and Reinforcement Learning
par: Lan, Guangchen, et autres
Publié: (2025)
par: Lan, Guangchen, et autres
Publié: (2025)
Toward Architecture-Aware Evaluation Metrics for LLM Agents
par: Souza, Débora, et autres
Publié: (2026)
par: Souza, Débora, et autres
Publié: (2026)
Documents similaires
-
AI Predicts AGI: Leveraging AGI Forecasting and Peer Review to Explore LLMs' Complex Reasoning Capabilities
par: Davide, Fabrizio, et autres
Publié: (2024) -
Can LLMs Compute with Reasons?
par: Sandilya, Harshit, et autres
Publié: (2024) -
Do Language Models Mirror Human Confidence? Exploring Psychological Insights to Address Overconfidence in LLMs
par: Xu, Chenjun, et autres
Publié: (2025) -
Evaluating the Limitations of Local LLMs in Solving Complex Programming Challenges
par: Matotek, Kadin, et autres
Publié: (2025) -
Can AI Assist in Olympiad Coding
par: Ren, Samuel
Publié: (2025)