Alice in Wonderland: Simple Tasks Showing Complete Reasoning Breakdown in State-Of-the-Art Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Nezhurina, Marianna, Cipolina-Kun, Lucia, Cherti, Mehdi, Jitsev, Jenia |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Game Reasoning Arena: A Framework and Benchmark for Assessing Reasoning Capabilities of Large Language Models via Game Play
di: Cipolina-Kun, Lucia, et al.
Pubblicazione: (2025)
di: Cipolina-Kun, Lucia, et al.
Pubblicazione: (2025)
Scaling Laws for Robust Comparison of Open Foundation Language-Vision Models and Datasets
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025)
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025)
Open-sci-ref-0.01: open and reproducible reference baselines for language model and dataset comparison
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025)
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025)
Inverse Deep Learning Ray Tracing for Heliostat Surface Prediction
di: Lewen, Jan, et al.
Pubblicazione: (2024)
di: Lewen, Jan, et al.
Pubblicazione: (2024)
Scalable heliostat surface predictions from focal spots: Sim-to-Real transfer of inverse Deep Learning Raytracing
di: Lewen, Jan, et al.
Pubblicazione: (2025)
di: Lewen, Jan, et al.
Pubblicazione: (2025)
MixtureVitae: Open Web-Scale Pretraining Dataset With High Quality Instruction and Reasoning Data Built from Permissive-First Text Sources
di: Nguyen, Huu, et al.
Pubblicazione: (2025)
di: Nguyen, Huu, et al.
Pubblicazione: (2025)
Reproducible scaling laws for contrastive language-image learning
di: Cherti, Mehdi, et al.
Pubblicazione: (2022)
di: Cherti, Mehdi, et al.
Pubblicazione: (2022)
Reasoning Capabilities of Large Language Models on Dynamic Tasks
di: Wong, Annie, et al.
Pubblicazione: (2025)
di: Wong, Annie, et al.
Pubblicazione: (2025)
COFT: Counterfactual-Conformal Decoding for Fair Chain-of-Thought Reasoning in Large Language Models
di: Fayyazi, Arya, et al.
Pubblicazione: (2026)
di: Fayyazi, Arya, et al.
Pubblicazione: (2026)
Large Language Models Show Signs of Alignment with Human Neurocognition During Abstract Reasoning
di: Pinier, Christopher, et al.
Pubblicazione: (2025)
di: Pinier, Christopher, et al.
Pubblicazione: (2025)
Eliciting Causal Abilities in Large Language Models for Reasoning Tasks
di: Wang, Yajing, et al.
Pubblicazione: (2024)
di: Wang, Yajing, et al.
Pubblicazione: (2024)
Efficient Language Adaptive Pre-training: Extending State-of-the-Art Large Language Models for Polish
di: Ruciński, Szymon
Pubblicazione: (2024)
di: Ruciński, Szymon
Pubblicazione: (2024)
Dissecting Failure Dynamics in Large Language Model Reasoning
di: Zhu, Wei, et al.
Pubblicazione: (2026)
di: Zhu, Wei, et al.
Pubblicazione: (2026)
Large Language Models in Cybersecurity: State-of-the-Art
di: Motlagh, Farzad Nourmohammadzadeh, et al.
Pubblicazione: (2024)
di: Motlagh, Farzad Nourmohammadzadeh, et al.
Pubblicazione: (2024)
Improving Performance, Robustness, and Fairness of Radiographic AI Models with Finely-Controllable Synthetic Data
di: Moroianu, Stefania L., et al.
Pubblicazione: (2025)
di: Moroianu, Stefania L., et al.
Pubblicazione: (2025)
Can Large Language Models Create New Knowledge for Spatial Reasoning Tasks?
di: Greatrix, Thomas, et al.
Pubblicazione: (2024)
di: Greatrix, Thomas, et al.
Pubblicazione: (2024)
Understanding Artificial Theory of Mind: Perturbed Tasks and Reasoning in Large Language Models
di: Nickel, Christian, et al.
Pubblicazione: (2026)
di: Nickel, Christian, et al.
Pubblicazione: (2026)
Using Counterfactual Tasks to Evaluate the Generality of Analogical Reasoning in Large Language Models
di: Lewis, Martha, et al.
Pubblicazione: (2024)
di: Lewis, Martha, et al.
Pubblicazione: (2024)
Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models
di: Panpatil, Siddhant, et al.
Pubblicazione: (2025)
di: Panpatil, Siddhant, et al.
Pubblicazione: (2025)
A Survey on Enhancing Causal Reasoning Ability of Large Language Models
di: Li, Xin, et al.
Pubblicazione: (2025)
di: Li, Xin, et al.
Pubblicazione: (2025)
A Good CREPE needs more than just Sugar: Investigating Biases in Compositional Vision-Language Benchmarks
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025)
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025)
Assessing and Enhancing the Robustness of Large Language Models with Task Structure Variations for Logical Reasoning
di: Bao, Qiming, et al.
Pubblicazione: (2023)
di: Bao, Qiming, et al.
Pubblicazione: (2023)
Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are Asked?
di: Song, Seok Hwan, et al.
Pubblicazione: (2025)
di: Song, Seok Hwan, et al.
Pubblicazione: (2025)
Do Large Language Models Show Biases in Causal Learning?
di: Carro, Maria Victoria, et al.
Pubblicazione: (2024)
di: Carro, Maria Victoria, et al.
Pubblicazione: (2024)
LASP: Surveying the State-of-the-Art in Large Language Model-Assisted AI Planning
di: Li, Haoming, et al.
Pubblicazione: (2024)
di: Li, Haoming, et al.
Pubblicazione: (2024)
A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models
di: Zhang, Junjie, et al.
Pubblicazione: (2025)
di: Zhang, Junjie, et al.
Pubblicazione: (2025)
Exploring Large Language Models for Knowledge Graph Completion
di: Yao, Liang, et al.
Pubblicazione: (2023)
di: Yao, Liang, et al.
Pubblicazione: (2023)
SR-FoT: A Syllogistic-Reasoning Framework of Thought for Large Language Models Tackling Knowledge-based Reasoning Tasks
di: Wan, Wentao, et al.
Pubblicazione: (2025)
di: Wan, Wentao, et al.
Pubblicazione: (2025)
Same Task, More Tokens: the Impact of Input Length on the Reasoning Performance of Large Language Models
di: Levy, Mosh, et al.
Pubblicazione: (2024)
di: Levy, Mosh, et al.
Pubblicazione: (2024)
General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks
di: Liu, Junlin, et al.
Pubblicazione: (2026)
di: Liu, Junlin, et al.
Pubblicazione: (2026)
TDA-RC: Task-Driven Alignment for Knowledge-Based Reasoning Chains in Large Language Models
di: Zhang, Jiaquan, et al.
Pubblicazione: (2026)
di: Zhang, Jiaquan, et al.
Pubblicazione: (2026)
Show, Don't Tell: Evaluating Large Language Models Beyond Textual Understanding with ChildPlay
di: de Carvalho, Gonçalo Hora, et al.
Pubblicazione: (2024)
di: de Carvalho, Gonçalo Hora, et al.
Pubblicazione: (2024)
AyurParam: A State-of-the-Art Bilingual Language Model for Ayurveda
di: Nauman, Mohd, et al.
Pubblicazione: (2025)
di: Nauman, Mohd, et al.
Pubblicazione: (2025)
Frontier LLMs Still Struggle with Simple Reasoning Tasks
di: Malek, Alan, et al.
Pubblicazione: (2025)
di: Malek, Alan, et al.
Pubblicazione: (2025)
DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
Large Language Models Are Still Misled by Simple Bias Ensembles
di: Sun, Zhouhao, et al.
Pubblicazione: (2025)
di: Sun, Zhouhao, et al.
Pubblicazione: (2025)
Simple Policy Gradients for Reasoning with Diffusion Language Models
di: Zhan, Anthony
Pubblicazione: (2025)
di: Zhan, Anthony
Pubblicazione: (2025)
TaskBench: Benchmarking Large Language Models for Task Automation
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
di: Shen, Yongliang, et al.
Pubblicazione: (2023)
Can AI Master Construction Management (CM)? Benchmarking State-of-the-Art Large Language Models on CM Certification Exams
di: Xiong, Ruoxin, et al.
Pubblicazione: (2025)
di: Xiong, Ruoxin, et al.
Pubblicazione: (2025)
Alice's Adventures in a Differentiable Wonderland -- Volume I, A Tour of the Land
di: Scardapane, Simone
Pubblicazione: (2024)
di: Scardapane, Simone
Pubblicazione: (2024)
Documenti analoghi
-
Game Reasoning Arena: A Framework and Benchmark for Assessing Reasoning Capabilities of Large Language Models via Game Play
di: Cipolina-Kun, Lucia, et al.
Pubblicazione: (2025) -
Scaling Laws for Robust Comparison of Open Foundation Language-Vision Models and Datasets
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025) -
Open-sci-ref-0.01: open and reproducible reference baselines for language model and dataset comparison
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025) -
Inverse Deep Learning Ray Tracing for Heliostat Surface Prediction
di: Lewen, Jan, et al.
Pubblicazione: (2024) -
Scalable heliostat surface predictions from focal spots: Sim-to-Real transfer of inverse Deep Learning Raytracing
di: Lewen, Jan, et al.
Pubblicazione: (2025)