In-Context Learning May Not Elicit Trustworthy Reasoning: A-Not-B Errors in Pretrained Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Han, Pengrui, Song, Peiyang, Yu, Haofei, You, Jiaxuan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Mining Large Language Models for Low-Resource Language Data: Comparing Elicitation Strategies for Hausa and Fongbe
by: Adjovi, Mahounan Pericles, et al.
Published: (2026)
by: Adjovi, Mahounan Pericles, et al.
Published: (2026)
Modeling Emotions and Ethics with Large Language Models
by: Chang, Edward Y.
Published: (2024)
by: Chang, Edward Y.
Published: (2024)
Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling
by: Li, Zhaoyan, et al.
Published: (2026)
by: Li, Zhaoyan, et al.
Published: (2026)
Reducing Selection Bias in Large Language Models
by: Eicher, J. E., et al.
Published: (2024)
by: Eicher, J. E., et al.
Published: (2024)
Revisiting Parameter-Based Knowledge Editing in Large Language Models: Theoretical Limits and Empirical Evidence
by: Ren, Wanying, et al.
Published: (2026)
by: Ren, Wanying, et al.
Published: (2026)
Box Maze: A Process-Control Architecture for Reliable LLM Reasoning
by: Qiang, Zou
Published: (2026)
by: Qiang, Zou
Published: (2026)
BabyReasoningBench: Generating Developmentally-Inspired Reasoning Tasks for Evaluating Baby Language Models
by: Dhole, Kaustubh D.
Published: (2026)
by: Dhole, Kaustubh D.
Published: (2026)
Quo Vadis ChatGPT? From Large Language Models to Large Knowledge Models
by: Venkatasubramanian, Venkat, et al.
Published: (2024)
by: Venkatasubramanian, Venkat, et al.
Published: (2024)
ConciseRL: Conciseness-Guided Reinforcement Learning for Efficient Reasoning Models
by: Dumitru, Razvan-Gabriel, et al.
Published: (2025)
by: Dumitru, Razvan-Gabriel, et al.
Published: (2025)
Training Language Models to Win Debates with Self-Play Improves Judge Accuracy
by: Arnesen, Samuel, et al.
Published: (2024)
by: Arnesen, Samuel, et al.
Published: (2024)
OG-RAG: Ontology-Grounded Retrieval-Augmented Generation For Large Language Models
by: Sharma, Kartik, et al.
Published: (2024)
by: Sharma, Kartik, et al.
Published: (2024)
Do Chains-of-Thoughts of Large Language Models Suffer from Hallucinations, Cognitive Biases, or Phobias in Bayesian Reasoning?
by: Araya, Roberto
Published: (2025)
by: Araya, Roberto
Published: (2025)
Beyond Direct Generation: A Decomposed Approach to Well-Crafted Screenwriting with LLMs
by: Lei, Hang, et al.
Published: (2025)
by: Lei, Hang, et al.
Published: (2025)
Fanar: An Arabic-Centric Multimodal Generative AI Platform
by: Fanar Team, et al.
Published: (2025)
by: Fanar Team, et al.
Published: (2025)
ConCISE: A Reference-Free Conciseness Evaluation Metric for LLM-Generated Answers
by: Ghafari, Seyed Mohssen, et al.
Published: (2025)
by: Ghafari, Seyed Mohssen, et al.
Published: (2025)
Cognitively Inspired Components for Social Conversational Agents
by: Clay, Alex, et al.
Published: (2023)
by: Clay, Alex, et al.
Published: (2023)
CuentosIE: can a chatbot about "tales with a message" help to teach emotional intelligence?
by: Ferrández, Antonio, et al.
Published: (2024)
by: Ferrández, Antonio, et al.
Published: (2024)
Evaluating Large Language Models for Causal Modeling
by: Razouk, Houssam, et al.
Published: (2024)
by: Razouk, Houssam, et al.
Published: (2024)
Large Language Model Reasoning Failures
by: Song, Peiyang, et al.
Published: (2026)
by: Song, Peiyang, et al.
Published: (2026)
Mutagenesis screen to map the functions of parameters of Large Language Models
by: Hu, Yue, et al.
Published: (2024)
by: Hu, Yue, et al.
Published: (2024)
A Case-Based Persistent Memory for a Large Language Model
by: Watson, Ian
Published: (2023)
by: Watson, Ian
Published: (2023)
Compressible Softmax-Attended Language under Incompressible Attention
by: Lee, Wonsuk
Published: (2026)
by: Lee, Wonsuk
Published: (2026)
Graph Language Models
by: Plenz, Moritz, et al.
Published: (2024)
by: Plenz, Moritz, et al.
Published: (2024)
NRR-Core: Non-Resolution Reasoning as a Computational Framework for Contextual Identity and Ambiguity Preservation
by: Saito, Kei
Published: (2025)
by: Saito, Kei
Published: (2025)
QuickSilver -- Speeding up LLM Inference through Dynamic Token Halting, KV Skipping, Contextual Token Fusion, and Adaptive Matryoshka Quantization
by: Khanna, Danush, et al.
Published: (2025)
by: Khanna, Danush, et al.
Published: (2025)
OpenAI Cribbed Our Tax Example, But Can GPT-4 Really Do Tax?
by: Blair-Stanek, Andrew, et al.
Published: (2023)
by: Blair-Stanek, Andrew, et al.
Published: (2023)
Brain-Inspired Exploration of Functional Networks and Key Neurons in Large Language Models
by: Liu, Yiheng, et al.
Published: (2025)
by: Liu, Yiheng, et al.
Published: (2025)
Mamba-Shedder: Post-Transformer Compression for Efficient Selective Structured State Space Models
by: Muñoz, J. Pablo, et al.
Published: (2025)
by: Muñoz, J. Pablo, et al.
Published: (2025)
Pareto-Optimized Open-Source LLMs for Healthcare via Context Retrieval
by: Bayarri-Planas, Jordi, et al.
Published: (2024)
by: Bayarri-Planas, Jordi, et al.
Published: (2024)
Context-Aware Full Body Anonymization using Text-to-Image Diffusion Models
by: Zwick, Pascal, et al.
Published: (2024)
by: Zwick, Pascal, et al.
Published: (2024)
Machine Learning and Theory Ladenness -- A Phenomenological Account
by: Termine, Alberto, et al.
Published: (2024)
by: Termine, Alberto, et al.
Published: (2024)
The Drill-Down and Fabricate Test (DDFT): A Protocol for Measuring Epistemic Robustness in Language Models
by: Baxi, Rahul
Published: (2025)
by: Baxi, Rahul
Published: (2025)
ARCTraj: A Dataset and Benchmark of Human Reasoning Trajectories for Abstract Problem Solving
by: Kim, Sejin, et al.
Published: (2025)
by: Kim, Sejin, et al.
Published: (2025)
From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments
by: Luo, Lijing, et al.
Published: (2026)
by: Luo, Lijing, et al.
Published: (2026)
The Democratic Paradox in Large Language Models' Underestimation of Press Freedom
by: Loaiza, I., et al.
Published: (2025)
by: Loaiza, I., et al.
Published: (2025)
Appraisal-Guided Proximal Policy Optimization: Modeling Psychological Disorders in Dynamic Grid World
by: Prasad, Hari, et al.
Published: (2024)
by: Prasad, Hari, et al.
Published: (2024)
Large Language Models Report Subjective Experience Under Self-Referential Processing
by: Berg, Cameron, et al.
Published: (2025)
by: Berg, Cameron, et al.
Published: (2025)
Learning from a Generative AI Predecessor -- The Many Motivations for Interacting with Conversational Agents
by: Brinkman, Donald, et al.
Published: (2023)
by: Brinkman, Donald, et al.
Published: (2023)
RWKV-7 "Goose" with Expressive Dynamic State Evolution
by: Peng, Bo, et al.
Published: (2025)
by: Peng, Bo, et al.
Published: (2025)
RTTC: Reward-Guided Collaborative Test-Time Compute
by: Muñoz, J. Pablo, et al.
Published: (2025)
by: Muñoz, J. Pablo, et al.
Published: (2025)
Similar Items
-
Mining Large Language Models for Low-Resource Language Data: Comparing Elicitation Strategies for Hausa and Fongbe
by: Adjovi, Mahounan Pericles, et al.
Published: (2026) -
Modeling Emotions and Ethics with Large Language Models
by: Chang, Edward Y.
Published: (2024) -
Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling
by: Li, Zhaoyan, et al.
Published: (2026) -
Reducing Selection Bias in Large Language Models
by: Eicher, J. E., et al.
Published: (2024) -
Revisiting Parameter-Based Knowledge Editing in Large Language Models: Theoretical Limits and Empirical Evidence
by: Ren, Wanying, et al.
Published: (2026)