When Hindsight is Not 20/20: Testing Limits on Reflective Thinking in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yanhong, Yang, Chenghao, Ettinger, Allyson |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects
par: Latimer, Chris, et autres
Publié: (2025)
par: Latimer, Chris, et autres
Publié: (2025)
Experimental Contexts Can Facilitate Robust Semantic Property Inference in Language Models, but Inconsistently
par: Misra, Kanishka, et autres
Publié: (2024)
par: Misra, Kanishka, et autres
Publié: (2024)
Cognitive Decision Routing in Large Language Models: When to Think Fast, When to Think Slow
par: Du, Y., et autres
Publié: (2025)
par: Du, Y., et autres
Publié: (2025)
The Chameleon's Limit: Investigating Persona Collapse and Homogenization in Large Language Models
par: Xiao, Yunze, et autres
Publié: (2026)
par: Xiao, Yunze, et autres
Publié: (2026)
ThinkSwitcher: When to Think Hard, When to Think Fast
par: Liang, Guosheng, et autres
Publié: (2025)
par: Liang, Guosheng, et autres
Publié: (2025)
Think-on-Graph 2.0: Deep and Faithful Large Language Model Reasoning with Knowledge-guided Retrieval Augmented Generation
par: Ma, Shengjie, et autres
Publié: (2024)
par: Ma, Shengjie, et autres
Publié: (2024)
Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection
par: Li, Moxin, et autres
Publié: (2024)
par: Li, Moxin, et autres
Publié: (2024)
Learning When to Think While Listening in Large Audio-Language Models
par: Song, Zhiyuan, et autres
Publié: (2026)
par: Song, Zhiyuan, et autres
Publié: (2026)
Thinking Out of Order: When Output Order Stops Reflecting Reasoning Order in Diffusion Language Models
par: Yu, Longxuan, et autres
Publié: (2026)
par: Yu, Longxuan, et autres
Publié: (2026)
Prejudge-Before-Think: Enhancing Large Language Models at Test-Time by Process Prejudge Reasoning
par: Wang, Jianing, et autres
Publié: (2025)
par: Wang, Jianing, et autres
Publié: (2025)
Think Only When You Need with Large Hybrid-Reasoning Models
par: Jiang, Lingjie, et autres
Publié: (2025)
par: Jiang, Lingjie, et autres
Publié: (2025)
InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language Models
par: Yan, Yuchen, et autres
Publié: (2025)
par: Yan, Yuchen, et autres
Publié: (2025)
Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models
par: Weng, Fenghua, et autres
Publié: (2025)
par: Weng, Fenghua, et autres
Publié: (2025)
Fast Thinking for Large Language Models
par: Zheng, Haoyu, et autres
Publié: (2025)
par: Zheng, Haoyu, et autres
Publié: (2025)
Retrieval-Augmented Hierarchical in-Context Reinforcement Learning and Hindsight Modular Reflections for Task Planning with LLMs
par: Sun, Chuanneng, et autres
Publié: (2024)
par: Sun, Chuanneng, et autres
Publié: (2024)
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
par: Butt, Natasha, et autres
Publié: (2024)
par: Butt, Natasha, et autres
Publié: (2024)
WildTeaming at Scale: From In-the-Wild Jailbreaks to (Adversarially) Safer Language Models
par: Jiang, Liwei, et autres
Publié: (2024)
par: Jiang, Liwei, et autres
Publié: (2024)
When Models Reason in Your Language: Controlling Thinking Language Comes at the Cost of Accuracy
par: Qi, Jirui, et autres
Publié: (2025)
par: Qi, Jirui, et autres
Publié: (2025)
Selecting and Merging: Towards Adaptable and Scalable Named Entity Recognition with Large Language Models
par: Ding, Zhuojun, et autres
Publié: (2025)
par: Ding, Zhuojun, et autres
Publié: (2025)
The Cost of Thinking: Increased Jailbreak Risk in Large Language Models
par: Yang, Fan
Publié: (2025)
par: Yang, Fan
Publié: (2025)
AI as Humanity's Salieri: Quantifying Linguistic Creativity of Language Models via Systematic Attribution of Machine Text against Web Text
par: Lu, Ximing, et autres
Publié: (2024)
par: Lu, Ximing, et autres
Publié: (2024)
ChiMed 2.0: Advancing Chinese Medical Dataset in Facilitating Large Language Modeling
par: Tian, Yuanhe, et autres
Publié: (2025)
par: Tian, Yuanhe, et autres
Publié: (2025)
On the Thinking-Language Modeling Gap in Large Language Models
par: Liu, Chenxi, et autres
Publié: (2025)
par: Liu, Chenxi, et autres
Publié: (2025)
When Truth Is Overridden: Uncovering the Internal Origins of Sycophancy in Large Language Models
par: Wang, Keyu, et autres
Publié: (2025)
par: Wang, Keyu, et autres
Publié: (2025)
TypedThinker: Diversify Large Language Model Reasoning with Typed Thinking
par: Wang, Danqing, et autres
Publié: (2024)
par: Wang, Danqing, et autres
Publié: (2024)
AdaptThink: Reasoning Models Can Learn When to Think
par: Zhang, Jiajie, et autres
Publié: (2025)
par: Zhang, Jiajie, et autres
Publié: (2025)
Can Multimodal Large Language Model Think Analogically?
par: Guo, Diandian, et autres
Publié: (2024)
par: Guo, Diandian, et autres
Publié: (2024)
Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
par: Wang, Ziyan, et autres
Publié: (2025)
par: Wang, Ziyan, et autres
Publié: (2025)
Assessing the Creativity of Large Language Models: Testing, Limits, and New Frontiers
par: Schapiro, Samuel, et autres
Publié: (2026)
par: Schapiro, Samuel, et autres
Publié: (2026)
Thinking in Many Modes: How Composite Reasoning Elevates Large Language Model Performance with Limited Data
par: Ahmad, Zishan, et autres
Publié: (2025)
par: Ahmad, Zishan, et autres
Publié: (2025)
When Do Tools and Planning Help Large Language Models Think? A Cost- and Latency-Aware Benchmark
par: Ghoshal, Subha, et autres
Publié: (2026)
par: Ghoshal, Subha, et autres
Publié: (2026)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
par: Jian, Pu, et autres
Publié: (2025)
par: Jian, Pu, et autres
Publié: (2025)
Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking
par: Xu, Nan, et autres
Publié: (2023)
par: Xu, Nan, et autres
Publié: (2023)
Think Again! The Effect of Test-Time Compute on Preferences, Opinions, and Beliefs of Large Language Models
par: Kour, George, et autres
Publié: (2025)
par: Kour, George, et autres
Publié: (2025)
When Do Language Models Endorse Limitations on Human Rights Principles?
par: Samway, Keenan, et autres
Publié: (2026)
par: Samway, Keenan, et autres
Publié: (2026)
Chunk-Distilled Language Modeling
par: Li, Yanhong, et autres
Publié: (2024)
par: Li, Yanhong, et autres
Publié: (2024)
Re-Initialization Token Learning for Tool-Augmented Large Language Models
par: Li, Chenghao, et autres
Publié: (2025)
par: Li, Chenghao, et autres
Publié: (2025)
Evaluating the Translation Performance of Large Language Models Based on Euas-20
par: Huang, Yan, et autres
Publié: (2024)
par: Huang, Yan, et autres
Publié: (2024)
Reflections and New Directions for Human-Centered Large Language Models
par: Ziems, Caleb, et autres
Publié: (2026)
par: Ziems, Caleb, et autres
Publié: (2026)
ThinkDial: An Open Recipe for Controlling Reasoning Effort in Large Language Models
par: He, Qianyu, et autres
Publié: (2025)
par: He, Qianyu, et autres
Publié: (2025)
Documents similaires
-
Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects
par: Latimer, Chris, et autres
Publié: (2025) -
Experimental Contexts Can Facilitate Robust Semantic Property Inference in Language Models, but Inconsistently
par: Misra, Kanishka, et autres
Publié: (2024) -
Cognitive Decision Routing in Large Language Models: When to Think Fast, When to Think Slow
par: Du, Y., et autres
Publié: (2025) -
The Chameleon's Limit: Investigating Persona Collapse and Homogenization in Large Language Models
par: Xiao, Yunze, et autres
Publié: (2026) -
ThinkSwitcher: When to Think Hard, When to Think Fast
par: Liang, Guosheng, et autres
Publié: (2025)