When Hindsight is Not 20/20: Testing Limits on Reflective Thinking in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Yanhong, Yang, Chenghao, Ettinger, Allyson |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects
por: Latimer, Chris, et al.
Publicado: (2025)
por: Latimer, Chris, et al.
Publicado: (2025)
Experimental Contexts Can Facilitate Robust Semantic Property Inference in Language Models, but Inconsistently
por: Misra, Kanishka, et al.
Publicado: (2024)
por: Misra, Kanishka, et al.
Publicado: (2024)
Cognitive Decision Routing in Large Language Models: When to Think Fast, When to Think Slow
por: Du, Y., et al.
Publicado: (2025)
por: Du, Y., et al.
Publicado: (2025)
The Chameleon's Limit: Investigating Persona Collapse and Homogenization in Large Language Models
por: Xiao, Yunze, et al.
Publicado: (2026)
por: Xiao, Yunze, et al.
Publicado: (2026)
ThinkSwitcher: When to Think Hard, When to Think Fast
por: Liang, Guosheng, et al.
Publicado: (2025)
por: Liang, Guosheng, et al.
Publicado: (2025)
Think-on-Graph 2.0: Deep and Faithful Large Language Model Reasoning with Knowledge-guided Retrieval Augmented Generation
por: Ma, Shengjie, et al.
Publicado: (2024)
por: Ma, Shengjie, et al.
Publicado: (2024)
Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection
por: Li, Moxin, et al.
Publicado: (2024)
por: Li, Moxin, et al.
Publicado: (2024)
Learning When to Think While Listening in Large Audio-Language Models
por: Song, Zhiyuan, et al.
Publicado: (2026)
por: Song, Zhiyuan, et al.
Publicado: (2026)
Thinking Out of Order: When Output Order Stops Reflecting Reasoning Order in Diffusion Language Models
por: Yu, Longxuan, et al.
Publicado: (2026)
por: Yu, Longxuan, et al.
Publicado: (2026)
Prejudge-Before-Think: Enhancing Large Language Models at Test-Time by Process Prejudge Reasoning
por: Wang, Jianing, et al.
Publicado: (2025)
por: Wang, Jianing, et al.
Publicado: (2025)
Think Only When You Need with Large Hybrid-Reasoning Models
por: Jiang, Lingjie, et al.
Publicado: (2025)
por: Jiang, Lingjie, et al.
Publicado: (2025)
InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language Models
por: Yan, Yuchen, et al.
Publicado: (2025)
por: Yan, Yuchen, et al.
Publicado: (2025)
Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models
por: Weng, Fenghua, et al.
Publicado: (2025)
por: Weng, Fenghua, et al.
Publicado: (2025)
Fast Thinking for Large Language Models
por: Zheng, Haoyu, et al.
Publicado: (2025)
por: Zheng, Haoyu, et al.
Publicado: (2025)
Retrieval-Augmented Hierarchical in-Context Reinforcement Learning and Hindsight Modular Reflections for Task Planning with LLMs
por: Sun, Chuanneng, et al.
Publicado: (2024)
por: Sun, Chuanneng, et al.
Publicado: (2024)
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
por: Butt, Natasha, et al.
Publicado: (2024)
por: Butt, Natasha, et al.
Publicado: (2024)
WildTeaming at Scale: From In-the-Wild Jailbreaks to (Adversarially) Safer Language Models
por: Jiang, Liwei, et al.
Publicado: (2024)
por: Jiang, Liwei, et al.
Publicado: (2024)
When Models Reason in Your Language: Controlling Thinking Language Comes at the Cost of Accuracy
por: Qi, Jirui, et al.
Publicado: (2025)
por: Qi, Jirui, et al.
Publicado: (2025)
Selecting and Merging: Towards Adaptable and Scalable Named Entity Recognition with Large Language Models
por: Ding, Zhuojun, et al.
Publicado: (2025)
por: Ding, Zhuojun, et al.
Publicado: (2025)
The Cost of Thinking: Increased Jailbreak Risk in Large Language Models
por: Yang, Fan
Publicado: (2025)
por: Yang, Fan
Publicado: (2025)
AI as Humanity's Salieri: Quantifying Linguistic Creativity of Language Models via Systematic Attribution of Machine Text against Web Text
por: Lu, Ximing, et al.
Publicado: (2024)
por: Lu, Ximing, et al.
Publicado: (2024)
ChiMed 2.0: Advancing Chinese Medical Dataset in Facilitating Large Language Modeling
por: Tian, Yuanhe, et al.
Publicado: (2025)
por: Tian, Yuanhe, et al.
Publicado: (2025)
On the Thinking-Language Modeling Gap in Large Language Models
por: Liu, Chenxi, et al.
Publicado: (2025)
por: Liu, Chenxi, et al.
Publicado: (2025)
When Truth Is Overridden: Uncovering the Internal Origins of Sycophancy in Large Language Models
por: Wang, Keyu, et al.
Publicado: (2025)
por: Wang, Keyu, et al.
Publicado: (2025)
TypedThinker: Diversify Large Language Model Reasoning with Typed Thinking
por: Wang, Danqing, et al.
Publicado: (2024)
por: Wang, Danqing, et al.
Publicado: (2024)
AdaptThink: Reasoning Models Can Learn When to Think
por: Zhang, Jiajie, et al.
Publicado: (2025)
por: Zhang, Jiajie, et al.
Publicado: (2025)
Can Multimodal Large Language Model Think Analogically?
por: Guo, Diandian, et al.
Publicado: (2024)
por: Guo, Diandian, et al.
Publicado: (2024)
Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
por: Wang, Ziyan, et al.
Publicado: (2025)
por: Wang, Ziyan, et al.
Publicado: (2025)
Assessing the Creativity of Large Language Models: Testing, Limits, and New Frontiers
por: Schapiro, Samuel, et al.
Publicado: (2026)
por: Schapiro, Samuel, et al.
Publicado: (2026)
Thinking in Many Modes: How Composite Reasoning Elevates Large Language Model Performance with Limited Data
por: Ahmad, Zishan, et al.
Publicado: (2025)
por: Ahmad, Zishan, et al.
Publicado: (2025)
When Do Tools and Planning Help Large Language Models Think? A Cost- and Latency-Aware Benchmark
por: Ghoshal, Subha, et al.
Publicado: (2026)
por: Ghoshal, Subha, et al.
Publicado: (2026)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
por: Jian, Pu, et al.
Publicado: (2025)
por: Jian, Pu, et al.
Publicado: (2025)
Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking
por: Xu, Nan, et al.
Publicado: (2023)
por: Xu, Nan, et al.
Publicado: (2023)
Think Again! The Effect of Test-Time Compute on Preferences, Opinions, and Beliefs of Large Language Models
por: Kour, George, et al.
Publicado: (2025)
por: Kour, George, et al.
Publicado: (2025)
When Do Language Models Endorse Limitations on Human Rights Principles?
por: Samway, Keenan, et al.
Publicado: (2026)
por: Samway, Keenan, et al.
Publicado: (2026)
Chunk-Distilled Language Modeling
por: Li, Yanhong, et al.
Publicado: (2024)
por: Li, Yanhong, et al.
Publicado: (2024)
Re-Initialization Token Learning for Tool-Augmented Large Language Models
por: Li, Chenghao, et al.
Publicado: (2025)
por: Li, Chenghao, et al.
Publicado: (2025)
Evaluating the Translation Performance of Large Language Models Based on Euas-20
por: Huang, Yan, et al.
Publicado: (2024)
por: Huang, Yan, et al.
Publicado: (2024)
Reflections and New Directions for Human-Centered Large Language Models
por: Ziems, Caleb, et al.
Publicado: (2026)
por: Ziems, Caleb, et al.
Publicado: (2026)
ThinkDial: An Open Recipe for Controlling Reasoning Effort in Large Language Models
por: He, Qianyu, et al.
Publicado: (2025)
por: He, Qianyu, et al.
Publicado: (2025)
Ejemplares similares
-
Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects
por: Latimer, Chris, et al.
Publicado: (2025) -
Experimental Contexts Can Facilitate Robust Semantic Property Inference in Language Models, but Inconsistently
por: Misra, Kanishka, et al.
Publicado: (2024) -
Cognitive Decision Routing in Large Language Models: When to Think Fast, When to Think Slow
por: Du, Y., et al.
Publicado: (2025) -
The Chameleon's Limit: Investigating Persona Collapse and Homogenization in Large Language Models
por: Xiao, Yunze, et al.
Publicado: (2026) -
ThinkSwitcher: When to Think Hard, When to Think Fast
por: Liang, Guosheng, et al.
Publicado: (2025)