Overthinking the Truth: Understanding how Language Models Process False Demonstrations
Fuente:
arXiv
Guardado en:
| Autores principales: | Halawi, Danny, Denain, Jean-Stanislas, Steinhardt, Jacob |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Approaching Human-Level Forecasting with Language Models
por: Halawi, Danny, et al.
Publicado: (2024)
por: Halawi, Danny, et al.
Publicado: (2024)
Covert Malicious Finetuning: Challenges in Safeguarding LLM Adaptation
por: Halawi, Danny, et al.
Publicado: (2024)
por: Halawi, Danny, et al.
Publicado: (2024)
How do Language Models Bind Entities in Context?
por: Feng, Jiahai, et al.
Publicado: (2023)
por: Feng, Jiahai, et al.
Publicado: (2023)
Discovering Latent Knowledge in Language Models Without Supervision
por: Burns, Collin, et al.
Publicado: (2022)
por: Burns, Collin, et al.
Publicado: (2022)
Feedback Loops With Language Models Drive In-Context Reward Hacking
por: Pan, Alexander, et al.
Publicado: (2024)
por: Pan, Alexander, et al.
Publicado: (2024)
Explaining Datasets in Words: Statistical Models with Natural Language Parameters
por: Zhong, Ruiqi, et al.
Publicado: (2024)
por: Zhong, Ruiqi, et al.
Publicado: (2024)
Which Attention Heads Matter for In-Context Learning?
por: Yin, Kayo, et al.
Publicado: (2025)
por: Yin, Kayo, et al.
Publicado: (2025)
Training Language Models to Explain Their Own Computations
por: Li, Belinda Z., et al.
Publicado: (2025)
por: Li, Belinda Z., et al.
Publicado: (2025)
Understanding In-context Learning of Addition via Activation Subspaces
por: Hu, Xinyan, et al.
Publicado: (2025)
por: Hu, Xinyan, et al.
Publicado: (2025)
Iterative Label Refinement Matters More than Preference Optimization under Weak Supervision
por: Ye, Yaowen, et al.
Publicado: (2025)
por: Ye, Yaowen, et al.
Publicado: (2025)
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
por: Huang, Yao, et al.
Publicado: (2025)
por: Huang, Yao, et al.
Publicado: (2025)
Learning a Generative Meta-Model of LLM Activations
por: Luo, Grace, et al.
Publicado: (2026)
por: Luo, Grace, et al.
Publicado: (2026)
Eliciting Language Model Behaviors with Investigator Agents
por: Li, Xiang Lisa, et al.
Publicado: (2025)
por: Li, Xiang Lisa, et al.
Publicado: (2025)
ForecastBench: A Dynamic Benchmark of AI Forecasting Capabilities
por: Karger, Ezra, et al.
Publicado: (2024)
por: Karger, Ezra, et al.
Publicado: (2024)
TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful Space
por: Zhang, Shaolei, et al.
Publicado: (2024)
por: Zhang, Shaolei, et al.
Publicado: (2024)
Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?
por: Fan, Chenrui, et al.
Publicado: (2025)
por: Fan, Chenrui, et al.
Publicado: (2025)
Personas as a Way to Model Truthfulness in Language Models
por: Joshi, Nitish, et al.
Publicado: (2023)
por: Joshi, Nitish, et al.
Publicado: (2023)
ROM: Real-time Overthinking Mitigation via Streaming Detection and Intervention
por: Wang, Xinyan, et al.
Publicado: (2026)
por: Wang, Xinyan, et al.
Publicado: (2026)
Ranking Large Language Models without Ground Truth
por: Dhurandhar, Amit, et al.
Publicado: (2024)
por: Dhurandhar, Amit, et al.
Publicado: (2024)
Explore Briefly, Then Decide: Mitigating LLM Overthinking via Cumulative Entropy Regulation
por: Bin, Yi, et al.
Publicado: (2025)
por: Bin, Yi, et al.
Publicado: (2025)
Predictive Concept Decoders: Training Scalable End-to-End Interpretability Assistants
por: Huang, Vincent, et al.
Publicado: (2025)
por: Huang, Vincent, et al.
Publicado: (2025)
Large Language Models are Skeptics: False Negative Problem of Input-conflicting Hallucination
por: Song, Jongyoon, et al.
Publicado: (2024)
por: Song, Jongyoon, et al.
Publicado: (2024)
Machine Bullshit: Characterizing the Emergent Disregard for Truth in Large Language Models
por: Liang, Kaiqu, et al.
Publicado: (2025)
por: Liang, Kaiqu, et al.
Publicado: (2025)
Inference-Time Intervention: Eliciting Truthful Answers from a Language Model
por: Li, Kenneth, et al.
Publicado: (2023)
por: Li, Kenneth, et al.
Publicado: (2023)
Don't "Overthink" Passage Reranking: Is Reasoning Truly Necessary?
por: Jedidi, Nour, et al.
Publicado: (2025)
por: Jedidi, Nour, et al.
Publicado: (2025)
Optimizing Instructions and Demonstrations for Multi-Stage Language Model Programs
por: Opsahl-Ong, Krista, et al.
Publicado: (2024)
por: Opsahl-Ong, Krista, et al.
Publicado: (2024)
Hallucination to Truth: A Review of Fact-Checking and Factuality Evaluation in Large Language Models
por: Rahman, Subhey Sadi, et al.
Publicado: (2025)
por: Rahman, Subhey Sadi, et al.
Publicado: (2025)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
por: Zhang, Qingru, et al.
Publicado: (2025)
por: Zhang, Qingru, et al.
Publicado: (2025)
TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
por: Wei, Zhepei, et al.
Publicado: (2025)
por: Wei, Zhepei, et al.
Publicado: (2025)
TruthFlow: Truthful LLM Generation via Representation Flow Correction
por: Wang, Hanyu, et al.
Publicado: (2025)
por: Wang, Hanyu, et al.
Publicado: (2025)
A Theoretical Understanding of Chain-of-Thought: Coherent Reasoning and Error-Aware Demonstration
por: Cui, Yingqian, et al.
Publicado: (2024)
por: Cui, Yingqian, et al.
Publicado: (2024)
Large Language Models Are Latent Variable Models: Explaining and Finding Good Demonstrations for In-Context Learning
por: Wang, Xinyi, et al.
Publicado: (2023)
por: Wang, Xinyi, et al.
Publicado: (2023)
Soft Tokens, Hard Truths
por: Butt, Natasha, et al.
Publicado: (2025)
por: Butt, Natasha, et al.
Publicado: (2025)
Understanding Understanding: A Pragmatic Framework Motivated by Large Language Models
por: Leyton-Brown, Kevin, et al.
Publicado: (2024)
por: Leyton-Brown, Kevin, et al.
Publicado: (2024)
Beyond Benchmarks: On The False Promise of AI Regulation
por: Stanovsky, Gabriel, et al.
Publicado: (2025)
por: Stanovsky, Gabriel, et al.
Publicado: (2025)
The Geometries of Truth Are Orthogonal Across Tasks
por: Azizian, Waiss, et al.
Publicado: (2025)
por: Azizian, Waiss, et al.
Publicado: (2025)
On The Truthfulness of 'Surprisingly Likely' Responses of Large Language Models
por: Goel, Naman
Publicado: (2023)
por: Goel, Naman
Publicado: (2023)
Emergent Semantic Role Understanding in Language Models
por: Griffiths, Carla, et al.
Publicado: (2026)
por: Griffiths, Carla, et al.
Publicado: (2026)
Understanding Subword Compositionality of Large Language Models
por: Peng, Qiwei, et al.
Publicado: (2025)
por: Peng, Qiwei, et al.
Publicado: (2025)
Understanding and Mitigating Tokenization Bias in Language Models
por: Phan, Buu, et al.
Publicado: (2024)
por: Phan, Buu, et al.
Publicado: (2024)
Ejemplares similares
-
Approaching Human-Level Forecasting with Language Models
por: Halawi, Danny, et al.
Publicado: (2024) -
Covert Malicious Finetuning: Challenges in Safeguarding LLM Adaptation
por: Halawi, Danny, et al.
Publicado: (2024) -
How do Language Models Bind Entities in Context?
por: Feng, Jiahai, et al.
Publicado: (2023) -
Discovering Latent Knowledge in Language Models Without Supervision
por: Burns, Collin, et al.
Publicado: (2022) -
Feedback Loops With Language Models Drive In-Context Reward Hacking
por: Pan, Alexander, et al.
Publicado: (2024)