Mechanisms of Introspective Awareness
Fuente:
arXiv
Salvato in:
| Autori principali: | Macar, Uzay, Yang, Li, Wang, Atticus, Wallich, Peter, Ameisen, Emmanuel, Lindsey, Jack |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hierarchical Multi-Armed Bandits for the Concurrent Intelligent Tutoring of Concepts and Problems of Varying Difficulty Levels
di: Castleman, Blake, et al.
Pubblicazione: (2024)
di: Castleman, Blake, et al.
Pubblicazione: (2024)
Thought Branches: Interpreting LLM Reasoning Requires Resampling
di: Macar, Uzay, et al.
Pubblicazione: (2025)
di: Macar, Uzay, et al.
Pubblicazione: (2025)
Thought Anchors: Which LLM Reasoning Steps Matter?
di: Bogdan, Paul C., et al.
Pubblicazione: (2025)
di: Bogdan, Paul C., et al.
Pubblicazione: (2025)
Breakpoint: Scalable evaluation of system-level reasoning in LLM code agents
di: Hariharan, Kaivalya, et al.
Pubblicazione: (2025)
di: Hariharan, Kaivalya, et al.
Pubblicazione: (2025)
Emergent Introspective Awareness in Large Language Models
di: Lindsey, Jack
Pubblicazione: (2026)
di: Lindsey, Jack
Pubblicazione: (2026)
When Models Manipulate Manifolds: The Geometry of a Counting Task
di: Gurnee, Wes, et al.
Pubblicazione: (2026)
di: Gurnee, Wes, et al.
Pubblicazione: (2026)
Exploration Through Introspection: A Self-Aware Reward Model
di: Petrowski, Michael, et al.
Pubblicazione: (2026)
di: Petrowski, Michael, et al.
Pubblicazione: (2026)
Prior Learning in Introspective VAEs
di: Athanasiadis, Ioannis, et al.
Pubblicazione: (2024)
di: Athanasiadis, Ioannis, et al.
Pubblicazione: (2024)
JULI: Jailbreak Large Language Models by Self-Introspection
di: Wang, Jesson, et al.
Pubblicazione: (2025)
di: Wang, Jesson, et al.
Pubblicazione: (2025)
Efficient Planning in Reinforcement Learning via Model Introspection
di: Stella, Gabriel
Pubblicazione: (2026)
di: Stella, Gabriel
Pubblicazione: (2026)
Inductive biases of multi-task learning and finetuning: multiple regimes of feature reuse
di: Lippl, Samuel, et al.
Pubblicazione: (2023)
di: Lippl, Samuel, et al.
Pubblicazione: (2023)
From Simulation to Enaction: Post-trained language models recognize and react to their own generations
di: G., Asvin, et al.
Pubblicazione: (2026)
di: G., Asvin, et al.
Pubblicazione: (2026)
Automatically Finding Reward Model Biases
di: Wang, Atticus, et al.
Pubblicazione: (2026)
di: Wang, Atticus, et al.
Pubblicazione: (2026)
MAGPI: Multifidelity-Augmented Gaussian Process Inputs for Surrogate Modeling from Scarce Data
di: Rex, Atticus, et al.
Pubblicazione: (2026)
di: Rex, Atticus, et al.
Pubblicazione: (2026)
Constructing Interpretable Features from Compositional Neuron Groups
di: Shafran, Or, et al.
Pubblicazione: (2025)
di: Shafran, Or, et al.
Pubblicazione: (2025)
Interpretable Fuzzy Systems For Forward Osmosis Desalination
di: Khaled, Qusai, et al.
Pubblicazione: (2026)
di: Khaled, Qusai, et al.
Pubblicazione: (2026)
Beyond Introspection: Reinforcing Thinking via Externalist Behavioral Feedback
di: Yang, Diji, et al.
Pubblicazione: (2024)
di: Yang, Diji, et al.
Pubblicazione: (2024)
Slot Machines: How LLMs Keep Track of Multiple Entities
di: Bogdan, Paul C., et al.
Pubblicazione: (2026)
di: Bogdan, Paul C., et al.
Pubblicazione: (2026)
Evaluating Open-Source Sparse Autoencoders on Disentangling Factual Knowledge in GPT-2 Small
di: Chaudhary, Maheep, et al.
Pubblicazione: (2024)
di: Chaudhary, Maheep, et al.
Pubblicazione: (2024)
Task structure and nonlinearity jointly determine learned representational geometry
di: Alleman, Matteo, et al.
Pubblicazione: (2024)
di: Alleman, Matteo, et al.
Pubblicazione: (2024)
Latent Introspection: Models Can Detect Prior Concept Injections
di: Pearson-Vogel, Theia, et al.
Pubblicazione: (2026)
di: Pearson-Vogel, Theia, et al.
Pubblicazione: (2026)
Explainable Uncertainty Quantification for Wastewater Treatment Energy Prediction via Interval Type-2 Neuro-Fuzzy System
di: Khaled, Qusai, et al.
Pubblicazione: (2026)
di: Khaled, Qusai, et al.
Pubblicazione: (2026)
Zero-Overhead Introspection for Adaptive Test-Time Compute
di: Manvi, Rohin, et al.
Pubblicazione: (2025)
di: Manvi, Rohin, et al.
Pubblicazione: (2025)
Bridging the Semantic Gap in Virtual Machine Introspection and Forensic Memory Analysis
di: Fellicious, Christofer, et al.
Pubblicazione: (2025)
di: Fellicious, Christofer, et al.
Pubblicazione: (2025)
Reflect then Learn: Active Prompting for Information Extraction Guided by Introspective Confusion
di: Zhao, Dong, et al.
Pubblicazione: (2025)
di: Zhao, Dong, et al.
Pubblicazione: (2025)
Combining Causal Models for More Accurate Abstractions of Neural Networks
di: Pîslar, Theodora-Mara, et al.
Pubblicazione: (2025)
di: Pîslar, Theodora-Mara, et al.
Pubblicazione: (2025)
How Causal Abstraction Underpins Computational Explanation
di: Geiger, Atticus, et al.
Pubblicazione: (2025)
di: Geiger, Atticus, et al.
Pubblicazione: (2025)
How Do Transformers Learn Variable Binding in Symbolic Programs?
di: Wu, Yiwei, et al.
Pubblicazione: (2025)
di: Wu, Yiwei, et al.
Pubblicazione: (2025)
Introspective Planning: Aligning Robots' Uncertainty with Inherent Task Ambiguity
di: Liang, Kaiqu, et al.
Pubblicazione: (2024)
di: Liang, Kaiqu, et al.
Pubblicazione: (2024)
From Imitation to Introspection: Probing Self-Consciousness in Language Models
di: Chen, Sirui, et al.
Pubblicazione: (2024)
di: Chen, Sirui, et al.
Pubblicazione: (2024)
Latent Planning Emerges with Scale
di: Hanna, Michael, et al.
Pubblicazione: (2026)
di: Hanna, Michael, et al.
Pubblicazione: (2026)
The Marked Edge Walk: A Novel MCMC Algorithm for Sampling of Graph Partitions
di: McWhorter, Atticus, et al.
Pubblicazione: (2025)
di: McWhorter, Atticus, et al.
Pubblicazione: (2025)
RIV: Recursive Introspection Mask Diffusion Vision Language Model
di: Li, YuQian, et al.
Pubblicazione: (2025)
di: Li, YuQian, et al.
Pubblicazione: (2025)
CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
Recursive Introspection: Teaching Language Model Agents How to Self-Improve
di: Qu, Yuxiao, et al.
Pubblicazione: (2024)
di: Qu, Yuxiao, et al.
Pubblicazione: (2024)
Introspective X Training: Feedback Conditioning Improves Scaling Across all LLM Training Stages
di: Cui, Brandon, et al.
Pubblicazione: (2026)
di: Cui, Brandon, et al.
Pubblicazione: (2026)
Simple Mechanistic Explanations for Out-Of-Context Reasoning
di: Wang, Atticus, et al.
Pubblicazione: (2025)
di: Wang, Atticus, et al.
Pubblicazione: (2025)
IntroLM: Introspective Language Models via Prefilling-Time Self-Evaluation
di: Kasnavieh, Hossein Hosseini, et al.
Pubblicazione: (2026)
di: Kasnavieh, Hossein Hosseini, et al.
Pubblicazione: (2026)
The Quantization Model of Neural Scaling
di: Michaud, Eric J., et al.
Pubblicazione: (2023)
di: Michaud, Eric J., et al.
Pubblicazione: (2023)
ScoNe: Benchmarking Negation Reasoning in Language Models With Fine-Tuning and In-Context Learning
di: She, Jingyuan Selena, et al.
Pubblicazione: (2023)
di: She, Jingyuan Selena, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Hierarchical Multi-Armed Bandits for the Concurrent Intelligent Tutoring of Concepts and Problems of Varying Difficulty Levels
di: Castleman, Blake, et al.
Pubblicazione: (2024) -
Thought Branches: Interpreting LLM Reasoning Requires Resampling
di: Macar, Uzay, et al.
Pubblicazione: (2025) -
Thought Anchors: Which LLM Reasoning Steps Matter?
di: Bogdan, Paul C., et al.
Pubblicazione: (2025) -
Breakpoint: Scalable evaluation of system-level reasoning in LLM code agents
di: Hariharan, Kaivalya, et al.
Pubblicazione: (2025) -
Emergent Introspective Awareness in Large Language Models
di: Lindsey, Jack
Pubblicazione: (2026)