Let's Think Dot by Dot: Hidden Computation in Transformer Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Pfau, Jacob, Merrill, William, Bowman, Samuel R. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Training Language Models to Win Debates with Self-Play Improves Judge Accuracy
di: Arnesen, Samuel, et al.
Pubblicazione: (2024)
di: Arnesen, Samuel, et al.
Pubblicazione: (2024)
Point of Order: Action-Aware LLM Persona Modeling for Realistic Civic Simulation
di: Merrill, Scott, et al.
Pubblicazione: (2025)
di: Merrill, Scott, et al.
Pubblicazione: (2025)
Towards Understanding Sycophancy in Language Models
di: Sharma, Mrinank, et al.
Pubblicazione: (2023)
di: Sharma, Mrinank, et al.
Pubblicazione: (2023)
Why Models Know But Don't Say: Chain-of-Thought Faithfulness Divergence Between Thinking Tokens and Answers in Open-Weight Reasoning Models
di: Young, Richard J.
Pubblicazione: (2026)
di: Young, Richard J.
Pubblicazione: (2026)
Categorical Perception in Large Language Model Hidden States: Structural Warping at Digit-Count Boundaries
di: Cacioli, Jon-Paul
Pubblicazione: (2026)
di: Cacioli, Jon-Paul
Pubblicazione: (2026)
Re-Mask and Redirect: Exploiting Denoising Irreversibility in Diffusion Language Models
di: Singh, Arth
Pubblicazione: (2026)
di: Singh, Arth
Pubblicazione: (2026)
Machine Unlearning for Masked Diffusion Language Models
di: Lee, Georu, et al.
Pubblicazione: (2026)
di: Lee, Georu, et al.
Pubblicazione: (2026)
Truth as a Compression Artifact in Language Model Training
di: Krestnikov, Konstantin
Pubblicazione: (2026)
di: Krestnikov, Konstantin
Pubblicazione: (2026)
Intention Collapse: Intention-Level Metrics for Reasoning in Language Models
di: Vera, Patricio
Pubblicazione: (2026)
di: Vera, Patricio
Pubblicazione: (2026)
Prototype Transformer: Towards Language Model Architectures Interpretable by Design
di: Yordanov, Yordan, et al.
Pubblicazione: (2026)
di: Yordanov, Yordan, et al.
Pubblicazione: (2026)
Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
di: Fadli, Samih
Pubblicazione: (2025)
di: Fadli, Samih
Pubblicazione: (2025)
Distributed Multi-Layer Editing for Rule-Level Knowledge in Large Language Models
di: Wang, Yating, et al.
Pubblicazione: (2026)
di: Wang, Yating, et al.
Pubblicazione: (2026)
Assessing Large Language Models on Islamic Legal Reasoning: Evidence from Inheritance Law Evaluation
di: Bouchekif, Abdessalam, et al.
Pubblicazione: (2025)
di: Bouchekif, Abdessalam, et al.
Pubblicazione: (2025)
Revisiting Parameter-Based Knowledge Editing in Large Language Models: Theoretical Limits and Empirical Evidence
di: Ren, Wanying, et al.
Pubblicazione: (2026)
di: Ren, Wanying, et al.
Pubblicazione: (2026)
SECURA: Sigmoid-Enhanced CUR Decomposition with Uninterrupted Retention and Low-Rank Adaptation in Large Language Models
di: Zhang, Yuxuan
Pubblicazione: (2025)
di: Zhang, Yuxuan
Pubblicazione: (2025)
RMGAP: Benchmarking the Generalization of Reward Models across Diverse Preferences
di: Zhou, Yangyang, et al.
Pubblicazione: (2026)
di: Zhou, Yangyang, et al.
Pubblicazione: (2026)
MeMo: Towards Language Models with Associative Memory Mechanisms
di: Zanzotto, Fabio Massimo, et al.
Pubblicazione: (2025)
di: Zanzotto, Fabio Massimo, et al.
Pubblicazione: (2025)
ImmigrationQA: A Source-Grounded Dataset and Small-Model Adaptation for U.S. Immigration Law
di: Shportun, Nazarii
Pubblicazione: (2026)
di: Shportun, Nazarii
Pubblicazione: (2026)
CRAFT: Clustered Regression for Adaptive Filtering of Training data
di: Panda, Parthasarathi, et al.
Pubblicazione: (2026)
di: Panda, Parthasarathi, et al.
Pubblicazione: (2026)
Mitigating Hallucinations in Zero-Shot Scientific Summarisation: A Pilot Study
di: Jaaouine, Imane, et al.
Pubblicazione: (2025)
di: Jaaouine, Imane, et al.
Pubblicazione: (2025)
EMA Is Not All You Need: Mapping the Boundary Between Structure and Content in Recurrent Context
di: Singh, Arth
Pubblicazione: (2026)
di: Singh, Arth
Pubblicazione: (2026)
Graph Memory Transformer (GMT)
di: Zanarini, Nicola, et al.
Pubblicazione: (2026)
di: Zanarini, Nicola, et al.
Pubblicazione: (2026)
Towards Ontology-Enhanced Representation Learning for Large Language Models
di: Ronzano, Francesco, et al.
Pubblicazione: (2024)
di: Ronzano, Francesco, et al.
Pubblicazione: (2024)
Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models
di: Zhang, Gongbo, et al.
Pubblicazione: (2026)
di: Zhang, Gongbo, et al.
Pubblicazione: (2026)
Evaluating Large Language Models for IUCN Red List Species Information
di: Uryu, Shinya
Pubblicazione: (2025)
di: Uryu, Shinya
Pubblicazione: (2025)
Thinker: Learning to Think Fast and Slow
di: Chung, Stephen, et al.
Pubblicazione: (2025)
di: Chung, Stephen, et al.
Pubblicazione: (2025)
Domain-Specific Pretraining of Language Models: A Comparative Study in the Medical Field
di: Kerner, Tobias
Pubblicazione: (2024)
di: Kerner, Tobias
Pubblicazione: (2024)
Cognitive Load Limits in Large Language Models: Benchmarking Multi-Hop Reasoning
di: Adapala, Sai Teja Reddy
Pubblicazione: (2025)
di: Adapala, Sai Teja Reddy
Pubblicazione: (2025)
Painless Activation Steering: An Automated, Lightweight Approach for Post-Training Large Language Models
di: Cui, Sasha, et al.
Pubblicazione: (2025)
di: Cui, Sasha, et al.
Pubblicazione: (2025)
No Free Swap: Protocol-Dependent Layer Redundancy in Transformers
di: Garcia, Gabriel
Pubblicazione: (2026)
di: Garcia, Gabriel
Pubblicazione: (2026)
Weakly Supervised Distillation of Hallucination Signals into Transformer Representations
di: Salehmohamed, Shoaib Sadiq, et al.
Pubblicazione: (2026)
di: Salehmohamed, Shoaib Sadiq, et al.
Pubblicazione: (2026)
Distilling Self-Consistency into Verbal Confidence: A Pre-Registered Negative Result and Post-Hoc Rescue on Gemma 3 4B
di: Cacioli, Jon-Paul
Pubblicazione: (2026)
di: Cacioli, Jon-Paul
Pubblicazione: (2026)
Exemplar Retrieval Without Overhypothesis Induction: Limits of Distributional Sequence Learning in Early Word Learning
di: Cacioli, Jon-Paul
Pubblicazione: (2026)
di: Cacioli, Jon-Paul
Pubblicazione: (2026)
Align and Shine: Building High-Quality Sentence-Aligned Corpora for Multilingual Text Simplification
di: Hilasaca, Kenji, et al.
Pubblicazione: (2026)
di: Hilasaca, Kenji, et al.
Pubblicazione: (2026)
Whether, Not Which: Mechanistic Interpretability Reveals Dissociable Affect Reception and Emotion Categorization in LLMs
di: Keeman, Michael
Pubblicazione: (2026)
di: Keeman, Michael
Pubblicazione: (2026)
KAConvText: Novel Approach to Burmese Sentence Classification using Kolmogorov-Arnold Convolution
di: Thu, Ye Kyaw, et al.
Pubblicazione: (2025)
di: Thu, Ye Kyaw, et al.
Pubblicazione: (2025)
When Persuasion Overrides Truth in Multi-Agent LLM Debates: Introducing a Confidence-Weighted Persuasion Override Rate (CW-POR)
di: Agarwal, Mahak, et al.
Pubblicazione: (2025)
di: Agarwal, Mahak, et al.
Pubblicazione: (2025)
The Pragmatic Persona: Discovering LLM Persona through Bridging Inference
di: Yang, Jisoo, et al.
Pubblicazione: (2026)
di: Yang, Jisoo, et al.
Pubblicazione: (2026)
A Hierarchical Error Framework for Reliable Automated Coding in Communication Research: Applications to Health and Political Communication
di: Zhao, Zhilong, et al.
Pubblicazione: (2025)
di: Zhao, Zhilong, et al.
Pubblicazione: (2025)
Bridging the Reasoning Gap: Small LLMs Can Plan with Generalised Strategies
di: Borro, Andrey, et al.
Pubblicazione: (2025)
di: Borro, Andrey, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Training Language Models to Win Debates with Self-Play Improves Judge Accuracy
di: Arnesen, Samuel, et al.
Pubblicazione: (2024) -
Point of Order: Action-Aware LLM Persona Modeling for Realistic Civic Simulation
di: Merrill, Scott, et al.
Pubblicazione: (2025) -
Towards Understanding Sycophancy in Language Models
di: Sharma, Mrinank, et al.
Pubblicazione: (2023) -
Why Models Know But Don't Say: Chain-of-Thought Faithfulness Divergence Between Thinking Tokens and Answers in Open-Weight Reasoning Models
di: Young, Richard J.
Pubblicazione: (2026) -
Categorical Perception in Large Language Model Hidden States: Structural Warping at Digit-Count Boundaries
di: Cacioli, Jon-Paul
Pubblicazione: (2026)