Controllable Context Sensitivity and the Knob Behind It
Fuente:
arXiv
Salvato in:
| Autori principali: | Minder, Julian, Du, Kevin, Stoehr, Niklas, Monea, Giovanni, Wendler, Chris, West, Robert, Cotterell, Ryan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Activation Scaling for Steering and Interpreting Language Models
di: Stoehr, Niklas, et al.
Pubblicazione: (2024)
di: Stoehr, Niklas, et al.
Pubblicazione: (2024)
Separating Tongue from Thought: Activation Patching Reveals Language-Agnostic Concept Representations in Transformers
di: Dumas, Clément, et al.
Pubblicazione: (2024)
di: Dumas, Clément, et al.
Pubblicazione: (2024)
Do Llamas Work in English? On the Latent Language of Multilingual Transformers
di: Wendler, Chris, et al.
Pubblicazione: (2024)
di: Wendler, Chris, et al.
Pubblicazione: (2024)
How Persuasive is Your Context?
di: Nguyen, Tu, et al.
Pubblicazione: (2025)
di: Nguyen, Tu, et al.
Pubblicazione: (2025)
LLMs Are In-Context Bandit Reinforcement Learners
di: Monea, Giovanni, et al.
Pubblicazione: (2024)
di: Monea, Giovanni, et al.
Pubblicazione: (2024)
Context versus Prior Knowledge in Language Models
di: Du, Kevin, et al.
Pubblicazione: (2024)
di: Du, Kevin, et al.
Pubblicazione: (2024)
Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences
di: Minder, Julian, et al.
Pubblicazione: (2025)
di: Minder, Julian, et al.
Pubblicazione: (2025)
Structured Voronoi Sampling
di: Amini, Afra, et al.
Pubblicazione: (2023)
di: Amini, Afra, et al.
Pubblicazione: (2023)
Localized Cultural Knowledge is Conserved and Controllable in Large Language Models
di: Veselovsky, Veniamin, et al.
Pubblicazione: (2025)
di: Veselovsky, Veniamin, et al.
Pubblicazione: (2025)
Towards Explainability in Legal Outcome Prediction Models
di: Valvoda, Josef, et al.
Pubblicazione: (2024)
di: Valvoda, Josef, et al.
Pubblicazione: (2024)
A Glitch in the Matrix? Locating and Detecting Language Model Grounding with Fakepedia
di: Monea, Giovanni, et al.
Pubblicazione: (2023)
di: Monea, Giovanni, et al.
Pubblicazione: (2023)
Are Large Language Models Sensitive to the Motives Behind Communication?
di: Wu, Addison J., et al.
Pubblicazione: (2025)
di: Wu, Addison J., et al.
Pubblicazione: (2025)
Believe It or Not: How Deeply do LLMs Believe Implanted Facts?
di: Slocum, Stewart, et al.
Pubblicazione: (2025)
di: Slocum, Stewart, et al.
Pubblicazione: (2025)
A Distributional Perspective on Word Learning in Neural Language Models
di: Ficarra, Filippo, et al.
Pubblicazione: (2025)
di: Ficarra, Filippo, et al.
Pubblicazione: (2025)
Syntactic Control of Language Models by Posterior Inference
di: Xefteri, Vicky, et al.
Pubblicazione: (2025)
di: Xefteri, Vicky, et al.
Pubblicazione: (2025)
Transformers Can Represent $n$-gram Language Models
di: Svete, Anej, et al.
Pubblicazione: (2024)
di: Svete, Anej, et al.
Pubblicazione: (2024)
Locally Typical Sampling
di: Meister, Clara, et al.
Pubblicazione: (2022)
di: Meister, Clara, et al.
Pubblicazione: (2022)
Direct Preference Optimization with an Offset
di: Amini, Afra, et al.
Pubblicazione: (2024)
di: Amini, Afra, et al.
Pubblicazione: (2024)
Generalized Measures of Anticipation and Responsivity in Online Language Processing
di: Giulianelli, Mario, et al.
Pubblicazione: (2024)
di: Giulianelli, Mario, et al.
Pubblicazione: (2024)
Better Estimation of the Kullback--Leibler Divergence Between Language Models
di: Amini, Afra, et al.
Pubblicazione: (2025)
di: Amini, Afra, et al.
Pubblicazione: (2025)
Overcoming Sparsity Artifacts in Crosscoders to Interpret Chat-Tuning
di: Minder, Julian, et al.
Pubblicazione: (2025)
di: Minder, Julian, et al.
Pubblicazione: (2025)
Mechanistic Knobs in LLMs: Retrieving and Steering High-Order Semantic Features via Sparse Autoencoders
di: Zhang, Ruikang, et al.
Pubblicazione: (2026)
di: Zhang, Ruikang, et al.
Pubblicazione: (2026)
Evaluating the Sensitivity of LLMs to Prior Context
di: Hankache, Robert, et al.
Pubblicazione: (2025)
di: Hankache, Robert, et al.
Pubblicazione: (2025)
EmoKnob: Enhance Voice Cloning with Fine-Grained Emotion Control
di: Chen, Haozhe, et al.
Pubblicazione: (2024)
di: Chen, Haozhe, et al.
Pubblicazione: (2024)
Discovering Forbidden Topics in Language Models
di: Rager, Can, et al.
Pubblicazione: (2025)
di: Rager, Can, et al.
Pubblicazione: (2025)
Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QA
di: Wang, Minzheng, et al.
Pubblicazione: (2024)
di: Wang, Minzheng, et al.
Pubblicazione: (2024)
Learning and Enforcing Context-Sensitive Control for LLMs
di: Albinhassan, Mohammad, et al.
Pubblicazione: (2026)
di: Albinhassan, Mohammad, et al.
Pubblicazione: (2026)
Internal states before wait modulate reasoning patterns
di: Troitskii, Dmitrii, et al.
Pubblicazione: (2025)
di: Troitskii, Dmitrii, et al.
Pubblicazione: (2025)
Gumbel Counterfactual Generation From Language Models
di: Ravfogel, Shauli, et al.
Pubblicazione: (2024)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2024)
Variational Best-of-N Alignment
di: Amini, Afra, et al.
Pubblicazione: (2024)
di: Amini, Afra, et al.
Pubblicazione: (2024)
Post-Training Language Models for Crosslingual Consistency
di: Liu, Tianyu, et al.
Pubblicazione: (2026)
di: Liu, Tianyu, et al.
Pubblicazione: (2026)
Reverse-Engineering the Reader
di: Kiegeland, Samuel, et al.
Pubblicazione: (2024)
di: Kiegeland, Samuel, et al.
Pubblicazione: (2024)
Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention
di: Munkhdalai, Tsendsuren, et al.
Pubblicazione: (2024)
di: Munkhdalai, Tsendsuren, et al.
Pubblicazione: (2024)
Efficiently Computing Susceptibility to Context in Language Models
di: Liu, Tianyu, et al.
Pubblicazione: (2024)
di: Liu, Tianyu, et al.
Pubblicazione: (2024)
The Foundations of Tokenization: Statistical and Computational Concerns
di: Gastaldi, Juan Luis, et al.
Pubblicazione: (2024)
di: Gastaldi, Juan Luis, et al.
Pubblicazione: (2024)
Revisiting Padded Transformer Expressivity: Which Architectural Choices Matter and Which Don't
di: Svete, Anej, et al.
Pubblicazione: (2026)
di: Svete, Anej, et al.
Pubblicazione: (2026)
Controlling Latent Diffusion Using Latent CLIP
di: Becker, Jason, et al.
Pubblicazione: (2025)
di: Becker, Jason, et al.
Pubblicazione: (2025)
From Language Models over Tokens to Language Models over Characters
di: Vieira, Tim, et al.
Pubblicazione: (2024)
di: Vieira, Tim, et al.
Pubblicazione: (2024)
Task-Specific Knowledge Distillation via Intermediate Probes
di: Brown, Ryan, et al.
Pubblicazione: (2026)
di: Brown, Ryan, et al.
Pubblicazione: (2026)
Computation Mechanism Behind LLM Position Generalization
di: Han, Chi, et al.
Pubblicazione: (2025)
di: Han, Chi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Activation Scaling for Steering and Interpreting Language Models
di: Stoehr, Niklas, et al.
Pubblicazione: (2024) -
Separating Tongue from Thought: Activation Patching Reveals Language-Agnostic Concept Representations in Transformers
di: Dumas, Clément, et al.
Pubblicazione: (2024) -
Do Llamas Work in English? On the Latent Language of Multilingual Transformers
di: Wendler, Chris, et al.
Pubblicazione: (2024) -
How Persuasive is Your Context?
di: Nguyen, Tu, et al.
Pubblicazione: (2025) -
LLMs Are In-Context Bandit Reinforcement Learners
di: Monea, Giovanni, et al.
Pubblicazione: (2024)