Subliminal Corruption: Mechanisms, Thresholds, and Interpretability
Fuente:
arXiv
Salvato in:
| Autori principali: | Vir, Reya, Bhatnagar, Sarvesh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Polynomial Regression as a Task for Understanding In-context Learning Through Finetuning and Alignment
di: Wilcoxson, Max, et al.
Pubblicazione: (2024)
di: Wilcoxson, Max, et al.
Pubblicazione: (2024)
Subliminal Signals in Preference Labels
di: Magistrali, Isotta, et al.
Pubblicazione: (2026)
di: Magistrali, Isotta, et al.
Pubblicazione: (2026)
SoftLMs: Efficient Adaptive Low-Rank Approximation of Language Models using Soft-Thresholding Mechanism
di: Bhatnagar, Priyansh, et al.
Pubblicazione: (2024)
di: Bhatnagar, Priyansh, et al.
Pubblicazione: (2024)
Subliminal Learning is a LoRA Artifact
di: Nief, Todd, et al.
Pubblicazione: (2026)
di: Nief, Todd, et al.
Pubblicazione: (2026)
Subliminal Effects in Your Data: A General Mechanism via Log-Linearity
di: Aden-Ali, Ishaq, et al.
Pubblicazione: (2026)
di: Aden-Ali, Ishaq, et al.
Pubblicazione: (2026)
Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
di: Schrodi, Simon, et al.
Pubblicazione: (2025)
di: Schrodi, Simon, et al.
Pubblicazione: (2025)
Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer
di: Askin, Baris, et al.
Pubblicazione: (2026)
di: Askin, Baris, et al.
Pubblicazione: (2026)
You Didn't Have to Say It like That: Subliminal Learning from Faithful Paraphrases
di: Gisler, Isaia, et al.
Pubblicazione: (2026)
di: Gisler, Isaia, et al.
Pubblicazione: (2026)
On the Optimizer Dependence of Neural Scaling Laws
di: Ramani, Vansh, et al.
Pubblicazione: (2026)
di: Ramani, Vansh, et al.
Pubblicazione: (2026)
Subliminal Learning: Language models transmit behavioral traits via hidden signals in data
di: Cloud, Alex, et al.
Pubblicazione: (2025)
di: Cloud, Alex, et al.
Pubblicazione: (2025)
Joint Score-Threshold Optimization for Interpretable Risk Assessment
di: Ganjkhanloo, Fardin, et al.
Pubblicazione: (2025)
di: Ganjkhanloo, Fardin, et al.
Pubblicazione: (2025)
Learning Through Noise: Why Subliminal Learning Works and When It Fails
di: Brockers, Vincent C., et al.
Pubblicazione: (2026)
di: Brockers, Vincent C., et al.
Pubblicazione: (2026)
Convergent Reinforcement Learning Algorithms for Stochastic Shortest Path Problem
di: Guin, Soumyajit, et al.
Pubblicazione: (2025)
di: Guin, Soumyajit, et al.
Pubblicazione: (2025)
A policy gradient approach for Finite Horizon Constrained Markov Decision Processes
di: Guin, Soumyajit, et al.
Pubblicazione: (2022)
di: Guin, Soumyajit, et al.
Pubblicazione: (2022)
Finite-Time Analysis of Three-Timescale Constrained Actor-Critic and Constrained Natural Actor-Critic Algorithms
di: Panda, Prashansa, et al.
Pubblicazione: (2023)
di: Panda, Prashansa, et al.
Pubblicazione: (2023)
Two-Timescale Critic-Actor for Average Reward MDPs with Function Approximation
di: Panda, Prashansa, et al.
Pubblicazione: (2024)
di: Panda, Prashansa, et al.
Pubblicazione: (2024)
Finite-time analysis of Multi-timescale Stochastic Optimization Algorithms
di: Kartikey, Kaustubh, et al.
Pubblicazione: (2026)
di: Kartikey, Kaustubh, et al.
Pubblicazione: (2026)
n-Step Temporal Difference Learning with Optimal n
di: Mandal, Lakshmi, et al.
Pubblicazione: (2023)
di: Mandal, Lakshmi, et al.
Pubblicazione: (2023)
Neuroplasticity and Corruption in Model Mechanisms: A Case Study Of Indirect Object Identification
di: Chhabra, Vishnu Kabir, et al.
Pubblicazione: (2025)
di: Chhabra, Vishnu Kabir, et al.
Pubblicazione: (2025)
Incremental Gaussian Mixture Clustering for Data Streams
di: Bhanderi, Aniket, et al.
Pubblicazione: (2024)
di: Bhanderi, Aniket, et al.
Pubblicazione: (2024)
Sustained Gradient Alignment Mediates Subliminal Learning in a Multi-Step Setting: Evidence from MNIST Auxiliary Logit Distillation Experiment
di: Kitkana, Chayanon, et al.
Pubblicazione: (2026)
di: Kitkana, Chayanon, et al.
Pubblicazione: (2026)
Cascading Bandits Robust to Adversarial Corruptions
di: Xie, Jize, et al.
Pubblicazione: (2025)
di: Xie, Jize, et al.
Pubblicazione: (2025)
Robust Bayesian Optimisation with Unbounded Corruptions
di: Ezzerg, Abdelhamid, et al.
Pubblicazione: (2025)
di: Ezzerg, Abdelhamid, et al.
Pubblicazione: (2025)
On Corruption-Robustness in Performative Reinforcement Learning
di: Pollatos, Vasilis, et al.
Pubblicazione: (2025)
di: Pollatos, Vasilis, et al.
Pubblicazione: (2025)
Corruption-Robust Lipschitz Contextual Search
di: Zuo, Shiliang
Pubblicazione: (2023)
di: Zuo, Shiliang
Pubblicazione: (2023)
Enabling Off-Policy Imitation Learning with Deep Actor Critic Stabilization
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)
Finite Time Analysis of Constrained Natural Critic-Actor Algorithm with Improved Sample Complexity
di: Panda, Prashansa, et al.
Pubblicazione: (2025)
di: Panda, Prashansa, et al.
Pubblicazione: (2025)
A Modular Zero-Shot Pipeline for Accident Detection, Localization, and Classification in Traffic Surveillance Video
di: Thakur, Amey, et al.
Pubblicazione: (2026)
di: Thakur, Amey, et al.
Pubblicazione: (2026)
Deep SOR Minimax Q-learning for Two-player Zero-sum Game
di: Gautam, Saksham, et al.
Pubblicazione: (2025)
di: Gautam, Saksham, et al.
Pubblicazione: (2025)
An Actor-Critic Algorithm with Function Approximation for Risk Sensitive Cost Markov Decision Processes
di: Guin, Soumyajit, et al.
Pubblicazione: (2025)
di: Guin, Soumyajit, et al.
Pubblicazione: (2025)
Actor-Critic or Critic-Actor? A Tale of Two Time Scales
di: Bhatnagar, Shalabh, et al.
Pubblicazione: (2022)
di: Bhatnagar, Shalabh, et al.
Pubblicazione: (2022)
Sparse Offline Reinforcement Learning with Corruption Robustness
di: Tran, Nam Phuong, et al.
Pubblicazione: (2025)
di: Tran, Nam Phuong, et al.
Pubblicazione: (2025)
Corruptions of Supervised Learning Problems: Typology and Mitigations
di: Iacovissi, Laura, et al.
Pubblicazione: (2023)
di: Iacovissi, Laura, et al.
Pubblicazione: (2023)
Stress-Testing ML Pipelines with Adversarial Data Corruption
di: Zhu, Jiongli, et al.
Pubblicazione: (2025)
di: Zhu, Jiongli, et al.
Pubblicazione: (2025)
Multi-Agent Stochastic Bandits Robust to Adversarial Corruptions
di: Ghaffari, Fatemeh, et al.
Pubblicazione: (2024)
di: Ghaffari, Fatemeh, et al.
Pubblicazione: (2024)
Robust Distribution Learning with Local and Global Adversarial Corruptions
di: Nietert, Sloan, et al.
Pubblicazione: (2024)
di: Nietert, Sloan, et al.
Pubblicazione: (2024)
Robust Reinforcement Learning from Corrupted Human Feedback
di: Bukharin, Alexander, et al.
Pubblicazione: (2024)
di: Bukharin, Alexander, et al.
Pubblicazione: (2024)
Robust Kernel Hypothesis Testing under Data Corruption
di: Schrab, Antonin, et al.
Pubblicazione: (2024)
di: Schrab, Antonin, et al.
Pubblicazione: (2024)
Disagreement-Regularized Importance Sampling for Adversarial Label Corruption
di: Horváth, Csongor, et al.
Pubblicazione: (2026)
di: Horváth, Csongor, et al.
Pubblicazione: (2026)
Convergence of Multiagent Learning Systems for Traffic control
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Polynomial Regression as a Task for Understanding In-context Learning Through Finetuning and Alignment
di: Wilcoxson, Max, et al.
Pubblicazione: (2024) -
Subliminal Signals in Preference Labels
di: Magistrali, Isotta, et al.
Pubblicazione: (2026) -
SoftLMs: Efficient Adaptive Low-Rank Approximation of Language Models using Soft-Thresholding Mechanism
di: Bhatnagar, Priyansh, et al.
Pubblicazione: (2024) -
Subliminal Learning is a LoRA Artifact
di: Nief, Todd, et al.
Pubblicazione: (2026) -
Subliminal Effects in Your Data: A General Mechanism via Log-Linearity
di: Aden-Ali, Ishaq, et al.
Pubblicazione: (2026)