AntiPaSTO: Self-Supervised Honesty Steering via Anti-Parallel Representations
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Clark, Michael J. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Training LLMs for Honesty via Confessions
par: Joglekar, Manas, et autres
Publié: (2025)
par: Joglekar, Manas, et autres
Publié: (2025)
QiMeng-MuPa: Mutual-Supervised Learning for Sequential-to-Parallel Code Translation
par: Ke, Changxin, et autres
Publié: (2025)
par: Ke, Changxin, et autres
Publié: (2025)
AdaPaD: Adaptive Parallel Deflation for PEFT with Self-Correcting Rank Discovery
par: Su, Barbara, et autres
Publié: (2026)
par: Su, Barbara, et autres
Publié: (2026)
Interpretable Self-Supervised Learning via Representer Landmarks and Nyström Approximation
par: Zarvandi, Maedeh, et autres
Publié: (2025)
par: Zarvandi, Maedeh, et autres
Publié: (2025)
Honesty in Causal Forests: When It Helps and When It Hurts
par: Hou, Yanfang, et autres
Publié: (2025)
par: Hou, Yanfang, et autres
Publié: (2025)
E3STO: Orbital Inspired SE(3)-Equivariant Molecular Representation for Electron Density Prediction
par: Mitnikov, Ilan, et autres
Publié: (2024)
par: Mitnikov, Ilan, et autres
Publié: (2024)
Measure-Theoretic Anti-Causal Representation Learning
par: Behnam, Arman, et autres
Publié: (2025)
par: Behnam, Arman, et autres
Publié: (2025)
PaSE: Parallelization Strategies for Efficient DNN Training
par: Elango, Venmugil
Publié: (2024)
par: Elango, Venmugil
Publié: (2024)
TARDIS: Mitigating Temporal Misalignment via Representation Steering
par: Shin, Changho, et autres
Publié: (2025)
par: Shin, Changho, et autres
Publié: (2025)
Self-Supervised Graph Representation Learning via Global Context Prediction
par: Peng, Zhen, et autres
Publié: (2020)
par: Peng, Zhen, et autres
Publié: (2020)
PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning
par: Hu, Jingcheng, et autres
Publié: (2026)
par: Hu, Jingcheng, et autres
Publié: (2026)
PaPaformer: Language Model from Pre-trained Parallel Paths
par: Tapaninaho, Joonas, et autres
Publié: (2025)
par: Tapaninaho, Joonas, et autres
Publié: (2025)
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
par: Shen, Guobin, et autres
Publié: (2026)
par: Shen, Guobin, et autres
Publié: (2026)
Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation
par: Mohamadi, Mohamad Amin, et autres
Publié: (2025)
par: Mohamadi, Mohamad Amin, et autres
Publié: (2025)
Self-Supervised Dynamical System Representations for Physiological Time-Series
par: Chen, Yenho, et autres
Publié: (2025)
par: Chen, Yenho, et autres
Publié: (2025)
Understanding Augmentation-based Self-Supervised Representation Learning via RKHS Approximation and Regression
par: Zhai, Runtian, et autres
Publié: (2023)
par: Zhai, Runtian, et autres
Publié: (2023)
Gaussian Joint Embeddings For Self-Supervised Representation Learning
par: Huang, Yongchao
Publié: (2026)
par: Huang, Yongchao
Publié: (2026)
Gaussian Joint Embeddings For Self-Supervised Representation Learning
par: Huang, Yongchao
Publié: (2026)
par: Huang, Yongchao
Publié: (2026)
Self-Supervised Representation Learning as Mutual Information Maximization
par: Sabby, Akhlaqur Rahman, et autres
Publié: (2025)
par: Sabby, Akhlaqur Rahman, et autres
Publié: (2025)
On Discriminative Probabilistic Modeling for Self-Supervised Representation Learning
par: Wang, Bokun, et autres
Publié: (2024)
par: Wang, Bokun, et autres
Publié: (2024)
Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning
par: Gu, Renjie, et autres
Publié: (2026)
par: Gu, Renjie, et autres
Publié: (2026)
Preference Learning with Lie Detectors can Induce Honesty or Evasion
par: Cundy, Chris, et autres
Publié: (2025)
par: Cundy, Chris, et autres
Publié: (2025)
STO-RL: Offline RL under Sparse Rewards via LLM-Guided Subgoal Temporal Order
par: Gu, Chengyang, et autres
Publié: (2026)
par: Gu, Chengyang, et autres
Publié: (2026)
Incentivizing Honesty among Competitors in Collaborative Learning and Optimization
par: Dorner, Florian E., et autres
Publié: (2023)
par: Dorner, Florian E., et autres
Publié: (2023)
HypeBoy: Generative Self-Supervised Representation Learning on Hypergraphs
par: Kim, Sunwoo, et autres
Publié: (2024)
par: Kim, Sunwoo, et autres
Publié: (2024)
PaECTER: Patent-level Representation Learning using Citation-informed Transformers
par: Ghosh, Mainak, et autres
Publié: (2024)
par: Ghosh, Mainak, et autres
Publié: (2024)
The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes
par: Taufeeque, Mohammad, et autres
Publié: (2026)
par: Taufeeque, Mohammad, et autres
Publié: (2026)
Anti Mode-Collapse in Mean-Field Transformer via Auxiliary Variables
par: Imaizumi, Masaaki, et autres
Publié: (2026)
par: Imaizumi, Masaaki, et autres
Publié: (2026)
Universal Spectral Tokenization via Self-Supervised Panchromatic Representation Learning
par: Shen, Jeff, et autres
Publié: (2025)
par: Shen, Jeff, et autres
Publié: (2025)
Learning Representation for Multitask learning through Self Supervised Auxiliary learning
par: Shin, Seokwon, et autres
Publié: (2024)
par: Shin, Seokwon, et autres
Publié: (2024)
Adv-SSL: Adversarial Self-Supervised Representation Learning with Theoretical Guarantees
par: Duan, Chenguang, et autres
Publié: (2024)
par: Duan, Chenguang, et autres
Publié: (2024)
Variance Covariance Regularization Enforces Pairwise Independence in Self-Supervised Representations
par: Mialon, Grégoire, et autres
Publié: (2022)
par: Mialon, Grégoire, et autres
Publié: (2022)
Brep2Shape: Boundary and Shape Representation Alignment via Self-Supervised Transformers
par: Sun, Yuanxu, et autres
Publié: (2026)
par: Sun, Yuanxu, et autres
Publié: (2026)
Think Before You Lie: How Reasoning Leads to Honesty
par: Yuan, Ann, et autres
Publié: (2026)
par: Yuan, Ann, et autres
Publié: (2026)
Understanding Representation Learnability of Nonlinear Self-Supervised Learning
par: Yang, Ruofeng, et autres
Publié: (2024)
par: Yang, Ruofeng, et autres
Publié: (2024)
The Impact of Semantic Pairs on Self-Supervised Representation Learning
par: Alkhalefi, Mohammad, et autres
Publié: (2025)
par: Alkhalefi, Mohammad, et autres
Publié: (2025)
Quantifying Representation Reliability in Self-Supervised Learning Models
par: Park, Young-Jin, et autres
Publié: (2023)
par: Park, Young-Jin, et autres
Publié: (2023)
Data-Driven Self-Supervised Graph Representation Learning
par: Samy, Ahmed E., et autres
Publié: (2024)
par: Samy, Ahmed E., et autres
Publié: (2024)
On Linear Separation Capacity of Self-Supervised Representation Learning
par: Wang, Shulei
Publié: (2023)
par: Wang, Shulei
Publié: (2023)
PaAno: Patch-Based Representation Learning for Time-Series Anomaly Detection
par: Park, Jinju, et autres
Publié: (2026)
par: Park, Jinju, et autres
Publié: (2026)
Documents similaires
-
Training LLMs for Honesty via Confessions
par: Joglekar, Manas, et autres
Publié: (2025) -
QiMeng-MuPa: Mutual-Supervised Learning for Sequential-to-Parallel Code Translation
par: Ke, Changxin, et autres
Publié: (2025) -
AdaPaD: Adaptive Parallel Deflation for PEFT with Self-Correcting Rank Discovery
par: Su, Barbara, et autres
Publié: (2026) -
Interpretable Self-Supervised Learning via Representer Landmarks and Nyström Approximation
par: Zarvandi, Maedeh, et autres
Publié: (2025) -
Honesty in Causal Forests: When It Helps and When It Hurts
par: Hou, Yanfang, et autres
Publié: (2025)