AntiPaSTO: Self-Supervised Honesty Steering via Anti-Parallel Representations
Fuente:
arXiv
Salvato in:
| Autore principale: | Clark, Michael J. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Training LLMs for Honesty via Confessions
di: Joglekar, Manas, et al.
Pubblicazione: (2025)
di: Joglekar, Manas, et al.
Pubblicazione: (2025)
QiMeng-MuPa: Mutual-Supervised Learning for Sequential-to-Parallel Code Translation
di: Ke, Changxin, et al.
Pubblicazione: (2025)
di: Ke, Changxin, et al.
Pubblicazione: (2025)
AdaPaD: Adaptive Parallel Deflation for PEFT with Self-Correcting Rank Discovery
di: Su, Barbara, et al.
Pubblicazione: (2026)
di: Su, Barbara, et al.
Pubblicazione: (2026)
Interpretable Self-Supervised Learning via Representer Landmarks and Nyström Approximation
di: Zarvandi, Maedeh, et al.
Pubblicazione: (2025)
di: Zarvandi, Maedeh, et al.
Pubblicazione: (2025)
Honesty in Causal Forests: When It Helps and When It Hurts
di: Hou, Yanfang, et al.
Pubblicazione: (2025)
di: Hou, Yanfang, et al.
Pubblicazione: (2025)
E3STO: Orbital Inspired SE(3)-Equivariant Molecular Representation for Electron Density Prediction
di: Mitnikov, Ilan, et al.
Pubblicazione: (2024)
di: Mitnikov, Ilan, et al.
Pubblicazione: (2024)
Measure-Theoretic Anti-Causal Representation Learning
di: Behnam, Arman, et al.
Pubblicazione: (2025)
di: Behnam, Arman, et al.
Pubblicazione: (2025)
PaSE: Parallelization Strategies for Efficient DNN Training
di: Elango, Venmugil
Pubblicazione: (2024)
di: Elango, Venmugil
Pubblicazione: (2024)
TARDIS: Mitigating Temporal Misalignment via Representation Steering
di: Shin, Changho, et al.
Pubblicazione: (2025)
di: Shin, Changho, et al.
Pubblicazione: (2025)
Self-Supervised Graph Representation Learning via Global Context Prediction
di: Peng, Zhen, et al.
Pubblicazione: (2020)
di: Peng, Zhen, et al.
Pubblicazione: (2020)
PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning
di: Hu, Jingcheng, et al.
Pubblicazione: (2026)
di: Hu, Jingcheng, et al.
Pubblicazione: (2026)
PaPaformer: Language Model from Pre-trained Parallel Paths
di: Tapaninaho, Joonas, et al.
Pubblicazione: (2025)
di: Tapaninaho, Joonas, et al.
Pubblicazione: (2025)
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
di: Shen, Guobin, et al.
Pubblicazione: (2026)
di: Shen, Guobin, et al.
Pubblicazione: (2026)
Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation
di: Mohamadi, Mohamad Amin, et al.
Pubblicazione: (2025)
di: Mohamadi, Mohamad Amin, et al.
Pubblicazione: (2025)
Self-Supervised Dynamical System Representations for Physiological Time-Series
di: Chen, Yenho, et al.
Pubblicazione: (2025)
di: Chen, Yenho, et al.
Pubblicazione: (2025)
Understanding Augmentation-based Self-Supervised Representation Learning via RKHS Approximation and Regression
di: Zhai, Runtian, et al.
Pubblicazione: (2023)
di: Zhai, Runtian, et al.
Pubblicazione: (2023)
Gaussian Joint Embeddings For Self-Supervised Representation Learning
di: Huang, Yongchao
Pubblicazione: (2026)
di: Huang, Yongchao
Pubblicazione: (2026)
Gaussian Joint Embeddings For Self-Supervised Representation Learning
di: Huang, Yongchao
Pubblicazione: (2026)
di: Huang, Yongchao
Pubblicazione: (2026)
Self-Supervised Representation Learning as Mutual Information Maximization
di: Sabby, Akhlaqur Rahman, et al.
Pubblicazione: (2025)
di: Sabby, Akhlaqur Rahman, et al.
Pubblicazione: (2025)
On Discriminative Probabilistic Modeling for Self-Supervised Representation Learning
di: Wang, Bokun, et al.
Pubblicazione: (2024)
di: Wang, Bokun, et al.
Pubblicazione: (2024)
Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning
di: Gu, Renjie, et al.
Pubblicazione: (2026)
di: Gu, Renjie, et al.
Pubblicazione: (2026)
Preference Learning with Lie Detectors can Induce Honesty or Evasion
di: Cundy, Chris, et al.
Pubblicazione: (2025)
di: Cundy, Chris, et al.
Pubblicazione: (2025)
STO-RL: Offline RL under Sparse Rewards via LLM-Guided Subgoal Temporal Order
di: Gu, Chengyang, et al.
Pubblicazione: (2026)
di: Gu, Chengyang, et al.
Pubblicazione: (2026)
Incentivizing Honesty among Competitors in Collaborative Learning and Optimization
di: Dorner, Florian E., et al.
Pubblicazione: (2023)
di: Dorner, Florian E., et al.
Pubblicazione: (2023)
HypeBoy: Generative Self-Supervised Representation Learning on Hypergraphs
di: Kim, Sunwoo, et al.
Pubblicazione: (2024)
di: Kim, Sunwoo, et al.
Pubblicazione: (2024)
PaECTER: Patent-level Representation Learning using Citation-informed Transformers
di: Ghosh, Mainak, et al.
Pubblicazione: (2024)
di: Ghosh, Mainak, et al.
Pubblicazione: (2024)
The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes
di: Taufeeque, Mohammad, et al.
Pubblicazione: (2026)
di: Taufeeque, Mohammad, et al.
Pubblicazione: (2026)
Anti Mode-Collapse in Mean-Field Transformer via Auxiliary Variables
di: Imaizumi, Masaaki, et al.
Pubblicazione: (2026)
di: Imaizumi, Masaaki, et al.
Pubblicazione: (2026)
Universal Spectral Tokenization via Self-Supervised Panchromatic Representation Learning
di: Shen, Jeff, et al.
Pubblicazione: (2025)
di: Shen, Jeff, et al.
Pubblicazione: (2025)
Learning Representation for Multitask learning through Self Supervised Auxiliary learning
di: Shin, Seokwon, et al.
Pubblicazione: (2024)
di: Shin, Seokwon, et al.
Pubblicazione: (2024)
Adv-SSL: Adversarial Self-Supervised Representation Learning with Theoretical Guarantees
di: Duan, Chenguang, et al.
Pubblicazione: (2024)
di: Duan, Chenguang, et al.
Pubblicazione: (2024)
Variance Covariance Regularization Enforces Pairwise Independence in Self-Supervised Representations
di: Mialon, Grégoire, et al.
Pubblicazione: (2022)
di: Mialon, Grégoire, et al.
Pubblicazione: (2022)
Brep2Shape: Boundary and Shape Representation Alignment via Self-Supervised Transformers
di: Sun, Yuanxu, et al.
Pubblicazione: (2026)
di: Sun, Yuanxu, et al.
Pubblicazione: (2026)
Think Before You Lie: How Reasoning Leads to Honesty
di: Yuan, Ann, et al.
Pubblicazione: (2026)
di: Yuan, Ann, et al.
Pubblicazione: (2026)
Understanding Representation Learnability of Nonlinear Self-Supervised Learning
di: Yang, Ruofeng, et al.
Pubblicazione: (2024)
di: Yang, Ruofeng, et al.
Pubblicazione: (2024)
The Impact of Semantic Pairs on Self-Supervised Representation Learning
di: Alkhalefi, Mohammad, et al.
Pubblicazione: (2025)
di: Alkhalefi, Mohammad, et al.
Pubblicazione: (2025)
Quantifying Representation Reliability in Self-Supervised Learning Models
di: Park, Young-Jin, et al.
Pubblicazione: (2023)
di: Park, Young-Jin, et al.
Pubblicazione: (2023)
Data-Driven Self-Supervised Graph Representation Learning
di: Samy, Ahmed E., et al.
Pubblicazione: (2024)
di: Samy, Ahmed E., et al.
Pubblicazione: (2024)
On Linear Separation Capacity of Self-Supervised Representation Learning
di: Wang, Shulei
Pubblicazione: (2023)
di: Wang, Shulei
Pubblicazione: (2023)
PaAno: Patch-Based Representation Learning for Time-Series Anomaly Detection
di: Park, Jinju, et al.
Pubblicazione: (2026)
di: Park, Jinju, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Training LLMs for Honesty via Confessions
di: Joglekar, Manas, et al.
Pubblicazione: (2025) -
QiMeng-MuPa: Mutual-Supervised Learning for Sequential-to-Parallel Code Translation
di: Ke, Changxin, et al.
Pubblicazione: (2025) -
AdaPaD: Adaptive Parallel Deflation for PEFT with Self-Correcting Rank Discovery
di: Su, Barbara, et al.
Pubblicazione: (2026) -
Interpretable Self-Supervised Learning via Representer Landmarks and Nyström Approximation
di: Zarvandi, Maedeh, et al.
Pubblicazione: (2025) -
Honesty in Causal Forests: When It Helps and When It Hurts
di: Hou, Yanfang, et al.
Pubblicazione: (2025)