Large language models can learn and generalize steganographic chain-of-thought under process supervision
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Skaf, Joey, Ibanez-Lissen, Luis, McCarthy, Robert, Watts, Connor, Georgiv, Vasil, Whittingham, Hannes, Gonzalez-Manzano, Lorena, Lindner, David, Tice, Cameron, Young, Edward James, Radmard, Puria |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Chain-of-thought obfuscation learned from output supervision can generalise to unseen tasks
par: Hadida, Nathaniel Mitrani, et autres
Publié: (2026)
par: Hadida, Nathaniel Mitrani, et autres
Publié: (2026)
Diagnosing Pathological Chain-of-Thought in Reasoning Models
par: Liu, Manqing, et autres
Publié: (2026)
par: Liu, Manqing, et autres
Publié: (2026)
A transformer architecture alteration to incentivise externalised reasoning
par: Pavlova, Elizabeth, et autres
Publié: (2026)
par: Pavlova, Elizabeth, et autres
Publié: (2026)
Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment
par: Tice, Cameron, et autres
Publié: (2026)
par: Tice, Cameron, et autres
Publié: (2026)
Setting up for failure: automatic discovery of the neural mechanisms of cognitive errors
par: Radmard, Puria, et autres
Publié: (2025)
par: Radmard, Puria, et autres
Publié: (2025)
A flexible Bayesian non-parametric mixture model reveals multiple dependencies of swap errors in visual working memory
par: Radmard, Puria, et autres
Publié: (2025)
par: Radmard, Puria, et autres
Publié: (2025)
Association-sensory spatiotemporal hierarchy and functional gradient-regularised recurrent neural network with implications for schizophrenia
par: Abulikemu, Subati, et autres
Publié: (2025)
par: Abulikemu, Subati, et autres
Publié: (2025)
LPASS: Linear Probes as Stepping Stones for vulnerability detection using compressed LLMs
par: Ibanez-Lissen, Luis, et autres
Publié: (2025)
par: Ibanez-Lissen, Luis, et autres
Publié: (2025)
LUMIA: Linear probing for Unimodal and MultiModal Membership Inference Attacks leveraging internal LLM states
par: Ibanez-Lissen, Luis, et autres
Publié: (2024)
par: Ibanez-Lissen, Luis, et autres
Publié: (2024)
Esports can bring growth, but requires commitment
par: Claudine McCarthy
Publié: (2024)
par: Claudine McCarthy
Publié: (2024)
Learn how positivity can improve work culture
par: Claudine McCarthy
Publié: (2025)
par: Claudine McCarthy
Publié: (2025)
Learn how positivity can improve work culture
par: Claudine McCarthy
Publié: (2025)
par: Claudine McCarthy
Publié: (2025)
Creative collaborations can support students’ mental health
par: Claudine McCarthy
Publié: (2024)
par: Claudine McCarthy
Publié: (2024)
Creative collaborations can support students’ mental health
par: Claudine McCarthy
Publié: (2024)
par: Claudine McCarthy
Publié: (2024)
Improved collaboration with ATs can boost student‐athlete experience
par: Claudine McCarthy
Publié: (2025)
par: Claudine McCarthy
Publié: (2025)
Developing effective approaches to interpretations can help maintain compliance with NCAA rules
par: Claudine McCarthy
Publié: (2024)
par: Claudine McCarthy
Publié: (2024)
Planning ahead can help protect your campus when natural disasters hit
par: Claudine McCarthy
Publié: (2025)
par: Claudine McCarthy
Publié: (2025)
Planning ahead can help protect your campus when natural disasters hit
par: Claudine McCarthy
Publié: (2025)
par: Claudine McCarthy
Publié: (2025)
Free expression teams can help protect students' rights while promoting campus safety
par: Claudine McCarthy
Publié: (2026)
par: Claudine McCarthy
Publié: (2026)
Free expression teams can help protect students’ rights while promoting campus safety
par: Claudine McCarthy
Publié: (2026)
par: Claudine McCarthy
Publié: (2026)
Shift in perspective can help DII, DIII schools tap into NIL as recruiting, retention tool
par: Claudine McCarthy
Publié: (2025)
par: Claudine McCarthy
Publié: (2025)
Private key and password protection by steganographic image encryption
par: Choudhury, Debesh, et autres
Publié: (2025)
par: Choudhury, Debesh, et autres
Publié: (2025)
Las nuevas tecnologías conquistan las Universidades Andaluzas
par: Encarnación Sánchez Lissen
Publié: (2007)
par: Encarnación Sánchez Lissen
Publié: (2007)
La Vocación entre los Aspirantes a Maestro
par: Encarnación Sánchez Lissen
Publié: (2003)
par: Encarnación Sánchez Lissen
Publié: (2003)
Dos caras de la carrera docente: satisfacción y desmotivación
par: Encarnación Sánchez Lissen
Publié: (2009)
par: Encarnación Sánchez Lissen
Publié: (2009)
Salud personal y comunitaria: la influencia de nuestras actitudes y comportamientos ambientales
par: Encarnación Sánchez Lissen
Publié: (2005)
par: Encarnación Sánchez Lissen
Publié: (2005)
Quantum steganographic protocols using degenerate and entanglement-assisted quantum codes
par: Dutta, Sanjoy, et autres
Publié: (2025)
par: Dutta, Sanjoy, et autres
Publié: (2025)
Towards Understanding Specification Gaming in Reasoning Models
par: Nishimura-Gasparian, Kei, et autres
Publié: (2026)
par: Nishimura-Gasparian, Kei, et autres
Publié: (2026)
Dissociating language and thought in large language models
par: Mahowald, Kyle, et autres
Publié: (2023)
par: Mahowald, Kyle, et autres
Publié: (2023)
SketchVLM: Vision language models can annotate images to explain thoughts and guide users
par: Collins, Brandon, et autres
Publié: (2026)
par: Collins, Brandon, et autres
Publié: (2026)
The richness of language is the richness of thought
par: Hasanzoda, Rukhshona, et autres
Publié: (2026)
par: Hasanzoda, Rukhshona, et autres
Publié: (2026)
EGT Quantum Resonance: Predicting the $\mathbf{402 \text{ GeV}}$ WIMP and Future Discovery Conditions at the Large Hadron Collider
par: Tice, Brian
Publié: (2025)
par: Tice, Brian
Publié: (2025)
Libertad de información
par: Jessica Whittingham
Publié: (2007)
par: Jessica Whittingham
Publié: (2007)
Slow crossover from superdiffusion to diffusion in isotropic spin chains
par: McCarthy, Catherine, et autres
Publié: (2024)
par: McCarthy, Catherine, et autres
Publié: (2024)
Gravitational Baryogenesis in $f(R)$ Cosmologies
par: Whittingham, Ian B.
Publié: (2026)
par: Whittingham, Ian B.
Publié: (2026)
Factores de riesgo relacionados con el Trabajo de Parto Prematuro en adolescentes embarazadas: revisión integradora de la literatura
par: Isabela Fleury Skaf Thomazini
Publié: (2016)
par: Isabela Fleury Skaf Thomazini
Publié: (2016)
Using Neurogram Similarity Index Measure (NSIM) to Model Hearing Loss and Cochlear Neural Degeneration
par: Cheema, Ahsan J., et autres
Publié: (2025)
par: Cheema, Ahsan J., et autres
Publié: (2025)
Utilizing Information Theoretic Approach to Study Cochlear Neural Degeneration
par: Cheema, Ahsan J., et autres
Publié: (2025)
par: Cheema, Ahsan J., et autres
Publié: (2025)
How well can off-the-shelf LLMs elucidate molecular structures from mass spectra using chain-of-thought reasoning?
par: Wang, Yufeng, et autres
Publié: (2026)
par: Wang, Yufeng, et autres
Publié: (2026)
Communist Multiculturalism
par: McCarthy, Susan
Publié: (2023)
par: McCarthy, Susan
Publié: (2023)
Documents similaires
-
Chain-of-thought obfuscation learned from output supervision can generalise to unseen tasks
par: Hadida, Nathaniel Mitrani, et autres
Publié: (2026) -
Diagnosing Pathological Chain-of-Thought in Reasoning Models
par: Liu, Manqing, et autres
Publié: (2026) -
A transformer architecture alteration to incentivise externalised reasoning
par: Pavlova, Elizabeth, et autres
Publié: (2026) -
Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment
par: Tice, Cameron, et autres
Publié: (2026) -
Setting up for failure: automatic discovery of the neural mechanisms of cognitive errors
par: Radmard, Puria, et autres
Publié: (2025)