Enregistré dans:
| Auteurs principaux: | Daniels, Oliver, Moodley, Perusha, Marlin, Benjamin M., Lindner, David |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.08877 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Exploration Hacking: Can LLMs Learn to Resist RL Training?
par: Jang, Eyon, et autres
Publié: (2026)
par: Jang, Eyon, et autres
Publié: (2026)
Multi-State-Action Tokenisation in Decision Transformers for Multi-Discrete Action Spaces
par: Moodley, Perusha, et autres
Publié: (2024)
par: Moodley, Perusha, et autres
Publié: (2024)
ACE and Diverse Generalization via Selective Disagreement
par: Daniels, Oliver, et autres
Publié: (2025)
par: Daniels, Oliver, et autres
Publié: (2025)
Combining LLM decision and RL action selection to improve RL policy for adaptive interventions
par: Karine, Karine, et autres
Publié: (2025)
par: Karine, Karine, et autres
Publié: (2025)
StepCountJITAI: simulation environment for RL with application to physical activity adaptive intervention
par: Karine, Karine, et autres
Publié: (2024)
par: Karine, Karine, et autres
Publié: (2024)
Heteroscedastic Temporal Variational Autoencoder For Irregular Time Series
par: Shukla, Satya Narayan, et autres
Publié: (2021)
par: Shukla, Satya Narayan, et autres
Publié: (2021)
Enhancing Adaptive Behavioral Interventions with LLM Inference from Participant-Described States
par: Karine, Karine, et autres
Publié: (2025)
par: Karine, Karine, et autres
Publié: (2025)
Strategically Deceptive Model Deployment in Performative Prediction
par: Bautiste, Javier Sanguino, et autres
Publié: (2025)
par: Bautiste, Javier Sanguino, et autres
Publié: (2025)
Detecting Strategic Deception Using Linear Probes
par: Goldowsky-Dill, Nicholas, et autres
Publié: (2025)
par: Goldowsky-Dill, Nicholas, et autres
Publié: (2025)
To Start Up a Start-Up$-$Embedding Strategic Demand Development in Operational On-Demand Fulfillment via Reinforcement Learning with Information Shaping
par: Chen, Xinwei, et autres
Publié: (2025)
par: Chen, Xinwei, et autres
Publié: (2025)
PromptAudit: Auditing Prompt Sensitivity in LLM-Based Vulnerability Detection
par: Camarato, Steffen J., et autres
Publié: (2026)
par: Camarato, Steffen J., et autres
Publié: (2026)
BOTS: Batch Bayesian Optimization of Extended Thompson Sampling for Severely Episode-Limited RL Settings
par: Karine, Karine, et autres
Publié: (2024)
par: Karine, Karine, et autres
Publié: (2024)
Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts
par: Wu, Zhaomin, et autres
Publié: (2025)
par: Wu, Zhaomin, et autres
Publié: (2025)
REBAR: Retrieval-Based Reconstruction for Time-series Contrastive Learning
par: Xu, Maxwell A., et autres
Publié: (2023)
par: Xu, Maxwell A., et autres
Publié: (2023)
Strategic Hypothesis Testing
par: Hossain, Safwan, et autres
Publié: (2025)
par: Hossain, Safwan, et autres
Publié: (2025)
Differentially Private Auditing Under Strategic Response
par: Burnat, Florian A. D.
Publié: (2026)
par: Burnat, Florian A. D.
Publié: (2026)
Temporally Multi-Scale Sparse Self-Attention for Physical Activity Data Imputation
par: Wei, Hui, et autres
Publié: (2024)
par: Wei, Hui, et autres
Publié: (2024)
Detecting Proxy Gaming in RL and LLM Alignment via Evaluator Stress Tests
par: Shihab, Ibne Farabi, et autres
Publié: (2025)
par: Shihab, Ibne Farabi, et autres
Publié: (2025)
When Thinking LLMs Lie: Unveiling the Strategic Deception in Representations of Reasoning Models
par: Wang, Kai, et autres
Publié: (2025)
par: Wang, Kai, et autres
Publié: (2025)
Targeted Tests for LLM Reasoning: An Audit-Constrained Protocol
par: Li, Hongmin
Publié: (2026)
par: Li, Hongmin
Publié: (2026)
An Auditing Test To Detect Behavioral Shift in Language Models
par: Richter, Leo, et autres
Publié: (2024)
par: Richter, Leo, et autres
Publié: (2024)
Pressure-Testing Deception Probes in LLMs: Scaling, Robustness, and the Geometry of Deceptive Representations
par: Kumar, Sachin
Publié: (2026)
par: Kumar, Sachin
Publié: (2026)
Evaluating LLM Safety Under Repeated Inference via Accelerated Prompt Stress Testing
par: Broadwater, Keita
Publié: (2026)
par: Broadwater, Keita
Publié: (2026)
Auditing Prompt Caching in Language Model APIs
par: Gu, Chenchen, et autres
Publié: (2025)
par: Gu, Chenchen, et autres
Publié: (2025)
CacheProbe: Auditing Prompt Cache Isolation in Gateway APIs
par: Fahey, Ryan
Publié: (2026)
par: Fahey, Ryan
Publié: (2026)
Deception Detection: From Static Texts to Multimodal Signals
par: Logan, Mandela
Publié: (2025)
par: Logan, Mandela
Publié: (2025)
Contextual Chart Generation for Cyber Deception
par: Nguyen, David D., et autres
Publié: (2024)
par: Nguyen, David D., et autres
Publié: (2024)
Gaming the Metric, Not the Harm: Certifying Safety Audits against Strategic Platform Manipulation
par: Burnat, Florian A. D., et autres
Publié: (2026)
par: Burnat, Florian A. D., et autres
Publié: (2026)
H-FLTN: A Privacy-Preserving Hierarchical Framework for Electric Vehicle Spatio-Temporal Charge Prediction
par: Marlin, Robert, et autres
Publié: (2025)
par: Marlin, Robert, et autres
Publié: (2025)
Deceptive Exploration in Multi-armed Bandits
par: Vurankaya, I. Arda, et autres
Publié: (2025)
par: Vurankaya, I. Arda, et autres
Publié: (2025)
To Align or Not to Align: Strategic Multimodal Representation Alignment for Optimal Performance
par: Fang, Wanlong, et autres
Publié: (2025)
par: Fang, Wanlong, et autres
Publié: (2025)
On the Contractivity of Stochastic Interpolation Flow
par: Daniels, Mara
Publié: (2025)
par: Daniels, Mara
Publié: (2025)
A lightweight Spatial-Temporal Graph Neural Network for Long-term Time Series Forecasting
par: Moges, Henok Tenaw, et autres
Publié: (2025)
par: Moges, Henok Tenaw, et autres
Publié: (2025)
CoT Red-Handed: Stress Testing Chain-of-Thought Monitoring
par: Arnav, Benjamin, et autres
Publié: (2025)
par: Arnav, Benjamin, et autres
Publié: (2025)
Instance-Level Data-Use Auditing of Visual ML Models
par: Huang, Zonghao, et autres
Publié: (2025)
par: Huang, Zonghao, et autres
Publié: (2025)
Stress-Testing Capability Elicitation With Password-Locked Models
par: Greenblatt, Ryan, et autres
Publié: (2024)
par: Greenblatt, Ryan, et autres
Publié: (2024)
Reinforcement Learning for High-Level Strategic Control in Tower Defense Games
par: Bergdahl, Joakim, et autres
Publié: (2024)
par: Bergdahl, Joakim, et autres
Publié: (2024)
A note on the VC dimension of 1-dimensional GNNs
par: Daniëls, Noah, et autres
Publié: (2024)
par: Daniëls, Noah, et autres
Publié: (2024)
Contextual StereoSet: Stress-Testing Bias Alignment Robustness in Large Language Models
par: Basu, Abhinaba, et autres
Publié: (2026)
par: Basu, Abhinaba, et autres
Publié: (2026)
SWAP: Towards Copyright Auditing of Soft Prompts via Sequential Watermarking
par: Yang, Wenyuan, et autres
Publié: (2025)
par: Yang, Wenyuan, et autres
Publié: (2025)
Documents similaires
-
Exploration Hacking: Can LLMs Learn to Resist RL Training?
par: Jang, Eyon, et autres
Publié: (2026) -
Multi-State-Action Tokenisation in Decision Transformers for Multi-Discrete Action Spaces
par: Moodley, Perusha, et autres
Publié: (2024) -
ACE and Diverse Generalization via Selective Disagreement
par: Daniels, Oliver, et autres
Publié: (2025) -
Combining LLM decision and RL action selection to improve RL policy for adaptive interventions
par: Karine, Karine, et autres
Publié: (2025) -
StepCountJITAI: simulation environment for RL with application to physical activity adaptive intervention
par: Karine, Karine, et autres
Publié: (2024)