Epistemic Traps: Rational Misalignment Driven by Model Misspecification
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Xingcheng, Qu, Jingjing, Zhang, Qiaosheng, Lu, Chaochao, Yang, Yanqing, Zou, Na, Hu, Xia |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
KALE: Enhancing Knowledge Manipulation in Large Language Models via Knowledge-aware Learning
di: Lv, Qitan, et al.
Pubblicazione: (2026)
di: Lv, Qitan, et al.
Pubblicazione: (2026)
RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning
di: Wei, Zeming, et al.
Pubblicazione: (2026)
di: Wei, Zeming, et al.
Pubblicazione: (2026)
SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces
di: Jin, Chang, et al.
Pubblicazione: (2026)
di: Jin, Chang, et al.
Pubblicazione: (2026)
MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety
di: Wen, Xiaoyu, et al.
Pubblicazione: (2026)
di: Wen, Xiaoyu, et al.
Pubblicazione: (2026)
The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models
di: Xu, Xingcheng
Pubblicazione: (2025)
di: Xu, Xingcheng
Pubblicazione: (2025)
Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models
di: Bao, Yicheng, et al.
Pubblicazione: (2026)
di: Bao, Yicheng, et al.
Pubblicazione: (2026)
Principled Understanding of Generalization for Generative Transformer Models in Arithmetic Reasoning Tasks
di: Xu, Xingcheng, et al.
Pubblicazione: (2024)
di: Xu, Xingcheng, et al.
Pubblicazione: (2024)
It Ain't That Bad: Understanding the Mysterious Performance Drop in OOD Generalization for Generative Transformer Models
di: Xu, Xingcheng, et al.
Pubblicazione: (2023)
di: Xu, Xingcheng, et al.
Pubblicazione: (2023)
Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
di: He, Zhida, et al.
Pubblicazione: (2026)
di: He, Zhida, et al.
Pubblicazione: (2026)
TrinityGuard: A Unified Framework for Safeguarding Multi-Agent Systems
di: Wang, Kai, et al.
Pubblicazione: (2026)
di: Wang, Kai, et al.
Pubblicazione: (2026)
CauScientist: Teaching LLMs to Respect Data for Causal Discovery
di: Peng, Bo, et al.
Pubblicazione: (2026)
di: Peng, Bo, et al.
Pubblicazione: (2026)
Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer
di: Askin, Baris, et al.
Pubblicazione: (2026)
di: Askin, Baris, et al.
Pubblicazione: (2026)
Can Post-Training Transform LLMs into Causal Reasoners?
di: Chen, Junqi, et al.
Pubblicazione: (2026)
di: Chen, Junqi, et al.
Pubblicazione: (2026)
Are More Tokens Rational? Inference-Time Scaling in Language Models as Adaptive Resource Rationality
di: Hu, Zhimin, et al.
Pubblicazione: (2026)
di: Hu, Zhimin, et al.
Pubblicazione: (2026)
RLHS: Mitigating Misalignment in RLHF with Hindsight Simulation
di: Liang, Kaiqu, et al.
Pubblicazione: (2025)
di: Liang, Kaiqu, et al.
Pubblicazione: (2025)
Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models
di: Chua, James, et al.
Pubblicazione: (2025)
di: Chua, James, et al.
Pubblicazione: (2025)
RePO: Replay-Enhanced Policy Optimization
di: Li, Siheng, et al.
Pubblicazione: (2025)
di: Li, Siheng, et al.
Pubblicazione: (2025)
Ulterior Motives: Detecting Misaligned Reasoning in Continuous Thought Models
di: Ramjee, Sharan
Pubblicazione: (2026)
di: Ramjee, Sharan
Pubblicazione: (2026)
Towards AI-$45^{\circ}$ Law: A Roadmap to Trustworthy AGI
di: Yang, Chao, et al.
Pubblicazione: (2024)
di: Yang, Chao, et al.
Pubblicazione: (2024)
Persona-Model Collapse in Emergent Misalignment
di: Costa, Davi Bastos, et al.
Pubblicazione: (2026)
di: Costa, Davi Bastos, et al.
Pubblicazione: (2026)
CLEAR: Can Language Models Really Understand Causal Graphs?
di: Chen, Sirui, et al.
Pubblicazione: (2024)
di: Chen, Sirui, et al.
Pubblicazione: (2024)
ESI: Epistemic Uncertainty Quantification via Semantic-preserving Intervention for Large Language Models
di: Li, Mingda, et al.
Pubblicazione: (2025)
di: Li, Mingda, et al.
Pubblicazione: (2025)
Decoupled Reasoning with Implicit Fact Tokens (DRIFT): A Dual-Model Framework for Efficient Long-Context Inference
di: Xie, Wenxuan, et al.
Pubblicazione: (2026)
di: Xie, Wenxuan, et al.
Pubblicazione: (2026)
Beyond Surface Structure: A Causal Assessment of LLMs' Comprehension Ability
di: Han, Yujin, et al.
Pubblicazione: (2024)
di: Han, Yujin, et al.
Pubblicazione: (2024)
Causal Evaluation of Language Models
di: Chen, Sirui, et al.
Pubblicazione: (2024)
di: Chen, Sirui, et al.
Pubblicazione: (2024)
Metaphors are a Source of Cross-Domain Misalignment of Large Reasoning Models
di: Hu, Zhibo, et al.
Pubblicazione: (2026)
di: Hu, Zhibo, et al.
Pubblicazione: (2026)
Can We Predict Alignment Before Models Finish Thinking? Towards Monitoring Misaligned Reasoning Models
di: Chan, Yik Siu, et al.
Pubblicazione: (2025)
di: Chan, Yik Siu, et al.
Pubblicazione: (2025)
MAVEN: Multi-Agent Verification-Elaboration Network with In-Step Epistemic Auditing
di: Yao, Yinsheng, et al.
Pubblicazione: (2026)
di: Yao, Yinsheng, et al.
Pubblicazione: (2026)
A Neuro-inspired Interpretation of Unlearning in Large Language Models through Sample-level Unlearning Difficulty
di: Feng, Xiaohua, et al.
Pubblicazione: (2025)
di: Feng, Xiaohua, et al.
Pubblicazione: (2025)
Rational Metareasoning for Large Language Models
di: De Sabbata, C. Nicolò, et al.
Pubblicazione: (2024)
di: De Sabbata, C. Nicolò, et al.
Pubblicazione: (2024)
Interactive Training: Feedback-Driven Neural Network Optimization
di: Zhang, Wentao, et al.
Pubblicazione: (2025)
di: Zhang, Wentao, et al.
Pubblicazione: (2025)
Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation
di: Hahm, Dongyoon, et al.
Pubblicazione: (2025)
di: Hahm, Dongyoon, et al.
Pubblicazione: (2025)
Does Visual Rendering Bypass Tokenization? Investigating Script-Tokenizer Misalignment in Pixel-Based Language Models
di: Susanto, Lucky, et al.
Pubblicazione: (2026)
di: Susanto, Lucky, et al.
Pubblicazione: (2026)
The Devil in the Details: Emergent Misalignment, Format and Coherence in Open-Weights LLMs
di: Dickson, Craig
Pubblicazione: (2025)
di: Dickson, Craig
Pubblicazione: (2025)
Solving Inequality Proofs with Large Language Models
di: Lu, Pan, et al.
Pubblicazione: (2025)
di: Lu, Pan, et al.
Pubblicazione: (2025)
The Flexibility Trap: Why Arbitrary Order Limits Reasoning Potential in Diffusion Language Models
di: Ni, Zanlin, et al.
Pubblicazione: (2026)
di: Ni, Zanlin, et al.
Pubblicazione: (2026)
Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
di: Hu, Shijing, et al.
Pubblicazione: (2025)
di: Hu, Shijing, et al.
Pubblicazione: (2025)
Integration of Large Language Models and Federated Learning
di: Chen, Chaochao, et al.
Pubblicazione: (2023)
di: Chen, Chaochao, et al.
Pubblicazione: (2023)
Epistemic Observability in Language Models
di: Mason, Tony, et al.
Pubblicazione: (2026)
di: Mason, Tony, et al.
Pubblicazione: (2026)
More Bang for the Buck: Process Reward Modeling with Entropy-Driven Uncertainty
di: Cao, Lang, et al.
Pubblicazione: (2025)
di: Cao, Lang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
KALE: Enhancing Knowledge Manipulation in Large Language Models via Knowledge-aware Learning
di: Lv, Qitan, et al.
Pubblicazione: (2026) -
RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning
di: Wei, Zeming, et al.
Pubblicazione: (2026) -
SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces
di: Jin, Chang, et al.
Pubblicazione: (2026) -
MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety
di: Wen, Xiaoyu, et al.
Pubblicazione: (2026) -
The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models
di: Xu, Xingcheng
Pubblicazione: (2025)