Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulation
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Chenkai, Zhang, Denghui, Zhai, ChengXiang, Ji, Heng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TinyHelen's First Curriculum: Training and Evaluating Tiny Language Models in a Simpler Language Environment
por: Yang, Ke, et al.
Publicado: (2024)
por: Yang, Ke, et al.
Publicado: (2024)
Persona-DB: Efficient Large Language Model Personalization for Response Prediction with Collaborative Data Refinement
por: Sun, Chenkai, et al.
Publicado: (2024)
por: Sun, Chenkai, et al.
Publicado: (2024)
An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems
por: Hao, Yuren, et al.
Publicado: (2025)
por: Hao, Yuren, et al.
Publicado: (2025)
User Simulation for Evaluating Information Access Systems
por: Balog, Krisztian, et al.
Publicado: (2023)
por: Balog, Krisztian, et al.
Publicado: (2023)
The Indispensable Role of User Simulation in the Pursuit of AGI
por: Balog, Krisztian, et al.
Publicado: (2025)
por: Balog, Krisztian, et al.
Publicado: (2025)
User Simulation in the Era of Generative AI: User Modeling, Synthetic Data Generation, and System Evaluation
por: Balog, Krisztian, et al.
Publicado: (2025)
por: Balog, Krisztian, et al.
Publicado: (2025)
User Preference Modeling for Conversational LLM Agents: Weak Rewards from Retrieval-Augmented Interaction
por: Hao, Yuren, et al.
Publicado: (2026)
por: Hao, Yuren, et al.
Publicado: (2026)
R-Judge: Benchmarking Safety Risk Awareness for LLM Agents
por: Yuan, Tongxin, et al.
Publicado: (2024)
por: Yuan, Tongxin, et al.
Publicado: (2024)
Evaluating and Improving Cultural Awareness of Reward Models for LLM Alignment
por: Zhang, Hongbin, et al.
Publicado: (2025)
por: Zhang, Hongbin, et al.
Publicado: (2025)
PlugMem: A Task-Agnostic Plugin Memory Module for LLM Agents
por: Yang, Ke, et al.
Publicado: (2026)
por: Yang, Ke, et al.
Publicado: (2026)
Synthetic Computers at Scale for Long-Horizon Productivity Simulation
por: Ge, Tao, et al.
Publicado: (2026)
por: Ge, Tao, et al.
Publicado: (2026)
Safety Is Not Universal: The Selective Safety Trap in LLM Alignment
por: Brito, Iago Alves, et al.
Publicado: (2026)
por: Brito, Iago Alves, et al.
Publicado: (2026)
Sensitivity Meets Sparsity: The Impact of Extremely Sparse Parameter Patterns on Theory-of-Mind of Large Language Models
por: Wu, Yuheng, et al.
Publicado: (2025)
por: Wu, Yuheng, et al.
Publicado: (2025)
Preference-Aware Memory Update for Long-Term LLM Agents
por: Sun, Haoran, et al.
Publicado: (2025)
por: Sun, Haoran, et al.
Publicado: (2025)
Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment
por: Cheng, Zehua, et al.
Publicado: (2026)
por: Cheng, Zehua, et al.
Publicado: (2026)
Globally Optimal Training of Spiking Neural Networks via Parameter Reconstruction
por: Udupi, Himanshu, et al.
Publicado: (2026)
por: Udupi, Himanshu, et al.
Publicado: (2026)
Efficient Knowledge Infusion via KG-LLM Alignment
por: Jiang, Zhouyu, et al.
Publicado: (2024)
por: Jiang, Zhouyu, et al.
Publicado: (2024)
HorizonBench: Long-Horizon Personalization with Evolving Preferences
por: Li, Shuyue Stella, et al.
Publicado: (2026)
por: Li, Shuyue Stella, et al.
Publicado: (2026)
Searching for Privacy Risks in LLM Agents via Simulation
por: Zhang, Yanzhe, et al.
Publicado: (2025)
por: Zhang, Yanzhe, et al.
Publicado: (2025)
Causal Intervention-Based Memory Selection for Long-Horizon LLM Agents
por: Srivastava, Saksham Sahai
Publicado: (2026)
por: Srivastava, Saksham Sahai
Publicado: (2026)
Cooperative Memory Paging with Keyword Bookmarks for Long-Horizon LLM Conversations
por: Liu, Ziyang
Publicado: (2026)
por: Liu, Ziyang
Publicado: (2026)
Context Engineering for Trustworthiness: Rescorla Wagner Steering Under Mixed and Inappropriate Contexts
por: Wang, Rushi, et al.
Publicado: (2025)
por: Wang, Rushi, et al.
Publicado: (2025)
Measuring Copyright Risks of Large Language Model via Partial Information Probing
por: Zhao, Weijie, et al.
Publicado: (2024)
por: Zhao, Weijie, et al.
Publicado: (2024)
Ten Principles of AI Agent Economics
por: Yang, Ke, et al.
Publicado: (2025)
por: Yang, Ke, et al.
Publicado: (2025)
Computation Mechanism Behind LLM Position Generalization
por: Han, Chi, et al.
Publicado: (2025)
por: Han, Chi, et al.
Publicado: (2025)
LongSafety: Evaluating Long-Context Safety of Large Language Models
por: Lu, Yida, et al.
Publicado: (2025)
por: Lu, Yida, et al.
Publicado: (2025)
PMMT: Preference Alignment in Multilingual Machine Translation via LLM Distillation
por: Sun, Shuqiao, et al.
Publicado: (2024)
por: Sun, Shuqiao, et al.
Publicado: (2024)
Beyond Single-Point Judgment: Distribution Alignment for LLM-as-a-Judge
por: Chen, Luyu, et al.
Publicado: (2025)
por: Chen, Luyu, et al.
Publicado: (2025)
UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios
por: Luo, Haotian, et al.
Publicado: (2025)
por: Luo, Haotian, et al.
Publicado: (2025)
ReFlect: An Effective Harness System for Complex Long-Horizon LLM Reasoning
por: Huang, Fan
Publicado: (2026)
por: Huang, Fan
Publicado: (2026)
LLM Probability Concentration: How Alignment Shrinks the Generative Horizon
por: Yang, Chenghao, et al.
Publicado: (2025)
por: Yang, Chenghao, et al.
Publicado: (2025)
Safety Alignment via Constrained Knowledge Unlearning
por: Shi, Zesheng, et al.
Publicado: (2025)
por: Shi, Zesheng, et al.
Publicado: (2025)
Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL
por: Gao, Jiaxuan, et al.
Publicado: (2025)
por: Gao, Jiaxuan, et al.
Publicado: (2025)
DEL-ToM: Inference-Time Scaling for Theory-of-Mind Reasoning via Dynamic Epistemic Logic
por: Wu, Yuheng, et al.
Publicado: (2025)
por: Wu, Yuheng, et al.
Publicado: (2025)
RAT: Retrieval Augmented Thoughts Elicit Context-Aware Reasoning in Long-Horizon Generation
por: Wang, Zihao, et al.
Publicado: (2024)
por: Wang, Zihao, et al.
Publicado: (2024)
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
por: Yang, Junxiao, et al.
Publicado: (2026)
por: Yang, Junxiao, et al.
Publicado: (2026)
LLaMAX: Scaling Linguistic Horizons of LLM by Enhancing Translation Capabilities Beyond 100 Languages
por: Lu, Yinquan, et al.
Publicado: (2024)
por: Lu, Yinquan, et al.
Publicado: (2024)
MAGE: Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory
por: Wang, Yuhui, et al.
Publicado: (2026)
por: Wang, Yuhui, et al.
Publicado: (2026)
REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search Agents
por: Chu, Zheng, et al.
Publicado: (2026)
por: Chu, Zheng, et al.
Publicado: (2026)
SafeCRS: Personalized Safety Alignment for LLM-Based Conversational Recommender Systems
por: Hao, Haochang, et al.
Publicado: (2026)
por: Hao, Haochang, et al.
Publicado: (2026)
Ejemplares similares
-
TinyHelen's First Curriculum: Training and Evaluating Tiny Language Models in a Simpler Language Environment
por: Yang, Ke, et al.
Publicado: (2024) -
Persona-DB: Efficient Large Language Model Personalization for Response Prediction with Collaborative Data Refinement
por: Sun, Chenkai, et al.
Publicado: (2024) -
An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems
por: Hao, Yuren, et al.
Publicado: (2025) -
User Simulation for Evaluating Information Access Systems
por: Balog, Krisztian, et al.
Publicado: (2023) -
The Indispensable Role of User Simulation in the Pursuit of AGI
por: Balog, Krisztian, et al.
Publicado: (2025)