Via Negativa for AI Alignment: Why Negative Constraints Are Structurally Superior to Positive Preferences
Fuente:
arXiv
Guardado en:
| Autor principal: | Cheng, Quan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Semantic Gravity Wells: Why Negative Constraints Backfire
por: Rana, Shailesh
Publicado: (2026)
por: Rana, Shailesh
Publicado: (2026)
Beyond Preferences in AI Alignment
por: Zhi-Xuan, Tan, et al.
Publicado: (2024)
por: Zhi-Xuan, Tan, et al.
Publicado: (2024)
Why the Valuable Capabilities of LLMs Are Precisely the Unexplainable Ones
por: Cheng, Quan
Publicado: (2026)
por: Cheng, Quan
Publicado: (2026)
Beyond Ordinal Preferences: Why Alignment Needs Cardinal Human Feedback
por: Whitfill, Parker, et al.
Publicado: (2025)
por: Whitfill, Parker, et al.
Publicado: (2025)
Why AI Alignment Failure Is Structural: Learned Human Interaction Structures and AGI as an Endogenous Evolutionary Shock
por: Sornette, Didier, et al.
Publicado: (2026)
por: Sornette, Didier, et al.
Publicado: (2026)
Alignment Revisited: Are Large Language Models Consistent in Stated and Revealed Preferences?
por: Gu, Zhuojun, et al.
Publicado: (2025)
por: Gu, Zhuojun, et al.
Publicado: (2025)
On Diversified Preferences of Large Language Model Alignment
por: Zeng, Dun, et al.
Publicado: (2023)
por: Zeng, Dun, et al.
Publicado: (2023)
Preference Learning for AI Alignment: a Causal Perspective
por: Kobalczyk, Katarzyna, et al.
Publicado: (2025)
por: Kobalczyk, Katarzyna, et al.
Publicado: (2025)
HPS: Hard Preference Sampling for Human Preference Alignment
por: Zou, Xiandong, et al.
Publicado: (2025)
por: Zou, Xiandong, et al.
Publicado: (2025)
FlipGuard: Defending Preference Alignment against Update Regression with Constrained Optimization
por: Zhu, Mingye, et al.
Publicado: (2024)
por: Zhu, Mingye, et al.
Publicado: (2024)
Strong Preferences Affect the Robustness of Preference Models and Value Alignment
por: Xu, Ziwei, et al.
Publicado: (2024)
por: Xu, Ziwei, et al.
Publicado: (2024)
On Negative-aware Preference Optimization for Recommendation
por: Ding, Chenlu, et al.
Publicado: (2025)
por: Ding, Chenlu, et al.
Publicado: (2025)
Negating Negatives: Alignment with Human Negative Samples via Distributional Dispreference Optimization
por: Duan, Shitong, et al.
Publicado: (2024)
por: Duan, Shitong, et al.
Publicado: (2024)
Unified Preference Optimization: Language Model Alignment Beyond the Preference Frontier
por: Badrinath, Anirudhan, et al.
Publicado: (2024)
por: Badrinath, Anirudhan, et al.
Publicado: (2024)
Alignment Imprint: Zero-Shot AI-Generated Text Detection via Provable Preference Discrepancy
por: Wu, Junxi, et al.
Publicado: (2026)
por: Wu, Junxi, et al.
Publicado: (2026)
A Revealed Preference Framework for AI Alignment
por: Suleymanov, Elchin
Publicado: (2026)
por: Suleymanov, Elchin
Publicado: (2026)
Position: Safety and Fairness in Agentic AI Depend on Interaction Topology, Not on Model Scale or Alignment
por: Bajaj, Tanav Singh, et al.
Publicado: (2026)
por: Bajaj, Tanav Singh, et al.
Publicado: (2026)
Adaptive Helpfulness-Harmlessness Alignment with Preference Vectors
por: Liang, Ren-Wei, et al.
Publicado: (2025)
por: Liang, Ren-Wei, et al.
Publicado: (2025)
Implicit Safety Alignment from Crowd Preferences
por: Lin, Qian, et al.
Publicado: (2026)
por: Lin, Qian, et al.
Publicado: (2026)
Architectural Constraints Alignment in AI-assisted, Platform-based Service Development
por: Irion, Julius, et al.
Publicado: (2026)
por: Irion, Julius, et al.
Publicado: (2026)
Position: Towards Bidirectional Human-AI Alignment
por: Shen, Hua, et al.
Publicado: (2024)
por: Shen, Hua, et al.
Publicado: (2024)
Direct Alignment with Heterogeneous Preferences
por: Shirali, Ali, et al.
Publicado: (2025)
por: Shirali, Ali, et al.
Publicado: (2025)
Why AI Safety Requires Uncertainty, Incomplete Preferences, and Non-Archimedean Utilities
por: Benavoli, Alessio, et al.
Publicado: (2025)
por: Benavoli, Alessio, et al.
Publicado: (2025)
Out of Control -- Why Alignment Needs Formal Control Theory (and an Alignment Control Stack)
por: Perrier, Elija
Publicado: (2025)
por: Perrier, Elija
Publicado: (2025)
ConstraintBench: Benchmarking LLM Constraint Reasoning on Direct Optimization
por: Tso, Joseph, et al.
Publicado: (2026)
por: Tso, Joseph, et al.
Publicado: (2026)
Implicit Preference Alignment for Human Image Animation
por: Wang, Yuanzhi, et al.
Publicado: (2026)
por: Wang, Yuanzhi, et al.
Publicado: (2026)
Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models
por: Wang, Boxuan, et al.
Publicado: (2025)
por: Wang, Boxuan, et al.
Publicado: (2025)
Word Alignment as Preference for Machine Translation
por: Wu, Qiyu, et al.
Publicado: (2024)
por: Wu, Qiyu, et al.
Publicado: (2024)
Preference Ranking Optimization for Human Alignment
por: Song, Feifan, et al.
Publicado: (2023)
por: Song, Feifan, et al.
Publicado: (2023)
Disentangling Preference Representation and Text Generation for Efficient Individual Preference Alignment
por: Zhang, Jianfei, et al.
Publicado: (2024)
por: Zhang, Jianfei, et al.
Publicado: (2024)
Position: Assistive Agents Need Accessibility Alignment
por: Hu, Jie, et al.
Publicado: (2026)
por: Hu, Jie, et al.
Publicado: (2026)
Adaptive Alignment: Dynamic Preference Adjustments via Multi-Objective Reinforcement Learning for Pluralistic AI
por: Harland, Hadassah, et al.
Publicado: (2024)
por: Harland, Hadassah, et al.
Publicado: (2024)
Correcting Negative Bias in Large Language Models through Negative Attention Score Alignment
por: Yu, Sangwon, et al.
Publicado: (2024)
por: Yu, Sangwon, et al.
Publicado: (2024)
ClinAlign: Scaling Healthcare Alignment from Clinician Preference
por: Lyu, Shiwei, et al.
Publicado: (2026)
por: Lyu, Shiwei, et al.
Publicado: (2026)
Improving Safety Alignment via Balanced Direct Preference Optimization
por: Zhao, Shiji, et al.
Publicado: (2026)
por: Zhao, Shiji, et al.
Publicado: (2026)
The Anatomy of Alignment: Decomposing Preference Optimization by Steering Sparse Features
por: Ferrao, Jeremias, et al.
Publicado: (2025)
por: Ferrao, Jeremias, et al.
Publicado: (2025)
Graph Unlearning Meets Influence-aware Negative Preference Optimization
por: Chen, Qiang, et al.
Publicado: (2025)
por: Chen, Qiang, et al.
Publicado: (2025)
Balancing Safety and Helpfulness in Healthcare AI Assistants through Iterative Preference Alignment
por: Nghiem, Huy, et al.
Publicado: (2025)
por: Nghiem, Huy, et al.
Publicado: (2025)
Negative as Positive: Enhancing Out-of-distribution Generalization for Graph Contrastive Learning
por: Wang, Zixu, et al.
Publicado: (2024)
por: Wang, Zixu, et al.
Publicado: (2024)
Adversarial Preference Learning for Robust LLM Alignment
por: Wang, Yuanfu, et al.
Publicado: (2025)
por: Wang, Yuanfu, et al.
Publicado: (2025)
Ejemplares similares
-
Semantic Gravity Wells: Why Negative Constraints Backfire
por: Rana, Shailesh
Publicado: (2026) -
Beyond Preferences in AI Alignment
por: Zhi-Xuan, Tan, et al.
Publicado: (2024) -
Why the Valuable Capabilities of LLMs Are Precisely the Unexplainable Ones
por: Cheng, Quan
Publicado: (2026) -
Beyond Ordinal Preferences: Why Alignment Needs Cardinal Human Feedback
por: Whitfill, Parker, et al.
Publicado: (2025) -
Why AI Alignment Failure Is Structural: Learned Human Interaction Structures and AGI as an Endogenous Evolutionary Shock
por: Sornette, Didier, et al.
Publicado: (2026)