The Alignment Problem from a Deep Learning Perspective
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ngo, Richard, Chan, Lawrence, Mindermann, Sören |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Probabilistic Modeling of Latent Agentic Substructures in Deep Neural Networks
par: Lee, Su Hyeong, et autres
Publié: (2025)
par: Lee, Su Hyeong, et autres
Publié: (2025)
Preference Learning for AI Alignment: a Causal Perspective
par: Kobalczyk, Katarzyna, et autres
Publié: (2025)
par: Kobalczyk, Katarzyna, et autres
Publié: (2025)
The Autonomy-Alignment Problem in Open-Ended Learning Robots: Formalising the Purpose Framework
par: Baldassarre, Gianluca, et autres
Publié: (2024)
par: Baldassarre, Gianluca, et autres
Publié: (2024)
Agentic Misalignment: How LLMs Could Be Insider Threats
par: Lynch, Aengus, et autres
Publié: (2025)
par: Lynch, Aengus, et autres
Publié: (2025)
How Deep is your Guess? A Fresh Perspective on Deep Learning for Medical Time-Series Imputation
par: Qian, Linglong, et autres
Publié: (2024)
par: Qian, Linglong, et autres
Publié: (2024)
Deep Learning for Modeling and Dispatching Hybrid Wind Farm Power Generation
par: Lawrence, Zach, et autres
Publié: (2025)
par: Lawrence, Zach, et autres
Publié: (2025)
Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment
par: An, Zhiyu, et autres
Publié: (2026)
par: An, Zhiyu, et autres
Publié: (2026)
Alignment faking in large language models
par: Greenblatt, Ryan, et autres
Publié: (2024)
par: Greenblatt, Ryan, et autres
Publié: (2024)
Is Exploration or Optimization the Problem for Deep Reinforcement Learning?
par: Berseth, Glen
Publié: (2025)
par: Berseth, Glen
Publié: (2025)
The Disagreement Problem in Explainable Machine Learning: A Practitioner's Perspective
par: Krishna, Satyapriya, et autres
Publié: (2022)
par: Krishna, Satyapriya, et autres
Publié: (2022)
Impartial Games: A Challenge for Reinforcement Learning
par: Zhou, Bei, et autres
Publié: (2022)
par: Zhou, Bei, et autres
Publié: (2022)
Deep Reinforcement Learning for Picker Routing Problem in Warehousing
par: Dunn, George, et autres
Publié: (2024)
par: Dunn, George, et autres
Publié: (2024)
Machine Learning Systems: A Survey from a Data-Oriented Perspective
par: Cabrera, Christian, et autres
Publié: (2023)
par: Cabrera, Christian, et autres
Publié: (2023)
AISSISTANT: Human-AI Collaborative Review and Perspective Research Workflows in Data Science
par: Gaddipati, Sasi Kiran, et autres
Publié: (2025)
par: Gaddipati, Sasi Kiran, et autres
Publié: (2025)
Open Problems in Machine Unlearning for AI Safety
par: Barez, Fazl, et autres
Publié: (2025)
par: Barez, Fazl, et autres
Publié: (2025)
Integral Signatures of Activation Functions: A 9-Dimensional Taxonomy and Stability Theory for Deep Learning
par: Mali, Ankur, et autres
Publié: (2025)
par: Mali, Ankur, et autres
Publié: (2025)
Spatial-Aware Deep Reinforcement Learning for the Traveling Officer Problem
par: Strauß, Niklas, et autres
Publié: (2024)
par: Strauß, Niklas, et autres
Publié: (2024)
Structure in Deep Reinforcement Learning: A Survey and Open Problems
par: Mohan, Aditya, et autres
Publié: (2023)
par: Mohan, Aditya, et autres
Publié: (2023)
Towards One Model for Classical Dimensionality Reduction: A Probabilistic Perspective on UMAP and t-SNE
par: Ravuri, Aditya, et autres
Publié: (2024)
par: Ravuri, Aditya, et autres
Publié: (2024)
Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
par: Kong, Deyang, et autres
Publié: (2025)
par: Kong, Deyang, et autres
Publié: (2025)
Dissecting Quantization Error: A Concentration-Alignment Perspective
par: Federici, Marco, et autres
Publié: (2026)
par: Federici, Marco, et autres
Publié: (2026)
Superintelligent Agents Pose Catastrophic Risks: Can Scientist AI Offer a Safer Path?
par: Bengio, Yoshua, et autres
Publié: (2025)
par: Bengio, Yoshua, et autres
Publié: (2025)
Multi-objective Reinforcement Learning: A Tool for Pluralistic Alignment
par: Vamplew, Peter, et autres
Publié: (2024)
par: Vamplew, Peter, et autres
Publié: (2024)
Diversity Optimization for Travelling Salesman Problem via Deep Reinforcement Learning
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
Generative Modeling for Robust Deep Reinforcement Learning on the Traveling Salesman Problem
par: Li, Michael, et autres
Publié: (2025)
par: Li, Michael, et autres
Publié: (2025)
Rethinking Inverse Reinforcement Learning: from Data Alignment to Task Alignment
par: Zhou, Weichao, et autres
Publié: (2024)
par: Zhou, Weichao, et autres
Publié: (2024)
Mathematical Models of Computation in Superposition
par: Hänni, Kaarel, et autres
Publié: (2024)
par: Hänni, Kaarel, et autres
Publié: (2024)
A Probabilistic Perspective on Unlearning and Alignment for Large Language Models
par: Scholten, Yan, et autres
Publié: (2024)
par: Scholten, Yan, et autres
Publié: (2024)
Predicting Preschoolers' Externalizing Problems with Mother-Child Interaction Dynamics and Deep Learning
par: Chen, Xi, et autres
Publié: (2024)
par: Chen, Xi, et autres
Publié: (2024)
Level Up: Defining and Exploiting Transitional Problems for Curriculum Learning
par: Tang, Zhenwei, et autres
Publié: (2026)
par: Tang, Zhenwei, et autres
Publié: (2026)
Unifying Perplexing Behaviors in Modified BP Attributions through Alignment Perspective
par: Zheng, Guanhua, et autres
Publié: (2025)
par: Zheng, Guanhua, et autres
Publié: (2025)
Reward Shaping for Inference-Time Alignment: A Stackelberg Game Perspective
par: Wang, Haichuan, et autres
Publié: (2026)
par: Wang, Haichuan, et autres
Publié: (2026)
Multimodal Deep Learning for Low-Resource Settings: A Vector Embedding Alignment Approach for Healthcare Applications
par: Restrepo, David, et autres
Publié: (2024)
par: Restrepo, David, et autres
Publié: (2024)
Modular addition without black-boxes: Compressing explanations of MLPs that compute numerical integration
par: Yip, Chun Hei, et autres
Publié: (2024)
par: Yip, Chun Hei, et autres
Publié: (2024)
A Unified Deep Reinforcement Learning Approach for Close Enough Traveling Salesman Problem
par: Fan, Mingfeng, et autres
Publié: (2025)
par: Fan, Mingfeng, et autres
Publié: (2025)
An End-to-End Deep Reinforcement Learning Approach for Solving the Traveling Salesman Problem with Drones
par: Zeng, Taihelong, et autres
Publié: (2025)
par: Zeng, Taihelong, et autres
Publié: (2025)
Deep Reinforcement Learning for Solving Management Problems: Towards A Large Management Mode
par: Jiang, Jinyang, et autres
Publié: (2024)
par: Jiang, Jinyang, et autres
Publié: (2024)
A Curriculum-Based Deep Reinforcement Learning Framework for the Electric Vehicle Routing Problem
par: Daysalilar, Mertcan, et autres
Publié: (2026)
par: Daysalilar, Mertcan, et autres
Publié: (2026)
The DeepXube Software Package for Solving Pathfinding Problems with Learned Heuristic Functions and Search
par: Agostinelli, Forest
Publié: (2026)
par: Agostinelli, Forest
Publié: (2026)
Applying Time Series Deep Learning Models to Forecast the Growth of Perennial Ryegrass in Ireland
par: Onibonoje, Oluwadurotimi, et autres
Publié: (2025)
par: Onibonoje, Oluwadurotimi, et autres
Publié: (2025)
Documents similaires
-
Probabilistic Modeling of Latent Agentic Substructures in Deep Neural Networks
par: Lee, Su Hyeong, et autres
Publié: (2025) -
Preference Learning for AI Alignment: a Causal Perspective
par: Kobalczyk, Katarzyna, et autres
Publié: (2025) -
The Autonomy-Alignment Problem in Open-Ended Learning Robots: Formalising the Purpose Framework
par: Baldassarre, Gianluca, et autres
Publié: (2024) -
Agentic Misalignment: How LLMs Could Be Insider Threats
par: Lynch, Aengus, et autres
Publié: (2025) -
How Deep is your Guess? A Fresh Perspective on Deep Learning for Medical Time-Series Imputation
par: Qian, Linglong, et autres
Publié: (2024)