Core Safety Values for Provably Corrigible Agents
Fuente:
arXiv
Gespeichert in:
| 1. Verfasser: | Nayebi, Aran |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Intrinsic Barriers and Practical Pathways for Human-AI Alignment: An Agreement-Based Complexity Analysis
von: Nayebi, Aran
Veröffentlicht: (2025)
von: Nayebi, Aran
Veröffentlicht: (2025)
Cooperative Game-Theoretic Credit Assignment for Multi-Agent Policy Gradients via the Core
von: Ji, Mengda, et al.
Veröffentlicht: (2025)
von: Ji, Mengda, et al.
Veröffentlicht: (2025)
Game-Theoretic and Algorithmic Analyses of Multi-Agent Routing under Crossing Costs
von: Hanaka, Tesshu, et al.
Veröffentlicht: (2026)
von: Hanaka, Tesshu, et al.
Veröffentlicht: (2026)
Procedural Fairness in Multi-Agent Bandits
von: Caiata, Joshua, et al.
Veröffentlicht: (2026)
von: Caiata, Joshua, et al.
Veröffentlicht: (2026)
Heterogeneous Multi-Agent Bandits with Parsimonious Hints
von: Mirfakhar, Amirmahdi, et al.
Veröffentlicht: (2025)
von: Mirfakhar, Amirmahdi, et al.
Veröffentlicht: (2025)
Emergent Dominance Hierarchies in Reinforcement Learning Agents
von: Rachum, Ram, et al.
Veröffentlicht: (2024)
von: Rachum, Ram, et al.
Veröffentlicht: (2024)
On the Complexity of Learning to Cooperate with Populations of Socially Rational Agents
von: Loftin, Robert, et al.
Veröffentlicht: (2024)
von: Loftin, Robert, et al.
Veröffentlicht: (2024)
RuleSmith: Multi-Agent LLMs for Automated Game Balancing
von: Zeng, Ziyao, et al.
Veröffentlicht: (2026)
von: Zeng, Ziyao, et al.
Veröffentlicht: (2026)
Learning Bilateral Team Formation in Cooperative Multi-Agent Reinforcement Learning
von: Moslemi, Koorosh, et al.
Veröffentlicht: (2025)
von: Moslemi, Koorosh, et al.
Veröffentlicht: (2025)
Independent RL for Cooperative-Competitive Agents: A Mean-Field Perspective
von: Zaman, Muhammad Aneeq uz, et al.
Veröffentlicht: (2024)
von: Zaman, Muhammad Aneeq uz, et al.
Veröffentlicht: (2024)
Active Evaluation of General Agents: Problem Definition and Comparison of Baseline Algorithms
von: Lanctot, Marc, et al.
Veröffentlicht: (2026)
von: Lanctot, Marc, et al.
Veröffentlicht: (2026)
Multi-Agent Training beyond Zero-Sum with Correlated Equilibrium Meta-Solvers
von: Marris, Luke, et al.
Veröffentlicht: (2021)
von: Marris, Luke, et al.
Veröffentlicht: (2021)
Preference-Based Multi-Agent Reinforcement Learning: Data Coverage and Algorithmic Techniques
von: Zhang, Natalia, et al.
Veröffentlicht: (2024)
von: Zhang, Natalia, et al.
Veröffentlicht: (2024)
A Single Online Agent Can Efficiently Learn Mean Field Games
von: Zhang, Chenyu, et al.
Veröffentlicht: (2024)
von: Zhang, Chenyu, et al.
Veröffentlicht: (2024)
AdaFair-MARL: Enforcing Adaptive Fairness Constraints in Multi-Agent Reinforcement Learning
von: Ekpo, Promise, et al.
Veröffentlicht: (2025)
von: Ekpo, Promise, et al.
Veröffentlicht: (2025)
Socially-Weighted Alignment: A Game-Theoretic Framework for Multi-Agent LLM Systems
von: Mumcu, Furkan, et al.
Veröffentlicht: (2026)
von: Mumcu, Furkan, et al.
Veröffentlicht: (2026)
Mechanism-Based Intelligence (MBI): Differentiable Incentives for Rational Coordination and Guaranteed Alignment in Multi-Agent Systems
von: Grassi, Stefano
Veröffentlicht: (2025)
von: Grassi, Stefano
Veröffentlicht: (2025)
Agent-Temporal Credit Assignment for Optimal Policy Preservation in Sparse Multi-Agent Reinforcement Learning
von: Kapoor, Aditya, et al.
Veröffentlicht: (2024)
von: Kapoor, Aditya, et al.
Veröffentlicht: (2024)
Approval-Based Committee Voting under Incomplete Information
von: Imber, Aviram, et al.
Veröffentlicht: (2021)
von: Imber, Aviram, et al.
Veröffentlicht: (2021)
Computational Social Choice: Parameterized Complexity and Challenges
von: Chen, Jiehua, et al.
Veröffentlicht: (2024)
von: Chen, Jiehua, et al.
Veröffentlicht: (2024)
On the Tractability Landscape of the Conditional Minisum Approval Voting Rule
von: Amanatidis, Georgios, et al.
Veröffentlicht: (2024)
von: Amanatidis, Georgios, et al.
Veröffentlicht: (2024)
Understanding LLM Agent Behaviours via Game Theory: Strategy Recognition, Biases and Multi-Agent Dynamics
von: Huynh, Trung-Kiet, et al.
Veröffentlicht: (2025)
von: Huynh, Trung-Kiet, et al.
Veröffentlicht: (2025)
Game-theoretic LLM: Agent Workflow for Negotiation Games
von: Hua, Wenyue, et al.
Veröffentlicht: (2024)
von: Hua, Wenyue, et al.
Veröffentlicht: (2024)
Provably Convergent Actor-Critic for MARL through Risk-aversion
von: Zhang, Yizhou, et al.
Veröffentlicht: (2026)
von: Zhang, Yizhou, et al.
Veröffentlicht: (2026)
Separation Assurance between Heterogeneous Fleets of Small Unmanned Aerial Systems via Multi-Agent Reinforcement Learning
von: Sharifi, Iman, et al.
Veröffentlicht: (2026)
von: Sharifi, Iman, et al.
Veröffentlicht: (2026)
Online Learning of Counter Categories and Ratings in PvP Games
von: Lin, Chiu-Chou, et al.
Veröffentlicht: (2025)
von: Lin, Chiu-Chou, et al.
Veröffentlicht: (2025)
Learning Mean Field Control on Sparse Graphs
von: Fabian, Christian, et al.
Veröffentlicht: (2025)
von: Fabian, Christian, et al.
Veröffentlicht: (2025)
Reinforcement Learning for Hanabi
von: Cohen, Nina, et al.
Veröffentlicht: (2025)
von: Cohen, Nina, et al.
Veröffentlicht: (2025)
Stackelberg Learning from Human Feedback: Preference Optimization as a Sequential Game
von: Pásztor, Barna, et al.
Veröffentlicht: (2025)
von: Pásztor, Barna, et al.
Veröffentlicht: (2025)
Evaluating LLMs in Open-Source Games
von: Sistla, Swadesh, et al.
Veröffentlicht: (2025)
von: Sistla, Swadesh, et al.
Veröffentlicht: (2025)
Learning to Negotiate via Voluntary Commitment
von: Zhu, Shuhui, et al.
Veröffentlicht: (2025)
von: Zhu, Shuhui, et al.
Veröffentlicht: (2025)
Offline Learning of Nash Stable Coalition Structures with Possibly Overlapping Coalitions
von: Cohen, Saar
Veröffentlicht: (2026)
von: Cohen, Saar
Veröffentlicht: (2026)
Distributed Stackelberg Strategies in State-based Potential Games for Autonomous Decentralized Learning Manufacturing Systems
von: Yuwono, Steve, et al.
Veröffentlicht: (2024)
von: Yuwono, Steve, et al.
Veröffentlicht: (2024)
Combining Tree-Search, Generative Models, and Nash Bargaining Concepts in Game-Theoretic Reinforcement Learning
von: Li, Zun, et al.
Veröffentlicht: (2023)
von: Li, Zun, et al.
Veröffentlicht: (2023)
Learning Mean Field Games on Sparse Graphs: A Hybrid Graphex Approach
von: Fabian, Christian, et al.
Veröffentlicht: (2024)
von: Fabian, Christian, et al.
Veröffentlicht: (2024)
Bounded Rationality Equilibrium Learning in Mean Field Games
von: Eich, Yannick, et al.
Veröffentlicht: (2024)
von: Eich, Yannick, et al.
Veröffentlicht: (2024)
A Black-box Approach for Non-stationary Multi-agent Reinforcement Learning
von: Jiang, Haozhe, et al.
Veröffentlicht: (2023)
von: Jiang, Haozhe, et al.
Veröffentlicht: (2023)
A Scalable Neural Network for DSIC Affine Maximizer Auction Design
von: Duan, Zhijian, et al.
Veröffentlicht: (2023)
von: Duan, Zhijian, et al.
Veröffentlicht: (2023)
Sample-Efficient Hypergradient Estimation for Decentralized Bi-Level Reinforcement Learning
von: Kudo, Mikoto, et al.
Veröffentlicht: (2026)
von: Kudo, Mikoto, et al.
Veröffentlicht: (2026)
Observation Interference in Partially Observable Assistance Games
von: Emmons, Scott, et al.
Veröffentlicht: (2024)
von: Emmons, Scott, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Intrinsic Barriers and Practical Pathways for Human-AI Alignment: An Agreement-Based Complexity Analysis
von: Nayebi, Aran
Veröffentlicht: (2025) -
Cooperative Game-Theoretic Credit Assignment for Multi-Agent Policy Gradients via the Core
von: Ji, Mengda, et al.
Veröffentlicht: (2025) -
Game-Theoretic and Algorithmic Analyses of Multi-Agent Routing under Crossing Costs
von: Hanaka, Tesshu, et al.
Veröffentlicht: (2026) -
Procedural Fairness in Multi-Agent Bandits
von: Caiata, Joshua, et al.
Veröffentlicht: (2026) -
Heterogeneous Multi-Agent Bandits with Parsimonious Hints
von: Mirfakhar, Amirmahdi, et al.
Veröffentlicht: (2025)