MC-CPO: Mastery-Conditioned Constrained Policy Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Olukola, Oluseyi, Rahimi, Nick |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems
di: Olukola, Oluseyi, et al.
Pubblicazione: (2026)
di: Olukola, Oluseyi, et al.
Pubblicazione: (2026)
Safe and Policy-Compliant Multi-Agent Orchestration for Enterprise AI
di: Pasupuleti, Vinil, et al.
Pubblicazione: (2026)
di: Pasupuleti, Vinil, et al.
Pubblicazione: (2026)
When Actions Disappear: Adversarial Action Removal in Self-Play Reinforcement Learning
di: Kujur, Arahan
Pubblicazione: (2026)
di: Kujur, Arahan
Pubblicazione: (2026)
FlowSteer: Towards Agents Designing Agentic Workflows via Reinforced Progressive Canvas Editing
di: Zhang, Mingda, et al.
Pubblicazione: (2026)
di: Zhang, Mingda, et al.
Pubblicazione: (2026)
Extending NGU to Multi-Agent RL: A Preliminary Study
di: Hernandez, Juan, et al.
Pubblicazione: (2025)
di: Hernandez, Juan, et al.
Pubblicazione: (2025)
Robust and Diverse Multi-Agent Learning via Rational Policy Gradient
di: Lauffer, Niklas, et al.
Pubblicazione: (2025)
di: Lauffer, Niklas, et al.
Pubblicazione: (2025)
Adaptive Data Flywheel: Applying MAPE Control Loops to AI Agent Improvement
di: Shukla, Aaditya, et al.
Pubblicazione: (2025)
di: Shukla, Aaditya, et al.
Pubblicazione: (2025)
Depth-Dependent Indirect Prompt Injection in Tool-Calling ReAct Agents: Injection Depth, Payload Framing, and Turn-Budget Sensitivity
di: Rashidi, Mohammadreza
Pubblicazione: (2026)
di: Rashidi, Mohammadreza
Pubblicazione: (2026)
HybridVFL: Disentangled Feature Learning for Edge-Enabled Vertical Federated Multimodal Classification
di: Anoosha, Mostafa, et al.
Pubblicazione: (2025)
di: Anoosha, Mostafa, et al.
Pubblicazione: (2025)
Policy Search, Retrieval, and Composition via Task Similarity in Collaborative Agentic Systems
di: Nath, Saptarshi, et al.
Pubblicazione: (2025)
di: Nath, Saptarshi, et al.
Pubblicazione: (2025)
FedAttr: Towards Privacy-preserving Client-Level Attribution in Federated LLM Fine-tuning
di: Zhang, Su, et al.
Pubblicazione: (2026)
di: Zhang, Su, et al.
Pubblicazione: (2026)
One Policy, Infinite NPCs: Persona-Traceable Shared RL Policies for Scalable Game Agents
di: Hong, Yoosung
Pubblicazione: (2026)
di: Hong, Yoosung
Pubblicazione: (2026)
MACS: Multi-Agent Reinforcement Learning for Optimization of Crystal Structures
di: Zamaraeva, Elena, et al.
Pubblicazione: (2025)
di: Zamaraeva, Elena, et al.
Pubblicazione: (2025)
AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents
di: Naik, Akshat, et al.
Pubblicazione: (2025)
di: Naik, Akshat, et al.
Pubblicazione: (2025)
Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents
di: Tang, Wenjie, et al.
Pubblicazione: (2026)
di: Tang, Wenjie, et al.
Pubblicazione: (2026)
ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation
di: Mittal, Tarun
Pubblicazione: (2026)
di: Mittal, Tarun
Pubblicazione: (2026)
StatePlane: A Cognitive State Plane for Long-Horizon AI Systems Under Bounded Context
di: Annapureddy, Sasank, et al.
Pubblicazione: (2026)
di: Annapureddy, Sasank, et al.
Pubblicazione: (2026)
Prompt Readiness Levels (PRL): a maturity scale and scoring framework for production grade prompt assets
di: Guinard, Sebastien
Pubblicazione: (2026)
di: Guinard, Sebastien
Pubblicazione: (2026)
When to Forget: A Memory Governance Primitive
di: Simsek, Baris
Pubblicazione: (2026)
di: Simsek, Baris
Pubblicazione: (2026)
Learning To Help: Training Models to Assist Legacy Devices
di: Wu, Yu, et al.
Pubblicazione: (2024)
di: Wu, Yu, et al.
Pubblicazione: (2024)
ME-IGM: Individual-Global-Max in Maximum Entropy Multi-Agent Reinforcement Learning
di: Chen, Wen-Tse, et al.
Pubblicazione: (2024)
di: Chen, Wen-Tse, et al.
Pubblicazione: (2024)
Cost-Aware Diffusion Active Search
di: Banerjee, Arundhati, et al.
Pubblicazione: (2026)
di: Banerjee, Arundhati, et al.
Pubblicazione: (2026)
From Safety Risk to Design Principle: Peer-Preservation in Multi-Agent LLM Systems and Its Implications for Orchestrated Democratic Discourse Analysis
di: Dietrich, Juergen
Pubblicazione: (2026)
di: Dietrich, Juergen
Pubblicazione: (2026)
Characterizing MARL for Energy Control: A Multi-KPI Benchmark on the CityLearn Environment
di: Khouja, Aymen, et al.
Pubblicazione: (2026)
di: Khouja, Aymen, et al.
Pubblicazione: (2026)
Individual Contributions as Intrinsic Exploration Scaffolds for Multi-agent Reinforcement Learning
di: Li, Xinran, et al.
Pubblicazione: (2024)
di: Li, Xinran, et al.
Pubblicazione: (2024)
Decentralized Time Series Classification with ROCKET Features
di: Casella, Bruno, et al.
Pubblicazione: (2025)
di: Casella, Bruno, et al.
Pubblicazione: (2025)
Distributed Value Decomposition Networks with Networked Agents
di: Varela, Guilherme S., et al.
Pubblicazione: (2025)
di: Varela, Guilherme S., et al.
Pubblicazione: (2025)
Representational Collapse in Multi-Agent LLM Committees: Measurement and Diversity-Aware Consensus
di: Patel, Dipkumar
Pubblicazione: (2026)
di: Patel, Dipkumar
Pubblicazione: (2026)
A Principle of Targeted Intervention for Multi-Agent Reinforcement Learning
di: Liu, Anjie, et al.
Pubblicazione: (2025)
di: Liu, Anjie, et al.
Pubblicazione: (2025)
RL-LLM-DT: An Automatic Decision Tree Generation Method Based on RL Evaluation and LLM Enhancement
di: Lin, Junjie, et al.
Pubblicazione: (2024)
di: Lin, Junjie, et al.
Pubblicazione: (2024)
Networked Agents in the Dark: Team Value Learning under Partial Observability
di: Varela, Guilherme S., et al.
Pubblicazione: (2025)
di: Varela, Guilherme S., et al.
Pubblicazione: (2025)
Collaboration Promotes Group Resilience in Multi-Agent RL
di: Shraga, Ilai, et al.
Pubblicazione: (2021)
di: Shraga, Ilai, et al.
Pubblicazione: (2021)
Dynamical Priors as a Training Objective in Reinforcement Learning
di: Subaharan, Sukesh
Pubblicazione: (2026)
di: Subaharan, Sukesh
Pubblicazione: (2026)
Risk-Sensitive Multi-Agent Reinforcement Learning in Network Aggregative Markov Games
di: Ghaemi, Hafez, et al.
Pubblicazione: (2024)
di: Ghaemi, Hafez, et al.
Pubblicazione: (2024)
Dynamic Attentional Context Scoping: Agent-Triggered Focus Sessions for Isolated Per-Agent Steering in Multi-Agent LLM Orchestration
di: Patel, Nickson
Pubblicazione: (2026)
di: Patel, Nickson
Pubblicazione: (2026)
On the Push-Based Asynchronous Federated Learning: A Bias-Correction Aggregation Approach
di: Bai, Jiahui, et al.
Pubblicazione: (2026)
di: Bai, Jiahui, et al.
Pubblicazione: (2026)
Byzantine-Resilient Federated Learning via QUBO-Based Client Selection on Quantum Annealers
di: Ferenczi, Andras, et al.
Pubblicazione: (2026)
di: Ferenczi, Andras, et al.
Pubblicazione: (2026)
Difference Rewards Policy Gradients
di: Castellini, Jacopo, et al.
Pubblicazione: (2020)
di: Castellini, Jacopo, et al.
Pubblicazione: (2020)
Procedural Game Level Design with Deep Reinforcement Learning
di: Özkan, Miraç Buğra
Pubblicazione: (2025)
di: Özkan, Miraç Buğra
Pubblicazione: (2025)
Instruction-Level Weight Shaping: A Framework for Self-Improving AI Agents
di: Costa, Rimom
Pubblicazione: (2025)
di: Costa, Rimom
Pubblicazione: (2025)
Documenti analoghi
-
Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems
di: Olukola, Oluseyi, et al.
Pubblicazione: (2026) -
Safe and Policy-Compliant Multi-Agent Orchestration for Enterprise AI
di: Pasupuleti, Vinil, et al.
Pubblicazione: (2026) -
When Actions Disappear: Adversarial Action Removal in Self-Play Reinforcement Learning
di: Kujur, Arahan
Pubblicazione: (2026) -
FlowSteer: Towards Agents Designing Agentic Workflows via Reinforced Progressive Canvas Editing
di: Zhang, Mingda, et al.
Pubblicazione: (2026) -
Extending NGU to Multi-Agent RL: A Preliminary Study
di: Hernandez, Juan, et al.
Pubblicazione: (2025)