When Actions Disappear: Adversarial Action Removal in Self-Play Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Author: | Kujur, Arahan |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Structural Threshold in Decision Capacity Governs Collapse in Self-Play Reinforcement Learning
by: Kujur, Arahan
Published: (2026)
by: Kujur, Arahan
Published: (2026)
Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents
by: Tang, Wenjie, et al.
Published: (2026)
by: Tang, Wenjie, et al.
Published: (2026)
FlowSteer: Towards Agents Designing Agentic Workflows via Reinforced Progressive Canvas Editing
by: Zhang, Mingda, et al.
Published: (2026)
by: Zhang, Mingda, et al.
Published: (2026)
Extending NGU to Multi-Agent RL: A Preliminary Study
by: Hernandez, Juan, et al.
Published: (2025)
by: Hernandez, Juan, et al.
Published: (2025)
Dynamical Priors as a Training Objective in Reinforcement Learning
by: Subaharan, Sukesh
Published: (2026)
by: Subaharan, Sukesh
Published: (2026)
ME-IGM: Individual-Global-Max in Maximum Entropy Multi-Agent Reinforcement Learning
by: Chen, Wen-Tse, et al.
Published: (2024)
by: Chen, Wen-Tse, et al.
Published: (2024)
A Principle of Targeted Intervention for Multi-Agent Reinforcement Learning
by: Liu, Anjie, et al.
Published: (2025)
by: Liu, Anjie, et al.
Published: (2025)
MACS: Multi-Agent Reinforcement Learning for Optimization of Crystal Structures
by: Zamaraeva, Elena, et al.
Published: (2025)
by: Zamaraeva, Elena, et al.
Published: (2025)
Individual Contributions as Intrinsic Exploration Scaffolds for Multi-agent Reinforcement Learning
by: Li, Xinran, et al.
Published: (2024)
by: Li, Xinran, et al.
Published: (2024)
Risk-Sensitive Multi-Agent Reinforcement Learning in Network Aggregative Markov Games
by: Ghaemi, Hafez, et al.
Published: (2024)
by: Ghaemi, Hafez, et al.
Published: (2024)
Robust and Diverse Multi-Agent Learning via Rational Policy Gradient
by: Lauffer, Niklas, et al.
Published: (2025)
by: Lauffer, Niklas, et al.
Published: (2025)
Reinforcement Learning for Scalable and Trustworthy Intelligent Systems
by: Lan, Guangchen
Published: (2026)
by: Lan, Guangchen
Published: (2026)
Learning To Help: Training Models to Assist Legacy Devices
by: Wu, Yu, et al.
Published: (2024)
by: Wu, Yu, et al.
Published: (2024)
Analysing Factorizations of Action-Value Networks for Cooperative Multi-Agent Reinforcement Learning
by: Castellini, Jacopo, et al.
Published: (2019)
by: Castellini, Jacopo, et al.
Published: (2019)
Networked Agents in the Dark: Team Value Learning under Partial Observability
by: Varela, Guilherme S., et al.
Published: (2025)
by: Varela, Guilherme S., et al.
Published: (2025)
ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation
by: Mittal, Tarun
Published: (2026)
by: Mittal, Tarun
Published: (2026)
StatePlane: A Cognitive State Plane for Long-Horizon AI Systems Under Bounded Context
by: Annapureddy, Sasank, et al.
Published: (2026)
by: Annapureddy, Sasank, et al.
Published: (2026)
When Outcome Looks Right But Discipline Fails: Trace-Based Evaluation Under Hidden Competitor State
by: Zhu, Peiying, et al.
Published: (2026)
by: Zhu, Peiying, et al.
Published: (2026)
Instruction-Level Weight Shaping: A Framework for Self-Improving AI Agents
by: Costa, Rimom
Published: (2025)
by: Costa, Rimom
Published: (2025)
On the Push-Based Asynchronous Federated Learning: A Bias-Correction Aggregation Approach
by: Bai, Jiahui, et al.
Published: (2026)
by: Bai, Jiahui, et al.
Published: (2026)
Byzantine-Resilient Federated Learning via QUBO-Based Client Selection on Quantum Annealers
by: Ferenczi, Andras, et al.
Published: (2026)
by: Ferenczi, Andras, et al.
Published: (2026)
When Agents Disagree: The Selection Bottleneck in Multi-Agent LLM Pipelines
by: Maryanskyy, Artem
Published: (2026)
by: Maryanskyy, Artem
Published: (2026)
Towards General Negotiation Strategies with End-to-End Reinforcement Learning
by: Renting, Bram M., et al.
Published: (2024)
by: Renting, Bram M., et al.
Published: (2024)
Representational Collapse in Multi-Agent LLM Committees: Measurement and Diversity-Aware Consensus
by: Patel, Dipkumar
Published: (2026)
by: Patel, Dipkumar
Published: (2026)
Dynamic Attentional Context Scoping: Agent-Triggered Focus Sessions for Isolated Per-Agent Steering in Multi-Agent LLM Orchestration
by: Patel, Nickson
Published: (2026)
by: Patel, Nickson
Published: (2026)
Decentralized Time Series Classification with ROCKET Features
by: Casella, Bruno, et al.
Published: (2025)
by: Casella, Bruno, et al.
Published: (2025)
Distributed Value Decomposition Networks with Networked Agents
by: Varela, Guilherme S., et al.
Published: (2025)
by: Varela, Guilherme S., et al.
Published: (2025)
RL-LLM-DT: An Automatic Decision Tree Generation Method Based on RL Evaluation and LLM Enhancement
by: Lin, Junjie, et al.
Published: (2024)
by: Lin, Junjie, et al.
Published: (2024)
Collaboration Promotes Group Resilience in Multi-Agent RL
by: Shraga, Ilai, et al.
Published: (2021)
by: Shraga, Ilai, et al.
Published: (2021)
Policy Search, Retrieval, and Composition via Task Similarity in Collaborative Agentic Systems
by: Nath, Saptarshi, et al.
Published: (2025)
by: Nath, Saptarshi, et al.
Published: (2025)
Cost-Aware Diffusion Active Search
by: Banerjee, Arundhati, et al.
Published: (2026)
by: Banerjee, Arundhati, et al.
Published: (2026)
Centrally Coordinated Multi-Agent Reinforcement Learning for Power Grid Topology Control
by: de Mol, Barbera, et al.
Published: (2025)
by: de Mol, Barbera, et al.
Published: (2025)
When Can Human-AI Teams Outperform Individuals? Tight Bounds with Impossibility Guarantees
by: Guo, Dongxin, et al.
Published: (2026)
by: Guo, Dongxin, et al.
Published: (2026)
Procedural Game Level Design with Deep Reinforcement Learning
by: Özkan, Miraç Buğra
Published: (2025)
by: Özkan, Miraç Buğra
Published: (2025)
When to Forget: A Memory Governance Primitive
by: Simsek, Baris
Published: (2026)
by: Simsek, Baris
Published: (2026)
One Policy, Infinite NPCs: Persona-Traceable Shared RL Policies for Scalable Game Agents
by: Hong, Yoosung
Published: (2026)
by: Hong, Yoosung
Published: (2026)
Advancing Multimodal Agent Reasoning with Long-Term Neuro-Symbolic Memory
by: Jiang, Rongjie, et al.
Published: (2026)
by: Jiang, Rongjie, et al.
Published: (2026)
WorkflowGen:an adaptive workflow generation mechanism driven by trajectory experience
by: Wei, Ruocan, et al.
Published: (2026)
by: Wei, Ruocan, et al.
Published: (2026)
Alif: Advancing Urdu Large Language Models via Multilingual Synthetic Data Distillation
by: Shafique, Muhammad Ali, et al.
Published: (2025)
by: Shafique, Muhammad Ali, et al.
Published: (2025)
Adaptive Data Flywheel: Applying MAPE Control Loops to AI Agent Improvement
by: Shukla, Aaditya, et al.
Published: (2025)
by: Shukla, Aaditya, et al.
Published: (2025)
Similar Items
-
A Structural Threshold in Decision Capacity Governs Collapse in Self-Play Reinforcement Learning
by: Kujur, Arahan
Published: (2026) -
Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents
by: Tang, Wenjie, et al.
Published: (2026) -
FlowSteer: Towards Agents Designing Agentic Workflows via Reinforced Progressive Canvas Editing
by: Zhang, Mingda, et al.
Published: (2026) -
Extending NGU to Multi-Agent RL: A Preliminary Study
by: Hernandez, Juan, et al.
Published: (2025) -
Dynamical Priors as a Training Objective in Reinforcement Learning
by: Subaharan, Sukesh
Published: (2026)