Self-Supervised On-Policy Reinforcement Learning via Contrastive Proximal Policy Optimisation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Osman, Asim, Abramowitz, Sasha, Bergh, Mark, Sob, Ulrich Armel Mbou, de Kock, Ruan John, Mahjoub, Omayma, Hidaoui, Oussama, De Nicola, Noah, Fokam, Arnol Manuel, Chalumeau, Felix, Rajaonarivonivelomanantsoa, Daniel, Singh, Siddarth, Shabe, Refiloe, Formanek, Juan Claude, Toit, Simon Verster Du, Pretorius, Arnu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Oryx: a Scalable Sequence Model for Many-Agent Coordination in Offline MARL
par: Formanek, Claude, et autres
Publié: (2025)
par: Formanek, Claude, et autres
Publié: (2025)
Breaking the Performance Ceiling in Reinforcement Learning requires Inference Strategies
par: Chalumeau, Felix, et autres
Publié: (2025)
par: Chalumeau, Felix, et autres
Publié: (2025)
Multi-Agent Reinforcement Learning with Selective State-Space Models
par: Daniel, Jemma, et autres
Publié: (2024)
par: Daniel, Jemma, et autres
Publié: (2024)
How much can change in a year? Revisiting Evaluation in Multi-Agent Reinforcement Learning
par: Singh, Siddarth, et autres
Publié: (2023)
par: Singh, Siddarth, et autres
Publié: (2023)
Efficiently Quantifying Individual Agent Importance in Cooperative MARL
par: Mahjoub, Omayma, et autres
Publié: (2023)
par: Mahjoub, Omayma, et autres
Publié: (2023)
A Landmark-Aware Visual Navigation Dataset
par: Johnson, Faith, et autres
Publié: (2024)
par: Johnson, Faith, et autres
Publié: (2024)
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
par: Tu, Songjun, et autres
Publié: (2025)
par: Tu, Songjun, et autres
Publié: (2025)
STACHE: Local Black-Box Explanations for Reinforcement Learning Policies
par: Elashkin, Andrew, et autres
Publié: (2025)
par: Elashkin, Andrew, et autres
Publié: (2025)
Intersymbolic AI: Interlinking Symbolic AI and Subsymbolic AI
par: Platzer, André
Publié: (2024)
par: Platzer, André
Publié: (2024)
STRIDE: A Self-Reflective Agent Framework for Reliable Automatic Equation Discovery
par: Su, Jiarui, et autres
Publié: (2026)
par: Su, Jiarui, et autres
Publié: (2026)
Few-Class Arena: A Benchmark for Efficient Selection of Vision Models and Dataset Difficulty Measurement
par: Cao, Bryan Bo, et autres
Publié: (2024)
par: Cao, Bryan Bo, et autres
Publié: (2024)
ABot-Claw: A Foundation for Persistent, Cooperative, and Self-Evolving Robotic Agents
par: Huo, Dongjie, et autres
Publié: (2026)
par: Huo, Dongjie, et autres
Publié: (2026)
ElasticFlow: One-Step Physics-Consistent Policy with Elastic Time Horizons for Language-Guided Manipulation
par: Chen, Kewei, et autres
Publié: (2026)
par: Chen, Kewei, et autres
Publié: (2026)
On measuring grounding and generalizing grounding problems
par: Quigley, Daniel, et autres
Publié: (2025)
par: Quigley, Daniel, et autres
Publié: (2025)
NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles
par: Jia, Xiao
Publié: (2026)
par: Jia, Xiao
Publié: (2026)
torchsom: The Reference PyTorch Library for Self-Organizing Maps
par: Berthier, Louis, et autres
Publié: (2025)
par: Berthier, Louis, et autres
Publié: (2025)
Emergence of Goal-Directed Behaviors via Active Inference with Self-Prior
par: Kim, Dongmin, et autres
Publié: (2025)
par: Kim, Dongmin, et autres
Publié: (2025)
Semantic Modeling for World-Centered Architectures
par: Mantsivoda, Andrei, et autres
Publié: (2026)
par: Mantsivoda, Andrei, et autres
Publié: (2026)
A Cost-Effective Eye-Tracker for Early Detection of Mild Cognitive Impairment
par: Greco, Danilo, et autres
Publié: (2024)
par: Greco, Danilo, et autres
Publié: (2024)
PhysMorph-GS: Render-Guided Volumetric Morphing with Differentiable Physics
par: Song, Chang-Yong, et autres
Publié: (2025)
par: Song, Chang-Yong, et autres
Publié: (2025)
Flex: End-to-End Text-Instructed Visual Navigation from Foundation Model Features
par: Chahine, Makram, et autres
Publié: (2024)
par: Chahine, Makram, et autres
Publié: (2024)
CulinaryCut-VLAP: A Vision-Language-Action-Physics Framework for Food Cutting via a Force-Aware Material Point Method
par: Koh, Hyunseo, et autres
Publié: (2026)
par: Koh, Hyunseo, et autres
Publié: (2026)
Structured Basis Function Networks: Loss-Centric Multi-Hypothesis Ensembles with Controllable Diversity
par: Dominguez, Alejandro Rodriguez, et autres
Publié: (2025)
par: Dominguez, Alejandro Rodriguez, et autres
Publié: (2025)
Agentic UAVs: LLM-Driven Autonomy with Integrated Tool-Calling and Cognitive Reasoning
par: Koubaa, Anis, et autres
Publié: (2025)
par: Koubaa, Anis, et autres
Publié: (2025)
Swish-T : Enhancing Swish Activation with Tanh Bias for Improved Neural Network Performance
par: Seo, Youngmin, et autres
Publié: (2024)
par: Seo, Youngmin, et autres
Publié: (2024)
FT-NCFM: An Influence-Aware Data Distillation Framework for Efficient VLA Models
par: Chen, Kewei, et autres
Publié: (2025)
par: Chen, Kewei, et autres
Publié: (2025)
ATAAT: Adaptive Threat-Aware Adversarial Tuning Framework against Backdoor Attacks on Vision-Language-Action Models
par: Chen, Kewei, et autres
Publié: (2026)
par: Chen, Kewei, et autres
Publié: (2026)
JAM: Controllable and Responsible Text Generation via Causal Reasoning and Latent Vector Manipulation
par: Huang, Yingbing, et autres
Publié: (2025)
par: Huang, Yingbing, et autres
Publié: (2025)
Enhancing Ultra-Low-Bit Quantization of Large Language Models Through Saliency-Aware Partial Retraining
par: Cao, Deyu, et autres
Publié: (2025)
par: Cao, Deyu, et autres
Publié: (2025)
LLM-supported document separation for printed reviews from zbMATH Open
par: Pluzhnikov, Ivan, et autres
Publié: (2026)
par: Pluzhnikov, Ivan, et autres
Publié: (2026)
CogniLoad: A Synthetic Natural Language Reasoning Benchmark With Tunable Length, Intrinsic Difficulty, and Distractor Density
par: Kaiser, Daniel, et autres
Publié: (2025)
par: Kaiser, Daniel, et autres
Publié: (2025)
Harnessing non-adversarial robustness in large language models
par: Zhou, Qinghua, et autres
Publié: (2026)
par: Zhou, Qinghua, et autres
Publié: (2026)
Named entity recognition for Serbian legal documents: Design, methodology and dataset development
par: Kalušev, Vladimir, et autres
Publié: (2025)
par: Kalušev, Vladimir, et autres
Publié: (2025)
Approaches to Semantic Textual Similarity in Slovak Language: From Algorithms to Transformers
par: Radosky, Lukas, et autres
Publié: (2026)
par: Radosky, Lukas, et autres
Publié: (2026)
Solving Zebra Puzzles Using Constraint-Guided Multi-Agent Systems
par: Berman, Shmuel, et autres
Publié: (2024)
par: Berman, Shmuel, et autres
Publié: (2024)
MVTamperBench: Evaluating Robustness of Vision-Language Models
par: Agarwal, Amit, et autres
Publié: (2024)
par: Agarwal, Amit, et autres
Publié: (2024)
PathFormer: A Transformer with 3D Grid Constraints for Digital Twin Robot-Arm Trajectory Generation
par: Alanazi, Ahmed, et autres
Publié: (2025)
par: Alanazi, Ahmed, et autres
Publié: (2025)
Task and Motion Planning in Hierarchical 3D Scene Graphs
par: Ray, Aaron, et autres
Publié: (2024)
par: Ray, Aaron, et autres
Publié: (2024)
Hierarchical Point-Patch Fusion with Adaptive Patch Codebook for 3D Shape Anomaly Detection
par: Kang, Xueyang, et autres
Publié: (2026)
par: Kang, Xueyang, et autres
Publié: (2026)
MerNav: A Highly Generalizable Memory-Execute-Review Framework for Zero-Shot Object Goal Navigation
par: Qi, Dekang, et autres
Publié: (2026)
par: Qi, Dekang, et autres
Publié: (2026)
Documents similaires
-
Oryx: a Scalable Sequence Model for Many-Agent Coordination in Offline MARL
par: Formanek, Claude, et autres
Publié: (2025) -
Breaking the Performance Ceiling in Reinforcement Learning requires Inference Strategies
par: Chalumeau, Felix, et autres
Publié: (2025) -
Multi-Agent Reinforcement Learning with Selective State-Space Models
par: Daniel, Jemma, et autres
Publié: (2024) -
How much can change in a year? Revisiting Evaluation in Multi-Agent Reinforcement Learning
par: Singh, Siddarth, et autres
Publié: (2023) -
Efficiently Quantifying Individual Agent Importance in Cooperative MARL
par: Mahjoub, Omayma, et autres
Publié: (2023)