Preference-based opponent shaping in differentiable games
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qiao, Xinyu, Hu, Yudong, Han, Congying, Wu, Weiyan, Guo, Tiande |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dual Alignment Maximin Optimization for Offline Model-based RL
par: Zhou, Chi, et autres
Publié: (2025)
par: Zhou, Chi, et autres
Publié: (2025)
A Fast Anti-Jamming Cognitive Radar Deployment Algorithm Based on Reinforcement Learning
par: Cai, Wencheng, et autres
Publié: (2025)
par: Cai, Wencheng, et autres
Publié: (2025)
Purity Law for Generalizable Neural TSP Solvers
par: Liu, Wenzhao, et autres
Publié: (2025)
par: Liu, Wenzhao, et autres
Publié: (2025)
Applying Opponent Modeling for Automatic Bidding in Online Repeated Auctions
par: Hu, Yudong, et autres
Publié: (2022)
par: Hu, Yudong, et autres
Publié: (2022)
Humans expect rationality and cooperation from LLM opponents in strategic games
par: Barak, Darija, et autres
Publié: (2025)
par: Barak, Darija, et autres
Publié: (2025)
Relating Checkpoint Update Probabilities to Momentum Parameters in Single-Loop Variance Reduction Methods
par: Liu, Hai, et autres
Publié: (2026)
par: Liu, Hai, et autres
Publié: (2026)
A-PSRO: A Unified Strategy Learning Method with Advantage Function for Normal-form Games
par: Hu, Yudong, et autres
Publié: (2023)
par: Hu, Yudong, et autres
Publié: (2023)
A zero-sum differential game for two opponent masses
par: Bagagiolo, Fabio, et autres
Publié: (2024)
par: Bagagiolo, Fabio, et autres
Publié: (2024)
Towards Optimal Adversarial Robust Q-learning with Bellman Infinity-error
par: Li, Haoran, et autres
Publié: (2024)
par: Li, Haoran, et autres
Publié: (2024)
Towards Optimal Adversarial Robust Reinforcement Learning with Infinity Measurement Error
par: Li, Haoran, et autres
Publié: (2025)
par: Li, Haoran, et autres
Publié: (2025)
Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization
par: Yu, Jiahao, et autres
Publié: (2025)
par: Yu, Jiahao, et autres
Publié: (2025)
Robust Accelerated Adaptive Search: High-Probability Complexity Bounds under Bounded-Moment Stochastic Oracles
par: Zhang, Shunzhi, et autres
Publié: (2026)
par: Zhang, Shunzhi, et autres
Publié: (2026)
PreferThinker: Reasoning-based Personalized Image Preference Assessment
par: Xu, Shengqi, et autres
Publié: (2025)
par: Xu, Shengqi, et autres
Publié: (2025)
On the optimal pivot path of simplex method for linear programming based on reinforcement learning
par: Li, Anqi, et autres
Publié: (2022)
par: Li, Anqi, et autres
Publié: (2022)
TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making
par: Jiao, Kechen, et autres
Publié: (2025)
par: Jiao, Kechen, et autres
Publié: (2025)
Diffusion-TS: Interpretable Diffusion for General Time Series Generation
par: Yuan, Xinyu, et autres
Publié: (2024)
par: Yuan, Xinyu, et autres
Publié: (2024)
On the Role of Preference Variance in Preference Optimization
par: Guo, Jiacheng, et autres
Publié: (2025)
par: Guo, Jiacheng, et autres
Publié: (2025)
Data-Driven Calibration of Prediction Sets in Large Vision-Language Models Based on Inductive Conformal Prediction
par: Ye, Yuanchang, et autres
Publié: (2025)
par: Ye, Yuanchang, et autres
Publié: (2025)
CRD: Collaborative Representation Distance for Practical Anomaly Detection
par: Han, Chao, et autres
Publié: (2023)
par: Han, Chao, et autres
Publié: (2023)
PLaD: Preference-based Large Language Model Distillation with Pseudo-Preference Pairs
par: Zhang, Rongzhi, et autres
Publié: (2024)
par: Zhang, Rongzhi, et autres
Publié: (2024)
MALLES: A Multi-agent LLMs-based Economic Sandbox with Consumer Preference Alignment
par: Wu, Yusen, et autres
Publié: (2026)
par: Wu, Yusen, et autres
Publié: (2026)
Mind the Inconspicuous: Revealing the Hidden Weakness in Aligned LLMs' Refusal Boundaries
par: Yu, Jiahao, et autres
Publié: (2024)
par: Yu, Jiahao, et autres
Publié: (2024)
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
par: Zhou, Zhanhui, et autres
Publié: (2023)
par: Zhou, Zhanhui, et autres
Publié: (2023)
Re-evaluating Automatic LLM System Ranking for Alignment with Human Preference
par: Gao, Mingqi, et autres
Publié: (2024)
par: Gao, Mingqi, et autres
Publié: (2024)
DR-BFR: Degradation Representation with Diffusion Models for Blind Face Restoration
par: Qiu, Xinmin, et autres
Publié: (2024)
par: Qiu, Xinmin, et autres
Publié: (2024)
Resolving Endpoint Underfitting in Diffusion Bridges via Noise Alignment
par: Gao, Yurong, et autres
Publié: (2026)
par: Gao, Yurong, et autres
Publié: (2026)
APF+: Boosting adaptive-potential function reinforcement learning methods with a W-shaped network for high-dimensional games
par: Chen, Yifei, et autres
Publié: (2025)
par: Chen, Yifei, et autres
Publié: (2025)
On Negative-aware Preference Optimization for Recommendation
par: Ding, Chenlu, et autres
Publié: (2025)
par: Ding, Chenlu, et autres
Publié: (2025)
Alignment Imprint: Zero-Shot AI-Generated Text Detection via Provable Preference Discrepancy
par: Wu, Junxi, et autres
Publié: (2026)
par: Wu, Junxi, et autres
Publié: (2026)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
par: Yang, Yiqin, et autres
Publié: (2026)
par: Yang, Yiqin, et autres
Publié: (2026)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
par: Gao, Chen-Xiao, et autres
Publié: (2024)
par: Gao, Chen-Xiao, et autres
Publié: (2024)
Playing games with knowledge: AI-Induced delusions need game theoretic interventions
par: Beaumaster, Will, et autres
Publié: (2026)
par: Beaumaster, Will, et autres
Publié: (2026)
CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction
par: Lu, Yudong, et autres
Publié: (2025)
par: Lu, Yudong, et autres
Publié: (2025)
LEASE: Offline Preference-based Reinforcement Learning with High Sample Efficiency
par: Liu, Xiao-Yin, et autres
Publié: (2024)
par: Liu, Xiao-Yin, et autres
Publié: (2024)
Policy-labeled Preference Learning: Is Preference Enough for RLHF?
par: Cho, Taehyun, et autres
Publié: (2025)
par: Cho, Taehyun, et autres
Publié: (2025)
MR-Coupler: Automated Metamorphic Test Generation via Functional Coupling Analysis
par: Xu, Congying, et autres
Publié: (2026)
par: Xu, Congying, et autres
Publié: (2026)
An LLM-based Framework for Human-Swarm Teaming Cognition in Disaster Search and Rescue
par: Ji, Kailun, et autres
Publié: (2025)
par: Ji, Kailun, et autres
Publié: (2025)
Advances in Preference-based Reinforcement Learning: A Review
par: Abdelkareem, Youssef, et autres
Publié: (2024)
par: Abdelkareem, Youssef, et autres
Publié: (2024)
Aligning Large Language Models with Searcher Preferences
par: Wu, Wei, et autres
Publié: (2026)
par: Wu, Wei, et autres
Publié: (2026)
POLO: Preference-Guided Multi-Turn Reinforcement Learning for Lead Optimization
par: Wang, Ziqing, et autres
Publié: (2025)
par: Wang, Ziqing, et autres
Publié: (2025)
Documents similaires
-
Dual Alignment Maximin Optimization for Offline Model-based RL
par: Zhou, Chi, et autres
Publié: (2025) -
A Fast Anti-Jamming Cognitive Radar Deployment Algorithm Based on Reinforcement Learning
par: Cai, Wencheng, et autres
Publié: (2025) -
Purity Law for Generalizable Neural TSP Solvers
par: Liu, Wenzhao, et autres
Publié: (2025) -
Applying Opponent Modeling for Automatic Bidding in Online Repeated Auctions
par: Hu, Yudong, et autres
Publié: (2022) -
Humans expect rationality and cooperation from LLM opponents in strategic games
par: Barak, Darija, et autres
Publié: (2025)