Mahjax: A GPU-Accelerated Mahjong Simulator for Reinforcement Learning in JAX
Fuente:
arXiv
Salvato in:
| Autori principali: | Nishimori, Soichiro, Okano, Shinri, Habara, Keigo, Koyamada, Sotetsu, Yu, Eason, Sugiyama, Masashi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Pgx: Hardware-Accelerated Parallel Game Simulators for Reinforcement Learning
di: Koyamada, Sotetsu, et al.
Pubblicazione: (2023)
di: Koyamada, Sotetsu, et al.
Pubblicazione: (2023)
Emergence of Exploration in Policy Gradient Reinforcement Learning via Retrying
di: Nishimori, Soichiro, et al.
Pubblicazione: (2026)
di: Nishimori, Soichiro, et al.
Pubblicazione: (2026)
A Batch Sequential Halving Algorithm without Performance Degradation
di: Koyamada, Sotetsu, et al.
Pubblicazione: (2024)
di: Koyamada, Sotetsu, et al.
Pubblicazione: (2024)
On Symmetric Losses for Robust Policy Optimization with Noisy Preferences
di: Nishimori, Soichiro, et al.
Pubblicazione: (2025)
di: Nishimori, Soichiro, et al.
Pubblicazione: (2025)
Mitigating Reward Hacking in RLHF via Advantage Sign Robustness
di: Ono, Shinnosuke, et al.
Pubblicazione: (2026)
di: Ono, Shinnosuke, et al.
Pubblicazione: (2026)
A Simple, Solid, and Reproducible Baseline for Bridge Bidding AI
di: Kita, Haruka, et al.
Pubblicazione: (2024)
di: Kita, Haruka, et al.
Pubblicazione: (2024)
Offline Reinforcement Learning with Domain-Unlabeled Data
di: Nishimori, Soichiro, et al.
Pubblicazione: (2024)
di: Nishimori, Soichiro, et al.
Pubblicazione: (2024)
Offline Reinforcement Learning from Datasets with Structured Non-Stationarity
di: Ackermann, Johannes, et al.
Pubblicazione: (2024)
di: Ackermann, Johannes, et al.
Pubblicazione: (2024)
JaxWildfire: A GPU-Accelerated Wildfire Simulator for Reinforcement Learning
di: Çakır, Ufuk, et al.
Pubblicazione: (2025)
di: Çakır, Ufuk, et al.
Pubblicazione: (2025)
Scaling Is All You Need: Autonomous Driving with JAX-Accelerated Reinforcement Learning
di: Harmel, Moritz, et al.
Pubblicazione: (2023)
di: Harmel, Moritz, et al.
Pubblicazione: (2023)
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
di: Ackermann, Johannes, et al.
Pubblicazione: (2025)
di: Ackermann, Johannes, et al.
Pubblicazione: (2025)
Chargax: A JAX Accelerated EV Charging Simulator
di: Ponse, Koen, et al.
Pubblicazione: (2025)
di: Ponse, Koen, et al.
Pubblicazione: (2025)
CAX: Cellular Automata Accelerated in JAX
di: Faldor, Maxence, et al.
Pubblicazione: (2024)
di: Faldor, Maxence, et al.
Pubblicazione: (2024)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
di: Ackermann, Johannes, et al.
Pubblicazione: (2026)
di: Ackermann, Johannes, et al.
Pubblicazione: (2026)
Jumanji: a Diverse Suite of Scalable Reinforcement Learning Environments in JAX
di: Bonnet, Clément, et al.
Pubblicazione: (2023)
di: Bonnet, Clément, et al.
Pubblicazione: (2023)
Generalization Limits of Reinforcement Learning Alignment
di: Shida, Haruhi, et al.
Pubblicazione: (2026)
di: Shida, Haruhi, et al.
Pubblicazione: (2026)
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
di: Cai, Xin-Qiang, et al.
Pubblicazione: (2025)
di: Cai, Xin-Qiang, et al.
Pubblicazione: (2025)
VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction
di: Cai, Xin-Qiang, et al.
Pubblicazione: (2026)
di: Cai, Xin-Qiang, et al.
Pubblicazione: (2026)
PuzzleJAX: A Benchmark for Reasoning and Learning
di: Earle, Sam, et al.
Pubblicazione: (2025)
di: Earle, Sam, et al.
Pubblicazione: (2025)
Learning Robust Diffusion Models from Imprecise Supervision
di: Wu, Dong-Dong, et al.
Pubblicazione: (2025)
di: Wu, Dong-Dong, et al.
Pubblicazione: (2025)
laplax -- Laplace Approximations with JAX
di: Weber, Tobias, et al.
Pubblicazione: (2025)
di: Weber, Tobias, et al.
Pubblicazione: (2025)
Robust Multi-View Learning via Representation Fusion of Sample-Level Attention and Alignment of Simulated Perturbation
di: Xu, Jie, et al.
Pubblicazione: (2025)
di: Xu, Jie, et al.
Pubblicazione: (2025)
Learning Bug Context for PyTorch-to-JAX Translation with LLMs
di: Phan, Hung, et al.
Pubblicazione: (2025)
di: Phan, Hung, et al.
Pubblicazione: (2025)
Towards Scalable Oversight via Partitioned Human Supervision
di: Yin, Ren, et al.
Pubblicazione: (2025)
di: Yin, Ren, et al.
Pubblicazione: (2025)
minimax: Efficient Baselines for Autocurricula in JAX
di: Jiang, Minqi, et al.
Pubblicazione: (2023)
di: Jiang, Minqi, et al.
Pubblicazione: (2023)
Sharpness-Aware Black-Box Optimization
di: Ye, Feiyang, et al.
Pubblicazione: (2024)
di: Ye, Feiyang, et al.
Pubblicazione: (2024)
NAVIX: Scaling MiniGrid Environments with JAX
di: Pignatelli, Eduardo, et al.
Pubblicazione: (2024)
di: Pignatelli, Eduardo, et al.
Pubblicazione: (2024)
On the Overlooked Pitfalls of Weight Decay and How to Mitigate Them: A Gradient-Norm Perspective
di: Xie, Zeke, et al.
Pubblicazione: (2020)
di: Xie, Zeke, et al.
Pubblicazione: (2020)
GPU-Accelerated Deep Learning for Heatwave Prediction and Urban Heat Risk Assessment
di: Alihodžić, Adis
Pubblicazione: (2026)
di: Alihodžić, Adis
Pubblicazione: (2026)
Causal Graph Learning via Distributional Invariance of Cause-Effect Relationship
di: Nguyen, Nang Hung, et al.
Pubblicazione: (2026)
di: Nguyen, Nang Hung, et al.
Pubblicazione: (2026)
Recursive Reward Aggregation
di: Tang, Yuting, et al.
Pubblicazione: (2025)
di: Tang, Yuting, et al.
Pubblicazione: (2025)
Human-Inspired Framework to Accelerate Reinforcement Learning
di: Beikmohammadi, Ali, et al.
Pubblicazione: (2023)
di: Beikmohammadi, Ali, et al.
Pubblicazione: (2023)
Generating Chain-of-Thoughts with a Pairwise-Comparison Approach to Searching for the Most Promising Intermediate Thought
di: Zhang, Zhen-Yu, et al.
Pubblicazione: (2024)
di: Zhang, Zhen-Yu, et al.
Pubblicazione: (2024)
Crazyflow: An Accurate, GPU-Accelerated, Differentiable Drone Simulator in JAX
di: Schuck, Martin, et al.
Pubblicazione: (2026)
di: Schuck, Martin, et al.
Pubblicazione: (2026)
Differentiable Initialization-Accelerated CPU-GPU Hybrid Combinatorial Scheduling
di: Liu, Mingju, et al.
Pubblicazione: (2026)
di: Liu, Mingju, et al.
Pubblicazione: (2026)
Accurate Forgetting for Heterogeneous Federated Continual Learning
di: Wuerkaixi, Abudukelimu, et al.
Pubblicazione: (2025)
di: Wuerkaixi, Abudukelimu, et al.
Pubblicazione: (2025)
A General Framework for Learning from Weak Supervision
di: Chen, Hao, et al.
Pubblicazione: (2024)
di: Chen, Hao, et al.
Pubblicazione: (2024)
From Coefficients to Directions: Rethinking Model Merging with Directional Alignment
di: Chen, Zhikang, et al.
Pubblicazione: (2025)
di: Chen, Zhikang, et al.
Pubblicazione: (2025)
Jasmine: A Simple, Performant and Scalable JAX-based World Modeling Codebase
di: Mahajan, Mihir, et al.
Pubblicazione: (2025)
di: Mahajan, Mihir, et al.
Pubblicazione: (2025)
Periodic Asynchrony: An On-Policy Approach for Accelerating LLM Reinforcement Learning
di: Lu, Jian
Pubblicazione: (2025)
di: Lu, Jian
Pubblicazione: (2025)
Documenti analoghi
-
Pgx: Hardware-Accelerated Parallel Game Simulators for Reinforcement Learning
di: Koyamada, Sotetsu, et al.
Pubblicazione: (2023) -
Emergence of Exploration in Policy Gradient Reinforcement Learning via Retrying
di: Nishimori, Soichiro, et al.
Pubblicazione: (2026) -
A Batch Sequential Halving Algorithm without Performance Degradation
di: Koyamada, Sotetsu, et al.
Pubblicazione: (2024) -
On Symmetric Losses for Robust Policy Optimization with Noisy Preferences
di: Nishimori, Soichiro, et al.
Pubblicazione: (2025) -
Mitigating Reward Hacking in RLHF via Advantage Sign Robustness
di: Ono, Shinnosuke, et al.
Pubblicazione: (2026)