A Batch Sequential Halving Algorithm without Performance Degradation
Fuente:
arXiv
Salvato in:
| Autori principali: | Koyamada, Sotetsu, Nishimori, Soichiro, Ishii, Shin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Emergence of Exploration in Policy Gradient Reinforcement Learning via Retrying
di: Nishimori, Soichiro, et al.
Pubblicazione: (2026)
di: Nishimori, Soichiro, et al.
Pubblicazione: (2026)
Pgx: Hardware-Accelerated Parallel Game Simulators for Reinforcement Learning
di: Koyamada, Sotetsu, et al.
Pubblicazione: (2023)
di: Koyamada, Sotetsu, et al.
Pubblicazione: (2023)
Mahjax: A GPU-Accelerated Mahjong Simulator for Reinforcement Learning in JAX
di: Nishimori, Soichiro, et al.
Pubblicazione: (2026)
di: Nishimori, Soichiro, et al.
Pubblicazione: (2026)
A Simple, Solid, and Reproducible Baseline for Bridge Bidding AI
di: Kita, Haruka, et al.
Pubblicazione: (2024)
di: Kita, Haruka, et al.
Pubblicazione: (2024)
Anytime Sequential Halving in Monte-Carlo Tree Search
di: Sagers, Dominic, et al.
Pubblicazione: (2024)
di: Sagers, Dominic, et al.
Pubblicazione: (2024)
Finite-Time Regret Analysis of Retry-Aware Bandits
di: Tong, Bingkui, et al.
Pubblicazione: (2026)
di: Tong, Bingkui, et al.
Pubblicazione: (2026)
Offline Reinforcement Learning with Domain-Unlabeled Data
di: Nishimori, Soichiro, et al.
Pubblicazione: (2024)
di: Nishimori, Soichiro, et al.
Pubblicazione: (2024)
Revisiting Tree Search for LLMs: Gumbel and Sequential Halving for Budget-Scalable Reasoning
di: Ugadiarov, Leonid, et al.
Pubblicazione: (2026)
di: Ugadiarov, Leonid, et al.
Pubblicazione: (2026)
On Symmetric Losses for Robust Policy Optimization with Noisy Preferences
di: Nishimori, Soichiro, et al.
Pubblicazione: (2025)
di: Nishimori, Soichiro, et al.
Pubblicazione: (2025)
A Policy Gradient Primal-Dual Algorithm for Constrained MDPs with Uniform PAC Guarantees
di: Kitamura, Toshinori, et al.
Pubblicazione: (2024)
di: Kitamura, Toshinori, et al.
Pubblicazione: (2024)
Toward Data Efficient Model Merging between Different Datasets without Performance Degradation
di: Yamada, Masanori, et al.
Pubblicazione: (2023)
di: Yamada, Masanori, et al.
Pubblicazione: (2023)
Mitigating Reward Hacking in RLHF via Advantage Sign Robustness
di: Ono, Shinnosuke, et al.
Pubblicazione: (2026)
di: Ono, Shinnosuke, et al.
Pubblicazione: (2026)
Fine-Tuning without Performance Degradation
di: Wang, Han, et al.
Pubblicazione: (2025)
di: Wang, Han, et al.
Pubblicazione: (2025)
Recursive Reward Aggregation
di: Tang, Yuting, et al.
Pubblicazione: (2025)
di: Tang, Yuting, et al.
Pubblicazione: (2025)
Batched Online Contextual Sparse Bandits with Sequential Inclusion of Features
di: Swiers, Rowan, et al.
Pubblicazione: (2024)
di: Swiers, Rowan, et al.
Pubblicazione: (2024)
Successive Halving with Learning Curve Prediction via Latent Kronecker Gaussian Processes
di: Lin, Jihao Andreas, et al.
Pubblicazione: (2025)
di: Lin, Jihao Andreas, et al.
Pubblicazione: (2025)
Performance Comparisons of Reinforcement Learning Algorithms for Sequential Experimental Design
di: Barlas, Yasir Zubayr, et al.
Pubblicazione: (2025)
di: Barlas, Yasir Zubayr, et al.
Pubblicazione: (2025)
On the attainment of the Wasserstein--Cramer--Rao lower bound
di: Nishimori, Hayato, et al.
Pubblicazione: (2025)
di: Nishimori, Hayato, et al.
Pubblicazione: (2025)
Optimal and Practical Batched Linear Bandit Algorithm
di: Yu, Sanghoon, et al.
Pubblicazione: (2025)
di: Yu, Sanghoon, et al.
Pubblicazione: (2025)
A Single Deep Preference-Conditioned Policy for Learning Pareto Coverage Sets
di: Kubo, Akihiro, et al.
Pubblicazione: (2026)
di: Kubo, Akihiro, et al.
Pubblicazione: (2026)
Investigating Batch Inference in a Sequential Monte Carlo Framework for Neural Networks
di: Millard, Andrew, et al.
Pubblicazione: (2026)
di: Millard, Andrew, et al.
Pubblicazione: (2026)
OneBatchPAM: A Fast and Frugal K-Medoids Algorithm
di: de Mathelin, Antoine, et al.
Pubblicazione: (2025)
di: de Mathelin, Antoine, et al.
Pubblicazione: (2025)
StableGrad: Backward Scale Control without Batch Normalization
di: Mestre, Jose I., et al.
Pubblicazione: (2026)
di: Mestre, Jose I., et al.
Pubblicazione: (2026)
An Investigation of Batch Normalization in Off-Policy Actor-Critic Algorithms
di: Wang, Li, et al.
Pubblicazione: (2025)
di: Wang, Li, et al.
Pubblicazione: (2025)
Spend More to Save More (SM2): An Energy-Aware Implementation of Successive Halving for Sustainable Hyperparameter Optimization
di: Geissler, Daniel, et al.
Pubblicazione: (2024)
di: Geissler, Daniel, et al.
Pubblicazione: (2024)
Sequential Regression Learning with Randomized Algorithms
di: Leão, Dorival, et al.
Pubblicazione: (2025)
di: Leão, Dorival, et al.
Pubblicazione: (2025)
Double Horizon Model-Based Policy Optimization
di: Kubo, Akihiro, et al.
Pubblicazione: (2025)
di: Kubo, Akihiro, et al.
Pubblicazione: (2025)
From Sequential Nodes to GPU Batches: Parallel Branch and Bound for Optimal $k$-Sparse GLMs
di: Liu, Jiachang, et al.
Pubblicazione: (2026)
di: Liu, Jiachang, et al.
Pubblicazione: (2026)
A Short Note on Batch-efficient Divide-and-Conquer Algorithm for EigenDecomposition
di: Song, Yue
Pubblicazione: (2026)
di: Song, Yue
Pubblicazione: (2026)
Risk-Aware Batch Testing for Performance Regression Detection
di: Sayedsalehi, Ali, et al.
Pubblicazione: (2026)
di: Sayedsalehi, Ali, et al.
Pubblicazione: (2026)
Supervised Batch Normalization
di: Faye, Bilal, et al.
Pubblicazione: (2024)
di: Faye, Bilal, et al.
Pubblicazione: (2024)
Robust Batched Bandits
di: Guo, Yunwen, et al.
Pubblicazione: (2025)
di: Guo, Yunwen, et al.
Pubblicazione: (2025)
Critical Batch Size Revisited: A Simple Empirical Approach to Large-Batch Language Model Training
di: Merrill, William, et al.
Pubblicazione: (2025)
di: Merrill, William, et al.
Pubblicazione: (2025)
Robust off-policy Reinforcement Learning via Soft Constrained Adversary
di: Nakanishi, Kosuke, et al.
Pubblicazione: (2024)
di: Nakanishi, Kosuke, et al.
Pubblicazione: (2024)
An FPGA-Based Accelerator for Graph Embedding using Sequential Training Algorithm
di: Sunaga, Kazuki, et al.
Pubblicazione: (2023)
di: Sunaga, Kazuki, et al.
Pubblicazione: (2023)
State-Separated SARSA: A Practical Sequential Decision-Making Algorithm with Recovering Rewards
di: Tanimoto, Yuto, et al.
Pubblicazione: (2024)
di: Tanimoto, Yuto, et al.
Pubblicazione: (2024)
C-kNN-LSH: A Nearest-Neighbor Algorithm for Sequential Counterfactual Inference
di: Wang, Jing, et al.
Pubblicazione: (2026)
di: Wang, Jing, et al.
Pubblicazione: (2026)
A General Algorithm for Detecting Higher-Order Interactions via Random Sequential Additions
di: Shamail, Ahmad, et al.
Pubblicazione: (2025)
di: Shamail, Ahmad, et al.
Pubblicazione: (2025)
Batch size invariant Adam
di: Wang, Xi, et al.
Pubblicazione: (2024)
di: Wang, Xi, et al.
Pubblicazione: (2024)
Slower Generalization, Faster Memorization: A Sweet Spot in Algorithmic Learning
di: So, Shin, et al.
Pubblicazione: (2026)
di: So, Shin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Emergence of Exploration in Policy Gradient Reinforcement Learning via Retrying
di: Nishimori, Soichiro, et al.
Pubblicazione: (2026) -
Pgx: Hardware-Accelerated Parallel Game Simulators for Reinforcement Learning
di: Koyamada, Sotetsu, et al.
Pubblicazione: (2023) -
Mahjax: A GPU-Accelerated Mahjong Simulator for Reinforcement Learning in JAX
di: Nishimori, Soichiro, et al.
Pubblicazione: (2026) -
A Simple, Solid, and Reproducible Baseline for Bridge Bidding AI
di: Kita, Haruka, et al.
Pubblicazione: (2024) -
Anytime Sequential Halving in Monte-Carlo Tree Search
di: Sagers, Dominic, et al.
Pubblicazione: (2024)