Accelerating Approximate Thompson Sampling with Underdamped Langevin Monte Carlo
Fuente:
arXiv
Guardado en:
| Autores principales: | Zheng, Haoyang, Deng, Wei, Moya, Christian, Lin, Guang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Rethinking Langevin Thompson Sampling from A Stochastic Approximation Perspective
por: Wang, Weixin, et al.
Publicado: (2025)
por: Wang, Weixin, et al.
Publicado: (2025)
Efficient Approximate Posterior Sampling with Annealed Langevin Monte Carlo
por: Parulekar, Advait, et al.
Publicado: (2025)
por: Parulekar, Advait, et al.
Publicado: (2025)
Constrained Exploration via Reflected Replica Exchange Stochastic Gradient Langevin Dynamics
por: Zheng, Haoyang, et al.
Publicado: (2024)
por: Zheng, Haoyang, et al.
Publicado: (2024)
Penalized Overdamped and Underdamped Langevin Monte Carlo Algorithms for Constrained Sampling
por: Gürbüzbalaban, Mert, et al.
Publicado: (2022)
por: Gürbüzbalaban, Mert, et al.
Publicado: (2022)
Dimension-Independent Convergence of Underdamped Langevin Monte Carlo in KL Divergence
por: Zhang, Shiyuan, et al.
Publicado: (2026)
por: Zhang, Shiyuan, et al.
Publicado: (2026)
Distilled Thompson Sampling: Practical and Efficient Thompson Sampling via Imitation Learning
por: Namkoong, Hongseok, et al.
Publicado: (2020)
por: Namkoong, Hongseok, et al.
Publicado: (2020)
Graph Neural Thompson Sampling
por: Wu, Shuang, et al.
Publicado: (2024)
por: Wu, Shuang, et al.
Publicado: (2024)
Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training
por: Moya, Christian, et al.
Publicado: (2026)
por: Moya, Christian, et al.
Publicado: (2026)
Thompson Sampling via Fine-Tuning of LLMs
por: Menet, Nicolas, et al.
Publicado: (2025)
por: Menet, Nicolas, et al.
Publicado: (2025)
MINTS: Minimalist Thompson Sampling
por: Wang, Kaizheng
Publicado: (2026)
por: Wang, Kaizheng
Publicado: (2026)
Contextual Thompson Sampling via Generation of Missing Data
por: Zhang, Kelly W., et al.
Publicado: (2025)
por: Zhang, Kelly W., et al.
Publicado: (2025)
Learning Solution Operators for Partial Differential Equations via Monte Carlo-Type Approximation
por: Choutri, Salah Eddine, et al.
Publicado: (2025)
por: Choutri, Salah Eddine, et al.
Publicado: (2025)
Direct Soft-Policy Sampling via Langevin Dynamics
por: Ki, Donghyeon, et al.
Publicado: (2026)
por: Ki, Donghyeon, et al.
Publicado: (2026)
Improved Bayesian Regret Bounds for Thompson Sampling in Reinforcement Learning
por: Moradipari, Ahmadreza, et al.
Publicado: (2023)
por: Moradipari, Ahmadreza, et al.
Publicado: (2023)
FedRTS: Federated Robust Pruning via Combinatorial Thompson Sampling
por: Huang, Hong, et al.
Publicado: (2025)
por: Huang, Hong, et al.
Publicado: (2025)
Improving Thompson Sampling via Information Relaxation for Budgeted Multi-armed Bandits
por: Jeong, Woojin, et al.
Publicado: (2024)
por: Jeong, Woojin, et al.
Publicado: (2024)
HomPINNs: homotopy physics-informed neural networks for solving the inverse problems of nonlinear differential equations with multiple solutions
por: Zheng, Haoyang, et al.
Publicado: (2023)
por: Zheng, Haoyang, et al.
Publicado: (2023)
Sampling for Quality: Training-Free Reward-Guided LLM Decoding via Sequential Monte Carlo
por: Markovic-Voronov, Jelena, et al.
Publicado: (2026)
por: Markovic-Voronov, Jelena, et al.
Publicado: (2026)
Ultra-Fast Language Generation via Discrete Diffusion Divergence Instruct
por: Zheng, Haoyang, et al.
Publicado: (2025)
por: Zheng, Haoyang, et al.
Publicado: (2025)
Discovering Mathematical Formulas from Data via GPT-guided Monte Carlo Tree Search
por: Li, Yanjie, et al.
Publicado: (2024)
por: Li, Yanjie, et al.
Publicado: (2024)
Monte Carlo Tree Search in the Presence of Transition Uncertainty
por: Kohankhaki, Farnaz, et al.
Publicado: (2023)
por: Kohankhaki, Farnaz, et al.
Publicado: (2023)
Monte Carlo Permutation Search
por: Cazenave, Tristan
Publicado: (2025)
por: Cazenave, Tristan
Publicado: (2025)
Fine-Tuning Diffusion Models for Molecular Generation via Reinforcement Learning and Fast Sampling
por: Lin, Guang, et al.
Publicado: (2026)
por: Lin, Guang, et al.
Publicado: (2026)
Accelerating Langevin Monte Carlo Sampling: A Large Deviations Analysis
por: Yao, Nian, et al.
Publicado: (2025)
por: Yao, Nian, et al.
Publicado: (2025)
BOTS: Batch Bayesian Optimization of Extended Thompson Sampling for Severely Episode-Limited RL Settings
por: Karine, Karine, et al.
Publicado: (2024)
por: Karine, Karine, et al.
Publicado: (2024)
Solving Linear-Gaussian Bayesian Inverse Problems with Decoupled Diffusion Sequential Monte Carlo
por: Kelvinius, Filip Ekström, et al.
Publicado: (2025)
por: Kelvinius, Filip Ekström, et al.
Publicado: (2025)
Epistemic Monte Carlo Tree Search
por: Oren, Yaniv, et al.
Publicado: (2022)
por: Oren, Yaniv, et al.
Publicado: (2022)
Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning
por: Xie, Yuxi, et al.
Publicado: (2024)
por: Xie, Yuxi, et al.
Publicado: (2024)
SPO: Sequential Monte Carlo Policy Optimisation
por: Macfarlane, Matthew V, et al.
Publicado: (2024)
por: Macfarlane, Matthew V, et al.
Publicado: (2024)
Monte Carlo Tree Search with Boltzmann Exploration
por: Painter, Michael, et al.
Publicado: (2024)
por: Painter, Michael, et al.
Publicado: (2024)
Twice Sequential Monte Carlo for Tree Search
por: Oren, Yaniv, et al.
Publicado: (2025)
por: Oren, Yaniv, et al.
Publicado: (2025)
Doubly Robust Monte Carlo Tree Search
por: Liu, Manqing, et al.
Publicado: (2025)
por: Liu, Manqing, et al.
Publicado: (2025)
PID-controlled Langevin Dynamics for Faster Sampling of Generative Models
por: Chen, Hongyi, et al.
Publicado: (2025)
por: Chen, Hongyi, et al.
Publicado: (2025)
Optimism Stabilizes Thompson Sampling for Adaptive Inference
por: Yan, Shunxing, et al.
Publicado: (2026)
por: Yan, Shunxing, et al.
Publicado: (2026)
Decision Potential Surface: A Theoretical and Practical Approximation of Large Language Model Decision Boundary
por: Liang, Zi, et al.
Publicado: (2025)
por: Liang, Zi, et al.
Publicado: (2025)
Diff-Instruct with Diffused Reward: Towards Principled One-step Generator RL
por: Wu, Junyi, et al.
Publicado: (2026)
por: Wu, Junyi, et al.
Publicado: (2026)
Anytime Sequential Halving in Monte-Carlo Tree Search
por: Sagers, Dominic, et al.
Publicado: (2024)
por: Sagers, Dominic, et al.
Publicado: (2024)
Improving GFlowNets with Monte Carlo Tree Search
por: Morozov, Nikita, et al.
Publicado: (2024)
por: Morozov, Nikita, et al.
Publicado: (2024)
Monte Carlo Tree Diffusion for System 2 Planning
por: Yoon, Jaesik, et al.
Publicado: (2025)
por: Yoon, Jaesik, et al.
Publicado: (2025)
Sequential Monte Carlo for Policy Optimization in Continuous POMDPs
por: Abdulsamad, Hany, et al.
Publicado: (2025)
por: Abdulsamad, Hany, et al.
Publicado: (2025)
Ejemplares similares
-
Rethinking Langevin Thompson Sampling from A Stochastic Approximation Perspective
por: Wang, Weixin, et al.
Publicado: (2025) -
Efficient Approximate Posterior Sampling with Annealed Langevin Monte Carlo
por: Parulekar, Advait, et al.
Publicado: (2025) -
Constrained Exploration via Reflected Replica Exchange Stochastic Gradient Langevin Dynamics
por: Zheng, Haoyang, et al.
Publicado: (2024) -
Penalized Overdamped and Underdamped Langevin Monte Carlo Algorithms for Constrained Sampling
por: Gürbüzbalaban, Mert, et al.
Publicado: (2022) -
Dimension-Independent Convergence of Underdamped Langevin Monte Carlo in KL Divergence
por: Zhang, Shiyuan, et al.
Publicado: (2026)