Parameter Expanded Stochastic Gradient Markov Chain Monte Carlo
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Hyunsu, Nam, Giung, Yun, Chulhee, Yang, Hongseok, Lee, Juho |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Variational Partial Group Convolutions for Input-Aware Partial Equivariance of Rotations and Color-Shifts
di: Kim, Hyunsu, et al.
Pubblicazione: (2024)
di: Kim, Hyunsu, et al.
Pubblicazione: (2024)
Axial Neural Networks for Dimension-Free Foundation Models
di: Kim, Hyunsu, et al.
Pubblicazione: (2025)
di: Kim, Hyunsu, et al.
Pubblicazione: (2025)
Sparse Weight Averaging with Multiple Particles for Iterative Magnitude Pruning
di: Choi, Moonseok, et al.
Pubblicazione: (2023)
di: Choi, Moonseok, et al.
Pubblicazione: (2023)
Fast Ensembling with Diffusion Schrödinger Bridge
di: Kim, Hyunsu, et al.
Pubblicazione: (2024)
di: Kim, Hyunsu, et al.
Pubblicazione: (2024)
Learning Infinitesimal Generators of Continuous Symmetries from Data
di: Ko, Gyeonghoon, et al.
Pubblicazione: (2024)
di: Ko, Gyeonghoon, et al.
Pubblicazione: (2024)
Improving Constrained Language Generation via Self-Distilled Twisted Sequential Monte Carlo
di: Kim, Sooyeon, et al.
Pubblicazione: (2025)
di: Kim, Sooyeon, et al.
Pubblicazione: (2025)
The Cost of Robustness: Tighter Bounds on Parameter Complexity for Robust Memorization in ReLU Nets
di: Kim, Yujun, et al.
Pubblicazione: (2025)
di: Kim, Yujun, et al.
Pubblicazione: (2025)
Ex Uno Pluria: Insights on Ensembling in Low Precision Number Systems
di: Nam, Giung, et al.
Pubblicazione: (2024)
di: Nam, Giung, et al.
Pubblicazione: (2024)
Provable Benefit of Cutout and CutMix for Feature Learning
di: Oh, Junsoo, et al.
Pubblicazione: (2024)
di: Oh, Junsoo, et al.
Pubblicazione: (2024)
Learning to Explore for Stochastic Gradient MCMC
di: Kim, SeungHyun, et al.
Pubblicazione: (2024)
di: Kim, SeungHyun, et al.
Pubblicazione: (2024)
Policy Gradient Algorithms with Monte Carlo Tree Learning for Non-Markov Decision Processes
di: Morimura, Tetsuro, et al.
Pubblicazione: (2022)
di: Morimura, Tetsuro, et al.
Pubblicazione: (2022)
Scaling Laws of SignSGD in Linear Regression: When Does It Outperform SGD?
di: Kim, Jihwan, et al.
Pubblicazione: (2026)
di: Kim, Jihwan, et al.
Pubblicazione: (2026)
Minor First, Major Last: A Depth-Induced Implicit Bias of Sharpness-Aware Minimization
di: Moon, Chaewon, et al.
Pubblicazione: (2026)
di: Moon, Chaewon, et al.
Pubblicazione: (2026)
Lipsum-FT: Robust Fine-Tuning of Zero-Shot Models Using Random Text Guidance
di: Nam, Giung, et al.
Pubblicazione: (2024)
di: Nam, Giung, et al.
Pubblicazione: (2024)
Continuous Monte Carlo Graph Search
di: Kujanpää, Kalle, et al.
Pubblicazione: (2022)
di: Kujanpää, Kalle, et al.
Pubblicazione: (2022)
Enhancing Transfer Learning with Flexible Nonparametric Posterior Sampling
di: Lee, Hyungi, et al.
Pubblicazione: (2024)
di: Lee, Hyungi, et al.
Pubblicazione: (2024)
Lightweight Dataset Pruning without Full Training via Example Difficulty and Prediction Uncertainty
di: Cho, Yeseul, et al.
Pubblicazione: (2025)
di: Cho, Yeseul, et al.
Pubblicazione: (2025)
Arithmetic Transformers Can Length-Generalize in Both Operand Length and Count
di: Cho, Hanseul, et al.
Pubblicazione: (2024)
di: Cho, Hanseul, et al.
Pubblicazione: (2024)
DASH: Warm-Starting Neural Network Training in Stationary Settings without Loss of Plasticity
di: Shin, Baekrok, et al.
Pubblicazione: (2024)
di: Shin, Baekrok, et al.
Pubblicazione: (2024)
Implicit Bias of Per-sample Adam on Separable Data: Departure from the Full-batch Regime
di: Baek, Beomhan, et al.
Pubblicazione: (2025)
di: Baek, Beomhan, et al.
Pubblicazione: (2025)
MC$^2$A: Enabling Algorithm-Hardware Co-Design for Efficient Markov Chain Monte Carlo Acceleration
di: Zhao, Shirui, et al.
Pubblicazione: (2025)
di: Zhao, Shirui, et al.
Pubblicazione: (2025)
Stochastic Parameter Decomposition
di: Bushnaq, Lucius, et al.
Pubblicazione: (2025)
di: Bushnaq, Lucius, et al.
Pubblicazione: (2025)
Through the River: Understanding the Benefit of Schedule-Free Methods for Language Model Training
di: Song, Minhak, et al.
Pubblicazione: (2025)
di: Song, Minhak, et al.
Pubblicazione: (2025)
Efficient Monte Carlo Tree Search via On-the-Fly State-Conditioned Action Abstraction
di: Kwak, Yunhyeok, et al.
Pubblicazione: (2024)
di: Kwak, Yunhyeok, et al.
Pubblicazione: (2024)
Policy Gradient for Robust Markov Decision Processes
di: Wang, Qiuhao, et al.
Pubblicazione: (2024)
di: Wang, Qiuhao, et al.
Pubblicazione: (2024)
MemEIC: A Step Toward Continual and Compositional Knowledge Editing
di: Seong, Jin, et al.
Pubblicazione: (2025)
di: Seong, Jin, et al.
Pubblicazione: (2025)
Transformers Learn to Implement Multi-step Gradient Descent with Chain of Thought
di: Huang, Jianhao, et al.
Pubblicazione: (2025)
di: Huang, Jianhao, et al.
Pubblicazione: (2025)
Monte Carlo Permutation Search
di: Cazenave, Tristan
Pubblicazione: (2025)
di: Cazenave, Tristan
Pubblicazione: (2025)
Clarifying Shampoo: Adapting Spectral Descent to Stochasticity and the Parameter Trajectory
di: Eschenhagen, Runa, et al.
Pubblicazione: (2026)
di: Eschenhagen, Runa, et al.
Pubblicazione: (2026)
Accurate Large-sample Uncertainty Quantification using Stochastic Gradient Markov Chain Monte Carlo
di: Wang, Yu, et al.
Pubblicazione: (2026)
di: Wang, Yu, et al.
Pubblicazione: (2026)
Distilled Thompson Sampling: Practical and Efficient Thompson Sampling via Imitation Learning
di: Namkoong, Hongseok, et al.
Pubblicazione: (2020)
di: Namkoong, Hongseok, et al.
Pubblicazione: (2020)
Epistemic Monte Carlo Tree Search
di: Oren, Yaniv, et al.
Pubblicazione: (2022)
di: Oren, Yaniv, et al.
Pubblicazione: (2022)
Linear attention is (maybe) all you need (to understand transformer optimization)
di: Ahn, Kwangjun, et al.
Pubblicazione: (2023)
di: Ahn, Kwangjun, et al.
Pubblicazione: (2023)
Position Coupling: Improving Length Generalization of Arithmetic Transformers Using Task Structure
di: Cho, Hanseul, et al.
Pubblicazione: (2024)
di: Cho, Hanseul, et al.
Pubblicazione: (2024)
Active Learning with Selective Time-Step Acquisition for PDEs
di: Kim, Yegon, et al.
Pubblicazione: (2025)
di: Kim, Yegon, et al.
Pubblicazione: (2025)
A Scalable and Transferable Time Series Prediction Framework for Demand Forecasting
di: Park, Young-Jin, et al.
Pubblicazione: (2024)
di: Park, Young-Jin, et al.
Pubblicazione: (2024)
Principled Gradient-based Markov Chain Monte Carlo for Text Generation
di: Du, Li, et al.
Pubblicazione: (2023)
di: Du, Li, et al.
Pubblicazione: (2023)
Mitigating Gradient Overlap in Deep Residual Networks with Gradient Normalization for Improved Non-Convex Optimization
di: Yun, Juyoung
Pubblicazione: (2024)
di: Yun, Juyoung
Pubblicazione: (2024)
Twice Sequential Monte Carlo for Tree Search
di: Oren, Yaniv, et al.
Pubblicazione: (2025)
di: Oren, Yaniv, et al.
Pubblicazione: (2025)
Doubly Robust Monte Carlo Tree Search
di: Liu, Manqing, et al.
Pubblicazione: (2025)
di: Liu, Manqing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Variational Partial Group Convolutions for Input-Aware Partial Equivariance of Rotations and Color-Shifts
di: Kim, Hyunsu, et al.
Pubblicazione: (2024) -
Axial Neural Networks for Dimension-Free Foundation Models
di: Kim, Hyunsu, et al.
Pubblicazione: (2025) -
Sparse Weight Averaging with Multiple Particles for Iterative Magnitude Pruning
di: Choi, Moonseok, et al.
Pubblicazione: (2023) -
Fast Ensembling with Diffusion Schrödinger Bridge
di: Kim, Hyunsu, et al.
Pubblicazione: (2024) -
Learning Infinitesimal Generators of Continuous Symmetries from Data
di: Ko, Gyeonghoon, et al.
Pubblicazione: (2024)