Enregistré dans:
| Auteurs principaux: | Ebihara, Akinori F., Miyagawa, Taiki, Sakurai, Kazuyuki, Imaoka, Hitoshi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2501.18059 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Accurate Evaluation of Quickest Changepoint Detectors via Non-parametric Survival Analysis
par: Miyagawa, Taiki, et autres
Publié: (2026)
par: Miyagawa, Taiki, et autres
Publié: (2026)
Rethinking the Backbone in Class Imbalanced Federated Source Free Domain Adaptation: The Utility of Vision Foundation Models
par: Kihara, Kosuke, et autres
Publié: (2025)
par: Kihara, Kosuke, et autres
Publié: (2025)
Federated Source-free Domain Adaptation for Classification: Weighted Cluster Aggregation for Unlabeled Data
par: Mori, Junki, et autres
Publié: (2024)
par: Mori, Junki, et autres
Publié: (2024)
ConSol: Sequential Probability Ratio Testing to Find Consistent LLM Reasoning Paths Efficiently
par: Lee, Jaeyeon, et autres
Publié: (2025)
par: Lee, Jaeyeon, et autres
Publié: (2025)
Prompt Tuning for Audio Deepfake Detection: Computationally Efficient Test-time Domain Adaptation with Limited Target Dataset
par: Oiso, Hideyuki, et autres
Publié: (2024)
par: Oiso, Hideyuki, et autres
Publié: (2024)
Physics-informed Neural Networks for Functional Differential Equations: Cylindrical Approximation and Its Convergence Guarantees
par: Miyagawa, Taiki, et autres
Publié: (2024)
par: Miyagawa, Taiki, et autres
Publié: (2024)
TERMINATOR: Learning Optimal Exit Points for Early Stopping in Chain-of-Thought Reasoning
par: Nagle, Alliot, et autres
Publié: (2026)
par: Nagle, Alliot, et autres
Publié: (2026)
Statistical Early Stopping for Reasoning Models
par: Xie, Yangxinyu, et autres
Publié: (2026)
par: Xie, Yangxinyu, et autres
Publié: (2026)
Rethinking Early Stopping: Refine, Then Calibrate
par: Berta, Eugène, et autres
Publié: (2025)
par: Berta, Eugène, et autres
Publié: (2025)
Know When to Abstain: Optimal Selective Classification with Likelihood Ratios
par: Heng, Alvin, et autres
Publié: (2025)
par: Heng, Alvin, et autres
Publié: (2025)
S2O: Early Stopping for Sparse Attention via Online Permutation
par: Zhang, Yu, et autres
Publié: (2026)
par: Zhang, Yu, et autres
Publié: (2026)
Learning to Stop Overthinking at Test Time
par: Bao, Hieu Tran, et autres
Publié: (2025)
par: Bao, Hieu Tran, et autres
Publié: (2025)
ESPO: Early-Stopping Proximal Policy Optimization
par: Li, Zihang, et autres
Publié: (2026)
par: Li, Zihang, et autres
Publié: (2026)
Early Stopping for Large Reasoning Models via Confidence Dynamics
par: Hosseini, Parsa, et autres
Publié: (2026)
par: Hosseini, Parsa, et autres
Publié: (2026)
BandPO: Bridging Trust Regions and Ratio Clipping via Probability-Aware Bounds for LLM Reinforcement Learning
par: Li, Yuan, et autres
Publié: (2026)
par: Li, Yuan, et autres
Publié: (2026)
Stop Regressing: Training Value Functions via Classification for Scalable Deep RL
par: Farebrother, Jesse, et autres
Publié: (2024)
par: Farebrother, Jesse, et autres
Publié: (2024)
Random Policy Enables In-Context Reinforcement Learning within Trust Horizons
par: Chen, Weiqin, et autres
Publié: (2024)
par: Chen, Weiqin, et autres
Publié: (2024)
Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation
par: Dai, Juntao, et autres
Publié: (2024)
par: Dai, Juntao, et autres
Publié: (2024)
BEACON: Bayesian Optimal Stopping for Efficient LLM Sampling
par: Wan, Guangya, et autres
Publié: (2025)
par: Wan, Guangya, et autres
Publié: (2025)
Don't Waste Your Time: Early Stopping Cross-Validation
par: Bergman, Edward, et autres
Publié: (2024)
par: Bergman, Edward, et autres
Publié: (2024)
Optimal Bayesian Stopping for Efficient Inference of Consistent LLM Answers
par: Huang, Jingkai, et autres
Publié: (2026)
par: Huang, Jingkai, et autres
Publié: (2026)
Learning Intrusion Prevention Policies through Optimal Stopping
par: Hammar, Kim, et autres
Publié: (2021)
par: Hammar, Kim, et autres
Publié: (2021)
Optimal Look-back Horizon for Time Series Forecasting in Federated Learning
par: Tang, Dahao, et autres
Publié: (2025)
par: Tang, Dahao, et autres
Publié: (2025)
LLM Probability Concentration: How Alignment Shrinks the Generative Horizon
par: Yang, Chenghao, et autres
Publié: (2025)
par: Yang, Chenghao, et autres
Publié: (2025)
Scheduled Curiosity-Deep Dyna-Q: Efficient Exploration for Dialog Policy Learning
par: Niu, Xuecheng, et autres
Publié: (2024)
par: Niu, Xuecheng, et autres
Publié: (2024)
Thinking While Listening: Fast-Slow Recurrence for Long-Horizon Sequential Modeling
par: Takashiro, Shota, et autres
Publié: (2026)
par: Takashiro, Shota, et autres
Publié: (2026)
Intrusion Prevention through Optimal Stopping
par: Hammar, Kim, et autres
Publié: (2021)
par: Hammar, Kim, et autres
Publié: (2021)
A Practical Two-Stage Recipe for Mathematical LLMs: Maximizing Accuracy with SFT and Efficiency with Reinforcement Learning
par: Yoshihara, Hiroshi, et autres
Publié: (2025)
par: Yoshihara, Hiroshi, et autres
Publié: (2025)
Robust Deepfake Detection for Electronic Know Your Customer Systems Using Registered Images
par: Amada, Takuma, et autres
Publié: (2025)
par: Amada, Takuma, et autres
Publié: (2025)
Optimal Sequential Decision-Making in Geosteering: A Reinforcement Learning Approach
par: Muhammad, Ressi Bonti, et autres
Publié: (2023)
par: Muhammad, Ressi Bonti, et autres
Publié: (2023)
Scaling Optimal LR Across Token Horizons
par: Bjorck, Johan, et autres
Publié: (2024)
par: Bjorck, Johan, et autres
Publié: (2024)
Deep Learning-Based Hypoglycemia Classification Across Multiple Prediction Horizons
par: Cinar, Beyza, et autres
Publié: (2025)
par: Cinar, Beyza, et autres
Publié: (2025)
Cost-optimal Sequential Testing via Doubly Robust Q-learning
par: Zhou, Doudou, et autres
Publié: (2026)
par: Zhou, Doudou, et autres
Publié: (2026)
The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL
par: Li, Yingru, et autres
Publié: (2026)
par: Li, Yingru, et autres
Publié: (2026)
Personalized Federated Learning via Sequential Layer Expansion in Representation Learning
par: Jang, Jaewon, et autres
Publié: (2024)
par: Jang, Jaewon, et autres
Publié: (2024)
Horizon Generalization in Reinforcement Learning
par: Myers, Vivek, et autres
Publié: (2025)
par: Myers, Vivek, et autres
Publié: (2025)
Learning for Long-Horizon Planning via Neuro-Symbolic Abductive Imitation
par: Shao, Jie-Jing, et autres
Publié: (2024)
par: Shao, Jie-Jing, et autres
Publié: (2024)
Dynamic Angle Selection in X-Ray CT: A Reinforcement Learning Approach to Optimal Stopping
par: Wang, Tianyuan, et autres
Publié: (2025)
par: Wang, Tianyuan, et autres
Publié: (2025)
Implicit Statistical Inference in Transformers: Approximating Likelihood-Ratio Tests In-Context
par: Chaudhry, Faris, et autres
Publié: (2026)
par: Chaudhry, Faris, et autres
Publié: (2026)
Can Machines Learn the True Probabilities?
par: Kim, Jinsook
Publié: (2024)
par: Kim, Jinsook
Publié: (2024)
Documents similaires
-
Accurate Evaluation of Quickest Changepoint Detectors via Non-parametric Survival Analysis
par: Miyagawa, Taiki, et autres
Publié: (2026) -
Rethinking the Backbone in Class Imbalanced Federated Source Free Domain Adaptation: The Utility of Vision Foundation Models
par: Kihara, Kosuke, et autres
Publié: (2025) -
Federated Source-free Domain Adaptation for Classification: Weighted Cluster Aggregation for Unlabeled Data
par: Mori, Junki, et autres
Publié: (2024) -
ConSol: Sequential Probability Ratio Testing to Find Consistent LLM Reasoning Paths Efficiently
par: Lee, Jaeyeon, et autres
Publié: (2025) -
Prompt Tuning for Audio Deepfake Detection: Computationally Efficient Test-time Domain Adaptation with Limited Target Dataset
par: Oiso, Hideyuki, et autres
Publié: (2024)