Detecting and Mitigating the Correct-Answer Extinction Window in Test-Time Reinforcement Learning with Majority Voting
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Hongxiang, Kuai, Zhirui, Xue, Erpeng, Wang, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment
par: Lin, Hongxiang, et autres
Publié: (2026)
par: Lin, Hongxiang, et autres
Publié: (2026)
Learning to Answer from Correct Demonstrations
par: Joshi, Nirmit, et autres
Publié: (2025)
par: Joshi, Nirmit, et autres
Publié: (2025)
Rewarding the Journey, Not Just the Destination: A Composite Path and Answer Self-Scoring Reward Mechanism for Test-Time Reinforcement Learning
par: Xing, Jingyu, et autres
Publié: (2025)
par: Xing, Jingyu, et autres
Publié: (2025)
Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning
par: Yu, Yongcan, et autres
Publié: (2026)
par: Yu, Yongcan, et autres
Publié: (2026)
Multi-period Learning for Financial Time Series Forecasting
par: Zhang, Xu, et autres
Publié: (2025)
par: Zhang, Xu, et autres
Publié: (2025)
Multi-View Majority Vote Learning Algorithms: Direct Minimization of PAC-Bayesian Bounds
par: Hennequin, Mehdi, et autres
Publié: (2024)
par: Hennequin, Mehdi, et autres
Publié: (2024)
The Majority Vote Paradigm Shift: When Popular Meets Optimal
par: Purificato, Antonio, et autres
Publié: (2025)
par: Purificato, Antonio, et autres
Publié: (2025)
C-voting: Confidence-Based Test-Time Voting without Explicit Energy Functions
par: Kubo, Kenji, et autres
Publié: (2026)
par: Kubo, Kenji, et autres
Publié: (2026)
Learning on the Job: Test-Time Curricula for Targeted Reinforcement Learning
par: Hübotter, Jonas, et autres
Publié: (2025)
par: Hübotter, Jonas, et autres
Publié: (2025)
IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking
par: Beigi, Mohammad, et autres
Publié: (2026)
par: Beigi, Mohammad, et autres
Publié: (2026)
What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time
par: Yan, Dong, et autres
Publié: (2026)
par: Yan, Dong, et autres
Publié: (2026)
Rethinking Optimal Verification Granularity for Compute-Efficient Test-Time Scaling
par: Chen, Hao Mark, et autres
Publié: (2025)
par: Chen, Hao Mark, et autres
Publié: (2025)
Minimax Optimality and Spectral Routing for Majority-Vote Ensembles under Markov Dependence
par: Shihab, Ibne Farabi, et autres
Publié: (2026)
par: Shihab, Ibne Farabi, et autres
Publié: (2026)
Edge-DIRECT: A Deep Reinforcement Learning-based Method for Solving Heterogeneous Electric Vehicle Routing Problem with Time Window Constraints
par: Mozhdehi, Arash, et autres
Publié: (2024)
par: Mozhdehi, Arash, et autres
Publié: (2024)
Reconcile Certified Robustness and Accuracy for DNN-based Smoothed Majority Vote Classifier
par: Jin, Gaojie, et autres
Publié: (2025)
par: Jin, Gaojie, et autres
Publié: (2025)
Mitigating Label Shift in Tabular In-Context Learning via Test-Time Posterior Adjustment
par: Lee, Seunghan
Publié: (2026)
par: Lee, Seunghan
Publié: (2026)
ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism
par: Liu, Jia, et autres
Publié: (2025)
par: Liu, Jia, et autres
Publié: (2025)
ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning
par: Zhao, Chu, et autres
Publié: (2026)
par: Zhao, Chu, et autres
Publié: (2026)
Learning to Solve Orienteering Problem with Time Windows and Variable Profits
par: Gao, Songqun, et autres
Publié: (2026)
par: Gao, Songqun, et autres
Publié: (2026)
Reinforcement Learning Teachers of Test Time Scaling
par: Cetin, Edoardo, et autres
Publié: (2025)
par: Cetin, Edoardo, et autres
Publié: (2025)
Is Inverse Reinforcement Learning Harder than Standard Reinforcement Learning? A Theoretical Perspective
par: Zhao, Lei, et autres
Publié: (2023)
par: Zhao, Lei, et autres
Publié: (2023)
Dual Turing Test: A Framework for Detecting and Mitigating Undetectable AI
par: Messina, Alberto
Publié: (2025)
par: Messina, Alberto
Publié: (2025)
Lyapunov-Guided Self-Alignment: Test-Time Adaptation for Offline Safe Reinforcement Learning
par: Han, Seungyub, et autres
Publié: (2026)
par: Han, Seungyub, et autres
Publié: (2026)
Superhuman AI for Stratego Using Self-Play Reinforcement Learning and Test-Time Search
par: Sokota, Samuel, et autres
Publié: (2025)
par: Sokota, Samuel, et autres
Publié: (2025)
Learning to Clean: Reinforcement Learning for Noisy Label Correction
par: Heidari, Marzi, et autres
Publié: (2025)
par: Heidari, Marzi, et autres
Publié: (2025)
Learning to Discover at Test Time
par: Yuksekgonul, Mert, et autres
Publié: (2026)
par: Yuksekgonul, Mert, et autres
Publié: (2026)
Proving that Cryptic Crossword Clue Answers are Correct
par: Andrews, Martin, et autres
Publié: (2024)
par: Andrews, Martin, et autres
Publié: (2024)
Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning
par: Wu, Jiayun, et autres
Publié: (2025)
par: Wu, Jiayun, et autres
Publié: (2025)
Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning
par: Zhu, Ting, et autres
Publié: (2024)
par: Zhu, Ting, et autres
Publié: (2024)
Mitigating Plasticity Loss in Continual Reinforcement Learning by Reducing Churn
par: Tang, Hongyao, et autres
Publié: (2025)
par: Tang, Hongyao, et autres
Publié: (2025)
MCTS-Judge: Test-Time Scaling in LLM-as-a-Judge for Code Correctness Evaluation
par: Wang, Yutong, et autres
Publié: (2025)
par: Wang, Yutong, et autres
Publié: (2025)
Offline Reinforcement Learning with OOD State Correction and OOD Action Suppression
par: Mao, Yixiu, et autres
Publié: (2024)
par: Mao, Yixiu, et autres
Publié: (2024)
DRTA: Dynamic Reward Scaling for Reinforcement Learning in Time Series Anomaly Detection
par: Golchin, Bahareh, et autres
Publié: (2025)
par: Golchin, Bahareh, et autres
Publié: (2025)
VIGraph: Generative Self-supervised Learning for Class-Imbalanced Node Classification
par: Hu, Yulan, et autres
Publié: (2023)
par: Hu, Yulan, et autres
Publié: (2023)
Time-Series Contrastive Learning against False Negatives and Class Imbalance
par: Jin, Xiyuan, et autres
Publié: (2023)
par: Jin, Xiyuan, et autres
Publié: (2023)
Test-driven Reinforcement Learning in Continuous Control
par: Yu, Zhao, et autres
Publié: (2025)
par: Yu, Zhao, et autres
Publié: (2025)
Refining Latent Representations: A Generative SSL Approach for Heterogeneous Graph Learning
par: Hu, Yulan, et autres
Publié: (2023)
par: Hu, Yulan, et autres
Publié: (2023)
Fine-Tuning Diffusion Models for Molecular Generation via Reinforcement Learning and Fast Sampling
par: Lin, Guang, et autres
Publié: (2026)
par: Lin, Guang, et autres
Publié: (2026)
Test Time Learning for Time Series Forecasting
par: Christou, Panayiotis, et autres
Publié: (2024)
par: Christou, Panayiotis, et autres
Publié: (2024)
Let Experts Feel Uncertainty: A Multi-Expert Label Distribution Approach to Probabilistic Time Series Forecasting
par: Zhou, Zhen, et autres
Publié: (2026)
par: Zhou, Zhen, et autres
Publié: (2026)
Documents similaires
-
SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment
par: Lin, Hongxiang, et autres
Publié: (2026) -
Learning to Answer from Correct Demonstrations
par: Joshi, Nirmit, et autres
Publié: (2025) -
Rewarding the Journey, Not Just the Destination: A Composite Path and Answer Self-Scoring Reward Mechanism for Test-Time Reinforcement Learning
par: Xing, Jingyu, et autres
Publié: (2025) -
Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning
par: Yu, Yongcan, et autres
Publié: (2026) -
Multi-period Learning for Financial Time Series Forecasting
par: Zhang, Xu, et autres
Publié: (2025)