In-Place Test-Time Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Feng, Guhao, Luo, Shengjie, Hua, Kai, Zhang, Ge, He, Di, Huang, Wenhao, Cai, Tianle |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Two Stones Hit One Bird: Bilevel Positional Encoding for Better Length Extrapolation
par: He, Zhenyu, et autres
Publié: (2024)
par: He, Zhenyu, et autres
Publié: (2024)
How Numerical Precision Affects Arithmetical Reasoning Capabilities of LLMs
par: Feng, Guhao, et autres
Publié: (2024)
par: Feng, Guhao, et autres
Publié: (2024)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
par: Huang, Jiameng, et autres
Publié: (2025)
par: Huang, Jiameng, et autres
Publié: (2025)
Do Efficient Transformers Really Save Computation?
par: Yang, Kai, et autres
Publié: (2024)
par: Yang, Kai, et autres
Publié: (2024)
Theoretical Benefit and Limitation of Diffusion Language Model
par: Feng, Guhao, et autres
Publié: (2025)
par: Feng, Guhao, et autres
Publié: (2025)
DPO Meets PPO: Reinforced Token Optimization for RLHF
par: Zhong, Han, et autres
Publié: (2024)
par: Zhong, Han, et autres
Publié: (2024)
Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision
par: Xi, Zhiheng, et autres
Publié: (2024)
par: Xi, Zhiheng, et autres
Publié: (2024)
Let the Code LLM Edit Itself When You Edit the Code
par: He, Zhenyu, et autres
Publié: (2024)
par: He, Zhenyu, et autres
Publié: (2024)
REST: Retrieval-Based Speculative Decoding
par: He, Zhenyu, et autres
Publié: (2023)
par: He, Zhenyu, et autres
Publié: (2023)
Self-Trained Verification for Training- and Test-Time Self-Improvement
par: Wu, Chen Henry, et autres
Publié: (2026)
par: Wu, Chen Henry, et autres
Publié: (2026)
Test-Time Detoxification without Training or Learning Anything
par: Saglam, Baturay, et autres
Publié: (2026)
par: Saglam, Baturay, et autres
Publié: (2026)
SR-TTT: Surprisal-Aware Residual Test-Time Training
par: P, Swamynathan V
Publié: (2026)
par: P, Swamynathan V
Publié: (2026)
The Surprising Effectiveness of Test-Time Training for Few-Shot Learning
par: Akyürek, Ekin, et autres
Publié: (2024)
par: Akyürek, Ekin, et autres
Publié: (2024)
Enhancing Causal Reasoning in Large Language Models: A Causal Attribution Model for Precision Fine-Tuning
par: Cai, Hengrui, et autres
Publié: (2023)
par: Cai, Hengrui, et autres
Publié: (2023)
Query-Conditioned Test-Time Self-Training for Large Language Models
par: Song, Chaehee, et autres
Publié: (2026)
par: Song, Chaehee, et autres
Publié: (2026)
MesaNet: Sequence Modeling by Locally Optimal Test-Time Training
par: von Oswald, Johannes, et autres
Publié: (2025)
par: von Oswald, Johannes, et autres
Publié: (2025)
Rethinking Model-based, Policy-based, and Value-based Reinforcement Learning via the Lens of Representation Complexity
par: Feng, Guhao, et autres
Publié: (2023)
par: Feng, Guhao, et autres
Publié: (2023)
Knapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocation
par: Li, Ziniu, et autres
Publié: (2025)
par: Li, Ziniu, et autres
Publié: (2025)
Efficient Test-Time Scaling via Self-Calibration
par: Huang, Chengsong, et autres
Publié: (2025)
par: Huang, Chengsong, et autres
Publié: (2025)
Atom of Thoughts for Markov LLM Test-Time Scaling
par: Teng, Fengwei, et autres
Publié: (2025)
par: Teng, Fengwei, et autres
Publié: (2025)
Online Reasoning Calibration: Test-Time Training Enables Generalizable Conformal LLM Reasoning
par: Zhou, Cai, et autres
Publié: (2026)
par: Zhou, Cai, et autres
Publié: (2026)
Test-Time Learning for Large Language Models
par: Hu, Jinwu, et autres
Publié: (2025)
par: Hu, Jinwu, et autres
Publié: (2025)
TTSR: Test-Time Self-Reflection for Continual Reasoning Improvement
par: He, Haoyang, et autres
Publié: (2026)
par: He, Haoyang, et autres
Publié: (2026)
Large Language Models as Tool Makers
par: Cai, Tianle, et autres
Publié: (2023)
par: Cai, Tianle, et autres
Publié: (2023)
Diagnosing Training Inference Mismatch in LLM Reinforcement Learning
par: Zhong, Tianle, et autres
Publié: (2026)
par: Zhong, Tianle, et autres
Publié: (2026)
SABER: Switchable and Balanced Training for Efficient LLM Reasoning
par: Zhao, Kai, et autres
Publié: (2025)
par: Zhao, Kai, et autres
Publié: (2025)
A Depression Detection Method Based on Multi-Modal Feature Fusion Using Cross-Attention
par: Li, Shengjie, et autres
Publié: (2024)
par: Li, Shengjie, et autres
Publié: (2024)
UltraEdit: Training-, Subject-, and Memory-Free Lifelong Editing in Language Models
par: Gu, Xiaojie, et autres
Publié: (2025)
par: Gu, Xiaojie, et autres
Publié: (2025)
TrimR: Verifier-based Training-Free Thinking Compression for Efficient Test-Time Scaling
par: Lin, Weizhe, et autres
Publié: (2025)
par: Lin, Weizhe, et autres
Publié: (2025)
A Survey of Test-Time Compute: From Intuitive Inference to Deliberate Reasoning
par: Ji, Yixin, et autres
Publié: (2025)
par: Ji, Yixin, et autres
Publié: (2025)
Latency and Token-Aware Test-Time Compute
par: Huang, Jenny Y., et autres
Publié: (2025)
par: Huang, Jenny Y., et autres
Publié: (2025)
DynaPrompt: Dynamic Test-Time Prompt Tuning
par: Xiao, Zehao, et autres
Publié: (2025)
par: Xiao, Zehao, et autres
Publié: (2025)
MetaScale: Test-Time Scaling with Evolving Meta-Thoughts
par: Liu, Qin, et autres
Publié: (2025)
par: Liu, Qin, et autres
Publié: (2025)
Thoth: Mid-Training Bridges LLMs to Time Series Understanding
par: Lin, Jiafeng, et autres
Publié: (2026)
par: Lin, Jiafeng, et autres
Publié: (2026)
Rethinking the Unsolvable: When In-Context Search Meets Test-Time Scaling
par: Xia, Fanzeng, et autres
Publié: (2025)
par: Xia, Fanzeng, et autres
Publié: (2025)
Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning
par: Yu, Yongcan, et autres
Publié: (2026)
par: Yu, Yongcan, et autres
Publié: (2026)
TTCS: Test-Time Curriculum Synthesis for Self-Evolving
par: Yang, Chengyi, et autres
Publié: (2026)
par: Yang, Chengyi, et autres
Publié: (2026)
Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
par: Cui, Yingqian, et autres
Publié: (2025)
par: Cui, Yingqian, et autres
Publié: (2025)
CoSPlay: Cooperative Self-Play at Test-Time with Self-Generated Code and Unit Test
par: Hu, Zhangyi, et autres
Publié: (2026)
par: Hu, Zhangyi, et autres
Publié: (2026)
Vector Policy Optimization: Training for Diversity Improves Test-Time Search
par: Bahlous-Boldi, Ryan, et autres
Publié: (2026)
par: Bahlous-Boldi, Ryan, et autres
Publié: (2026)
Documents similaires
-
Two Stones Hit One Bird: Bilevel Positional Encoding for Better Length Extrapolation
par: He, Zhenyu, et autres
Publié: (2024) -
How Numerical Precision Affects Arithmetical Reasoning Capabilities of LLMs
par: Feng, Guhao, et autres
Publié: (2024) -
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
par: Huang, Jiameng, et autres
Publié: (2025) -
Do Efficient Transformers Really Save Computation?
par: Yang, Kai, et autres
Publié: (2024) -
Theoretical Benefit and Limitation of Diffusion Language Model
par: Feng, Guhao, et autres
Publié: (2025)