Skip a Layer or Loop it? Test-Time Depth Adaptation of Pretrained LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Ziyue, Li, Yang, Zhou, Tianyi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without Test
par: Li, Ziyue, et autres
Publié: (2025)
par: Li, Ziyue, et autres
Publié: (2025)
C3PO: Critical-Layer, Core-Expert, Collaborative Pathway Optimization for Test-Time Expert Re-Mixing
par: Li, Zhongyang, et autres
Publié: (2025)
par: Li, Zhongyang, et autres
Publié: (2025)
R2-T2: Re-Routing in Test-Time for Multimodal Mixture-of-Experts
par: Li, Zhongyang, et autres
Publié: (2025)
par: Li, Zhongyang, et autres
Publié: (2025)
Routing Manifold Alignment Improves Generalization of Mixture-of-Experts LLMs
par: Li, Zhongyang, et autres
Publié: (2025)
par: Li, Zhongyang, et autres
Publié: (2025)
Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free
par: Li, Ziyue, et autres
Publié: (2024)
par: Li, Ziyue, et autres
Publié: (2024)
How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
Test-Time Adaptation for Depth Completion
par: Park, Hyoungseob, et autres
Publié: (2024)
par: Park, Hyoungseob, et autres
Publié: (2024)
Online Test-Time Adaptation of Spatial-Temporal Traffic Flow Forecasting
par: Guo, Pengxin, et autres
Publié: (2024)
par: Guo, Pengxin, et autres
Publié: (2024)
LoopUS: Recasting Pretrained LLMs into Looped Latent Refinement Models
par: Park, Taekhyun, et autres
Publié: (2026)
par: Park, Taekhyun, et autres
Publié: (2026)
What Happened in LLMs Layers when Trained for Fast vs. Slow Thinking: A Gradient Perspective
par: Li, Ming, et autres
Publié: (2024)
par: Li, Ming, et autres
Publié: (2024)
Many-Objective Multi-Solution Transport
par: Li, Ziyue, et autres
Publié: (2024)
par: Li, Ziyue, et autres
Publié: (2024)
Learning to Skip the Middle Layers of Transformers
par: Lawson, Tim, et autres
Publié: (2025)
par: Lawson, Tim, et autres
Publié: (2025)
Test-Time Adaptation by Causal Trimming
par: Liu, Yingnan, et autres
Publié: (2025)
par: Liu, Yingnan, et autres
Publié: (2025)
Pretrained Diffusion Models Are Inherently Skipped-Step Samplers
par: Xu, Wenju
Publié: (2025)
par: Xu, Wenju
Publié: (2025)
R-Tuning: Wavelet-Decomposed Replay and Semantic Alignment for Continual Adaptation of Pretrained Time-Series Models
par: Yin, Tianyi, et autres
Publié: (2025)
par: Yin, Tianyi, et autres
Publié: (2025)
On the Learnability of Test-Time Adaptation: A Recovery Complexity Perspective
par: Zhou, Zhi, et autres
Publié: (2026)
par: Zhou, Zhi, et autres
Publié: (2026)
Self-Bootstrapping for Versatile Test-Time Adaptation
par: Niu, Shuaicheng, et autres
Publié: (2025)
par: Niu, Shuaicheng, et autres
Publié: (2025)
Variational Continual Test-Time Adaptation
par: Lyu, Fan, et autres
Publié: (2024)
par: Lyu, Fan, et autres
Publié: (2024)
DASH: Input-Aware Dynamic Layer Skipping for Efficient LLM Inference with Markov Decision Policies
par: Yang, Ning, et autres
Publié: (2025)
par: Yang, Ning, et autres
Publié: (2025)
Noisy Test-Time Adaptation in Vision-Language Models
par: Cao, Chentao, et autres
Publié: (2025)
par: Cao, Chentao, et autres
Publié: (2025)
Skipping Computations in Multimodal LLMs
par: Shukor, Mustafa, et autres
Publié: (2024)
par: Shukor, Mustafa, et autres
Publié: (2024)
FoCTTA: Low-Memory Continual Test-Time Adaptation with Focus
par: Hu, Youbing, et autres
Publié: (2025)
par: Hu, Youbing, et autres
Publié: (2025)
Learning to Generate Gradients for Test-Time Adaptation via Test-Time Training Layers
par: Deng, Qi, et autres
Publié: (2024)
par: Deng, Qi, et autres
Publié: (2024)
Structural Alignment Improves Graph Test-Time Adaptation
par: Hsu, Hans Hao-Hsun, et autres
Publié: (2025)
par: Hsu, Hans Hao-Hsun, et autres
Publié: (2025)
Reduce Computational Complexity for Convolutional Layers by Skipping Zeros
par: Zhang, Zhiyi, et autres
Publié: (2023)
par: Zhang, Zhiyi, et autres
Publié: (2023)
A Layer Selection Approach to Test Time Adaptation
par: Sahoo, Sabyasachi, et autres
Publié: (2024)
par: Sahoo, Sabyasachi, et autres
Publié: (2024)
Impact of Bottleneck Layers and Skip Connections on the Generalization of Linear Denoising Autoencoders
par: Ham, Jonghyun, et autres
Publié: (2025)
par: Ham, Jonghyun, et autres
Publié: (2025)
Test-Time Efficient Pretrained Model Portfolios for Time Series Forecasting
par: Kayaalp, Mert, et autres
Publié: (2025)
par: Kayaalp, Mert, et autres
Publié: (2025)
ConfLayers: Adaptive Confidence-based Layer Skipping for Self-Speculative Decoding
par: Amer, Walaa, et autres
Publié: (2026)
par: Amer, Walaa, et autres
Publié: (2026)
PoSE: Efficient Context Window Extension of LLMs via Positional Skip-wise Training
par: Zhu, Dawei, et autres
Publié: (2023)
par: Zhu, Dawei, et autres
Publié: (2023)
Federated Learning with Layer Skipping: Efficient Training of Large Language Models for Healthcare NLP
par: Zhang, Lihong, et autres
Publié: (2025)
par: Zhang, Lihong, et autres
Publié: (2025)
Active Test-Time Adaptation: Theoretical Analyses and An Algorithm
par: Gui, Shurui, et autres
Publié: (2024)
par: Gui, Shurui, et autres
Publié: (2024)
Skip-It? Theoretical Conditions for Layer Skipping in Vision-Language Models
par: Hartman, Max, et autres
Publié: (2025)
par: Hartman, Max, et autres
Publié: (2025)
Generative Pretrained Hierarchical Transformer for Time Series Forecasting
par: Liu, Zhiding, et autres
Publié: (2024)
par: Liu, Zhiding, et autres
Publié: (2024)
Scaling Atomistic Protein Binder Design with Generative Pretraining and Test-Time Compute
par: Didi, Kieran, et autres
Publié: (2026)
par: Didi, Kieran, et autres
Publié: (2026)
On the Adversarial Risk of Test Time Adaptation: An Investigation into Realistic Test-Time Data Poisoning
par: Su, Yongyi, et autres
Publié: (2024)
par: Su, Yongyi, et autres
Publié: (2024)
Fully Test-time Adaptation for Tabular Data
par: Zhou, Zhi, et autres
Publié: (2024)
par: Zhou, Zhi, et autres
Publié: (2024)
Controllable Continual Test-Time Adaptation
par: Shi, Ziqi, et autres
Publié: (2024)
par: Shi, Ziqi, et autres
Publié: (2024)
Pretrained LLMs as Real-Time Controllers for Robot Operated Serial Production Line
par: Waseem, Muhammad, et autres
Publié: (2025)
par: Waseem, Muhammad, et autres
Publié: (2025)
When Fewer Layers Break More Chains: Layer Pruning Harms Test-Time Scaling in LLMs
par: Wang, Keyu, et autres
Publié: (2025)
par: Wang, Keyu, et autres
Publié: (2025)
Documents similaires
-
Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without Test
par: Li, Ziyue, et autres
Publié: (2025) -
C3PO: Critical-Layer, Core-Expert, Collaborative Pathway Optimization for Test-Time Expert Re-Mixing
par: Li, Zhongyang, et autres
Publié: (2025) -
R2-T2: Re-Routing in Test-Time for Multimodal Mixture-of-Experts
par: Li, Zhongyang, et autres
Publié: (2025) -
Routing Manifold Alignment Improves Generalization of Mixture-of-Experts LLMs
par: Li, Zhongyang, et autres
Publié: (2025) -
Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free
par: Li, Ziyue, et autres
Publié: (2024)