Dynamic layer selection in decoder-only transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Glavas, Theodore, Chataoui, Joud, Regol, Florence, Jabbour, Wassim, Valkanas, Antonios, Oreshkin, Boris N., Coates, Mark |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Jointly-Learned Exit and Inference for a Dynamic Neural Network : JEI-DNN
par: Regol, Florence, et autres
Publié: (2023)
par: Regol, Florence, et autres
Publié: (2023)
MODL: Multilearner Online Deep Learning
par: Valkanas, Antonios, et autres
Publié: (2024)
par: Valkanas, Antonios, et autres
Publié: (2024)
Predicting Probabilities of Error to Combine Quantization and Early Exiting: QuEE
par: Regol, Florence, et autres
Publié: (2024)
par: Regol, Florence, et autres
Publié: (2024)
SKOLR: Structured Koopman Operator Linear RNN for Time-Series Forecasting
par: Zhang, Yitian, et autres
Publié: (2025)
par: Zhang, Yitian, et autres
Publié: (2025)
Interacting Diffusion Processes for Event Sequence Forecasting
par: Zeng, Mai, et autres
Publié: (2023)
par: Zeng, Mai, et autres
Publié: (2023)
C3PO: Optimized Large Language Model Cascades with Probabilistic Cost Constraints for Reasoning
par: Valkanas, Antonios, et autres
Publié: (2025)
par: Valkanas, Antonios, et autres
Publié: (2025)
When to retrain a machine learning model
par: Florence, Regol, et autres
Publié: (2025)
par: Florence, Regol, et autres
Publié: (2025)
A decoder-only foundation model for time-series forecasting
par: Das, Abhimanyu, et autres
Publié: (2023)
par: Das, Abhimanyu, et autres
Publié: (2023)
Scavenging Hyena: Distilling Transformers into Long Convolution Models
par: Ralambomihanta, Tokiniaina Raharison, et autres
Publié: (2024)
par: Ralambomihanta, Tokiniaina Raharison, et autres
Publié: (2024)
FEval-TTC: Fair Evaluation Protocol for Test-Time Compute
par: Rumiantsev, Pavel, et autres
Publié: (2025)
par: Rumiantsev, Pavel, et autres
Publié: (2025)
Leveraging Open Information Extraction for More Robust Domain Transfer of Event Trigger Detection
par: Dukić, David, et autres
Publié: (2023)
par: Dukić, David, et autres
Publié: (2023)
InnerThoughts: Disentangling Representations and Predictions in Large Language Models
par: Chételat, Didier, et autres
Publié: (2025)
par: Chételat, Didier, et autres
Publié: (2025)
Plain Transformers Can be Powerful Graph Learners
par: Ma, Liheng, et autres
Publié: (2025)
par: Ma, Liheng, et autres
Publié: (2025)
Estimating near-verbatim extraction risk in language models with decoding-constrained beam search
par: Cooper, A. Feder, et autres
Publié: (2026)
par: Cooper, A. Feder, et autres
Publié: (2026)
ENTP: Encoder-only Next Token Prediction
par: Ewer, Ethan, et autres
Publié: (2024)
par: Ewer, Ethan, et autres
Publié: (2024)
Compositional Steering of Large Language Models with Steering Tokens
par: Radevski, Gorjan, et autres
Publié: (2026)
par: Radevski, Gorjan, et autres
Publié: (2026)
Large Language Models are Miscalibrated In-Context Learners
par: Li, Chengzu, et autres
Publié: (2023)
par: Li, Chengzu, et autres
Publié: (2023)
Towards smaller, faster decoder-only transformers: Architectural variants and their implications
par: Suresh, Sathya Krishnan, et autres
Publié: (2024)
par: Suresh, Sathya Krishnan, et autres
Publié: (2024)
Mixture-of-Depths: Dynamically allocating compute in transformer-based language models
par: Raposo, David, et autres
Publié: (2024)
par: Raposo, David, et autres
Publié: (2024)
Safe Language Generation in the Limit
par: Anastasopoulos, Antonios, et autres
Publié: (2026)
par: Anastasopoulos, Antonios, et autres
Publié: (2026)
Everybody Prune Now: Structured Pruning of LLMs with only Forward Passes
par: Kolawole, Steven, et autres
Publié: (2024)
par: Kolawole, Steven, et autres
Publié: (2024)
Permute-and-Flip: An optimally stable and watermarkable decoder for LLMs
par: Zhao, Xuandong, et autres
Publié: (2024)
par: Zhao, Xuandong, et autres
Publié: (2024)
Decoding Partial Differential Equations: Cross-Modal Adaptation of Decoder-only Models to PDEs
par: García-de-Herreros, Paloma, et autres
Publié: (2025)
par: García-de-Herreros, Paloma, et autres
Publié: (2025)
Enhancing Logical Reasoning in Large Language Models through Graph-based Synthetic Data
par: Zhou, Jiaming, et autres
Publié: (2024)
par: Zhou, Jiaming, et autres
Publié: (2024)
Text-only domain adaptation for end-to-end ASR using integrated text-to-mel-spectrogram generator
par: Bataev, Vladimir, et autres
Publié: (2023)
par: Bataev, Vladimir, et autres
Publié: (2023)
Unsupervised Domain Adaptation Approaches for Chessboard Recognition
par: Jabbour, Wassim, et autres
Publié: (2024)
par: Jabbour, Wassim, et autres
Publié: (2024)
Speech foundation models in healthcare: Effect of layer selection on pathological speech feature prediction
par: Wiepert, Daniela A., et autres
Publié: (2024)
par: Wiepert, Daniela A., et autres
Publié: (2024)
Dynamic sparsity in tree-structured feed-forward layers at scale
par: Sedghi, Reza, et autres
Publié: (2026)
par: Sedghi, Reza, et autres
Publié: (2026)
It Takes Two: Your GRPO Is Secretly DPO
par: Wu, Yihong, et autres
Publié: (2025)
par: Wu, Yihong, et autres
Publié: (2025)
Probabilistic Pretraining for Neural Regression
par: Oreshkin, Boris N., et autres
Publié: (2025)
par: Oreshkin, Boris N., et autres
Publié: (2025)
Wings: Learning Multimodal LLMs without Text-only Forgetting
par: Zhang, Yi-Kai, et autres
Publié: (2024)
par: Zhang, Yi-Kai, et autres
Publié: (2024)
Gloss2Text: Sign Language Gloss translation using LLMs and Semantically Aware Label Smoothing
par: Fayyazsanavi, Pooya, et autres
Publié: (2024)
par: Fayyazsanavi, Pooya, et autres
Publié: (2024)
AttentionStitch: How Attention Solves the Speech Editing Problem
par: Alexos, Antonios, et autres
Publié: (2024)
par: Alexos, Antonios, et autres
Publié: (2024)
Faithfulness Evaluation for Decoder-only LLM Attributions with Controlled Retained Information
par: Huang, Xin, et autres
Publié: (2026)
par: Huang, Xin, et autres
Publié: (2026)
Iteration Head: A Mechanistic Study of Chain-of-Thought
par: Cabannes, Vivien, et autres
Publié: (2024)
par: Cabannes, Vivien, et autres
Publié: (2024)
A path to natural language through tokenisation and transformers
par: Berman, David S., et autres
Publié: (2026)
par: Berman, David S., et autres
Publié: (2026)
Pareto Optimal Learning for Estimating Large Language Model Errors
par: Zhao, Theodore, et autres
Publié: (2023)
par: Zhao, Theodore, et autres
Publié: (2023)
Boosting classification reliability of NLP transformer models in the long run
par: Kmetty, Zoltán, et autres
Publié: (2023)
par: Kmetty, Zoltán, et autres
Publié: (2023)
Personalized Negative Reservoir for Incremental Learning in Recommender Systems
par: Valkanas, Antonios, et autres
Publié: (2024)
par: Valkanas, Antonios, et autres
Publié: (2024)
You only need 4 extra tokens: Synergistic Test-time Adaptation for LLMs
par: Xu, Yijie, et autres
Publié: (2025)
par: Xu, Yijie, et autres
Publié: (2025)
Documents similaires
-
Jointly-Learned Exit and Inference for a Dynamic Neural Network : JEI-DNN
par: Regol, Florence, et autres
Publié: (2023) -
MODL: Multilearner Online Deep Learning
par: Valkanas, Antonios, et autres
Publié: (2024) -
Predicting Probabilities of Error to Combine Quantization and Early Exiting: QuEE
par: Regol, Florence, et autres
Publié: (2024) -
SKOLR: Structured Koopman Operator Linear RNN for Time-Series Forecasting
par: Zhang, Yitian, et autres
Publié: (2025) -
Interacting Diffusion Processes for Event Sequence Forecasting
par: Zeng, Mai, et autres
Publié: (2023)