Adaptive Layer-skipping in Pre-trained LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Luo, Xuan, Wang, Weizhi, Yan, Xifeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Direct Multi-Token Decoding
por: Luo, Xuan, et al.
Publicado: (2025)
por: Luo, Xuan, et al.
Publicado: (2025)
Learning When Not to Attend Globally
por: Luo, Xuan, et al.
Publicado: (2025)
por: Luo, Xuan, et al.
Publicado: (2025)
Automated Detection of Pre-training Text in Black-box LLMs
por: Hu, Ruihan, et al.
Publicado: (2025)
por: Hu, Ruihan, et al.
Publicado: (2025)
Bot or Human? Detecting ChatGPT Imposters with A Single Question
por: Wang, Hong, et al.
Publicado: (2023)
por: Wang, Hong, et al.
Publicado: (2023)
Pre-training LLMs using human-like development data corpus
por: Bhardwaj, Khushi, et al.
Publicado: (2023)
por: Bhardwaj, Khushi, et al.
Publicado: (2023)
Pre-trained Large Language Models for Financial Sentiment Analysis
por: Luo, Wei, et al.
Publicado: (2024)
por: Luo, Wei, et al.
Publicado: (2024)
Open-Qwen2VL: Compute-Efficient Pre-Training of Fully-Open Multimodal LLMs on Academic Resources
por: Wang, Weizhi, et al.
Publicado: (2025)
por: Wang, Weizhi, et al.
Publicado: (2025)
STAGE: Simplified Text-Attributed Graph Embeddings Using Pre-trained LLMs
por: Zolnai-Lucas, Aaron, et al.
Publicado: (2024)
por: Zolnai-Lucas, Aaron, et al.
Publicado: (2024)
Adaptive Few-shot Prompting for Machine Translation with Pre-trained Language Models
por: Tang, Lei, et al.
Publicado: (2025)
por: Tang, Lei, et al.
Publicado: (2025)
Efficient Language Adaptive Pre-training: Extending State-of-the-Art Large Language Models for Polish
por: Ruciński, Szymon
Publicado: (2024)
por: Ruciński, Szymon
Publicado: (2024)
Personalized Turn-Level User Conversation Satisfaction Benchmark
por: Wang, Zhefan, et al.
Publicado: (2026)
por: Wang, Zhefan, et al.
Publicado: (2026)
Synergistic Anchored Contrastive Pre-training for Few-Shot Relation Extraction
por: Luo, Da, et al.
Publicado: (2023)
por: Luo, Da, et al.
Publicado: (2023)
LangCell: Language-Cell Pre-training for Cell Identity Understanding
por: Zhao, Suyuan, et al.
Publicado: (2024)
por: Zhao, Suyuan, et al.
Publicado: (2024)
Scaling LLM Pre-training with Vocabulary Curriculum
por: Yu, Fangyuan
Publicado: (2025)
por: Yu, Fangyuan
Publicado: (2025)
Exploring the Benefit of Activation Sparsity in Pre-training
por: Zhang, Zhengyan, et al.
Publicado: (2024)
por: Zhang, Zhengyan, et al.
Publicado: (2024)
TransGPT: Multi-modal Generative Pre-trained Transformer for Transportation
por: Wang, Peng, et al.
Publicado: (2024)
por: Wang, Peng, et al.
Publicado: (2024)
Towards Smarter Hiring: Are Zero-Shot and Few-Shot Pre-trained LLMs Ready for HR Spoken Interview Transcript Analysis?
por: Maity, Subhankar, et al.
Publicado: (2025)
por: Maity, Subhankar, et al.
Publicado: (2025)
Benchmarking the Performance of Pre-trained LLMs across Urdu NLP Tasks
por: Tahir, Munief Hassan, et al.
Publicado: (2024)
por: Tahir, Munief Hassan, et al.
Publicado: (2024)
PreCog: Exploring the Relation between Memorization and Performance in Pre-trained Language Models
por: Ranaldi, Leonardo, et al.
Publicado: (2023)
por: Ranaldi, Leonardo, et al.
Publicado: (2023)
StoryBench: A Dynamic Benchmark for Evaluating Long-Term Memory with Multi Turns
por: Wan, Luanbo, et al.
Publicado: (2025)
por: Wan, Luanbo, et al.
Publicado: (2025)
Zero, Finite, and Infinite Belief History of Theory of Mind Reasoning in Large Language Models
por: Tang, Weizhi, et al.
Publicado: (2024)
por: Tang, Weizhi, et al.
Publicado: (2024)
ToM-LM: Delegating Theory of Mind Reasoning to External Symbolic Executors in Large Language Models
por: Tang, Weizhi, et al.
Publicado: (2024)
por: Tang, Weizhi, et al.
Publicado: (2024)
Teaching LLMs According to Their Aptitude: Adaptive Reasoning for Mathematical Problem Solving
por: Xu, Xin, et al.
Publicado: (2025)
por: Xu, Xin, et al.
Publicado: (2025)
Probing Language Models for Pre-training Data Detection
por: Liu, Zhenhua, et al.
Publicado: (2024)
por: Liu, Zhenhua, et al.
Publicado: (2024)
A Logical Pattern Memory Pre-trained Model for Entailment Tree Generation
por: Yuan, Li, et al.
Publicado: (2024)
por: Yuan, Li, et al.
Publicado: (2024)
SPAFIT: Stratified Progressive Adaptation Fine-tuning for Pre-trained Large Language Models
por: Arora, Samir, et al.
Publicado: (2024)
por: Arora, Samir, et al.
Publicado: (2024)
AdaptGOT: A Pre-trained Model for Adaptive Contextual POI Representation Learning
por: Ren, Xiaobin, et al.
Publicado: (2025)
por: Ren, Xiaobin, et al.
Publicado: (2025)
Can Pre-trained Language Models Understand Chinese Humor?
por: Chen, Yuyan, et al.
Publicado: (2024)
por: Chen, Yuyan, et al.
Publicado: (2024)
Spike No More: Stabilizing the Pre-training of Large Language Models
por: Takase, Sho, et al.
Publicado: (2023)
por: Takase, Sho, et al.
Publicado: (2023)
Hallucination Detection with the Internal Layers of LLMs
por: Preiß, Martin
Publicado: (2025)
por: Preiß, Martin
Publicado: (2025)
B-cos LM: Efficiently Transforming Pre-trained Language Models for Improved Explainability
por: Wang, Yifan, et al.
Publicado: (2025)
por: Wang, Yifan, et al.
Publicado: (2025)
HiFloat4 Format for Language Model Pre-training on Ascend NPUs
por: Taghian, Mehran, et al.
Publicado: (2026)
por: Taghian, Mehran, et al.
Publicado: (2026)
Compensating Distribution Drifts in Class-incremental Learning of Pre-trained Vision Transformers
por: Rao, Xuan, et al.
Publicado: (2025)
por: Rao, Xuan, et al.
Publicado: (2025)
Rethinking the Chain-of-Thought: The Roles of In-Context Learning and Pre-trained Priors
por: Yang, Hao, et al.
Publicado: (2025)
por: Yang, Hao, et al.
Publicado: (2025)
Boosting Explainability through Selective Rationalization in Pre-trained Language Models
por: Yuan, Libing, et al.
Publicado: (2025)
por: Yuan, Libing, et al.
Publicado: (2025)
DataMan: Data Manager for Pre-training Large Language Models
por: Peng, Ru, et al.
Publicado: (2025)
por: Peng, Ru, et al.
Publicado: (2025)
DocMamba: Efficient Document Pre-training with State Space Model
por: Hu, Pengfei, et al.
Publicado: (2024)
por: Hu, Pengfei, et al.
Publicado: (2024)
From N-grams to Pre-trained Multilingual Models For Language Identification
por: Sindane, Thapelo, et al.
Publicado: (2024)
por: Sindane, Thapelo, et al.
Publicado: (2024)
Understanding Data Temporality Impact on Large Language Models Pre-training
por: Pilchen, Hippolyte, et al.
Publicado: (2026)
por: Pilchen, Hippolyte, et al.
Publicado: (2026)
RegMix: Data Mixture as Regression for Language Model Pre-training
por: Liu, Qian, et al.
Publicado: (2024)
por: Liu, Qian, et al.
Publicado: (2024)
Ejemplares similares
-
Direct Multi-Token Decoding
por: Luo, Xuan, et al.
Publicado: (2025) -
Learning When Not to Attend Globally
por: Luo, Xuan, et al.
Publicado: (2025) -
Automated Detection of Pre-training Text in Black-box LLMs
por: Hu, Ruihan, et al.
Publicado: (2025) -
Bot or Human? Detecting ChatGPT Imposters with A Single Question
por: Wang, Hong, et al.
Publicado: (2023) -
Pre-training LLMs using human-like development data corpus
por: Bhardwaj, Khushi, et al.
Publicado: (2023)