Sorted LLaMA: Unlocking the Potential of Intermediate Layers of Large Language Models for Dynamic Inference
Fuente:
arXiv
Guardado en:
| Autores principales: | Kavehzadeh, Parsa, Valipour, Mojtaba, Tahaei, Marzieh, Ghodsi, Ali, Chen, Boxing, Rezagholizadeh, Mehdi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SortedNet: A Scalable and Generalized Framework for Training Modular Deep Neural Networks
por: Valipour, Mojtaba, et al.
Publicado: (2023)
por: Valipour, Mojtaba, et al.
Publicado: (2023)
S2D: Sorted Speculative Decoding For More Efficient Deployment of Nested Large Language Models
por: Kavehzadeh, Parsa, et al.
Publicado: (2024)
por: Kavehzadeh, Parsa, et al.
Publicado: (2024)
Balcony: A Lightweight Approach to Dynamic Inference of Generative Language Models
por: Jamialahmadi, Benyamin, et al.
Publicado: (2025)
por: Jamialahmadi, Benyamin, et al.
Publicado: (2025)
QDyLoRA: Quantized Dynamic Low-Rank Adaptation for Efficient Large Language Model Tuning
por: Rajabzadeh, Hossein, et al.
Publicado: (2024)
por: Rajabzadeh, Hossein, et al.
Publicado: (2024)
ECHO-LLaMA: Efficient Caching for High-Performance LLaMA Training
por: Dialameh, Maryam, et al.
Publicado: (2025)
por: Dialameh, Maryam, et al.
Publicado: (2025)
DTRNet: Dynamic Token Routing Network to Reduce Quadratic Costs in Transformers
por: Sharma, Aman, et al.
Publicado: (2025)
por: Sharma, Aman, et al.
Publicado: (2025)
LLaMA Pro: Progressive LLaMA with Block Expansion
por: Wu, Chengyue, et al.
Publicado: (2024)
por: Wu, Chengyue, et al.
Publicado: (2024)
EchoAtt: Attend, Copy, then Adjust for More Efficient Large Language Models
por: Rajabzadeh, Hossein, et al.
Publicado: (2024)
por: Rajabzadeh, Hossein, et al.
Publicado: (2024)
Me LLaMA: Foundation Large Language Models for Medical Applications
por: Xie, Qianqian, et al.
Publicado: (2024)
por: Xie, Qianqian, et al.
Publicado: (2024)
LLaMA-MoE: Building Mixture-of-Experts from LLaMA with Continual Pre-training
por: Zhu, Tong, et al.
Publicado: (2024)
por: Zhu, Tong, et al.
Publicado: (2024)
BanglaLlama: LLaMA for Bangla Language
por: Zehady, Abdullah Khan, et al.
Publicado: (2024)
por: Zehady, Abdullah Khan, et al.
Publicado: (2024)
On the importance of Data Scale in Pretraining Arabic Language Models
por: Ghaddar, Abbas, et al.
Publicado: (2024)
por: Ghaddar, Abbas, et al.
Publicado: (2024)
Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages
por: Andersland, Michael
Publicado: (2024)
por: Andersland, Michael
Publicado: (2024)
LLaMA-Omni: Seamless Speech Interaction with Large Language Models
por: Fang, Qingkai, et al.
Publicado: (2024)
por: Fang, Qingkai, et al.
Publicado: (2024)
LogLLaMA: Transformer-based log anomaly detection with LLaMA
por: Yang, Zhuoyi, et al.
Publicado: (2025)
por: Yang, Zhuoyi, et al.
Publicado: (2025)
LLaMA-MoE v2: Exploring Sparsity of LLaMA from Perspective of Mixture-of-Experts with Post-Training
por: Qu, Xiaoye, et al.
Publicado: (2024)
por: Qu, Xiaoye, et al.
Publicado: (2024)
Shortened LLaMA: Depth Pruning for Large Language Models with Comparison of Retraining Methods
por: Kim, Bo-Kyeong, et al.
Publicado: (2024)
por: Kim, Bo-Kyeong, et al.
Publicado: (2024)
Is Bigger and Deeper Always Better? Probing LLaMA Across Scales and Layers
por: Chen, Nuo, et al.
Publicado: (2023)
por: Chen, Nuo, et al.
Publicado: (2023)
LLaMAs Have Feelings Too: Unveiling Sentiment and Emotion Representations in LLaMA Models Through Probing
por: Di Palma, Dario, et al.
Publicado: (2025)
por: Di Palma, Dario, et al.
Publicado: (2025)
LLaMA-Based Models for Aspect-Based Sentiment Analysis
por: Šmíd, Jakub, et al.
Publicado: (2025)
por: Šmíd, Jakub, et al.
Publicado: (2025)
Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression
por: Metel, Michael R., et al.
Publicado: (2024)
por: Metel, Michael R., et al.
Publicado: (2024)
LLaMA Beyond English: An Empirical Study on Language Capability Transfer
por: Zhao, Jun, et al.
Publicado: (2024)
por: Zhao, Jun, et al.
Publicado: (2024)
How Vocabulary Sharing Facilitates Multilingualism in LLaMA?
por: Yuan, Fei, et al.
Publicado: (2023)
por: Yuan, Fei, et al.
Publicado: (2023)
Metamorphic Testing for Fairness Evaluation in Large Language Models: Identifying Intersectional Bias in LLaMA and GPT
por: Reddy, Harishwar, et al.
Publicado: (2025)
por: Reddy, Harishwar, et al.
Publicado: (2025)
Parameter-Efficient Fine-Tuning of LLaMA for the Clinical Domain
por: Gema, Aryo Pradipta, et al.
Publicado: (2023)
por: Gema, Aryo Pradipta, et al.
Publicado: (2023)
Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning
por: Xia, Mengzhou, et al.
Publicado: (2023)
por: Xia, Mengzhou, et al.
Publicado: (2023)
LLaMA based Punctuation Restoration With Forward Pass Only Decoding
por: Pang, Yutong, et al.
Publicado: (2024)
por: Pang, Yutong, et al.
Publicado: (2024)
Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca
por: Cui, Yiming, et al.
Publicado: (2023)
por: Cui, Yiming, et al.
Publicado: (2023)
FedSEA-LLaMA: A Secure, Efficient and Adaptive Federated Splitting Framework for Large Language Models
por: Zhang, Zishuai, et al.
Publicado: (2025)
por: Zhang, Zishuai, et al.
Publicado: (2025)
LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention
por: Zhang, Renrui, et al.
Publicado: (2023)
por: Zhang, Renrui, et al.
Publicado: (2023)
What If We Recaption Billions of Web Images with LLaMA-3?
por: Li, Xianhang, et al.
Publicado: (2024)
por: Li, Xianhang, et al.
Publicado: (2024)
Beyond the Limits: A Survey of Techniques to Extend the Context Length in Large Language Models
por: Wang, Xindi, et al.
Publicado: (2024)
por: Wang, Xindi, et al.
Publicado: (2024)
LLaMA-Mesh: Unifying 3D Mesh Generation with Language Models
por: Wang, Zhengyi, et al.
Publicado: (2024)
por: Wang, Zhengyi, et al.
Publicado: (2024)
OncoGPT: A Medical Conversational Model Tailored with Oncology Domain Expertise on a Large Language Model Meta-AI (LLaMA)
por: Jia, Fujian, et al.
Publicado: (2024)
por: Jia, Fujian, et al.
Publicado: (2024)
LLaSE-G1: Incentivizing Generalization Capability for LLaMA-based Speech Enhancement
por: Kang, Boyi, et al.
Publicado: (2025)
por: Kang, Boyi, et al.
Publicado: (2025)
Generating Knowledge Graphs from Large Language Models: A Comparative Study of GPT-4, LLaMA 2, and BERT
por: Bhatt, Ahan, et al.
Publicado: (2024)
por: Bhatt, Ahan, et al.
Publicado: (2024)
Llamazip: Leveraging LLaMA for Lossless Text Compression and Training Dataset Detection
por: Dréano, Sören, et al.
Publicado: (2025)
por: Dréano, Sören, et al.
Publicado: (2025)
ChatGPT vs Gemini vs LLaMA on Multilingual Sentiment Analysis
por: Buscemi, Alessio, et al.
Publicado: (2024)
por: Buscemi, Alessio, et al.
Publicado: (2024)
Walia-LLM: Enhancing Amharic-LLaMA by Integrating Task-Specific and Generative Datasets
por: Azime, Israel Abebe, et al.
Publicado: (2024)
por: Azime, Israel Abebe, et al.
Publicado: (2024)
Empowering Smaller Models: Tuning LLaMA and Gemma with Chain-of-Thought for Ukrainian Exam Tasks
por: Syromiatnikov, Mykyta, et al.
Publicado: (2025)
por: Syromiatnikov, Mykyta, et al.
Publicado: (2025)
Ejemplares similares
-
SortedNet: A Scalable and Generalized Framework for Training Modular Deep Neural Networks
por: Valipour, Mojtaba, et al.
Publicado: (2023) -
S2D: Sorted Speculative Decoding For More Efficient Deployment of Nested Large Language Models
por: Kavehzadeh, Parsa, et al.
Publicado: (2024) -
Balcony: A Lightweight Approach to Dynamic Inference of Generative Language Models
por: Jamialahmadi, Benyamin, et al.
Publicado: (2025) -
QDyLoRA: Quantized Dynamic Low-Rank Adaptation for Efficient Large Language Model Tuning
por: Rajabzadeh, Hossein, et al.
Publicado: (2024) -
ECHO-LLaMA: Efficient Caching for High-Performance LLaMA Training
por: Dialameh, Maryam, et al.
Publicado: (2025)