Why Lift so Heavy? Slimming Large Language Models by Cutting Off the Layers
Fuente:
arXiv
Salvato in:
| Autori principali: | Yuan, Shuzhou, Nie, Ercong, Ma, Bolei, Färber, Michael |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Decomposed Prompting: Probing Multilingual Linguistic Structure Knowledge in Large Language Models
di: Nie, Ercong, et al.
Pubblicazione: (2024)
di: Nie, Ercong, et al.
Pubblicazione: (2024)
GNNavi: Navigating the Information Flow in Large Language Models by Graph Neural Network
di: Yuan, Shuzhou, et al.
Pubblicazione: (2024)
di: Yuan, Shuzhou, et al.
Pubblicazione: (2024)
CoDAE: Adapting Large Language Models for Education via Chain-of-Thought Data Augmentation
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
ToPro: Token-Level Prompt Decomposition for Cross-Lingual Sequence Labeling Tasks
di: Ma, Bolei, et al.
Pubblicazione: (2024)
di: Ma, Bolei, et al.
Pubblicazione: (2024)
Hateful Person or Hateful Model? Investigating the Role of Personas in Hate Speech Detection by Large Language Models
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
GraSAME: Injecting Token-Level Structural Information to Pretrained Language Models via Graph-guided Self-Attention Mechanism
di: Yuan, Shuzhou, et al.
Pubblicazione: (2024)
di: Yuan, Shuzhou, et al.
Pubblicazione: (2024)
Analyzing Bias in False Refusal Behavior of Large Language Models for Hate Speech Detoxification
di: Im, Kyuri, et al.
Pubblicazione: (2026)
di: Im, Kyuri, et al.
Pubblicazione: (2026)
Beyond Over-Refusal: Scenario-Based Diagnostics and Post-Hoc Mitigation for Exaggerated Refusals in LLMs
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
From Monolingual to Bilingual: Investigating Language Conditioning in Large Language Models for Psycholinguistic Tasks
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
LLM in the Loop: Creating the ParaDeHate Dataset for Hate Speech Detoxification
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
PoeTone: A Framework for Constrained Generation of Structured Chinese Songci with LLMs
di: Qu, Zhan, et al.
Pubblicazione: (2025)
di: Qu, Zhan, et al.
Pubblicazione: (2025)
Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models
di: Nie, Ercong, et al.
Pubblicazione: (2025)
di: Nie, Ercong, et al.
Pubblicazione: (2025)
The Imperfective Paradox in Large Language Models
di: Ma, Bolei, et al.
Pubblicazione: (2026)
di: Ma, Bolei, et al.
Pubblicazione: (2026)
Can Hallucinations Help? Boosting LLMs for Drug Discovery
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)
Tracing Relational Knowledge Recall in Large Language Models
di: Popovič, Nicholas, et al.
Pubblicazione: (2026)
di: Popovič, Nicholas, et al.
Pubblicazione: (2026)
Large Language Models as Neurolinguistic Subjects: Discrepancy between Performance and Competence
di: He, Linyang, et al.
Pubblicazione: (2024)
di: He, Linyang, et al.
Pubblicazione: (2024)
Graph-Guided Textual Explanation Generation Framework
di: Yuan, Shuzhou, et al.
Pubblicazione: (2024)
di: Yuan, Shuzhou, et al.
Pubblicazione: (2024)
Do Large Language Models Think Like the Brain? Sentence-Level Evidences from Layer-Wise Embeddings and fMRI
di: Lei, Yu, et al.
Pubblicazione: (2025)
di: Lei, Yu, et al.
Pubblicazione: (2025)
Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Language Models
di: Schreieder, Tobias, et al.
Pubblicazione: (2025)
di: Schreieder, Tobias, et al.
Pubblicazione: (2025)
Capabilities and Evaluation Biases of Large Language Models in Classical Chinese Poetry Generation: A Case Study on Tang Poetry
di: Ma, Bolei, et al.
Pubblicazione: (2025)
di: Ma, Bolei, et al.
Pubblicazione: (2025)
Table Question Answering in the Era of Large Language Models: A Comprehensive Survey of Tasks, Methods, and Evaluation
di: Zhou, Wei, et al.
Pubblicazione: (2025)
di: Zhou, Wei, et al.
Pubblicazione: (2025)
GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching
di: Su, Guinan, et al.
Pubblicazione: (2025)
di: Su, Guinan, et al.
Pubblicazione: (2025)
The Hidden Bias: A Study on Explicit and Implicit Political Stereotypes in Large Language Models
di: Löhr, Konrad, et al.
Pubblicazione: (2025)
di: Löhr, Konrad, et al.
Pubblicazione: (2025)
Language Model Re-rankers are Fooled by Lexical Similarities
di: Hagström, Lovisa, et al.
Pubblicazione: (2025)
di: Hagström, Lovisa, et al.
Pubblicazione: (2025)
Decoding Probing: Revealing Internal Linguistic Structures in Neural Language Models using Minimal Pairs
di: He, Linyang, et al.
Pubblicazione: (2024)
di: He, Linyang, et al.
Pubblicazione: (2024)
SlimMoE: Structured Compression of Large MoE Models via Expert Slimming and Distillation
di: Li, Zichong, et al.
Pubblicazione: (2025)
di: Li, Zichong, et al.
Pubblicazione: (2025)
Lost in Multilinguality: Dissecting Cross-lingual Factual Inconsistency in Transformer Language Models
di: Wang, Mingyang, et al.
Pubblicazione: (2025)
di: Wang, Mingyang, et al.
Pubblicazione: (2025)
The Potential and Challenges of Evaluating Attitudes, Opinions, and Values in Large Language Models
di: Ma, Bolei, et al.
Pubblicazione: (2024)
di: Ma, Bolei, et al.
Pubblicazione: (2024)
Knowledge Graph Structure as Prompt: Improving Small Language Models Capabilities for Knowledge-based Causal Discovery
di: Susanti, Yuni, et al.
Pubblicazione: (2024)
di: Susanti, Yuni, et al.
Pubblicazione: (2024)
Benchmarking Uncertainty Calibration in Large Language Model Long-Form Question Answering
di: Müller, Philip, et al.
Pubblicazione: (2026)
di: Müller, Philip, et al.
Pubblicazione: (2026)
Extractive Fact Decomposition for Interpretable Natural Language Inference in one Forward Pass
di: Popovič, Nicholas, et al.
Pubblicazione: (2025)
di: Popovič, Nicholas, et al.
Pubblicazione: (2025)
Evaluating Zero-Shot Multilingual Aspect-Based Sentiment Analysis with Large Language Models
di: Wu, Chengyan, et al.
Pubblicazione: (2024)
di: Wu, Chengyan, et al.
Pubblicazione: (2024)
SlimLM: An Efficient Small Language Model for On-Device Document Assistance
di: Pham, Thang M., et al.
Pubblicazione: (2024)
di: Pham, Thang M., et al.
Pubblicazione: (2024)
Too Open for Opinion? Embracing Open-Endedness in Large Language Models for Social Simulation
di: Ma, Bolei, et al.
Pubblicazione: (2025)
di: Ma, Bolei, et al.
Pubblicazione: (2025)
Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning
di: Yan, Sikuan, et al.
Pubblicazione: (2025)
di: Yan, Sikuan, et al.
Pubblicazione: (2025)
SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training
di: Tang, Shengkun, et al.
Pubblicazione: (2026)
di: Tang, Shengkun, et al.
Pubblicazione: (2026)
Cutting Off the Head Ends the Conflict: A Mechanism for Interpreting and Mitigating Knowledge Conflicts in Language Models
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models
di: Zhang, Hengyuan, et al.
Pubblicazione: (2026)
di: Zhang, Hengyuan, et al.
Pubblicazione: (2026)
Algorithmic Fidelity of Large Language Models in Generating Synthetic German Public Opinions: A Case Study
di: Ma, Bolei, et al.
Pubblicazione: (2024)
di: Ma, Bolei, et al.
Pubblicazione: (2024)
Embedded Named Entity Recognition using Probing Classifiers
di: Popovič, Nicholas, et al.
Pubblicazione: (2024)
di: Popovič, Nicholas, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Decomposed Prompting: Probing Multilingual Linguistic Structure Knowledge in Large Language Models
di: Nie, Ercong, et al.
Pubblicazione: (2024) -
GNNavi: Navigating the Information Flow in Large Language Models by Graph Neural Network
di: Yuan, Shuzhou, et al.
Pubblicazione: (2024) -
CoDAE: Adapting Large Language Models for Education via Chain-of-Thought Data Augmentation
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025) -
ToPro: Token-Level Prompt Decomposition for Cross-Lingual Sequence Labeling Tasks
di: Ma, Bolei, et al.
Pubblicazione: (2024) -
Hateful Person or Hateful Model? Investigating the Role of Personas in Hate Speech Detection by Large Language Models
di: Yuan, Shuzhou, et al.
Pubblicazione: (2025)