Liger: Linearizing Large Language Models to Gated Recurrent Structures
Fuente:
arXiv
Guardado en:
| Autores principales: | Lan, Disen, Sun, Weigao, Hu, Jiaxi, Du, Jusen, Cheng, Yu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MoM: Linear Sequence Modeling with Mixture-of-Memories
por: Du, Jusen, et al.
Publicado: (2025)
por: Du, Jusen, et al.
Publicado: (2025)
Native Hybrid Attention for Efficient Sequence Modeling
por: Du, Jusen, et al.
Publicado: (2025)
por: Du, Jusen, et al.
Publicado: (2025)
LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid
por: Sun, Weigao, et al.
Publicado: (2025)
por: Sun, Weigao, et al.
Publicado: (2025)
Linear-MoE: Linear Sequence Modeling Meets Mixture-of-Experts
por: Sun, Weigao, et al.
Publicado: (2025)
por: Sun, Weigao, et al.
Publicado: (2025)
Comba: Improving Bilinear RNNs with Closed-loop Control
por: Hu, Jiaxi, et al.
Publicado: (2025)
por: Hu, Jiaxi, et al.
Publicado: (2025)
Speed Always Wins: A Survey on Efficient Architectures for Large Language Models
por: Sun, Weigao, et al.
Publicado: (2025)
por: Sun, Weigao, et al.
Publicado: (2025)
Liger Kernel: Efficient Triton Kernels for LLM Training
por: Hsu, Pin-Lun, et al.
Publicado: (2024)
por: Hsu, Pin-Lun, et al.
Publicado: (2024)
Time-SSM: Simplifying and Unifying State Space Models for Time Series Forecasting
por: Hu, Jiaxi, et al.
Publicado: (2024)
por: Hu, Jiaxi, et al.
Publicado: (2024)
The Structure of Relation Decoding Linear Operators in Large Language Models
por: Christ, Miranda Anna, et al.
Publicado: (2025)
por: Christ, Miranda Anna, et al.
Publicado: (2025)
GateLoop: Fully Data-Controlled Linear Recurrence for Sequence Modeling
por: Katsch, Tobias
Publicado: (2023)
por: Katsch, Tobias
Publicado: (2023)
Equivalent Linear Mappings of Large Language Models
por: Golden, James R.
Publicado: (2025)
por: Golden, James R.
Publicado: (2025)
Fine-Grained Interpretation of Political Opinions in Large Language Models
por: Hu, Jingyu, et al.
Publicado: (2025)
por: Hu, Jingyu, et al.
Publicado: (2025)
On the Compressibility of Quantized Large Language Models
por: Mao, Yu, et al.
Publicado: (2024)
por: Mao, Yu, et al.
Publicado: (2024)
Optimal Decay Spectra for Linear Recurrences
por: Cao, Yang
Publicado: (2026)
por: Cao, Yang
Publicado: (2026)
The Linear Representation Hypothesis and the Geometry of Large Language Models
por: Park, Kiho, et al.
Publicado: (2023)
por: Park, Kiho, et al.
Publicado: (2023)
Scalable Token-Level Hallucination Detection in Large Language Models
por: Min, Rui, et al.
Publicado: (2026)
por: Min, Rui, et al.
Publicado: (2026)
Large Language Models as Topological Structure Enhancers for Text-Attributed Graphs
por: Sun, Shengyin, et al.
Publicado: (2023)
por: Sun, Shengyin, et al.
Publicado: (2023)
All Language Models Large and Small
por: Chen, Zhixun, et al.
Publicado: (2024)
por: Chen, Zhixun, et al.
Publicado: (2024)
LoLCATs: On Low-Rank Linearizing of Large Language Models
por: Zhang, Michael, et al.
Publicado: (2024)
por: Zhang, Michael, et al.
Publicado: (2024)
Adaptive Pruning for Large Language Models with Structural Importance Awareness
por: Zheng, Haotian, et al.
Publicado: (2024)
por: Zheng, Haotian, et al.
Publicado: (2024)
Recurrent Knowledge Identification and Fusion for Language Model Continual Learning
por: Feng, Yujie, et al.
Publicado: (2025)
por: Feng, Yujie, et al.
Publicado: (2025)
SambaLingo: Teaching Large Language Models New Languages
por: Csaki, Zoltan, et al.
Publicado: (2024)
por: Csaki, Zoltan, et al.
Publicado: (2024)
Filter-then-Generate: Large Language Models with Structure-Text Adapter for Knowledge Graph Completion
por: Liu, Ben, et al.
Publicado: (2024)
por: Liu, Ben, et al.
Publicado: (2024)
FaithLM: Towards Faithful Explanations for Large Language Models
por: Chuang, Yu-Neng, et al.
Publicado: (2024)
por: Chuang, Yu-Neng, et al.
Publicado: (2024)
Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models
por: Lan, Michael, et al.
Publicado: (2023)
por: Lan, Michael, et al.
Publicado: (2023)
Align to Structure: Aligning Large Language Models with Structural Information
por: Kim, Zae Myung, et al.
Publicado: (2025)
por: Kim, Zae Myung, et al.
Publicado: (2025)
Structured Agent Distillation for Large Language Model
por: Liu, Jun, et al.
Publicado: (2025)
por: Liu, Jun, et al.
Publicado: (2025)
SLOT: Structuring the Output of Large Language Models
por: Wang, Darren Yow-Bang, et al.
Publicado: (2025)
por: Wang, Darren Yow-Bang, et al.
Publicado: (2025)
PAT: Pruning-Aware Tuning for Large Language Models
por: Liu, Yijiang, et al.
Publicado: (2024)
por: Liu, Yijiang, et al.
Publicado: (2024)
Parallax: Parameterized Local Linear Attention for Language Modeling
por: Zuo, Yifei, et al.
Publicado: (2026)
por: Zuo, Yifei, et al.
Publicado: (2026)
BASE-Q: Bias and Asymmetric Scaling Enhanced Rotational Quantization for Large Language Models
por: He, Liulu, et al.
Publicado: (2025)
por: He, Liulu, et al.
Publicado: (2025)
Linguistic Blind Spots of Large Language Models
por: Cheng, Jiali, et al.
Publicado: (2025)
por: Cheng, Jiali, et al.
Publicado: (2025)
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
por: Hu, Xing, et al.
Publicado: (2024)
por: Hu, Xing, et al.
Publicado: (2024)
When Linear Attention Meets Autoregressive Decoding: Towards More Effective and Efficient Linearized Large Language Models
por: You, Haoran, et al.
Publicado: (2024)
por: You, Haoran, et al.
Publicado: (2024)
PromptIntern: Saving Inference Costs by Internalizing Recurrent Prompt during Large Language Model Fine-tuning
por: Zou, Jiaru, et al.
Publicado: (2024)
por: Zou, Jiaru, et al.
Publicado: (2024)
StructEval: Deepen and Broaden Large Language Model Assessment via Structured Evaluation
por: Cao, Boxi, et al.
Publicado: (2024)
por: Cao, Boxi, et al.
Publicado: (2024)
Exploring Multilingual Probing in Large Language Models: A Cross-Language Analysis
por: Li, Daoyang, et al.
Publicado: (2024)
por: Li, Daoyang, et al.
Publicado: (2024)
A Survey on LoRA of Large Language Models
por: Mao, Yuren, et al.
Publicado: (2024)
por: Mao, Yuren, et al.
Publicado: (2024)
Teaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence
por: McLeish, Sean, et al.
Publicado: (2025)
por: McLeish, Sean, et al.
Publicado: (2025)
On Calibration of Large Language Models: From Response To Capability
por: Yang, Sin-Han, et al.
Publicado: (2026)
por: Yang, Sin-Han, et al.
Publicado: (2026)
Ejemplares similares
-
MoM: Linear Sequence Modeling with Mixture-of-Memories
por: Du, Jusen, et al.
Publicado: (2025) -
Native Hybrid Attention for Efficient Sequence Modeling
por: Du, Jusen, et al.
Publicado: (2025) -
LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid
por: Sun, Weigao, et al.
Publicado: (2025) -
Linear-MoE: Linear Sequence Modeling Meets Mixture-of-Experts
por: Sun, Weigao, et al.
Publicado: (2025) -
Comba: Improving Bilinear RNNs with Closed-loop Control
por: Hu, Jiaxi, et al.
Publicado: (2025)