Speed Always Wins: A Survey on Efficient Architectures for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Weigao, Hu, Jiaxi, Zhou, Yucheng, Du, Jusen, Lan, Disen, Wang, Kexin, Zhu, Tong, Qu, Xiaoye, Zhang, Yu, Mo, Xiaoyu, Liu, Daizong, Liang, Yuxuan, Chen, Wenliang, Li, Guoqi, Cheng, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Liger: Linearizing Large Language Models to Gated Recurrent Structures
par: Lan, Disen, et autres
Publié: (2025)
par: Lan, Disen, et autres
Publié: (2025)
MoM: Linear Sequence Modeling with Mixture-of-Memories
par: Du, Jusen, et autres
Publié: (2025)
par: Du, Jusen, et autres
Publié: (2025)
Linear-MoE: Linear Sequence Modeling Meets Mixture-of-Experts
par: Sun, Weigao, et autres
Publié: (2025)
par: Sun, Weigao, et autres
Publié: (2025)
Comba: Improving Bilinear RNNs with Closed-loop Control
par: Hu, Jiaxi, et autres
Publié: (2025)
par: Hu, Jiaxi, et autres
Publié: (2025)
LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid
par: Sun, Weigao, et autres
Publié: (2025)
par: Sun, Weigao, et autres
Publié: (2025)
Native Hybrid Attention for Efficient Sequence Modeling
par: Du, Jusen, et autres
Publié: (2025)
par: Du, Jusen, et autres
Publié: (2025)
LLaMA-MoE v2: Exploring Sparsity of LLaMA from Perspective of Mixture-of-Experts with Post-Training
par: Qu, Xiaoye, et autres
Publié: (2024)
par: Qu, Xiaoye, et autres
Publié: (2024)
A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends
par: Liu, Daizong, et autres
Publié: (2024)
par: Liu, Daizong, et autres
Publié: (2024)
Dynamic Data Mixing Maximizes Instruction Tuning for Mixture-of-Experts
par: Zhu, Tong, et autres
Publié: (2024)
par: Zhu, Tong, et autres
Publié: (2024)
VideoSSR: Video Self-Supervised Reinforcement Learning
par: He, Zefeng, et autres
Publié: (2025)
par: He, Zefeng, et autres
Publié: (2025)
FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
par: He, Zefeng, et autres
Publié: (2025)
par: He, Zefeng, et autres
Publié: (2025)
A Survey of Efficient Reasoning for Large Reasoning Models: Language, Multimodality, and Beyond
par: Qu, Xiaoye, et autres
Publié: (2025)
par: Qu, Xiaoye, et autres
Publié: (2025)
Rethinking Video-Language Model from the Language Input Perspective
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
In This Apportionment Lottery, the House Always Wins
par: Gölz, Paul, et autres
Publié: (2022)
par: Gölz, Paul, et autres
Publié: (2022)
Towards Stabilized and Efficient Diffusion Transformers through Long-Skip-Connections with Spectral Constraints
par: Chen, Guanjie, et autres
Publié: (2024)
par: Chen, Guanjie, et autres
Publié: (2024)
Spotlight on Token Perception for Multimodal Reinforcement Learning
par: Huang, Siyuan, et autres
Publié: (2025)
par: Huang, Siyuan, et autres
Publié: (2025)
Various Lengths, Constant Speed: Efficient Language Modeling with Lightning Attention
par: Qin, Zhen, et autres
Publié: (2024)
par: Qin, Zhen, et autres
Publié: (2024)
CLIP-MoE: Towards Building Mixture of Experts for CLIP with Diversified Multiplet Upcycling
par: Zhang, Jihai, et autres
Publié: (2024)
par: Zhang, Jihai, et autres
Publié: (2024)
Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs
par: Huang, Siyuan, et autres
Publié: (2026)
par: Huang, Siyuan, et autres
Publié: (2026)
SURf: Teaching Large Vision-Language Models to Selectively Utilize Retrieved Information
par: Sun, Jiashuo, et autres
Publié: (2024)
par: Sun, Jiashuo, et autres
Publié: (2024)
How Tokenization Limits Phonological Knowledge Representation in Language Models and How to Improve Them
par: Liao, Disen, et autres
Publié: (2026)
par: Liao, Disen, et autres
Publié: (2026)
LLaMA-MoE: Building Mixture-of-Experts from LLaMA with Continual Pre-training
par: Zhu, Tong, et autres
Publié: (2024)
par: Zhu, Tong, et autres
Publié: (2024)
Time-SSM: Simplifying and Unifying State Space Models for Time Series Forecasting
par: Hu, Jiaxi, et autres
Publié: (2024)
par: Hu, Jiaxi, et autres
Publié: (2024)
ExFusion: Efficient Transformer Training via Multi-Experts Fusion
par: Ruan, Jiacheng, et autres
Publié: (2026)
par: Ruan, Jiacheng, et autres
Publié: (2026)
DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models
par: He, Zefeng, et autres
Publié: (2025)
par: He, Zefeng, et autres
Publié: (2025)
Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning
par: Liao, Xinyao, et autres
Publié: (2025)
par: Liao, Xinyao, et autres
Publié: (2025)
SEE: Continual Fine-tuning with Sequential Ensemble of Experts
par: Wang, Zhilin, et autres
Publié: (2025)
par: Wang, Zhilin, et autres
Publié: (2025)
Rethinking Weakly-supervised Video Temporal Grounding From a Game Perspective
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Learning the Unlearned: Mitigating Feature Suppression in Contrastive Learning
par: Zhang, Jihai, et autres
Publié: (2024)
par: Zhang, Jihai, et autres
Publié: (2024)
Not All Inputs Are Valid: Towards Open-Set Video Moment Retrieval Using Language
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Mitigating Multilingual Hallucination in Large Vision-Language Models
par: Qu, Xiaoye, et autres
Publié: (2024)
par: Qu, Xiaoye, et autres
Publié: (2024)
From Head to Tail: Towards Balanced Representation in Large Vision-Language Models through Adaptive Data Calibration
par: Song, Mingyang, et autres
Publié: (2025)
par: Song, Mingyang, et autres
Publié: (2025)
Look, Compare, Decide: Alleviating Hallucination in Large Vision-Language Models via Multi-View Multi-Path Reasoning
par: Qu, Xiaoye, et autres
Publié: (2024)
par: Qu, Xiaoye, et autres
Publié: (2024)
SATORI-R1: Incentivizing Multimodal Reasoning through Explicit Visual Anchoring
par: Shen, Chuming, et autres
Publié: (2025)
par: Shen, Chuming, et autres
Publié: (2025)
Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback
par: Li, Yafu, et autres
Publié: (2025)
par: Li, Yafu, et autres
Publié: (2025)
Toward Efficient Agents: Memory, Tool learning, and Planning
par: Yang, Xiaofang, et autres
Publié: (2026)
par: Yang, Xiaofang, et autres
Publié: (2026)
Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding
par: Huang, Wencan, et autres
Publié: (2025)
par: Huang, Wencan, et autres
Publié: (2025)
CO2: Efficient Distributed Training with Full Communication-Computation Overlap
par: Sun, Weigao, et autres
Publié: (2024)
par: Sun, Weigao, et autres
Publié: (2024)
GEMS: Agent-Native Multimodal Generation with Memory and Skills
par: He, Zefeng, et autres
Publié: (2026)
par: He, Zefeng, et autres
Publié: (2026)
Timo: Towards Better Temporal Reasoning for Language Models
par: Su, Zhaochen, et autres
Publié: (2024)
par: Su, Zhaochen, et autres
Publié: (2024)
Documents similaires
-
Liger: Linearizing Large Language Models to Gated Recurrent Structures
par: Lan, Disen, et autres
Publié: (2025) -
MoM: Linear Sequence Modeling with Mixture-of-Memories
par: Du, Jusen, et autres
Publié: (2025) -
Linear-MoE: Linear Sequence Modeling Meets Mixture-of-Experts
par: Sun, Weigao, et autres
Publié: (2025) -
Comba: Improving Bilinear RNNs with Closed-loop Control
par: Hu, Jiaxi, et autres
Publié: (2025) -
LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid
par: Sun, Weigao, et autres
Publié: (2025)