Search for Efficient Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Shen, Xuan, Zhao, Pu, Gong, Yifan, Kong, Zhenglun, Zhan, Zheng, Wu, Yushu, Lin, Ming, Wu, Chao, Lin, Xue, Wang, Yanzhi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Exploring Token Pruning in Vision State Space Models
von: Zhan, Zheng, et al.
Veröffentlicht: (2024)
von: Zhan, Zheng, et al.
Veröffentlicht: (2024)
Fast and Memory-Efficient Video Diffusion Using Streamlined Inference
von: Zhan, Zheng, et al.
Veröffentlicht: (2024)
von: Zhan, Zheng, et al.
Veröffentlicht: (2024)
Pruning Foundation Models for High Accuracy without Retraining
von: Zhao, Pu, et al.
Veröffentlicht: (2024)
von: Zhao, Pu, et al.
Veröffentlicht: (2024)
Rethinking Token Reduction for State Space Models
von: Zhan, Zheng, et al.
Veröffentlicht: (2024)
von: Zhan, Zheng, et al.
Veröffentlicht: (2024)
Squat: Quant Small Language Models on the Edge
von: Shen, Xuan, et al.
Veröffentlicht: (2024)
von: Shen, Xuan, et al.
Veröffentlicht: (2024)
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
von: Shen, Xuan, et al.
Veröffentlicht: (2023)
von: Shen, Xuan, et al.
Veröffentlicht: (2023)
Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment
von: Liu, Jun, et al.
Veröffentlicht: (2024)
von: Liu, Jun, et al.
Veröffentlicht: (2024)
Structured Agent Distillation for Large Language Model
von: Liu, Jun, et al.
Veröffentlicht: (2025)
von: Liu, Jun, et al.
Veröffentlicht: (2025)
RoRA: Efficient Fine-Tuning of LLM with Reliability Optimization for Rank Adaptation
von: Liu, Jun, et al.
Veröffentlicht: (2025)
von: Liu, Jun, et al.
Veröffentlicht: (2025)
Taming Diffusion for Dataset Distillation with High Representativeness
von: Zhao, Lin, et al.
Veröffentlicht: (2025)
von: Zhao, Lin, et al.
Veröffentlicht: (2025)
OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation
von: Zhao, Lin, et al.
Veröffentlicht: (2026)
von: Zhao, Lin, et al.
Veröffentlicht: (2026)
TSLA: A Task-Specific Learning Adaptation for Semantic Segmentation on Autonomous Vehicles Platform
von: Liu, Jun, et al.
Veröffentlicht: (2025)
von: Liu, Jun, et al.
Veröffentlicht: (2025)
When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making
von: Liu, Jun, et al.
Veröffentlicht: (2026)
von: Liu, Jun, et al.
Veröffentlicht: (2026)
Token Reduction Should Go Beyond Efficiency in Generative Models -- From Vision, Language to Multimodality
von: Kong, Zhenglun, et al.
Veröffentlicht: (2025)
von: Kong, Zhenglun, et al.
Veröffentlicht: (2025)
PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference
von: Zhao, Yushu, et al.
Veröffentlicht: (2025)
von: Zhao, Yushu, et al.
Veröffentlicht: (2025)
Efficient Reasoning with Hidden Thinking
von: Shen, Xuan, et al.
Veröffentlicht: (2025)
von: Shen, Xuan, et al.
Veröffentlicht: (2025)
Quasar-ViT: Hardware-Oriented Quantization-Aware Architecture Search for Vision Transformers
von: Li, Zhengang, et al.
Veröffentlicht: (2024)
von: Li, Zhengang, et al.
Veröffentlicht: (2024)
RCR-Router: Efficient Role-Aware Context Routing for Multi-Agent LLM Systems with Structured Memory
von: Liu, Jun, et al.
Veröffentlicht: (2025)
von: Liu, Jun, et al.
Veröffentlicht: (2025)
USimAgent: Large Language Models for Simulating Search Users
von: Zhang, Erhan, et al.
Veröffentlicht: (2024)
von: Zhang, Erhan, et al.
Veröffentlicht: (2024)
Lotus: learning-based online thermal and latency variation management for two-stage detectors on edge devices
von: Gong, Yifan, et al.
Veröffentlicht: (2024)
von: Gong, Yifan, et al.
Veröffentlicht: (2024)
EvoMerge: Neuroevolution for Large Language Models
von: Jiang, Yushu
Veröffentlicht: (2024)
von: Jiang, Yushu
Veröffentlicht: (2024)
DraftAttention: Fast Video Diffusion via Low-Resolution Attention Guidance
von: Shen, Xuan, et al.
Veröffentlicht: (2025)
von: Shen, Xuan, et al.
Veröffentlicht: (2025)
Routing Mamba: Scaling State Space Models with Mixture-of-Experts Projection
von: Zhan, Zheng, et al.
Veröffentlicht: (2025)
von: Zhan, Zheng, et al.
Veröffentlicht: (2025)
Efficient Training with Denoised Neural Weights
von: Gong, Yifan, et al.
Veröffentlicht: (2024)
von: Gong, Yifan, et al.
Veröffentlicht: (2024)
Tandem: Riding Together with Large and Small Language Models for Efficient Reasoning
von: Fu, Zichuan, et al.
Veröffentlicht: (2026)
von: Fu, Zichuan, et al.
Veröffentlicht: (2026)
FastCar: Cache Attentive Replay for Fast Auto-Regressive Video Generation on the Edge
von: Shen, Xuan, et al.
Veröffentlicht: (2025)
von: Shen, Xuan, et al.
Veröffentlicht: (2025)
SPREG: Structured Plan Repair with Entropy-Guided Test-Time Intervention for Large Language Model Reasoning
von: Wang, Xuan, et al.
Veröffentlicht: (2026)
von: Wang, Xuan, et al.
Veröffentlicht: (2026)
Legal Documents Drafting with Fine-Tuned Pre-Trained Large Language Model
von: Lin, Chun-Hsien, et al.
Veröffentlicht: (2024)
von: Lin, Chun-Hsien, et al.
Veröffentlicht: (2024)
Knowing without Acting: The Disentangled Geometry of Safety Mechanisms in Large Language Models
von: Wu, Jinman, et al.
Veröffentlicht: (2026)
von: Wu, Jinman, et al.
Veröffentlicht: (2026)
Numerical Pruning for Efficient Autoregressive Models
von: Shen, Xuan, et al.
Veröffentlicht: (2024)
von: Shen, Xuan, et al.
Veröffentlicht: (2024)
SimpleLLM4AD: An End-to-End Vision-Language Model with Graph Visual Question Answering for Autonomous Driving
von: Zheng, Peiru, et al.
Veröffentlicht: (2024)
von: Zheng, Peiru, et al.
Veröffentlicht: (2024)
MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router
von: Xie, Yanyue, et al.
Veröffentlicht: (2024)
von: Xie, Yanyue, et al.
Veröffentlicht: (2024)
Over-Searching in Search-Augmented Large Language Models
von: Xie, Roy, et al.
Veröffentlicht: (2026)
von: Xie, Roy, et al.
Veröffentlicht: (2026)
AyE-Edge: Automated Deployment Space Search Empowering Accuracy yet Efficient Real-Time Object Detection on the Edge
von: Wu, Chao, et al.
Veröffentlicht: (2024)
von: Wu, Chao, et al.
Veröffentlicht: (2024)
Massive Editing for Large Language Models Based on Dynamic Weight Generation
von: Wan, Wentao, et al.
Veröffentlicht: (2025)
von: Wan, Wentao, et al.
Veröffentlicht: (2025)
CoLLM-NAS: Collaborative Large Language Models for Efficient Knowledge-Guided Neural Architecture Search
von: Li, Zhe, et al.
Veröffentlicht: (2025)
von: Li, Zhe, et al.
Veröffentlicht: (2025)
Property Enhanced Instruction Tuning for Multi-task Molecule Generation with Large Language Models
von: Lin, Xuan, et al.
Veröffentlicht: (2024)
von: Lin, Xuan, et al.
Veröffentlicht: (2024)
Flash Communication: Reducing Tensor Parallelization Bottleneck for Fast Large Language Model Inference
von: Li, Qingyuan, et al.
Veröffentlicht: (2024)
von: Li, Qingyuan, et al.
Veröffentlicht: (2024)
E$^{2}$GAN: Efficient Training of Efficient GANs for Image-to-Image Translation
von: Gong, Yifan, et al.
Veröffentlicht: (2024)
von: Gong, Yifan, et al.
Veröffentlicht: (2024)
Sparsity-Aware Low-Rank Representation for Efficient Fine-Tuning of Large Language Models
von: Zhang, Longteng, et al.
Veröffentlicht: (2026)
von: Zhang, Longteng, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Exploring Token Pruning in Vision State Space Models
von: Zhan, Zheng, et al.
Veröffentlicht: (2024) -
Fast and Memory-Efficient Video Diffusion Using Streamlined Inference
von: Zhan, Zheng, et al.
Veröffentlicht: (2024) -
Pruning Foundation Models for High Accuracy without Retraining
von: Zhao, Pu, et al.
Veröffentlicht: (2024) -
Rethinking Token Reduction for State Space Models
von: Zhan, Zheng, et al.
Veröffentlicht: (2024) -
Squat: Quant Small Language Models on the Edge
von: Shen, Xuan, et al.
Veröffentlicht: (2024)