Squat: Quant Small Language Models on the Edge
Fuente:
arXiv
Salvato in:
| Autori principali: | Shen, Xuan, Dong, Peiyan, Kong, Zhenglun, Gong, Yifan, Yang, Changdi, Han, Zhaoyang, Xie, Yanyue, Lu, Lei, Lyu, Cheng, Wu, Chao, Wang, Yanzhi, Zhao, Pu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
di: Shen, Xuan, et al.
Pubblicazione: (2023)
di: Shen, Xuan, et al.
Pubblicazione: (2023)
Rethinking Token Reduction for State Space Models
di: Zhan, Zheng, et al.
Pubblicazione: (2024)
di: Zhan, Zheng, et al.
Pubblicazione: (2024)
RoRA: Efficient Fine-Tuning of LLM with Reliability Optimization for Rank Adaptation
di: Liu, Jun, et al.
Pubblicazione: (2025)
di: Liu, Jun, et al.
Pubblicazione: (2025)
Search for Efficient Large Language Models
di: Shen, Xuan, et al.
Pubblicazione: (2024)
di: Shen, Xuan, et al.
Pubblicazione: (2024)
Structured Agent Distillation for Large Language Model
di: Liu, Jun, et al.
Pubblicazione: (2025)
di: Liu, Jun, et al.
Pubblicazione: (2025)
Fast and Memory-Efficient Video Diffusion Using Streamlined Inference
di: Zhan, Zheng, et al.
Pubblicazione: (2024)
di: Zhan, Zheng, et al.
Pubblicazione: (2024)
Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment
di: Liu, Jun, et al.
Pubblicazione: (2024)
di: Liu, Jun, et al.
Pubblicazione: (2024)
Enabling Flexible Multi-LLM Integration for Scalable Knowledge Aggregation
di: Kong, Zhenglun, et al.
Pubblicazione: (2025)
di: Kong, Zhenglun, et al.
Pubblicazione: (2025)
Quasar-ViT: Hardware-Oriented Quantization-Aware Architecture Search for Vision Transformers
di: Li, Zhengang, et al.
Pubblicazione: (2024)
di: Li, Zhengang, et al.
Pubblicazione: (2024)
DraftAttention: Fast Video Diffusion via Low-Resolution Attention Guidance
di: Shen, Xuan, et al.
Pubblicazione: (2025)
di: Shen, Xuan, et al.
Pubblicazione: (2025)
Pruning Foundation Models for High Accuracy without Retraining
di: Zhao, Pu, et al.
Pubblicazione: (2024)
di: Zhao, Pu, et al.
Pubblicazione: (2024)
TSLA: A Task-Specific Learning Adaptation for Semantic Segmentation on Autonomous Vehicles Platform
di: Liu, Jun, et al.
Pubblicazione: (2025)
di: Liu, Jun, et al.
Pubblicazione: (2025)
RCR-Router: Efficient Role-Aware Context Routing for Multi-Agent LLM Systems with Structured Memory
di: Liu, Jun, et al.
Pubblicazione: (2025)
di: Liu, Jun, et al.
Pubblicazione: (2025)
FastCar: Cache Attentive Replay for Fast Auto-Regressive Video Generation on the Edge
di: Shen, Xuan, et al.
Pubblicazione: (2025)
di: Shen, Xuan, et al.
Pubblicazione: (2025)
Exploring Token Pruning in Vision State Space Models
di: Zhan, Zheng, et al.
Pubblicazione: (2024)
di: Zhan, Zheng, et al.
Pubblicazione: (2024)
HybridFlow: Infusing Continuity into Masked Codebook for Extreme Low-Bitrate Image Compression
di: Lu, Lei, et al.
Pubblicazione: (2024)
di: Lu, Lei, et al.
Pubblicazione: (2024)
Collaborative Compression for Large-Scale MoE Deployment on Edge
di: Chen, Yixiao, et al.
Pubblicazione: (2025)
di: Chen, Yixiao, et al.
Pubblicazione: (2025)
When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making
di: Liu, Jun, et al.
Pubblicazione: (2026)
di: Liu, Jun, et al.
Pubblicazione: (2026)
QuartDepth: Post-Training Quantization for Real-Time Depth Estimation on the Edge
di: Shen, Xuan, et al.
Pubblicazione: (2025)
di: Shen, Xuan, et al.
Pubblicazione: (2025)
DiffClass: Diffusion-Based Class Incremental Learning
di: Meng, Zichong, et al.
Pubblicazione: (2024)
di: Meng, Zichong, et al.
Pubblicazione: (2024)
InstructGIE: Towards Generalizable Image Editing
di: Meng, Zichong, et al.
Pubblicazione: (2024)
di: Meng, Zichong, et al.
Pubblicazione: (2024)
ALTER: All-in-One Layer Pruning and Temporal Expert Routing for Efficient Diffusion Generation
di: Yang, Xiaomeng, et al.
Pubblicazione: (2025)
di: Yang, Xiaomeng, et al.
Pubblicazione: (2025)
AyE-Edge: Automated Deployment Space Search Empowering Accuracy yet Efficient Real-Time Object Detection on the Edge
di: Wu, Chao, et al.
Pubblicazione: (2024)
di: Wu, Chao, et al.
Pubblicazione: (2024)
7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement
di: Zhao, Pu, et al.
Pubblicazione: (2024)
di: Zhao, Pu, et al.
Pubblicazione: (2024)
Open-Source Multimodal Moxin Models with Moxin-VLM and Moxin-VLA
di: Zhao, Pu, et al.
Pubblicazione: (2025)
di: Zhao, Pu, et al.
Pubblicazione: (2025)
LLM App Squatting and Cloning
di: Xie, Yinglin, et al.
Pubblicazione: (2024)
di: Xie, Yinglin, et al.
Pubblicazione: (2024)
SuperFlow: A Fully-Customized RTL-to-GDS Design Automation Flow for Adiabatic Quantum-Flux-Parametron Superconducting Circuits
di: Xie, Yanyue, et al.
Pubblicazione: (2024)
di: Xie, Yanyue, et al.
Pubblicazione: (2024)
OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation
di: Zhao, Lin, et al.
Pubblicazione: (2026)
di: Zhao, Lin, et al.
Pubblicazione: (2026)
MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router
di: Xie, Yanyue, et al.
Pubblicazione: (2024)
di: Xie, Yanyue, et al.
Pubblicazione: (2024)
QuantMCP: Grounding Large Language Models in Verifiable Financial Reality
di: Zeng, Yifan
Pubblicazione: (2025)
di: Zeng, Yifan
Pubblicazione: (2025)
Learning Through Unhoming. Extended Squatting Time and Agentic Homemaking After Squatting in Rome
di: Chiara Cacciotti
Pubblicazione: (2026)
di: Chiara Cacciotti
Pubblicazione: (2026)
Squatting in Rio de Janeiro
di: Wittger, Bea
Pubblicazione: (2021)
di: Wittger, Bea
Pubblicazione: (2021)
Using Isometric Squat Strength to Predict Concentric and Eccentric Squat Strength in Young and Older Adults
di: Michael T. Dunn, et al.
Pubblicazione: (2025)
di: Michael T. Dunn, et al.
Pubblicazione: (2025)
Lotus: learning-based online thermal and latency variation management for two-stage detectors on edge devices
di: Gong, Yifan, et al.
Pubblicazione: (2024)
di: Gong, Yifan, et al.
Pubblicazione: (2024)
Large, Small or Both: A Novel Data Augmentation Framework Based on Language Models for Debiasing Opinion Summarization
di: Zhang, Yanyue, et al.
Pubblicazione: (2024)
di: Zhang, Yanyue, et al.
Pubblicazione: (2024)
Spatial Sovereignties in Squatted “Excess Spaces”
di: Ali Jones
Pubblicazione: (2024)
di: Ali Jones
Pubblicazione: (2024)
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
Token Reduction Should Go Beyond Efficiency in Generative Models -- From Vision, Language to Multimodality
di: Kong, Zhenglun, et al.
Pubblicazione: (2025)
di: Kong, Zhenglun, et al.
Pubblicazione: (2025)
Cross-Platform Scaling of Vision-Language-Action Models from Edge to Cloud GPUs
di: Taherin, Amir, et al.
Pubblicazione: (2025)
di: Taherin, Amir, et al.
Pubblicazione: (2025)
Rehearse With User: Personalized Opinion Summarization via Role-Playing based on Large Language Models
di: Zhang, Yanyue, et al.
Pubblicazione: (2025)
di: Zhang, Yanyue, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
di: Shen, Xuan, et al.
Pubblicazione: (2023) -
Rethinking Token Reduction for State Space Models
di: Zhan, Zheng, et al.
Pubblicazione: (2024) -
RoRA: Efficient Fine-Tuning of LLM with Reliability Optimization for Rank Adaptation
di: Liu, Jun, et al.
Pubblicazione: (2025) -
Search for Efficient Large Language Models
di: Shen, Xuan, et al.
Pubblicazione: (2024) -
Structured Agent Distillation for Large Language Model
di: Liu, Jun, et al.
Pubblicazione: (2025)