EdgeFlex-Transformer: Transformer Inference for Edge Devices
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mohammad, Shoaib, Song, Guanqun, Zhu, Ting |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CoFormer: Collaborating with Heterogeneous Edge Devices for Scalable Transformer Inference
par: Xu, Guanyu, et autres
Publié: (2025)
par: Xu, Guanyu, et autres
Publié: (2025)
Going Beyond the Edge: Distributed Inference of Transformer Models on Ultra-Low-Power Wireless Devices
par: Gräfe, Alexander, et autres
Publié: (2026)
par: Gräfe, Alexander, et autres
Publié: (2026)
Energy-Efficient Vision Transformer Inference for Edge-AI Deployment
par: Amanzhol, Nursultan, et autres
Publié: (2025)
par: Amanzhol, Nursultan, et autres
Publié: (2025)
Adaptive Semantic Token Communication for Transformer-based Edge Inference
par: Devoto, Alessio, et autres
Publié: (2025)
par: Devoto, Alessio, et autres
Publié: (2025)
EdgeRAG: Online-Indexed RAG for Edge Devices
par: Seemakhupt, Korakit, et autres
Publié: (2024)
par: Seemakhupt, Korakit, et autres
Publié: (2024)
COBRA: Algorithm-Architecture Co-optimized Binary Transformer Accelerator for Edge Inference
par: Qiao, Ye, et autres
Publié: (2025)
par: Qiao, Ye, et autres
Publié: (2025)
Compiler-Assisted Speculative Sampling for Accelerated LLM Inference on Heterogeneous Edge Devices
par: Mesa, Alejandro Ruiz y, et autres
Publié: (2026)
par: Mesa, Alejandro Ruiz y, et autres
Publié: (2026)
Optimising TinyML with Quantization and Distillation of Transformer and Mamba Models for Indoor Localisation on Edge Devices
par: Suwannaphong, Thanaphon, et autres
Publié: (2024)
par: Suwannaphong, Thanaphon, et autres
Publié: (2024)
PolyThrottle: Energy-efficient Neural Network Inference on Edge Devices
par: Yan, Minghao, et autres
Publié: (2023)
par: Yan, Minghao, et autres
Publié: (2023)
Adaptive Stream Processing on Edge Devices through Active Inference
par: Sedlak, Boris, et autres
Publié: (2024)
par: Sedlak, Boris, et autres
Publié: (2024)
EFormer: An Effective Edge-based Transformer for Vehicle Routing Problems
par: Meng, Dian, et autres
Publié: (2025)
par: Meng, Dian, et autres
Publié: (2025)
Ask the Expert: Collaborative Inference for Vision Transformers with Near-Edge Accelerators
par: Liu, Hao, et autres
Publié: (2026)
par: Liu, Hao, et autres
Publié: (2026)
From LLMs to Edge: Parameter-Efficient Fine-Tuning on Edge Devices
par: Slamanig, Georg, et autres
Publié: (2025)
par: Slamanig, Georg, et autres
Publié: (2025)
Bitnet.cpp: Efficient Edge Inference for Ternary LLMs
par: Wang, Jinheng, et autres
Publié: (2025)
par: Wang, Jinheng, et autres
Publié: (2025)
Graph Neural Networks Automated Design and Deployment on Device-Edge Co-Inference Systems
par: Zhou, Ao, et autres
Publié: (2024)
par: Zhou, Ao, et autres
Publié: (2024)
Edge Unlearning is Not "on Edge"! An Adaptive Exact Unlearning System on Resource-Constrained Devices
par: Xia, Xiaoyu, et autres
Publié: (2024)
par: Xia, Xiaoyu, et autres
Publié: (2024)
EntroLLM: Entropy Encoded Weight Compression for Efficient Large Language Model Inference on Edge Devices
par: Sanyal, Arnab, et autres
Publié: (2025)
par: Sanyal, Arnab, et autres
Publié: (2025)
Accelerating PoT Quantization on Edge Devices
par: Saha, Rappy, et autres
Publié: (2024)
par: Saha, Rappy, et autres
Publié: (2024)
Hermes: Memory-Efficient Pipeline Inference for Large Models on Edge Devices
par: Han, Xueyuan, et autres
Publié: (2024)
par: Han, Xueyuan, et autres
Publié: (2024)
The Topological Trouble With Transformers
par: Mozer, Michael C., et autres
Publié: (2026)
par: Mozer, Michael C., et autres
Publié: (2026)
On-Device Crack Segmentation for Edge Structural Health Monitoring
par: Zhang, Yuxuan, et autres
Publié: (2025)
par: Zhang, Yuxuan, et autres
Publié: (2025)
AMED: Automatic Mixed-Precision Quantization for Edge Devices
par: Kimhi, Moshe, et autres
Publié: (2022)
par: Kimhi, Moshe, et autres
Publié: (2022)
Unsupervised Training of Neural Cellular Automata on Edge Devices
par: Kalkhof, John, et autres
Publié: (2024)
par: Kalkhof, John, et autres
Publié: (2024)
On the Sustainability of AI Inferences in the Edge
par: Sobhani, Ghazal, et autres
Publié: (2025)
par: Sobhani, Ghazal, et autres
Publié: (2025)
On-device Large Multi-modal Agent for Human Activity Recognition
par: Siam, Md Shakhrul Iman, et autres
Publié: (2025)
par: Siam, Md Shakhrul Iman, et autres
Publié: (2025)
Lightweight Transformer Architectures for Edge Devices in Real-Time Applications
par: Samson, Hema Hariharan
Publié: (2026)
par: Samson, Hema Hariharan
Publié: (2026)
Privacy-Aware Multi-Device Cooperative Edge Inference with Distributed Resource Bidding
par: Zhuang, Wenhao, et autres
Publié: (2024)
par: Zhuang, Wenhao, et autres
Publié: (2024)
Neuromorphic Wireless Device-Edge Co-Inference via the Directed Information Bottleneck
par: Ke, Yuzhen, et autres
Publié: (2024)
par: Ke, Yuzhen, et autres
Publié: (2024)
Vicious Classifiers: Assessing Inference-time Data Reconstruction Risk in Edge Computing
par: Malekzadeh, Mohammad, et autres
Publié: (2022)
par: Malekzadeh, Mohammad, et autres
Publié: (2022)
Accelerated Training on Low-Power Edge Devices
par: Ahmed, Mohamed Aboelenien, et autres
Publié: (2025)
par: Ahmed, Mohamed Aboelenien, et autres
Publié: (2025)
Designing Efficient LLM Accelerators for Edge Devices
par: Haris, Jude, et autres
Publié: (2024)
par: Haris, Jude, et autres
Publié: (2024)
ASTRA: Communication-Efficient Acceleration for Multi-Device Transformer Inference
par: Liu, Xiao, et autres
Publié: (2025)
par: Liu, Xiao, et autres
Publié: (2025)
Dynamic Quality-Latency Aware Routing for LLM Inference in Wireless Edge-Device Networks
par: Bao, Rui, et autres
Publié: (2025)
par: Bao, Rui, et autres
Publié: (2025)
Galaxy: A Resource-Efficient Collaborative Edge AI System for In-situ Transformer Inference
par: Ye, Shengyuan, et autres
Publié: (2024)
par: Ye, Shengyuan, et autres
Publié: (2024)
EdgeInfinite-Instruct: Bridging SFT-Based Optimization and NPU-Level Efficiency for Edge Devices
par: Chen, Jiyu, et autres
Publié: (2025)
par: Chen, Jiyu, et autres
Publié: (2025)
Dynamic Graph Representation Learning via Edge Temporal States Modeling and Structure-reinforced Transformer
par: Hu, Shengxiang, et autres
Publié: (2023)
par: Hu, Shengxiang, et autres
Publié: (2023)
A PAC-Bayesian Analysis of Channel-Induced Degradation in Edge Inference
par: He, Yangshuo, et autres
Publié: (2026)
par: He, Yangshuo, et autres
Publié: (2026)
DAPA: Distribution Aware Piecewise Activation Functions for On-Device Transformer Inference and Training
par: Xiang, Maoyang, et autres
Publié: (2026)
par: Xiang, Maoyang, et autres
Publié: (2026)
Beyond the Frame: Single and mutilple video summarization method with user-defined length
par: Kalkhorani, Vahid Ahmadi, et autres
Publié: (2023)
par: Kalkhorani, Vahid Ahmadi, et autres
Publié: (2023)
Dynamic Clustering for Personalized Federated Learning on Heterogeneous Edge Devices
par: Liu, Heting, et autres
Publié: (2025)
par: Liu, Heting, et autres
Publié: (2025)
Documents similaires
-
CoFormer: Collaborating with Heterogeneous Edge Devices for Scalable Transformer Inference
par: Xu, Guanyu, et autres
Publié: (2025) -
Going Beyond the Edge: Distributed Inference of Transformer Models on Ultra-Low-Power Wireless Devices
par: Gräfe, Alexander, et autres
Publié: (2026) -
Energy-Efficient Vision Transformer Inference for Edge-AI Deployment
par: Amanzhol, Nursultan, et autres
Publié: (2025) -
Adaptive Semantic Token Communication for Transformer-based Edge Inference
par: Devoto, Alessio, et autres
Publié: (2025) -
EdgeRAG: Online-Indexed RAG for Edge Devices
par: Seemakhupt, Korakit, et autres
Publié: (2024)