On-Device Vision Training, Deployment, and Inference on a Thumb-Sized Microcontroller
Fuente:
arXiv
Guardado en:
| Autor principal: | Ellis, Jeremy |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
WebSerial Vision Training for Microcontrollers: A Browser-Based Companion to On-Device CNN Training
por: Ellis, Jeremy
Publicado: (2026)
por: Ellis, Jeremy
Publicado: (2026)
Value-Driven Mixed-Precision Quantization for Patch-Based Inference on Microcontrollers
por: Tao, Wei, et al.
Publicado: (2024)
por: Tao, Wei, et al.
Publicado: (2024)
A Study on Inference Latency for Vision Transformers on Mobile Devices
por: Li, Zhuojin, et al.
Publicado: (2025)
por: Li, Zhuojin, et al.
Publicado: (2025)
Methodology to Deploy CNN-Based Computer Vision Models on Immersive Wearable Devices
por: Malek, Kaveh, et al.
Publicado: (2024)
por: Malek, Kaveh, et al.
Publicado: (2024)
TAP-ViTs: Task-Adaptive Pruning for On-Device Deployment of Vision Transformers
por: Wang, Zhibo, et al.
Publicado: (2026)
por: Wang, Zhibo, et al.
Publicado: (2026)
ELASTIC: Efficient Once For All Iterative Search for Object Detection on Microcontrollers
por: Tran, Tony, et al.
Publicado: (2025)
por: Tran, Tony, et al.
Publicado: (2025)
Breast Cancer VLMs: Clinically Practical Vision-Language Train-Inference Models
por: Zheng, Shunjie-Fabian, et al.
Publicado: (2025)
por: Zheng, Shunjie-Fabian, et al.
Publicado: (2025)
Beyond Thumbs Up/Down: Untangling Challenges of Fine-Grained Feedback for Text-to-Image Generation
por: Collins, Katherine M., et al.
Publicado: (2024)
por: Collins, Katherine M., et al.
Publicado: (2024)
LL-ViT: Edge Deployable Vision Transformers with Look Up Table Neurons
por: Nag, Shashank, et al.
Publicado: (2025)
por: Nag, Shashank, et al.
Publicado: (2025)
Slicing Vision Transformer for Flexible Inference
por: Zhang, Yitian, et al.
Publicado: (2024)
por: Zhang, Yitian, et al.
Publicado: (2024)
microYOLO: Towards Single-Shot Object Detection on Microcontrollers
por: Deutel, Mark, et al.
Publicado: (2024)
por: Deutel, Mark, et al.
Publicado: (2024)
Hardware-Friendly Diffusion Models with Fixed-Size Reusable Structures for On-Device Image Generation
por: Palit, Sanchar, et al.
Publicado: (2024)
por: Palit, Sanchar, et al.
Publicado: (2024)
AutoMMLab: Automatically Generating Deployable Models from Language Instructions for Computer Vision Tasks
por: Yang, Zekang, et al.
Publicado: (2024)
por: Yang, Zekang, et al.
Publicado: (2024)
BoardVision: Deployment-ready and Robust Motherboard Defect Detection with YOLO+Faster-RCNN Ensemble
por: Hill, Brandon, et al.
Publicado: (2025)
por: Hill, Brandon, et al.
Publicado: (2025)
Survey of Quantization Techniques for On-Device Vision-based Crack Detection
por: Zhang, Yuxuan, et al.
Publicado: (2025)
por: Zhang, Yuxuan, et al.
Publicado: (2025)
Training Feature Attribution for Vision Models
por: Bacha, Aziz, et al.
Publicado: (2025)
por: Bacha, Aziz, et al.
Publicado: (2025)
On the Use of Anchoring for Training Vision Models
por: Narayanaswamy, Vivek, et al.
Publicado: (2024)
por: Narayanaswamy, Vivek, et al.
Publicado: (2024)
Open-Source Acceleration of Stable-Diffusion.cpp Deployable on All Devices
por: Ng, Jingxu, et al.
Publicado: (2024)
por: Ng, Jingxu, et al.
Publicado: (2024)
Source-Free Domain Adaptation Guided by Vision and Vision-Language Pre-Training
por: Zhang, Wenyu, et al.
Publicado: (2024)
por: Zhang, Wenyu, et al.
Publicado: (2024)
On-Demand Multi-Task Sparsity for Efficient Large-Model Deployment on Edge Devices
por: Huang, Lianming, et al.
Publicado: (2025)
por: Huang, Lianming, et al.
Publicado: (2025)
Block Selective Reprogramming for On-device Training of Vision Transformers
por: Sarkar, Sreetama, et al.
Publicado: (2024)
por: Sarkar, Sreetama, et al.
Publicado: (2024)
Training a Computer Vision Model for Commercial Bakeries with Primarily Synthetic Images
por: Schmitt, Thomas H., et al.
Publicado: (2024)
por: Schmitt, Thomas H., et al.
Publicado: (2024)
Inducing Spatial Locality in Vision Transformers through the Training Protocol
por: Toledo, Eduardo Santiago, et al.
Publicado: (2026)
por: Toledo, Eduardo Santiago, et al.
Publicado: (2026)
Contrastive Forward-Forward: A Training Algorithm of Vision Transformer
por: Aghagolzadeh, Hossein, et al.
Publicado: (2025)
por: Aghagolzadeh, Hossein, et al.
Publicado: (2025)
Explaining the Impact of Training on Vision Models via Activation Clustering
por: Boubekki, Ahcène, et al.
Publicado: (2024)
por: Boubekki, Ahcène, et al.
Publicado: (2024)
ToFe: Lagged Token Freezing and Reusing for Efficient Vision Transformer Inference
por: Zhang, Haoyue, et al.
Publicado: (2025)
por: Zhang, Haoyue, et al.
Publicado: (2025)
Light Interaction: Training-Free Inference Acceleration for Interactive Video World Models
por: Lu, Jiacheng, et al.
Publicado: (2026)
por: Lu, Jiacheng, et al.
Publicado: (2026)
Training Without Orthogonalization, Inference With SVD: A Gradient Analysis of Rotation Representations
por: Choy, Chris
Publicado: (2026)
por: Choy, Chris
Publicado: (2026)
DANCE: DAta-Network Co-optimization for Efficient Segmentation Model Training and Inference
por: Li, Chaojian, et al.
Publicado: (2021)
por: Li, Chaojian, et al.
Publicado: (2021)
Accelerating Vision Transformers with Adaptive Patch Sizes
por: Choudhury, Rohan, et al.
Publicado: (2025)
por: Choudhury, Rohan, et al.
Publicado: (2025)
Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding
por: Ilhan, Fatih, et al.
Publicado: (2026)
por: Ilhan, Fatih, et al.
Publicado: (2026)
Unveil Benign Overfitting for Transformer in Vision: Training Dynamics, Convergence, and Generalization
por: Jiang, Jiarui, et al.
Publicado: (2024)
por: Jiang, Jiarui, et al.
Publicado: (2024)
VLG-CBM: Training Concept Bottleneck Models with Vision-Language Guidance
por: Srivastava, Divyansh, et al.
Publicado: (2024)
por: Srivastava, Divyansh, et al.
Publicado: (2024)
Enhancing Quantization-Aware Training on Edge Devices via Relative Entropy Coreset Selection and Cascaded Layer Correction
por: Tong, Yujia, et al.
Publicado: (2025)
por: Tong, Yujia, et al.
Publicado: (2025)
Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models
por: Yoon, Lauren Hyoseo, et al.
Publicado: (2025)
por: Yoon, Lauren Hyoseo, et al.
Publicado: (2025)
Iterative Deployment Exposure for Unsupervised Out-of-Distribution Detection
por: Doorenbos, Lars, et al.
Publicado: (2024)
por: Doorenbos, Lars, et al.
Publicado: (2024)
STAR: Stage-Wise Attention-Guided Token Reduction for Efficient Large Vision-Language Models Inference
por: Guo, Yichen, et al.
Publicado: (2025)
por: Guo, Yichen, et al.
Publicado: (2025)
Training-Free Test-Time Adaptation with Brownian Distance Covariance in Vision-Language Models
por: Zhang, Yi, et al.
Publicado: (2026)
por: Zhang, Yi, et al.
Publicado: (2026)
ViTNT-FIQA: Training-Free Face Image Quality Assessment with Vision Transformers
por: Ozgur, Guray, et al.
Publicado: (2026)
por: Ozgur, Guray, et al.
Publicado: (2026)
Parameter-Efficient Fine-Tuning for Pre-Trained Vision Models: A Survey and Benchmark
por: Xin, Yi, et al.
Publicado: (2024)
por: Xin, Yi, et al.
Publicado: (2024)
Ejemplares similares
-
WebSerial Vision Training for Microcontrollers: A Browser-Based Companion to On-Device CNN Training
por: Ellis, Jeremy
Publicado: (2026) -
Value-Driven Mixed-Precision Quantization for Patch-Based Inference on Microcontrollers
por: Tao, Wei, et al.
Publicado: (2024) -
A Study on Inference Latency for Vision Transformers on Mobile Devices
por: Li, Zhuojin, et al.
Publicado: (2025) -
Methodology to Deploy CNN-Based Computer Vision Models on Immersive Wearable Devices
por: Malek, Kaveh, et al.
Publicado: (2024) -
TAP-ViTs: Task-Adaptive Pruning for On-Device Deployment of Vision Transformers
por: Wang, Zhibo, et al.
Publicado: (2026)