TinyVLM: Zero-Shot Object Detection on Microcontrollers via Vision-Language Distillation with Matryoshka Embeddings
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Wilson, Bibin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TinySSL: Distilled Self-Supervised Pretraining for Sub-Megabyte MCU Models
par: Wilson, Bibin
Publié: (2026)
par: Wilson, Bibin
Publié: (2026)
Latent Replay Detection: Memory-Efficient Continual Object Detection on Microcontrollers via Task-Adaptive Compression
par: Wilson, Bibin
Publié: (2026)
par: Wilson, Bibin
Publié: (2026)
microYOLO: Towards Single-Shot Object Detection on Microcontrollers
par: Deutel, Mark, et autres
Publié: (2024)
par: Deutel, Mark, et autres
Publié: (2024)
TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions
par: Chen, Ce, et autres
Publié: (2026)
par: Chen, Ce, et autres
Publié: (2026)
SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding
par: Lin, Jiawen, et autres
Publié: (2025)
par: Lin, Jiawen, et autres
Publié: (2025)
Towards a Multi-Agent Vision-Language System for Zero-Shot Novel Hazardous Object Detection for Autonomous Driving Safety
par: Shriram, Shashank, et autres
Publié: (2025)
par: Shriram, Shashank, et autres
Publié: (2025)
Hybrid Discriminative Attribute-Object Embedding Network for Compositional Zero-Shot Learning
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis
par: Kang, Donggoo, et autres
Publié: (2024)
par: Kang, Donggoo, et autres
Publié: (2024)
AHC: Meta-Learned Adaptive Compression for Continual Object Detection on Memory-Constrained Microcontrollers
par: Wilson, Bibin
Publié: (2026)
par: Wilson, Bibin
Publié: (2026)
SparseFormer: Detecting Objects in HRW Shots via Sparse Vision Transformer
par: Li, Wenxi, et autres
Publié: (2025)
par: Li, Wenxi, et autres
Publié: (2025)
Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play
par: Wang, Qinsi, et autres
Publié: (2025)
par: Wang, Qinsi, et autres
Publié: (2025)
Evaluating Vision-Language Models for Zero-Shot Detection, Classification, and Association of Motorcycles, Passengers, and Helmets
par: Choi, Lucas, et autres
Publié: (2024)
par: Choi, Lucas, et autres
Publié: (2024)
Temporal Object-Aware Vision Transformer for Few-Shot Video Object Detection
par: Kumar, Yogesh, et autres
Publié: (2025)
par: Kumar, Yogesh, et autres
Publié: (2025)
TinyViT-Batten: Few-Shot Vision Transformer with Explainable Attention for Early Batten-Disease Detection on Pediatric MRI
par: Uppalapati, Khartik, et autres
Publié: (2025)
par: Uppalapati, Khartik, et autres
Publié: (2025)
Improving Zero-Shot Object-Level Change Detection by Incorporating Visual Correspondence
par: Nguyen, Hung Huy, et autres
Publié: (2025)
par: Nguyen, Hung Huy, et autres
Publié: (2025)
Binary Verification for Zero-Shot Vision
par: Hu, Rongbin, et autres
Publié: (2025)
par: Hu, Rongbin, et autres
Publié: (2025)
Anomaly-Aware Vision-Language Adapters for Zero-Shot Anomaly Detection
par: Aqeel, Muhammad, et autres
Publié: (2026)
par: Aqeel, Muhammad, et autres
Publié: (2026)
Zero-Shot Vision-and-Language Navigation with Collision Mitigation in Continuous Environment
par: Jeong, Seongjun, et autres
Publié: (2024)
par: Jeong, Seongjun, et autres
Publié: (2024)
VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
par: Jiang, Ziyan, et autres
Publié: (2024)
par: Jiang, Ziyan, et autres
Publié: (2024)
MonitorVLM:A Vision Language Framework for Safety Violation Detection in Mining Operations
par: Wu, Jiang, et autres
Publié: (2025)
par: Wu, Jiang, et autres
Publié: (2025)
LightZeroNav: Zero-Shot Vision Language Navigation in Continuous Environments Based on Lightweight VLMs
par: Luo, Kun, et autres
Publié: (2026)
par: Luo, Kun, et autres
Publié: (2026)
ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models
par: Zhang, Pu, et autres
Publié: (2025)
par: Zhang, Pu, et autres
Publié: (2025)
Benchmarking Zero-Shot Recognition with Vision-Language Models: Challenges on Granularity and Specificity
par: Xu, Zhenlin, et autres
Publié: (2023)
par: Xu, Zhenlin, et autres
Publié: (2023)
TINA: Think, Interaction, and Action Framework for Zero-Shot Vision Language Navigation
par: Li, Dingbang, et autres
Publié: (2024)
par: Li, Dingbang, et autres
Publié: (2024)
LLM meets Vision-Language Models for Zero-Shot One-Class Classification
par: Bendou, Yassir, et autres
Publié: (2024)
par: Bendou, Yassir, et autres
Publié: (2024)
RT-VLM: Re-Thinking Vision Language Model with 4-Clues for Real-World Object Recognition Robustness
par: Park, Junghyun, et autres
Publié: (2025)
par: Park, Junghyun, et autres
Publié: (2025)
TinyDrop: Tiny Model Guided Token Dropping for Vision Transformers
par: Wang, Guoxin, et autres
Publié: (2025)
par: Wang, Guoxin, et autres
Publié: (2025)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
par: Zhang, Jianke, et autres
Publié: (2026)
par: Zhang, Jianke, et autres
Publié: (2026)
Data Distribution Distilled Generative Model for Generalized Zero-Shot Recognition
par: Wang, Yijie, et autres
Publié: (2024)
par: Wang, Yijie, et autres
Publié: (2024)
LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models
par: Sun, Fan-Yun, et autres
Publié: (2024)
par: Sun, Fan-Yun, et autres
Publié: (2024)
A Recipe for Improving Remote Sensing VLM Zero Shot Generalization
par: Barzilai, Aviad, et autres
Publié: (2025)
par: Barzilai, Aviad, et autres
Publié: (2025)
TinyFormer: Preserving Tiny Objects in YOLO-DETR Hybrid Real-time Detectors
par: Hsieh, Jun-Wei, et autres
Publié: (2026)
par: Hsieh, Jun-Wei, et autres
Publié: (2026)
LAGO: Language-Guided Adaptive Object-Region Focus for Zero-Shot Visual-Text Alignment
par: Hu, Junyi, et autres
Publié: (2026)
par: Hu, Junyi, et autres
Publié: (2026)
SpecVLM: Fast Speculative Decoding in Vision-Language Models
par: Huang, Haiduo, et autres
Publié: (2025)
par: Huang, Haiduo, et autres
Publié: (2025)
Situation Monitor: Diversity-Driven Zero-Shot Out-of-Distribution Detection using Budding Ensemble Architecture for Object Detection
par: Syed, Qutub, et autres
Publié: (2024)
par: Syed, Qutub, et autres
Publié: (2024)
Noise-Robust Tiny Object Localization with Flows
par: Sun, Huixin, et autres
Publié: (2026)
par: Sun, Huixin, et autres
Publié: (2026)
Scale-Aware Relay and Scale-Adaptive Loss for Tiny Object Detection in Aerial Images
par: Li, Jinfu, et autres
Publié: (2025)
par: Li, Jinfu, et autres
Publié: (2025)
Leveraging MLLM Embeddings and Attribute Smoothing for Compositional Zero-Shot Learning
par: Yan, Xudong, et autres
Publié: (2024)
par: Yan, Xudong, et autres
Publié: (2024)
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
par: Qian, Chen, et autres
Publié: (2026)
par: Qian, Chen, et autres
Publié: (2026)
IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
par: Ji, Yatai, et autres
Publié: (2024)
par: Ji, Yatai, et autres
Publié: (2024)
Documents similaires
-
TinySSL: Distilled Self-Supervised Pretraining for Sub-Megabyte MCU Models
par: Wilson, Bibin
Publié: (2026) -
Latent Replay Detection: Memory-Efficient Continual Object Detection on Microcontrollers via Task-Adaptive Compression
par: Wilson, Bibin
Publié: (2026) -
microYOLO: Towards Single-Shot Object Detection on Microcontrollers
par: Deutel, Mark, et autres
Publié: (2024) -
TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions
par: Chen, Ce, et autres
Publié: (2026) -
SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding
par: Lin, Jiawen, et autres
Publié: (2025)