Flash-VL 2B: Optimizing Vision-Language Model Performance for Ultra-Low Latency and High Throughput
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Bo, Li, Shuo, Tian, Runhe, Yang, Yang, Tang, Jixin, Zhou, Jinhao, Ma, Lin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VL-Reader: Vision and Language Reconstructor is an Effective Scene Text Recognizer
di: Zhong, Humen, et al.
Pubblicazione: (2024)
di: Zhong, Humen, et al.
Pubblicazione: (2024)
FlashClear: Ultra-Fast Image Content Removal via Efficient Step Distillation and Feature Caching
di: Tang, Yixin, et al.
Pubblicazione: (2026)
di: Tang, Yixin, et al.
Pubblicazione: (2026)
PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model
di: Cui, Cheng, et al.
Pubblicazione: (2025)
di: Cui, Cheng, et al.
Pubblicazione: (2025)
Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism
di: Zhang, Siyu, et al.
Pubblicazione: (2025)
di: Zhang, Siyu, et al.
Pubblicazione: (2025)
Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation
di: Trinh, Quoc-Huy, et al.
Pubblicazione: (2026)
di: Trinh, Quoc-Huy, et al.
Pubblicazione: (2026)
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
di: Chen, Jiuhai, et al.
Pubblicazione: (2024)
di: Chen, Jiuhai, et al.
Pubblicazione: (2024)
BREATH-VL: Vision-Language-Guided 6-DoF Bronchoscopy Localization via Semantic-Geometric Fusion
di: Tian, Qingyao, et al.
Pubblicazione: (2026)
di: Tian, Qingyao, et al.
Pubblicazione: (2026)
Youtu-VL: Unleashing Visual Potential via Unified Vision-Language Supervision
di: Wei, Zhixiang, et al.
Pubblicazione: (2026)
di: Wei, Zhixiang, et al.
Pubblicazione: (2026)
DP^2-VL: Private Photo Dataset Protection by Data Poisoning for Vision-Language Models
di: Miao, Hongyi, et al.
Pubblicazione: (2026)
di: Miao, Hongyi, et al.
Pubblicazione: (2026)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
di: Li, Lei, et al.
Pubblicazione: (2024)
di: Li, Lei, et al.
Pubblicazione: (2024)
Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding
di: Yao, Yuan, et al.
Pubblicazione: (2026)
di: Yao, Yuan, et al.
Pubblicazione: (2026)
VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies
di: Gao, Mingjian, et al.
Pubblicazione: (2026)
di: Gao, Mingjian, et al.
Pubblicazione: (2026)
SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding
di: Cheng, Shuang, et al.
Pubblicazione: (2025)
di: Cheng, Shuang, et al.
Pubblicazione: (2025)
LEO-VL: Efficient Scene Representation for Scalable 3D Vision-Language Learning
di: Huang, Jiangyong, et al.
Pubblicazione: (2025)
di: Huang, Jiangyong, et al.
Pubblicazione: (2025)
Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
Qianfan-VL: Domain-Enhanced Universal Vision-Language Models
di: Dong, Daxiang, et al.
Pubblicazione: (2025)
di: Dong, Daxiang, et al.
Pubblicazione: (2025)
FlashCap: Millisecond-Accurate Human Motion Capture via Flashing LEDs and Event-Based Vision
di: Wu, Zekai, et al.
Pubblicazione: (2026)
di: Wu, Zekai, et al.
Pubblicazione: (2026)
Thermo-VL: Extending Vision-Language Models to Thermal Infrared Perception
di: Thushara, Rusiru, et al.
Pubblicazione: (2026)
di: Thushara, Rusiru, et al.
Pubblicazione: (2026)
3VL: Using Trees to Improve Vision-Language Models' Interpretability
di: Yellinek, Nir, et al.
Pubblicazione: (2023)
di: Yellinek, Nir, et al.
Pubblicazione: (2023)
VL4Gaze: Unleashing Vision-Language Models for Gaze Following
di: Wang, Shijing, et al.
Pubblicazione: (2025)
di: Wang, Shijing, et al.
Pubblicazione: (2025)
ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language Tuning
di: Hao, Zhiwei, et al.
Pubblicazione: (2024)
di: Hao, Zhiwei, et al.
Pubblicazione: (2024)
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
di: Wang, Peng, et al.
Pubblicazione: (2024)
di: Wang, Peng, et al.
Pubblicazione: (2024)
Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
di: Lu, Jinghui, et al.
Pubblicazione: (2026)
di: Lu, Jinghui, et al.
Pubblicazione: (2026)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
di: He, Yefei, et al.
Pubblicazione: (2024)
di: He, Yefei, et al.
Pubblicazione: (2024)
FA: Forced Prompt Learning of Vision-Language Models for Out-of-Distribution Detection
di: Lu, Xinhua, et al.
Pubblicazione: (2025)
di: Lu, Xinhua, et al.
Pubblicazione: (2025)
EarthVL: A Progressive Earth Vision-Language Understanding and Generation Framework
di: Wang, Junjue, et al.
Pubblicazione: (2026)
di: Wang, Junjue, et al.
Pubblicazione: (2026)
A-VL: Adaptive Attention for Large Vision-Language Models
di: Zhang, Junyang, et al.
Pubblicazione: (2024)
di: Zhang, Junyang, et al.
Pubblicazione: (2024)
GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI
di: Li, Tianbin, et al.
Pubblicazione: (2024)
di: Li, Tianbin, et al.
Pubblicazione: (2024)
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
di: Deria, Ankan, et al.
Pubblicazione: (2026)
di: Deria, Ankan, et al.
Pubblicazione: (2026)
DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models
di: Zeng, Lunbin, et al.
Pubblicazione: (2025)
di: Zeng, Lunbin, et al.
Pubblicazione: (2025)
ShotVL: Human-Centric Highlight Frame Retrieval via Language Queries
di: Xue, Wangyu, et al.
Pubblicazione: (2024)
di: Xue, Wangyu, et al.
Pubblicazione: (2024)
Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders
di: Zhang, Boqiang, et al.
Pubblicazione: (2026)
di: Zhang, Boqiang, et al.
Pubblicazione: (2026)
STEP3-VL-10B Technical Report
di: Huang, Ailin, et al.
Pubblicazione: (2026)
di: Huang, Ailin, et al.
Pubblicazione: (2026)
Hierarchical Vision-Language Learning for Medical Out-of-Distribution Detection
di: Lai, Runhe, et al.
Pubblicazione: (2025)
di: Lai, Runhe, et al.
Pubblicazione: (2025)
InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models
di: Tao, Hongyuan, et al.
Pubblicazione: (2025)
di: Tao, Hongyuan, et al.
Pubblicazione: (2025)
VL-Uncertainty: Detecting Hallucination in Large Vision-Language Model via Uncertainty Estimation
di: Zhang, Ruiyang, et al.
Pubblicazione: (2024)
di: Zhang, Ruiyang, et al.
Pubblicazione: (2024)
GraSP-VL: Length as a Semantic Granularity Interface for Vision-Language Representations
di: Li, Zesheng, et al.
Pubblicazione: (2026)
di: Li, Zesheng, et al.
Pubblicazione: (2026)
VL4AD: Vision-Language Models Improve Pixel-wise Anomaly Detection
di: Zhong, Liangyu, et al.
Pubblicazione: (2024)
di: Zhong, Liangyu, et al.
Pubblicazione: (2024)
TinyChemVL: Advancing Chemical Vision-Language Models via Efficient Visual Token Reduction and Complex Reaction Tasks
di: Zhao, Xuanle, et al.
Pubblicazione: (2025)
di: Zhao, Xuanle, et al.
Pubblicazione: (2025)
OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics
di: Shen, Jinjie, et al.
Pubblicazione: (2026)
di: Shen, Jinjie, et al.
Pubblicazione: (2026)
Documenti analoghi
-
VL-Reader: Vision and Language Reconstructor is an Effective Scene Text Recognizer
di: Zhong, Humen, et al.
Pubblicazione: (2024) -
FlashClear: Ultra-Fast Image Content Removal via Efficient Step Distillation and Feature Caching
di: Tang, Yixin, et al.
Pubblicazione: (2026) -
PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model
di: Cui, Cheng, et al.
Pubblicazione: (2025) -
Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism
di: Zhang, Siyu, et al.
Pubblicazione: (2025) -
Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation
di: Trinh, Quoc-Huy, et al.
Pubblicazione: (2026)