Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation
Fuente:
arXiv
Salvato in:
| Autori principali: | Trinh, Quoc-Huy, Abdullahi, Mustapha, Zhao, Bo, Jha, Debesh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Viper-F1: Fast and Fine-Grained Multimodal Understanding with Cross-Modal State-Space Modulation
di: Trinh, Quoc-Huy
Pubblicazione: (2025)
di: Trinh, Quoc-Huy
Pubblicazione: (2025)
PRS-Med: Position Reasoning Segmentation in Medical Imaging
di: Trinh, Quoc-Huy, et al.
Pubblicazione: (2025)
di: Trinh, Quoc-Huy, et al.
Pubblicazione: (2025)
SAM-EG: Segment Anything Model with Egde Guidance framework for efficient Polyp Segmentation
di: Trinh, Quoc-Huy, et al.
Pubblicazione: (2024)
di: Trinh, Quoc-Huy, et al.
Pubblicazione: (2024)
Investigating Zero-Shot Diagnostic Pathology in Vision-Language Models with Efficient Prompt Design
di: Sharma, Vasudev, et al.
Pubblicazione: (2025)
di: Sharma, Vasudev, et al.
Pubblicazione: (2025)
Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation
di: Yang, Zhiyuan, et al.
Pubblicazione: (2026)
di: Yang, Zhiyuan, et al.
Pubblicazione: (2026)
SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding
di: Cheng, Shuang, et al.
Pubblicazione: (2025)
di: Cheng, Shuang, et al.
Pubblicazione: (2025)
HaploVL: A Single-Transformer Baseline for Multi-Modal Understanding
di: Yang, Rui, et al.
Pubblicazione: (2025)
di: Yang, Rui, et al.
Pubblicazione: (2025)
PGDS: Pose-Guidance Deep Supervision for Mitigating Clothes-Changing in Person Re-Identification
di: Trinh, Quoc-Huy, et al.
Pubblicazione: (2023)
di: Trinh, Quoc-Huy, et al.
Pubblicazione: (2023)
BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion
di: Xiang, Sike, et al.
Pubblicazione: (2025)
di: Xiang, Sike, et al.
Pubblicazione: (2025)
ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language Tuning
di: Hao, Zhiwei, et al.
Pubblicazione: (2024)
di: Hao, Zhiwei, et al.
Pubblicazione: (2024)
GraphVL: Graph-Enhanced Semantic Modeling via Vision-Language Models for Generalized Class Discovery
di: Solanki, Bhupendra, et al.
Pubblicazione: (2024)
di: Solanki, Bhupendra, et al.
Pubblicazione: (2024)
TinyChemVL: Advancing Chemical Vision-Language Models via Efficient Visual Token Reduction and Complex Reaction Tasks
di: Zhao, Xuanle, et al.
Pubblicazione: (2025)
di: Zhao, Xuanle, et al.
Pubblicazione: (2025)
Distilling Vision-Language Pretraining for Efficient Cross-Modal Retrieval
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
MOOZY: A Patient-First Foundation Model for Computational Pathology
di: Kotp, Yousef, et al.
Pubblicazione: (2026)
di: Kotp, Yousef, et al.
Pubblicazione: (2026)
Vim4Path: Self-Supervised Vision Mamba for Histopathology Images
di: Nasiri-Sarvi, Ali, et al.
Pubblicazione: (2024)
di: Nasiri-Sarvi, Ali, et al.
Pubblicazione: (2024)
SRMA-Mamba: Spatial Reverse Mamba Attention Network for Pathological Liver Segmentation in MRI Volumes
di: Zeng, Jun, et al.
Pubblicazione: (2025)
di: Zeng, Jun, et al.
Pubblicazione: (2025)
FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding
di: Liu, Zheng, et al.
Pubblicazione: (2025)
di: Liu, Zheng, et al.
Pubblicazione: (2025)
LEO-VL: Efficient Scene Representation for Scalable 3D Vision-Language Learning
di: Huang, Jiangyong, et al.
Pubblicazione: (2025)
di: Huang, Jiangyong, et al.
Pubblicazione: (2025)
VEN-VL: A Visual Ensemble MoE Framework for Effective and Efficient Multi-Modal Understanding
di: Wu, Yinghao, et al.
Pubblicazione: (2026)
di: Wu, Yinghao, et al.
Pubblicazione: (2026)
Rice-VL: Evaluating Vision-Language Models for Cultural Understanding Across ASEAN Countries
di: Pranav, Tushar, et al.
Pubblicazione: (2025)
di: Pranav, Tushar, et al.
Pubblicazione: (2025)
EarthVL: A Progressive Earth Vision-Language Understanding and Generation Framework
di: Wang, Junjue, et al.
Pubblicazione: (2026)
di: Wang, Junjue, et al.
Pubblicazione: (2026)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
di: He, Yefei, et al.
Pubblicazione: (2024)
di: He, Yefei, et al.
Pubblicazione: (2024)
Youtu-VL: Unleashing Visual Potential via Unified Vision-Language Supervision
di: Wei, Zhixiang, et al.
Pubblicazione: (2026)
di: Wei, Zhixiang, et al.
Pubblicazione: (2026)
Thermo-VL: Extending Vision-Language Models to Thermal Infrared Perception
di: Thushara, Rusiru, et al.
Pubblicazione: (2026)
di: Thushara, Rusiru, et al.
Pubblicazione: (2026)
VL-Reader: Vision and Language Reconstructor is an Effective Scene Text Recognizer
di: Zhong, Humen, et al.
Pubblicazione: (2024)
di: Zhong, Humen, et al.
Pubblicazione: (2024)
3VL: Using Trees to Improve Vision-Language Models' Interpretability
di: Yellinek, Nir, et al.
Pubblicazione: (2023)
di: Yellinek, Nir, et al.
Pubblicazione: (2023)
VL4Gaze: Unleashing Vision-Language Models for Gaze Following
di: Wang, Shijing, et al.
Pubblicazione: (2025)
di: Wang, Shijing, et al.
Pubblicazione: (2025)
ConsensusDrop: Fusing Visual and Cross-Modal Saliency for Efficient Vision Language Models
di: Parikh, Dhruv, et al.
Pubblicazione: (2026)
di: Parikh, Dhruv, et al.
Pubblicazione: (2026)
From SAM to DINOv2: Towards Distilling Foundation Models to Lightweight Baselines for Generalized Polyp Segmentation
di: Agnihotri, Shivanshu, et al.
Pubblicazione: (2025)
di: Agnihotri, Shivanshu, et al.
Pubblicazione: (2025)
MeDocVL: A Visual Language Model for Medical Document Understanding and Parsing
di: Wang, Wenjie, et al.
Pubblicazione: (2026)
di: Wang, Wenjie, et al.
Pubblicazione: (2026)
RotCAtt-TransUNet++: Novel Deep Neural Network for Sophisticated Cardiac Segmentation
di: Nguyen-Le, Quoc-Bao, et al.
Pubblicazione: (2024)
di: Nguyen-Le, Quoc-Bao, et al.
Pubblicazione: (2024)
From Classification to Cross-Modal Understanding: Leveraging Vision-Language Models for Fine-Grained Renal Pathology
di: Guo, Zhenhao, et al.
Pubblicazione: (2025)
di: Guo, Zhenhao, et al.
Pubblicazione: (2025)
DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
di: Wu, Zhiyu, et al.
Pubblicazione: (2024)
di: Wu, Zhiyu, et al.
Pubblicazione: (2024)
SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding
di: Li, Hao, et al.
Pubblicazione: (2024)
di: Li, Hao, et al.
Pubblicazione: (2024)
DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding
di: Xuan, Weihao, et al.
Pubblicazione: (2025)
di: Xuan, Weihao, et al.
Pubblicazione: (2025)
2DMamba: Efficient State Space Model for Image Representation with Applications on Giga-Pixel Whole Slide Image Classification
di: Zhang, Jingwei, et al.
Pubblicazione: (2024)
di: Zhang, Jingwei, et al.
Pubblicazione: (2024)
UMind-VL: A Generalist Ultrasound Vision-Language Model for Unified Grounded Perception and Comprehensive Interpretation
di: Chen, Dengbo, et al.
Pubblicazione: (2025)
di: Chen, Dengbo, et al.
Pubblicazione: (2025)
In the Era of Prompt Learning with Vision-Language Models
di: Jha, Ankit
Pubblicazione: (2024)
di: Jha, Ankit
Pubblicazione: (2024)
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
di: Deria, Ankan, et al.
Pubblicazione: (2026)
di: Deria, Ankan, et al.
Pubblicazione: (2026)
DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models
di: Zeng, Lunbin, et al.
Pubblicazione: (2025)
di: Zeng, Lunbin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Viper-F1: Fast and Fine-Grained Multimodal Understanding with Cross-Modal State-Space Modulation
di: Trinh, Quoc-Huy
Pubblicazione: (2025) -
PRS-Med: Position Reasoning Segmentation in Medical Imaging
di: Trinh, Quoc-Huy, et al.
Pubblicazione: (2025) -
SAM-EG: Segment Anything Model with Egde Guidance framework for efficient Polyp Segmentation
di: Trinh, Quoc-Huy, et al.
Pubblicazione: (2024) -
Investigating Zero-Shot Diagnostic Pathology in Vision-Language Models with Efficient Prompt Design
di: Sharma, Vasudev, et al.
Pubblicazione: (2025) -
Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation
di: Yang, Zhiyuan, et al.
Pubblicazione: (2026)