BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion
Fuente:
arXiv
Guardado en:
| Autores principales: | Xiang, Sike, Chen, Shuang, Atapour-Abarghouei, Amir |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Checkup2Action: A Multimodal Clinical Check-up Report Dataset for Patient-Oriented Action Card Generation
por: Xiang, Sike, et al.
Publicado: (2026)
por: Xiang, Sike, et al.
Publicado: (2026)
DEEP-SEA: Deep-Learning Enhancement for Environmental Perception in Submerged Aquatics
por: Chen, Shuang, et al.
Publicado: (2025)
por: Chen, Shuang, et al.
Publicado: (2025)
Exploring the Potentials of Spiking Neural Networks for Image Deraining
por: Chen, Shuang, et al.
Publicado: (2025)
por: Chen, Shuang, et al.
Publicado: (2025)
HINT: High-quality INPainting Transformer with Mask-Aware Encoding and Enhanced Attention
por: Chen, Shuang, et al.
Publicado: (2024)
por: Chen, Shuang, et al.
Publicado: (2024)
SEM-Net: Efficient Pixel Modelling for image inpainting with Spatially Enhanced SSM
por: Chen, Shuang, et al.
Publicado: (2024)
por: Chen, Shuang, et al.
Publicado: (2024)
Motion-Adaptive Multi-Scale Temporal Modelling with Skeleton-Constrained Spatial Graphs for Efficient 3D Human Pose Estimation
por: Li, Ruochen, et al.
Publicado: (2026)
por: Li, Ruochen, et al.
Publicado: (2026)
KD360-VoxelBEV: LiDAR and 360-degree Camera Cross Modality Knowledge Distillation for Bird's-Eye-View Segmentation
por: E, Wenke, et al.
Publicado: (2025)
por: E, Wenke, et al.
Publicado: (2025)
MxT: Mamba x Transformer for Image Inpainting
por: Chen, Shuang, et al.
Publicado: (2024)
por: Chen, Shuang, et al.
Publicado: (2024)
Deep Learning-Enhanced Visual Monitoring in Hazardous Underwater Environments with a Swarm of Micro-Robots
por: Chen, Shuang, et al.
Publicado: (2025)
por: Chen, Shuang, et al.
Publicado: (2025)
Leveraging Imperfect Medical Data: A Manifold-Consistent Spatio-Temporal Network for Sensor-based Human Activity Recognition
por: Fan, Jiangtao, et al.
Publicado: (2026)
por: Fan, Jiangtao, et al.
Publicado: (2026)
CaFlow: Enhancing Long-Term Action Quality Assessment with Causal Counterfactual Flow
por: Han, Ruisheng, et al.
Publicado: (2025)
por: Han, Ruisheng, et al.
Publicado: (2025)
UIESNN: A Scale-Aware Spiking Network for Underwater Image Enhancement
por: Chen, Shuang, et al.
Publicado: (2026)
por: Chen, Shuang, et al.
Publicado: (2026)
Enriching Knowledge Distillation with Cross-Modal Teacher Fusion
por: Mansourian, Amir M., et al.
Publicado: (2025)
por: Mansourian, Amir M., et al.
Publicado: (2025)
Distilling Vision-Language Pretraining for Efficient Cross-Modal Retrieval
por: Jang, Young Kyun, et al.
Publicado: (2024)
por: Jang, Young Kyun, et al.
Publicado: (2024)
Disentangling Racial Phenotypes: Fine-Grained Control of Race-related Facial Phenotype Characteristics
por: Yucer, Seyma, et al.
Publicado: (2024)
por: Yucer, Seyma, et al.
Publicado: (2024)
FineCausal: A Causal-Based Framework for Interpretable Fine-Grained Action Quality Assessment
por: Han, Ruisheng, et al.
Publicado: (2025)
por: Han, Ruisheng, et al.
Publicado: (2025)
GateFusion: Hierarchical Gated Cross-Modal Fusion for Active Speaker Detection
por: Wang, Yu, et al.
Publicado: (2025)
por: Wang, Yu, et al.
Publicado: (2025)
Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation
por: Trinh, Quoc-Huy, et al.
Publicado: (2026)
por: Trinh, Quoc-Huy, et al.
Publicado: (2026)
EEG-Driven Intention Decoding: Offline Deep Learning Benchmarking on a Robotic Rover
por: Alosaimi, Ghadah, et al.
Publicado: (2026)
por: Alosaimi, Ghadah, et al.
Publicado: (2026)
TOMD: A Trail-based Off-road Multimodal Dataset for Traversable Pathway Segmentation under Challenging Illumination Conditions
por: Sun, Yixin, et al.
Publicado: (2025)
por: Sun, Yixin, et al.
Publicado: (2025)
BiomedAP: A Vision-Informed Dual-Anchor Framework with Gated Cross-Modal Fusion for Robust Medical Vision-Language Adaptation
por: Tong, Huanyang, et al.
Publicado: (2026)
por: Tong, Huanyang, et al.
Publicado: (2026)
ART: Adaptive Relational Transformer for Pedestrian Trajectory Prediction with Temporal-Aware Relations
por: Li, Ruochen, et al.
Publicado: (2026)
por: Li, Ruochen, et al.
Publicado: (2026)
Insights from the Use of Previously Unseen Neural Architecture Search Datasets
por: Geada, Rob, et al.
Publicado: (2024)
por: Geada, Rob, et al.
Publicado: (2024)
FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding
por: Liu, Zheng, et al.
Publicado: (2025)
por: Liu, Zheng, et al.
Publicado: (2025)
LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
por: Irawan, Patrick Amadeus, et al.
Publicado: (2026)
por: Irawan, Patrick Amadeus, et al.
Publicado: (2026)
Dur360BEV: A Real-world 360-degree Single Camera Dataset and Benchmark for Bird-Eye View Mapping in Autonomous Driving
por: E, Wenke, et al.
Publicado: (2025)
por: E, Wenke, et al.
Publicado: (2025)
Mind2Drive: Predicting Driver Intentions from EEG in Real-world On-Road Driving
por: Alosaimi, Ghadah, et al.
Publicado: (2026)
por: Alosaimi, Ghadah, et al.
Publicado: (2026)
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
por: Feng, Qianhan, et al.
Publicado: (2024)
por: Feng, Qianhan, et al.
Publicado: (2024)
Vision-Language Models Create Cross-Modal Task Representations
por: Luo, Grace, et al.
Publicado: (2024)
por: Luo, Grace, et al.
Publicado: (2024)
Q-CLIP: Unleashing the Power of Vision-Language Models for Video Quality Assessment through Unified Cross-Modal Adaptation
por: Mi, Yachun, et al.
Publicado: (2025)
por: Mi, Yachun, et al.
Publicado: (2025)
Non-target Divergence Hypothesis: Toward Understanding Domain Gaps in Cross-Modal Knowledge Distillation
por: Chen, Yilong, et al.
Publicado: (2024)
por: Chen, Yilong, et al.
Publicado: (2024)
EVLF: Early Vision-Language Fusion for Generative Dataset Distillation
por: Cai, Wenqi, et al.
Publicado: (2026)
por: Cai, Wenqi, et al.
Publicado: (2026)
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2024)
por: Wang, Liuyi, et al.
Publicado: (2024)
ConsensusDrop: Fusing Visual and Cross-Modal Saliency for Efficient Vision Language Models
por: Parikh, Dhruv, et al.
Publicado: (2026)
por: Parikh, Dhruv, et al.
Publicado: (2026)
From Classification to Cross-Modal Understanding: Leveraging Vision-Language Models for Fine-Grained Renal Pathology
por: Guo, Zhenhao, et al.
Publicado: (2025)
por: Guo, Zhenhao, et al.
Publicado: (2025)
SphereFusion: Efficient Panorama Depth Estimation via Gated Fusion
por: Yan, Qingsong, et al.
Publicado: (2025)
por: Yan, Qingsong, et al.
Publicado: (2025)
VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models
por: Wang, Chenyu, et al.
Publicado: (2026)
por: Wang, Chenyu, et al.
Publicado: (2026)
Cross-Attentive Multiview Fusion of Vision-Language Embeddings
por: Martins, Tomas Berriel, et al.
Publicado: (2026)
por: Martins, Tomas Berriel, et al.
Publicado: (2026)
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
por: Kim, Sanghwan, et al.
Publicado: (2024)
por: Kim, Sanghwan, et al.
Publicado: (2024)
Learning Modality Knowledge Alignment for Cross-Modality Transfer
por: Ma, Wenxuan, et al.
Publicado: (2024)
por: Ma, Wenxuan, et al.
Publicado: (2024)
Ejemplares similares
-
Checkup2Action: A Multimodal Clinical Check-up Report Dataset for Patient-Oriented Action Card Generation
por: Xiang, Sike, et al.
Publicado: (2026) -
DEEP-SEA: Deep-Learning Enhancement for Environmental Perception in Submerged Aquatics
por: Chen, Shuang, et al.
Publicado: (2025) -
Exploring the Potentials of Spiking Neural Networks for Image Deraining
por: Chen, Shuang, et al.
Publicado: (2025) -
HINT: High-quality INPainting Transformer with Mask-Aware Encoding and Enhanced Attention
por: Chen, Shuang, et al.
Publicado: (2024) -
SEM-Net: Efficient Pixel Modelling for image inpainting with Spatially Enhanced SSM
por: Chen, Shuang, et al.
Publicado: (2024)