Similar Items
PEVLM: Parallel Encoding for Vision-Language Models
by: Kang, Letian, et al.
Published: (2025)
by: Kang, Letian, et al.
Published: (2025)
AMMKD: Adaptive Multimodal Multi-teacher Distillation for Lightweight Vision-Language Models
by: Li, Yuqi, et al.
Published: (2025)
by: Li, Yuqi, et al.
Published: (2025)
A Lightweight Convolution and Vision Transformer integrated model with Multi-scale Self-attention Mechanism
by: Zhang, Yi, et al.
Published: (2025)
by: Zhang, Yi, et al.
Published: (2025)
Dynamic Pattern Alignment Learning for Pretraining Lightweight Human-Centric Vision Models
by: Wang, Xuanhan, et al.
Published: (2025)
by: Wang, Xuanhan, et al.
Published: (2025)
Unleashing Vision Foundation Models for Coronary Artery Segmentation: Parallel ViT-CNN Encoding and Variational Fusion
by: Dong, Caixia, et al.
Published: (2025)
by: Dong, Caixia, et al.
Published: (2025)
ESDiff: Encoding Strategy-inspired Diffusion Model with Few-shot Learning for Color Image Inpainting
by: Zhang, Junyan, et al.
Published: (2025)
by: Zhang, Junyan, et al.
Published: (2025)
OMEGA: Optimized Multimodal Position Encoding Index Derivation with Global Adaptive Scaling for Vision-Language Models
by: Huang, Ruoxiang, et al.
Published: (2025)
by: Huang, Ruoxiang, et al.
Published: (2025)
LGM-Pose: A Lightweight Global Modeling Network for Real-time Human Pose Estimation
by: Guo, Biao, et al.
Published: (2025)
by: Guo, Biao, et al.
Published: (2025)
GAIA: A Global, Multi-modal, Multi-scale Vision-Language Dataset for Remote Sensing Image Analysis
by: Zavras, Angelos, et al.
Published: (2025)
by: Zavras, Angelos, et al.
Published: (2025)
Revisiting Multimodal Positional Encoding in Vision-Language Models
by: Huang, Jie, et al.
Published: (2025)
by: Huang, Jie, et al.
Published: (2025)
Image Recognition with Online Lightweight Vision Transformer: A Survey
by: Zhang, Zherui, et al.
Published: (2025)
by: Zhang, Zherui, et al.
Published: (2025)
Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection
by: Pay, Quan Bi, et al.
Published: (2025)
by: Pay, Quan Bi, et al.
Published: (2025)
SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models
by: Yu, Youngjoon, et al.
Published: (2024)
by: Yu, Youngjoon, et al.
Published: (2024)
AMD: Automatic Multi-step Distillation of Large-scale Vision Models
by: Han, Cheng, et al.
Published: (2024)
by: Han, Cheng, et al.
Published: (2024)
A Lightweight Parallel Framework for Blind Image Quality Assessment
by: Huang, Qunyue, et al.
Published: (2024)
by: Huang, Qunyue, et al.
Published: (2024)
Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models
by: Thapa, Rahul, et al.
Published: (2024)
by: Thapa, Rahul, et al.
Published: (2024)
Lightweight and Accurate Multi-View Stereo with Confidence-Aware Diffusion Model
by: Wang, Fangjinhua, et al.
Published: (2025)
by: Wang, Fangjinhua, et al.
Published: (2025)
Lightweight Gaze Estimation Model Via Fusion Global Information
by: Cheng, Zhang, et al.
Published: (2024)
by: Cheng, Zhang, et al.
Published: (2024)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
by: Gao, Junyuan, et al.
Published: (2025)
by: Gao, Junyuan, et al.
Published: (2025)
EAGLES: Efficient Accelerated 3D Gaussians with Lightweight EncodingS
by: Girish, Sharath, et al.
Published: (2023)
by: Girish, Sharath, et al.
Published: (2023)
Lightweight Vision Transformer with Bidirectional Interaction
by: Fan, Qihang, et al.
Published: (2023)
by: Fan, Qihang, et al.
Published: (2023)
LLMind: Bio-inspired Training-free Adaptive Visual Representations for Vision-Language Models
by: Debnath, Soumyaratna, et al.
Published: (2026)
by: Debnath, Soumyaratna, et al.
Published: (2026)
Color Spike Data Generation via Bio-inspired Neuron-like Encoding with an Artificial Photoreceptor Layer
by: Ching-Teng, Hsieh, et al.
Published: (2025)
by: Ching-Teng, Hsieh, et al.
Published: (2025)
SCSegamba: Lightweight Structure-Aware Vision Mamba for Crack Segmentation in Structures
by: Liu, Hui, et al.
Published: (2025)
by: Liu, Hui, et al.
Published: (2025)
PMFSNet: Polarized Multi-scale Feature Self-attention Network For Lightweight Medical Image Segmentation
by: Zhong, Jiahui, et al.
Published: (2024)
by: Zhong, Jiahui, et al.
Published: (2024)
PIE: Physics-inspired Low-light Enhancement
by: Liang, Dong, et al.
Published: (2024)
by: Liang, Dong, et al.
Published: (2024)
EffLoc: Lightweight Vision Transformer for Efficient 6-DOF Camera Relocalization
by: Xiao, Zhendong, et al.
Published: (2024)
by: Xiao, Zhendong, et al.
Published: (2024)
GLACE: Global Local Accelerated Coordinate Encoding
by: Wang, Fangjinhua, et al.
Published: (2024)
by: Wang, Fangjinhua, et al.
Published: (2024)
Multi-scale Coarse-to-fine Modeling for Test-time Human Motion Control
by: Le, Nhat, et al.
Published: (2026)
by: Le, Nhat, et al.
Published: (2026)
Lightweight RGB-T Tracking with Mobile Vision Transformers
by: Falaki, Mahdi, et al.
Published: (2025)
by: Falaki, Mahdi, et al.
Published: (2025)
Deflickering Vision-Based Occupancy Networks through Lightweight Spatio-Temporal Correlation
by: Yu, Fengcheng, et al.
Published: (2025)
by: Yu, Fengcheng, et al.
Published: (2025)
Semantic-Guided Global-Local Collaborative Networks for Lightweight Image Super-Resolution
by: Fan, Wanshu, et al.
Published: (2025)
by: Fan, Wanshu, et al.
Published: (2025)
From Per-Image Low-Rank to Encoding Mismatch: Rethinking Feature Distillation in Vision Transformers
by: Tian, Huiyuan, et al.
Published: (2025)
by: Tian, Huiyuan, et al.
Published: (2025)
Prompt-based Adaptation in Large-scale Vision Models: A Survey
by: Xiao, Xi, et al.
Published: (2025)
by: Xiao, Xi, et al.
Published: (2025)
H-Flow: Self-supervised Human Scene Flow via Physics-inspired Joint Multi-modal Learning
by: Huang, Zhanbo, et al.
Published: (2026)
by: Huang, Zhanbo, et al.
Published: (2026)
VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving
by: Zhang, Ruifei, et al.
Published: (2025)
by: Zhang, Ruifei, et al.
Published: (2025)
Multi-Frame, Lightweight & Efficient Vision-Language Models for Question Answering in Autonomous Driving
by: Gopalkrishnan, Akshay, et al.
Published: (2024)
by: Gopalkrishnan, Akshay, et al.
Published: (2024)
An Intelligent Multi-task Supply Chain Model Based on Bio-inspired Networks
by: Khaleghi, Mehdi, et al.
Published: (2025)
by: Khaleghi, Mehdi, et al.
Published: (2025)
An Investigation on The Position Encoding in Vision-Based Dynamics Prediction
by: Zhu, Jiageng, et al.
Published: (2024)
by: Zhu, Jiageng, et al.
Published: (2024)
CLoVe: Encoding Compositional Language in Contrastive Vision-Language Models
by: Castro, Santiago, et al.
Published: (2024)
by: Castro, Santiago, et al.
Published: (2024)
Similar Items
-
PEVLM: Parallel Encoding for Vision-Language Models
by: Kang, Letian, et al.
Published: (2025) -
AMMKD: Adaptive Multimodal Multi-teacher Distillation for Lightweight Vision-Language Models
by: Li, Yuqi, et al.
Published: (2025) -
A Lightweight Convolution and Vision Transformer integrated model with Multi-scale Self-attention Mechanism
by: Zhang, Yi, et al.
Published: (2025) -
Dynamic Pattern Alignment Learning for Pretraining Lightweight Human-Centric Vision Models
by: Wang, Xuanhan, et al.
Published: (2025) -
Unleashing Vision Foundation Models for Coronary Artery Segmentation: Parallel ViT-CNN Encoding and Variational Fusion
by: Dong, Caixia, et al.
Published: (2025)