Human-inspired Global-to-Parallel Multi-scale Encoding for Lightweight Vision Models
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Xu, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PEVLM: Parallel Encoding for Vision-Language Models
par: Kang, Letian, et autres
Publié: (2025)
par: Kang, Letian, et autres
Publié: (2025)
AMMKD: Adaptive Multimodal Multi-teacher Distillation for Lightweight Vision-Language Models
par: Li, Yuqi, et autres
Publié: (2025)
par: Li, Yuqi, et autres
Publié: (2025)
A Lightweight Convolution and Vision Transformer integrated model with Multi-scale Self-attention Mechanism
par: Zhang, Yi, et autres
Publié: (2025)
par: Zhang, Yi, et autres
Publié: (2025)
Dynamic Pattern Alignment Learning for Pretraining Lightweight Human-Centric Vision Models
par: Wang, Xuanhan, et autres
Publié: (2025)
par: Wang, Xuanhan, et autres
Publié: (2025)
Unleashing Vision Foundation Models for Coronary Artery Segmentation: Parallel ViT-CNN Encoding and Variational Fusion
par: Dong, Caixia, et autres
Publié: (2025)
par: Dong, Caixia, et autres
Publié: (2025)
ESDiff: Encoding Strategy-inspired Diffusion Model with Few-shot Learning for Color Image Inpainting
par: Zhang, Junyan, et autres
Publié: (2025)
par: Zhang, Junyan, et autres
Publié: (2025)
OMEGA: Optimized Multimodal Position Encoding Index Derivation with Global Adaptive Scaling for Vision-Language Models
par: Huang, Ruoxiang, et autres
Publié: (2025)
par: Huang, Ruoxiang, et autres
Publié: (2025)
LGM-Pose: A Lightweight Global Modeling Network for Real-time Human Pose Estimation
par: Guo, Biao, et autres
Publié: (2025)
par: Guo, Biao, et autres
Publié: (2025)
GAIA: A Global, Multi-modal, Multi-scale Vision-Language Dataset for Remote Sensing Image Analysis
par: Zavras, Angelos, et autres
Publié: (2025)
par: Zavras, Angelos, et autres
Publié: (2025)
Revisiting Multimodal Positional Encoding in Vision-Language Models
par: Huang, Jie, et autres
Publié: (2025)
par: Huang, Jie, et autres
Publié: (2025)
Image Recognition with Online Lightweight Vision Transformer: A Survey
par: Zhang, Zherui, et autres
Publié: (2025)
par: Zhang, Zherui, et autres
Publié: (2025)
Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection
par: Pay, Quan Bi, et autres
Publié: (2025)
par: Pay, Quan Bi, et autres
Publié: (2025)
SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models
par: Yu, Youngjoon, et autres
Publié: (2024)
par: Yu, Youngjoon, et autres
Publié: (2024)
AMD: Automatic Multi-step Distillation of Large-scale Vision Models
par: Han, Cheng, et autres
Publié: (2024)
par: Han, Cheng, et autres
Publié: (2024)
A Lightweight Parallel Framework for Blind Image Quality Assessment
par: Huang, Qunyue, et autres
Publié: (2024)
par: Huang, Qunyue, et autres
Publié: (2024)
Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models
par: Thapa, Rahul, et autres
Publié: (2024)
par: Thapa, Rahul, et autres
Publié: (2024)
Lightweight and Accurate Multi-View Stereo with Confidence-Aware Diffusion Model
par: Wang, Fangjinhua, et autres
Publié: (2025)
par: Wang, Fangjinhua, et autres
Publié: (2025)
Lightweight Gaze Estimation Model Via Fusion Global Information
par: Cheng, Zhang, et autres
Publié: (2024)
par: Cheng, Zhang, et autres
Publié: (2024)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
par: Gao, Junyuan, et autres
Publié: (2025)
par: Gao, Junyuan, et autres
Publié: (2025)
EAGLES: Efficient Accelerated 3D Gaussians with Lightweight EncodingS
par: Girish, Sharath, et autres
Publié: (2023)
par: Girish, Sharath, et autres
Publié: (2023)
Lightweight Vision Transformer with Bidirectional Interaction
par: Fan, Qihang, et autres
Publié: (2023)
par: Fan, Qihang, et autres
Publié: (2023)
LLMind: Bio-inspired Training-free Adaptive Visual Representations for Vision-Language Models
par: Debnath, Soumyaratna, et autres
Publié: (2026)
par: Debnath, Soumyaratna, et autres
Publié: (2026)
Color Spike Data Generation via Bio-inspired Neuron-like Encoding with an Artificial Photoreceptor Layer
par: Ching-Teng, Hsieh, et autres
Publié: (2025)
par: Ching-Teng, Hsieh, et autres
Publié: (2025)
SCSegamba: Lightweight Structure-Aware Vision Mamba for Crack Segmentation in Structures
par: Liu, Hui, et autres
Publié: (2025)
par: Liu, Hui, et autres
Publié: (2025)
PMFSNet: Polarized Multi-scale Feature Self-attention Network For Lightweight Medical Image Segmentation
par: Zhong, Jiahui, et autres
Publié: (2024)
par: Zhong, Jiahui, et autres
Publié: (2024)
PIE: Physics-inspired Low-light Enhancement
par: Liang, Dong, et autres
Publié: (2024)
par: Liang, Dong, et autres
Publié: (2024)
EffLoc: Lightweight Vision Transformer for Efficient 6-DOF Camera Relocalization
par: Xiao, Zhendong, et autres
Publié: (2024)
par: Xiao, Zhendong, et autres
Publié: (2024)
GLACE: Global Local Accelerated Coordinate Encoding
par: Wang, Fangjinhua, et autres
Publié: (2024)
par: Wang, Fangjinhua, et autres
Publié: (2024)
Multi-scale Coarse-to-fine Modeling for Test-time Human Motion Control
par: Le, Nhat, et autres
Publié: (2026)
par: Le, Nhat, et autres
Publié: (2026)
Lightweight RGB-T Tracking with Mobile Vision Transformers
par: Falaki, Mahdi, et autres
Publié: (2025)
par: Falaki, Mahdi, et autres
Publié: (2025)
Deflickering Vision-Based Occupancy Networks through Lightweight Spatio-Temporal Correlation
par: Yu, Fengcheng, et autres
Publié: (2025)
par: Yu, Fengcheng, et autres
Publié: (2025)
Semantic-Guided Global-Local Collaborative Networks for Lightweight Image Super-Resolution
par: Fan, Wanshu, et autres
Publié: (2025)
par: Fan, Wanshu, et autres
Publié: (2025)
From Per-Image Low-Rank to Encoding Mismatch: Rethinking Feature Distillation in Vision Transformers
par: Tian, Huiyuan, et autres
Publié: (2025)
par: Tian, Huiyuan, et autres
Publié: (2025)
Prompt-based Adaptation in Large-scale Vision Models: A Survey
par: Xiao, Xi, et autres
Publié: (2025)
par: Xiao, Xi, et autres
Publié: (2025)
H-Flow: Self-supervised Human Scene Flow via Physics-inspired Joint Multi-modal Learning
par: Huang, Zhanbo, et autres
Publié: (2026)
par: Huang, Zhanbo, et autres
Publié: (2026)
VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving
par: Zhang, Ruifei, et autres
Publié: (2025)
par: Zhang, Ruifei, et autres
Publié: (2025)
Multi-Frame, Lightweight & Efficient Vision-Language Models for Question Answering in Autonomous Driving
par: Gopalkrishnan, Akshay, et autres
Publié: (2024)
par: Gopalkrishnan, Akshay, et autres
Publié: (2024)
An Intelligent Multi-task Supply Chain Model Based on Bio-inspired Networks
par: Khaleghi, Mehdi, et autres
Publié: (2025)
par: Khaleghi, Mehdi, et autres
Publié: (2025)
An Investigation on The Position Encoding in Vision-Based Dynamics Prediction
par: Zhu, Jiageng, et autres
Publié: (2024)
par: Zhu, Jiageng, et autres
Publié: (2024)
CLoVe: Encoding Compositional Language in Contrastive Vision-Language Models
par: Castro, Santiago, et autres
Publié: (2024)
par: Castro, Santiago, et autres
Publié: (2024)
Documents similaires
-
PEVLM: Parallel Encoding for Vision-Language Models
par: Kang, Letian, et autres
Publié: (2025) -
AMMKD: Adaptive Multimodal Multi-teacher Distillation for Lightweight Vision-Language Models
par: Li, Yuqi, et autres
Publié: (2025) -
A Lightweight Convolution and Vision Transformer integrated model with Multi-scale Self-attention Mechanism
par: Zhang, Yi, et autres
Publié: (2025) -
Dynamic Pattern Alignment Learning for Pretraining Lightweight Human-Centric Vision Models
par: Wang, Xuanhan, et autres
Publié: (2025) -
Unleashing Vision Foundation Models for Coronary Artery Segmentation: Parallel ViT-CNN Encoding and Variational Fusion
par: Dong, Caixia, et autres
Publié: (2025)