Efficient Modulation for Vision Networks
Fuente:
arXiv
Saved in:
| Main Authors: | Ma, Xu, Dai, Xiyang, Yang, Jianwei, Xiao, Bin, Chen, Yinpeng, Fu, Yun, Yuan, Lu |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Rewrite the Stars
by: Ma, Xu, et al.
Published: (2024)
by: Ma, Xu, et al.
Published: (2024)
Exploring Invariance in Images through One-way Wave Equations
by: Chen, Yinpeng, et al.
Published: (2023)
by: Chen, Yinpeng, et al.
Published: (2023)
HyCTAS: Multi-Objective Hybrid Convolution-Transformer Architecture Search for Real-Time Image Segmentation
by: Yu, Hongyuan, et al.
Published: (2024)
by: Yu, Hongyuan, et al.
Published: (2024)
AutoBreach: Universal and Adaptive Jailbreaking with Efficient Wordplay-Guided Optimization
by: Chen, Jiawei, et al.
Published: (2024)
by: Chen, Jiawei, et al.
Published: (2024)
DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs
by: Meng, Lingchen, et al.
Published: (2024)
by: Meng, Lingchen, et al.
Published: (2024)
FaceCat: Enhancing Face Recognition Security with a Unified Diffusion Model
by: Chen, Jiawei, et al.
Published: (2024)
by: Chen, Jiawei, et al.
Published: (2024)
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
by: Chen, Jiuhai, et al.
Published: (2024)
by: Chen, Jiuhai, et al.
Published: (2024)
OmniTracker: Unifying Object Tracking by Tracking-with-Detection
by: Wang, Junke, et al.
Published: (2023)
by: Wang, Junke, et al.
Published: (2023)
VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning
by: Xu, Hengbo, et al.
Published: (2026)
by: Xu, Hengbo, et al.
Published: (2026)
Adapting to Length Shift: FlexiLength Network for Trajectory Prediction
by: Xu, Yi, et al.
Published: (2024)
by: Xu, Yi, et al.
Published: (2024)
Rethinking Model Ensemble in Transfer-based Adversarial Attacks
by: Chen, Huanran, et al.
Published: (2023)
by: Chen, Huanran, et al.
Published: (2023)
EVLM: An Efficient Vision-Language Model for Visual Understanding
by: Chen, Kaibing, et al.
Published: (2024)
by: Chen, Kaibing, et al.
Published: (2024)
Spatiotemporal Decoupling for Efficient Vision-Based Occupancy Forecasting
by: Xu, Jingyi, et al.
Published: (2024)
by: Xu, Jingyi, et al.
Published: (2024)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
by: Ruan, Shouwei, et al.
Published: (2024)
by: Ruan, Shouwei, et al.
Published: (2024)
Vision KAN: Towards an Attention-Free Backbone for Vision with Kolmogorov-Arnold Networks
by: Yang, Zhuoqin, et al.
Published: (2026)
by: Yang, Zhuoqin, et al.
Published: (2026)
FastRef:Fast Prototype Refinement for Few-Shot Industrial Anomaly Detection
by: Tian, Long, et al.
Published: (2025)
by: Tian, Long, et al.
Published: (2025)
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
by: Duan, Yuchen, et al.
Published: (2024)
by: Duan, Yuchen, et al.
Published: (2024)
EffLoc: Lightweight Vision Transformer for Efficient 6-DOF Camera Relocalization
by: Xiao, Zhendong, et al.
Published: (2024)
by: Xiao, Zhendong, et al.
Published: (2024)
Transferable 3D Adversarial Shape Completion using Diffusion Models
by: Dai, Xuelong, et al.
Published: (2024)
by: Dai, Xuelong, et al.
Published: (2024)
Towards Transferable Targeted 3D Adversarial Attack in the Physical World
by: Huang, Yao, et al.
Published: (2023)
by: Huang, Yao, et al.
Published: (2023)
Text-Pass Filter: An Efficient Scene Text Detector
by: Yang, Chuang, et al.
Published: (2026)
by: Yang, Chuang, et al.
Published: (2026)
Asphalt Concrete Characterization Using Digital Image Correlation: A Systematic Review of Best Practices, Applications, and Future Vision
by: Wang, Siqi, et al.
Published: (2024)
by: Wang, Siqi, et al.
Published: (2024)
Machine Vision Therapy: Multimodal Large Language Models Can Enhance Visual Robustness via Denoising In-Context Learning
by: Huang, Zhuo, et al.
Published: (2023)
by: Huang, Zhuo, et al.
Published: (2023)
Consistency and Uncertainty: Identifying Unreliable Responses From Black-Box Vision-Language Models for Selective Visual Question Answering
by: Khan, Zaid, et al.
Published: (2024)
by: Khan, Zaid, et al.
Published: (2024)
Slicing Vision Transformer for Flexible Inference
by: Zhang, Yitian, et al.
Published: (2024)
by: Zhang, Yitian, et al.
Published: (2024)
SHViT: Single-Head Vision Transformer with Memory Efficient Macro Design
by: Yun, Seokju, et al.
Published: (2024)
by: Yun, Seokju, et al.
Published: (2024)
Intensive Vision-guided Network for Radiology Report Generation
by: Zheng, Fudan, et al.
Published: (2024)
by: Zheng, Fudan, et al.
Published: (2024)
Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation
by: Trinh, Quoc-Huy, et al.
Published: (2026)
by: Trinh, Quoc-Huy, et al.
Published: (2026)
Vision Remember: Recovering Visual Information in Efficient LVLM with Vision Feature Resampling
by: Feng, Ze, et al.
Published: (2025)
by: Feng, Ze, et al.
Published: (2025)
VIP: Visual-guided Prompt Evolution for Efficient Dense Vision-Language Inference
by: Zhu, Hao, et al.
Published: (2026)
by: Zhu, Hao, et al.
Published: (2026)
Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications
by: Xiong, Yuwen, et al.
Published: (2024)
by: Xiong, Yuwen, et al.
Published: (2024)
Fine-T2I: An Open, Large-Scale, and Diverse Dataset for High-Quality T2I Fine-Tuning
by: Ma, Xu, et al.
Published: (2026)
by: Ma, Xu, et al.
Published: (2026)
Sports-Traj: A Unified Trajectory Generation Model for Multi-Agent Movement in Sports
by: Xu, Yi, et al.
Published: (2024)
by: Xu, Yi, et al.
Published: (2024)
AdaSports-Traj: Role- and Domain-Aware Adaptation for Multi-Agent Trajectory Modeling in Sports
by: Xu, Yi, et al.
Published: (2025)
by: Xu, Yi, et al.
Published: (2025)
FullLoRA: Efficiently Boosting the Robustness of Pretrained Vision Transformers
by: Yuan, Zheng, et al.
Published: (2024)
by: Yuan, Zheng, et al.
Published: (2024)
Breaking Modality Gap in RGBT Tracking: Coupled Knowledge Distillation
by: Lu, Andong, et al.
Published: (2024)
by: Lu, Andong, et al.
Published: (2024)
Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers
by: Lu, Andrew, et al.
Published: (2025)
by: Lu, Andrew, et al.
Published: (2025)
Spectral-Adaptive Modulation Networks for Visual Perception
by: Yun, Guhnoo, et al.
Published: (2025)
by: Yun, Guhnoo, et al.
Published: (2025)
GVTNet: Graph Vision Transformer For Face Super-Resolution
by: Yang, Chao, et al.
Published: (2025)
by: Yang, Chao, et al.
Published: (2025)
IIR-VLM: In-Context Instance-level Recognition for Large Vision-Language Models
by: Shi, Liang, et al.
Published: (2026)
by: Shi, Liang, et al.
Published: (2026)
Similar Items
-
Rewrite the Stars
by: Ma, Xu, et al.
Published: (2024) -
Exploring Invariance in Images through One-way Wave Equations
by: Chen, Yinpeng, et al.
Published: (2023) -
HyCTAS: Multi-Objective Hybrid Convolution-Transformer Architecture Search for Real-Time Image Segmentation
by: Yu, Hongyuan, et al.
Published: (2024) -
AutoBreach: Universal and Adaptive Jailbreaking with Efficient Wordplay-Guided Optimization
by: Chen, Jiawei, et al.
Published: (2024) -
DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs
by: Meng, Lingchen, et al.
Published: (2024)