DAPE: Dynamic Non-uniform Alignment and Progressive Detail Enhancement Techniques for Improving the Performance of Efficient Visual Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Tian, Mengyuan, Zhao, Qiyan, Wang, Yanan, Wang, Da-Han |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TextMamba: Scene Text Detector with Mamba
di: Zhao, Qiyan, et al.
Pubblicazione: (2025)
di: Zhao, Qiyan, et al.
Pubblicazione: (2025)
DAPE: Dual-Stage Parameter-Efficient Fine-Tuning for Consistent Video Editing with Diffusion Models
di: Xia, Junhao, et al.
Pubblicazione: (2025)
di: Xia, Junhao, et al.
Pubblicazione: (2025)
Progressive Prompt Detailing for Improved Alignment in Text-to-Image Generative Models
di: Saichandran, Ketan Suhaas, et al.
Pubblicazione: (2025)
di: Saichandran, Ketan Suhaas, et al.
Pubblicazione: (2025)
Asymmetric Visual Semantic Embedding Framework for Efficient Vision-Language Alignment
di: Liu, Yang, et al.
Pubblicazione: (2025)
di: Liu, Yang, et al.
Pubblicazione: (2025)
SR-Stereo & DAPE: Stepwise Regression and Pre-trained Edges for Practical Stereo Matching
di: Xiao, Weiqing, et al.
Pubblicazione: (2024)
di: Xiao, Weiqing, et al.
Pubblicazione: (2024)
Restoring Real-World Images with an Internal Detail Enhancement Diffusion Model
di: Xiao, Peng, et al.
Pubblicazione: (2025)
di: Xiao, Peng, et al.
Pubblicazione: (2025)
Progressive Supernet Training for Efficient Visual Autoregressive Modeling
di: Chen, Xiaoyue, et al.
Pubblicazione: (2025)
di: Chen, Xiaoyue, et al.
Pubblicazione: (2025)
MARIS: Marine Open-Vocabulary Instance Segmentation with Geometric Enhancement and Semantic Alignment
di: Li, Bingyu, et al.
Pubblicazione: (2025)
di: Li, Bingyu, et al.
Pubblicazione: (2025)
Indoor Scene Reconstruction with Fine-Grained Details Using Hybrid Representation and Normal Prior Enhancement
di: Ye, Sheng, et al.
Pubblicazione: (2023)
di: Ye, Sheng, et al.
Pubblicazione: (2023)
ProPhy: Progressive Physical Alignment for Dynamic World Simulation
di: Wang, Zijun, et al.
Pubblicazione: (2025)
di: Wang, Zijun, et al.
Pubblicazione: (2025)
Benchmarking and Improving Detail Image Caption
di: Dong, Hongyuan, et al.
Pubblicazione: (2024)
di: Dong, Hongyuan, et al.
Pubblicazione: (2024)
Constrained Prompt Enhancement for Improving Zero-Shot Generalization of Vision-Language Models
di: Yin, Xiaojie, et al.
Pubblicazione: (2025)
di: Yin, Xiaojie, et al.
Pubblicazione: (2025)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
di: Yang, Chenyu, et al.
Pubblicazione: (2024)
di: Yang, Chenyu, et al.
Pubblicazione: (2024)
Visual Representation Alignment for Multimodal Large Language Models
di: Yoon, Heeji, et al.
Pubblicazione: (2025)
di: Yoon, Heeji, et al.
Pubblicazione: (2025)
Tango: Taming Visual Signals for Efficient Video Large Language Models
di: Yin, Shukang, et al.
Pubblicazione: (2026)
di: Yin, Shukang, et al.
Pubblicazione: (2026)
LoD-Loc v2: Aerial Visual Localization over Low Level-of-Detail City Models using Explicit Silhouette Alignment
di: Zhu, Juelin, et al.
Pubblicazione: (2025)
di: Zhu, Juelin, et al.
Pubblicazione: (2025)
Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models
di: Jung, Mingi, et al.
Pubblicazione: (2025)
di: Jung, Mingi, et al.
Pubblicazione: (2025)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
di: Yan, Ziang, et al.
Pubblicazione: (2024)
di: Yan, Ziang, et al.
Pubblicazione: (2024)
TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment
di: Qin, Chunxia, et al.
Pubblicazione: (2026)
di: Qin, Chunxia, et al.
Pubblicazione: (2026)
Improving Bracket Image Restoration and Enhancement with Flow-guided Alignment and Enhanced Feature Aggregation
di: Lin, Wenjie, et al.
Pubblicazione: (2024)
di: Lin, Wenjie, et al.
Pubblicazione: (2024)
Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts
di: Rang, Miao, et al.
Pubblicazione: (2025)
di: Rang, Miao, et al.
Pubblicazione: (2025)
VIIS: Visible and Infrared Information Synthesis for Severe Low-light Image Enhancement
di: Zhao, Chen, et al.
Pubblicazione: (2024)
di: Zhao, Chen, et al.
Pubblicazione: (2024)
SpatialV2A: Visual-Guided High-fidelity Spatial Audio Generation
di: Wang, Yanan, et al.
Pubblicazione: (2026)
di: Wang, Yanan, et al.
Pubblicazione: (2026)
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP
di: Li, Yinqi, et al.
Pubblicazione: (2025)
di: Li, Yinqi, et al.
Pubblicazione: (2025)
Conjugated Semantic Pool Improves OOD Detection with Pre-trained Vision-Language Models
di: Chen, Mengyuan, et al.
Pubblicazione: (2024)
di: Chen, Mengyuan, et al.
Pubblicazione: (2024)
DyDiT++: Diffusion Transformers with Timestep and Spatial Dynamics for Efficient Visual Generation
di: Zhao, Wangbo, et al.
Pubblicazione: (2025)
di: Zhao, Wangbo, et al.
Pubblicazione: (2025)
Dynamic Pyramid Network for Efficient Multimodal Large Language Model
di: Ai, Hao, et al.
Pubblicazione: (2025)
di: Ai, Hao, et al.
Pubblicazione: (2025)
MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces
di: E, Shaojun, et al.
Pubblicazione: (2025)
di: E, Shaojun, et al.
Pubblicazione: (2025)
Latent Denoising Improves Visual Alignment in Large Multimodal Models
di: Parikh, Dhruv, et al.
Pubblicazione: (2026)
di: Parikh, Dhruv, et al.
Pubblicazione: (2026)
Modest-Align: Data-Efficient Alignment for Vision-Language Models
di: Liu, Jiaxiang, et al.
Pubblicazione: (2025)
di: Liu, Jiaxiang, et al.
Pubblicazione: (2025)
Locality Alignment Improves Vision-Language Models
di: Covert, Ian, et al.
Pubblicazione: (2024)
di: Covert, Ian, et al.
Pubblicazione: (2024)
NUC-Net: Non-uniform Cylindrical Partition Network for Efficient LiDAR Semantic Segmentation
di: Wang, Xuzhi, et al.
Pubblicazione: (2025)
di: Wang, Xuzhi, et al.
Pubblicazione: (2025)
EGM: Efficient Visual Grounding Language Models
di: Zhan, Guanqi, et al.
Pubblicazione: (2026)
di: Zhan, Guanqi, et al.
Pubblicazione: (2026)
Astrea: A MOE-based Visual Understanding Model with Progressive Alignment
di: Yang, Xiaoda, et al.
Pubblicazione: (2025)
di: Yang, Xiaoda, et al.
Pubblicazione: (2025)
Progressive Language-guided Visual Learning for Multi-Task Visual Grounding
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder
di: Hu, Xiaoxing, et al.
Pubblicazione: (2025)
di: Hu, Xiaoxing, et al.
Pubblicazione: (2025)
Video-Panda: Parameter-efficient Alignment for Encoder-free Video-Language Models
di: Yi, Jinhui, et al.
Pubblicazione: (2024)
di: Yi, Jinhui, et al.
Pubblicazione: (2024)
IAR2: Improving Autoregressive Visual Generation with Semantic-Detail Associated Token Prediction
di: Yi, Ran, et al.
Pubblicazione: (2025)
di: Yi, Ran, et al.
Pubblicazione: (2025)
Large Language Model Guided Progressive Feature Alignment for Multimodal UAV Object Detection
di: Wu, Wentao, et al.
Pubblicazione: (2025)
di: Wu, Wentao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
TextMamba: Scene Text Detector with Mamba
di: Zhao, Qiyan, et al.
Pubblicazione: (2025) -
DAPE: Dual-Stage Parameter-Efficient Fine-Tuning for Consistent Video Editing with Diffusion Models
di: Xia, Junhao, et al.
Pubblicazione: (2025) -
Progressive Prompt Detailing for Improved Alignment in Text-to-Image Generative Models
di: Saichandran, Ketan Suhaas, et al.
Pubblicazione: (2025) -
Asymmetric Visual Semantic Embedding Framework for Efficient Vision-Language Alignment
di: Liu, Yang, et al.
Pubblicazione: (2025) -
SR-Stereo & DAPE: Stepwise Regression and Pre-trained Edges for Practical Stereo Matching
di: Xiao, Weiqing, et al.
Pubblicazione: (2024)