DVLA-RL: Dual-Level Vision-Language Alignment with Reinforcement Learning Gating for Few-Shot Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Wenhao, Meng, Xianjing, Wang, Qiangchang, Han, Zhongyi, Wu, Zhibin, Yin, Yilong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VT-FSL: Bridging Vision and Text with LLMs for Few-Shot Learning
par: Li, Wenhao, et autres
Publié: (2025)
par: Li, Wenhao, et autres
Publié: (2025)
KNN Transformer with Pyramid Prompts for Few-Shot Learning
par: Li, Wenhao, et autres
Publié: (2024)
par: Li, Wenhao, et autres
Publié: (2024)
Doodle Your Keypoints: Sketch-Based Few-Shot Keypoint Detection
par: Maity, Subhajit, et autres
Publié: (2025)
par: Maity, Subhajit, et autres
Publié: (2025)
IAMAP: Unlocking Deep Learning in QGIS for non-coders and limited computing resources
par: Tresson, Paul, et autres
Publié: (2025)
par: Tresson, Paul, et autres
Publié: (2025)
Vision-based Situational Graphs Exploiting Fiducial Markers for the Integration of Semantic Entities
par: Tourani, Ali, et autres
Publié: (2023)
par: Tourani, Ali, et autres
Publié: (2023)
Consistency-Driven Calibration and Matching for Few-Shot Class-Incremental Learning
par: Wang, Qinzhe, et autres
Publié: (2025)
par: Wang, Qinzhe, et autres
Publié: (2025)
Decoupled Sensitivity-Consistency Learning for Weakly Supervised Video Anomaly Detection
par: Zheng, Hantao, et autres
Publié: (2026)
par: Zheng, Hantao, et autres
Publié: (2026)
Optimizing Multi-Scale Representations to Detect Effect Heterogeneity Using Earth Observation and Computer Vision: Applications to Two Anti-Poverty RCTs
par: Zhu, Fucheng Warren, et autres
Publié: (2024)
par: Zhu, Fucheng Warren, et autres
Publié: (2024)
TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models
par: Wang, Zeqing, et autres
Publié: (2025)
par: Wang, Zeqing, et autres
Publié: (2025)
EarthVL: A Progressive Earth Vision-Language Understanding and Generation Framework
par: Wang, Junjue, et autres
Publié: (2026)
par: Wang, Junjue, et autres
Publié: (2026)
Physics Augmented Tuple Transformer for Autism Severity Level Detection
par: Ranasingha, Chinthaka, et autres
Publié: (2024)
par: Ranasingha, Chinthaka, et autres
Publié: (2024)
Skeletonization-Based Adversarial Perturbations on Large Vision Language Model's Mathematical Text Recognition
par: Yoshida, Masatomo, et autres
Publié: (2026)
par: Yoshida, Masatomo, et autres
Publié: (2026)
DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models
par: Zhou, Yue, et autres
Publié: (2026)
par: Zhou, Yue, et autres
Publié: (2026)
Learning to count small and clustered objects with application to bacterial colonies
par: Zheng, Minghua, et autres
Publié: (2026)
par: Zheng, Minghua, et autres
Publié: (2026)
DisasterM3: A Remote Sensing Vision-Language Dataset for Disaster Damage Assessment and Response
par: Wang, Junjue, et autres
Publié: (2025)
par: Wang, Junjue, et autres
Publié: (2025)
SETR: A Two-Stage Semantic-Enhanced Framework for Zero-Shot Composed Image Retrieval
par: Xiao, Yuqi, et autres
Publié: (2025)
par: Xiao, Yuqi, et autres
Publié: (2025)
UAV-assisted Visual SLAM Generating Reconstructed 3D Scene Graphs in GPS-denied Environments
par: Radwan, Ahmed, et autres
Publié: (2024)
par: Radwan, Ahmed, et autres
Publié: (2024)
Data Augmentation in Earth Observation: A Diffusion Model Approach
par: Sousa, Tiago, et autres
Publié: (2024)
par: Sousa, Tiago, et autres
Publié: (2024)
Can LLM Agents Respond to Disasters? Benchmarking Heterogeneous Geospatial Reasoning in Emergency Operations
par: Wang, Junjue, et autres
Publié: (2026)
par: Wang, Junjue, et autres
Publié: (2026)
WPDA: Frequency-based Backdoor Attack with Wavelet Packet Decomposition
par: Song, Zhengyao, et autres
Publié: (2024)
par: Song, Zhengyao, et autres
Publié: (2024)
EEG Signal Denoising Using pix2pix GAN: Enhancing Neurological Data Analysis
par: Wang, Haoyi, et autres
Publié: (2024)
par: Wang, Haoyi, et autres
Publié: (2024)
Automated Discontinuity Set Characterisation in Enclosed Rock Face Point Clouds Using Single-Shot Filtering and Cyclic Orientation Transformation
par: Patra, Dibyayan, et autres
Publié: (2026)
par: Patra, Dibyayan, et autres
Publié: (2026)
Supersampling of Data from Structured-light Scanner with Deep Learning
par: Melicherčík, Martin, et autres
Publié: (2023)
par: Melicherčík, Martin, et autres
Publié: (2023)
MdaIF: Robust One-Stop Multi-Degradation-Aware Image Fusion with Language-Driven Semantics
par: Li, Jing, et autres
Publié: (2025)
par: Li, Jing, et autres
Publié: (2025)
Grounding Synthetic Data Generation With Vision and Language Models
par: Çağlar, Ümit Mert, et autres
Publié: (2026)
par: Çağlar, Ümit Mert, et autres
Publié: (2026)
Evaluating the Significance of Outdoor Advertising from Driver's Perspective Using Computer Vision
par: Černeková, Zuzana, et autres
Publié: (2023)
par: Černeková, Zuzana, et autres
Publié: (2023)
Processing and Segmentation of Human Teeth from 2D Images using Weakly Supervised Learning
par: Kunzo, Tomáš, et autres
Publié: (2023)
par: Kunzo, Tomáš, et autres
Publié: (2023)
DIsoN: Decentralized Isolation Networks for Out-of-Distribution Detection in Medical Imaging
par: Wagner, Felix, et autres
Publié: (2025)
par: Wagner, Felix, et autres
Publié: (2025)
Estimating optical vegetation indices and biophysical variables for temperate forests with Sentinel-1 SAR data using machine learning techniques: A case study for Czechia
par: Paluba, Daniel, et autres
Publié: (2023)
par: Paluba, Daniel, et autres
Publié: (2023)
Optimal Blackjack Strategy Recommender: A Comprehensive Study on Computer Vision Integration for Enhanced Gameplay
par: Gupta, Krishnanshu, et autres
Publié: (2024)
par: Gupta, Krishnanshu, et autres
Publié: (2024)
A Deep Learning Approach to Identify Rock Bolts in Complex 3D Point Clouds of Underground Mines Captured Using Mobile Laser Scanners
par: Patra, Dibyayan, et autres
Publié: (2025)
par: Patra, Dibyayan, et autres
Publié: (2025)
Dynamic Residual Encoding with Slide-Level Contrastive Learning for End-to-End Whole Slide Image Representation
par: Jin, Jing, et autres
Publié: (2025)
par: Jin, Jing, et autres
Publié: (2025)
Gaze-Guided Learning: Avoiding Shortcut Bias in Visual Classification
par: Li, Jiahang, et autres
Publié: (2025)
par: Li, Jiahang, et autres
Publié: (2025)
Detailed Evaluation of Modern Machine Learning Approaches for Optic Plastics Sorting
par: Maheshkar, Vaishali, et autres
Publié: (2025)
par: Maheshkar, Vaishali, et autres
Publié: (2025)
Accelerating Post-Tornado Disaster Assessment Using Advanced Deep Learning Models
par: Umeike, Robinson, et autres
Publié: (2024)
par: Umeike, Robinson, et autres
Publié: (2024)
A Computer Vision Pipeline for Iterative Bullet Hole Tracking in Rifle Zeroing
par: Belcher, Robert M., et autres
Publié: (2026)
par: Belcher, Robert M., et autres
Publié: (2026)
Non-destructive Identification of Oyster Species is possible from Hyperspectral Images with Machine Learning
par: Waters, Ethan Kane, et autres
Publié: (2026)
par: Waters, Ethan Kane, et autres
Publié: (2026)
On-the-Fly Guidance Training for Medical Image Registration
par: Xin, Yuelin, et autres
Publié: (2023)
par: Xin, Yuelin, et autres
Publié: (2023)
Low-Cost Tree Crown Dieback Estimation Using Deep Learning-Based Segmentation
par: Allen, M. J., et autres
Publié: (2024)
par: Allen, M. J., et autres
Publié: (2024)
DCT-HistoTransformer: Efficient Lightweight Vision Transformer with DCT Integration for histopathological image analysis
par: Ranjbar, Mahtab, et autres
Publié: (2024)
par: Ranjbar, Mahtab, et autres
Publié: (2024)
Documents similaires
-
VT-FSL: Bridging Vision and Text with LLMs for Few-Shot Learning
par: Li, Wenhao, et autres
Publié: (2025) -
KNN Transformer with Pyramid Prompts for Few-Shot Learning
par: Li, Wenhao, et autres
Publié: (2024) -
Doodle Your Keypoints: Sketch-Based Few-Shot Keypoint Detection
par: Maity, Subhajit, et autres
Publié: (2025) -
IAMAP: Unlocking Deep Learning in QGIS for non-coders and limited computing resources
par: Tresson, Paul, et autres
Publié: (2025) -
Vision-based Situational Graphs Exploiting Fiducial Markers for the Integration of Semantic Entities
par: Tourani, Ali, et autres
Publié: (2023)