Let's Roll a BiFTA: Bi-refinement for Fine-grained Text-visual Alignment in Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Yuhao, Cai, Chengyi, Zhang, Jiacheng, Ye, Zesheng, Yuan, Xingliang, Liu, Feng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Attribute-based Visual Reprogramming for Vision-Language Models
di: Cai, Chengyi, et al.
Pubblicazione: (2025)
di: Cai, Chengyi, et al.
Pubblicazione: (2025)
Sample-Specific Noise Injection For Diffusion-Based Adversarial Purification
di: Sun, Yuhao, et al.
Pubblicazione: (2025)
di: Sun, Yuhao, et al.
Pubblicazione: (2025)
Bayesian-guided Label Mapping for Visual Reprogramming
di: Cai, Chengyi, et al.
Pubblicazione: (2024)
di: Cai, Chengyi, et al.
Pubblicazione: (2024)
Understanding Model Reprogramming for CLIP via Decoupling Visual Prompts
di: Cai, Chengyi, et al.
Pubblicazione: (2025)
di: Cai, Chengyi, et al.
Pubblicazione: (2025)
Sample-specific Masks for Visual Reprogramming-based Prompting
di: Cai, Chengyi, et al.
Pubblicazione: (2024)
di: Cai, Chengyi, et al.
Pubblicazione: (2024)
Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning
di: Cai, Chengyi, et al.
Pubblicazione: (2026)
di: Cai, Chengyi, et al.
Pubblicazione: (2026)
Bi-MCQ: Reformulating Vision-Language Alignment for Negation Understanding
di: Kim, Tae Hun, et al.
Pubblicazione: (2026)
di: Kim, Tae Hun, et al.
Pubblicazione: (2026)
Beat: Bi-directional One-to-Many Embedding Alignment for Text-based Person Retrieval
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
BaFTA: Backprop-Free Test-Time Adaptation For Zero-Shot Vision-Language Models
di: Hu, Xuefeng, et al.
Pubblicazione: (2024)
di: Hu, Xuefeng, et al.
Pubblicazione: (2024)
Kernelized Sparse Fine-Tuning with Bi-level Parameter Competition for Vision Models
di: Shen, Shufan, et al.
Pubblicazione: (2025)
di: Shen, Shufan, et al.
Pubblicazione: (2025)
Large Vision Model-Guided Masked Low-Rank Approximation for Ground-Roll Attenuation
di: Liao, Jiacheng, et al.
Pubblicazione: (2026)
di: Liao, Jiacheng, et al.
Pubblicazione: (2026)
How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking
di: Li, Xuchen, et al.
Pubblicazione: (2024)
di: Li, Xuchen, et al.
Pubblicazione: (2024)
ETVA: Evaluation of Text-to-Video Alignment via Fine-grained Question Generation and Answering
di: Guan, Kaisi, et al.
Pubblicazione: (2025)
di: Guan, Kaisi, et al.
Pubblicazione: (2025)
BiVLC: Extending Vision-Language Compositionality Evaluation with Text-to-Image Retrieval
di: Miranda, Imanol, et al.
Pubblicazione: (2024)
di: Miranda, Imanol, et al.
Pubblicazione: (2024)
Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
di: Chen, Honghao, et al.
Pubblicazione: (2025)
di: Chen, Honghao, et al.
Pubblicazione: (2025)
Vision-Language Feature Alignment for Road Anomaly Segmentation
di: He, Zhuolin, et al.
Pubblicazione: (2026)
di: He, Zhuolin, et al.
Pubblicazione: (2026)
BiGain: Unified Token Compression for Joint Generation and Classification
di: Liu, Jiacheng, et al.
Pubblicazione: (2026)
di: Liu, Jiacheng, et al.
Pubblicazione: (2026)
Infusing fine-grained visual knowledge to Vision-Language Models
di: Ypsilantis, Nikolaos-Antonios, et al.
Pubblicazione: (2025)
di: Ypsilantis, Nikolaos-Antonios, et al.
Pubblicazione: (2025)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
di: Xu, Guowei, et al.
Pubblicazione: (2024)
di: Xu, Guowei, et al.
Pubblicazione: (2024)
Semantic Shield: Defending Vision-Language Models Against Backdooring and Poisoning via Fine-grained Knowledge Alignment
di: Ishmam, Alvi Md, et al.
Pubblicazione: (2024)
di: Ishmam, Alvi Md, et al.
Pubblicazione: (2024)
KETA: Kinematic-Phrases-Enhanced Text-to-Motion Generation via Fine-grained Alignment
di: Jiang, Yu, et al.
Pubblicazione: (2025)
di: Jiang, Yu, et al.
Pubblicazione: (2025)
Cross-modal Full-mode Fine-grained Alignment for Text-to-Image Person Retrieval
di: Yin, Hao, et al.
Pubblicazione: (2025)
di: Yin, Hao, et al.
Pubblicazione: (2025)
DeBiFormer: Vision Transformer with Deformable Agent Bi-level Routing Attention
di: Long, Nguyen Huu Bao, et al.
Pubblicazione: (2024)
di: Long, Nguyen Huu Bao, et al.
Pubblicazione: (2024)
3DAlign-DAER: Dynamic Attention Policy and Efficient Retrieval Strategy for Fine-grained 3D-Text Alignment at Scale
di: Fan, Yijia, et al.
Pubblicazione: (2025)
di: Fan, Yijia, et al.
Pubblicazione: (2025)
EViT: An Eagle Vision Transformer with Bi-Fovea Self-Attention
di: Shi, Yulong, et al.
Pubblicazione: (2023)
di: Shi, Yulong, et al.
Pubblicazione: (2023)
FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model
di: Xie, Chunyu, et al.
Pubblicazione: (2025)
di: Xie, Chunyu, et al.
Pubblicazione: (2025)
BiPVL-Seg: Bidirectional Progressive Vision-Language Fusion with Global-Local Alignment for Medical Image Segmentation
di: Sultan, Rafi Ibn, et al.
Pubblicazione: (2025)
di: Sultan, Rafi Ibn, et al.
Pubblicazione: (2025)
Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations
di: Cui, Yibo, et al.
Pubblicazione: (2025)
di: Cui, Yibo, et al.
Pubblicazione: (2025)
GraSP-VL: Length as a Semantic Granularity Interface for Vision-Language Representations
di: Li, Zesheng, et al.
Pubblicazione: (2026)
di: Li, Zesheng, et al.
Pubblicazione: (2026)
Fine-grained Text to Image Synthesis
di: Ouyang, Xu, et al.
Pubblicazione: (2024)
di: Ouyang, Xu, et al.
Pubblicazione: (2024)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
di: Wang, Zhecan, et al.
Pubblicazione: (2023)
di: Wang, Zhecan, et al.
Pubblicazione: (2023)
MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models
di: Chen, Kaixiang, et al.
Pubblicazione: (2026)
di: Chen, Kaixiang, et al.
Pubblicazione: (2026)
Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments
di: Li, Haoyuan, et al.
Pubblicazione: (2026)
di: Li, Haoyuan, et al.
Pubblicazione: (2026)
BiTDiff: Fine-Grained 3D Conducting Motion Generation via BiMamba-Transformer Diffusion
di: Jia, Tianzhi, et al.
Pubblicazione: (2026)
di: Jia, Tianzhi, et al.
Pubblicazione: (2026)
Invisible Watermarks, Visible Gains: Steering Machine Unlearning with Bi-Level Watermarking Design
di: Sun, Yuhao, et al.
Pubblicazione: (2025)
di: Sun, Yuhao, et al.
Pubblicazione: (2025)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
Mask-adaptive Gated Convolution and Bi-directional Progressive Fusion Network for Depth Completion
di: Huang, Tingxuan, et al.
Pubblicazione: (2024)
di: Huang, Tingxuan, et al.
Pubblicazione: (2024)
FaithScore: Fine-grained Evaluations of Hallucinations in Large Vision-Language Models
di: Jing, Liqiang, et al.
Pubblicazione: (2023)
di: Jing, Liqiang, et al.
Pubblicazione: (2023)
Adapting Vision-Language Model with Fine-grained Semantics for Open-Vocabulary Segmentation
di: Chng, Yong Xien, et al.
Pubblicazione: (2024)
di: Chng, Yong Xien, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Attribute-based Visual Reprogramming for Vision-Language Models
di: Cai, Chengyi, et al.
Pubblicazione: (2025) -
Sample-Specific Noise Injection For Diffusion-Based Adversarial Purification
di: Sun, Yuhao, et al.
Pubblicazione: (2025) -
Bayesian-guided Label Mapping for Visual Reprogramming
di: Cai, Chengyi, et al.
Pubblicazione: (2024) -
Understanding Model Reprogramming for CLIP via Decoupling Visual Prompts
di: Cai, Chengyi, et al.
Pubblicazione: (2025) -
Sample-specific Masks for Visual Reprogramming-based Prompting
di: Cai, Chengyi, et al.
Pubblicazione: (2024)