Let's Roll a BiFTA: Bi-refinement for Fine-grained Text-visual Alignment in Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Yuhao, Cai, Chengyi, Zhang, Jiacheng, Ye, Zesheng, Yuan, Xingliang, Liu, Feng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Attribute-based Visual Reprogramming for Vision-Language Models
por: Cai, Chengyi, et al.
Publicado: (2025)
por: Cai, Chengyi, et al.
Publicado: (2025)
Sample-Specific Noise Injection For Diffusion-Based Adversarial Purification
por: Sun, Yuhao, et al.
Publicado: (2025)
por: Sun, Yuhao, et al.
Publicado: (2025)
Bayesian-guided Label Mapping for Visual Reprogramming
por: Cai, Chengyi, et al.
Publicado: (2024)
por: Cai, Chengyi, et al.
Publicado: (2024)
Understanding Model Reprogramming for CLIP via Decoupling Visual Prompts
por: Cai, Chengyi, et al.
Publicado: (2025)
por: Cai, Chengyi, et al.
Publicado: (2025)
Sample-specific Masks for Visual Reprogramming-based Prompting
por: Cai, Chengyi, et al.
Publicado: (2024)
por: Cai, Chengyi, et al.
Publicado: (2024)
Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning
por: Cai, Chengyi, et al.
Publicado: (2026)
por: Cai, Chengyi, et al.
Publicado: (2026)
Bi-MCQ: Reformulating Vision-Language Alignment for Negation Understanding
por: Kim, Tae Hun, et al.
Publicado: (2026)
por: Kim, Tae Hun, et al.
Publicado: (2026)
Beat: Bi-directional One-to-Many Embedding Alignment for Text-based Person Retrieval
por: Ma, Yiwei, et al.
Publicado: (2024)
por: Ma, Yiwei, et al.
Publicado: (2024)
BaFTA: Backprop-Free Test-Time Adaptation For Zero-Shot Vision-Language Models
por: Hu, Xuefeng, et al.
Publicado: (2024)
por: Hu, Xuefeng, et al.
Publicado: (2024)
Kernelized Sparse Fine-Tuning with Bi-level Parameter Competition for Vision Models
por: Shen, Shufan, et al.
Publicado: (2025)
por: Shen, Shufan, et al.
Publicado: (2025)
Large Vision Model-Guided Masked Low-Rank Approximation for Ground-Roll Attenuation
por: Liao, Jiacheng, et al.
Publicado: (2026)
por: Liao, Jiacheng, et al.
Publicado: (2026)
How Texts Help? A Fine-grained Evaluation to Reveal the Role of Language in Vision-Language Tracking
por: Li, Xuchen, et al.
Publicado: (2024)
por: Li, Xuchen, et al.
Publicado: (2024)
ETVA: Evaluation of Text-to-Video Alignment via Fine-grained Question Generation and Answering
por: Guan, Kaisi, et al.
Publicado: (2025)
por: Guan, Kaisi, et al.
Publicado: (2025)
BiVLC: Extending Vision-Language Compositionality Evaluation with Text-to-Image Retrieval
por: Miranda, Imanol, et al.
Publicado: (2024)
por: Miranda, Imanol, et al.
Publicado: (2024)
Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
por: Chen, Honghao, et al.
Publicado: (2025)
por: Chen, Honghao, et al.
Publicado: (2025)
Vision-Language Feature Alignment for Road Anomaly Segmentation
por: He, Zhuolin, et al.
Publicado: (2026)
por: He, Zhuolin, et al.
Publicado: (2026)
BiGain: Unified Token Compression for Joint Generation and Classification
por: Liu, Jiacheng, et al.
Publicado: (2026)
por: Liu, Jiacheng, et al.
Publicado: (2026)
Infusing fine-grained visual knowledge to Vision-Language Models
por: Ypsilantis, Nikolaos-Antonios, et al.
Publicado: (2025)
por: Ypsilantis, Nikolaos-Antonios, et al.
Publicado: (2025)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
por: Xu, Guowei, et al.
Publicado: (2024)
por: Xu, Guowei, et al.
Publicado: (2024)
Semantic Shield: Defending Vision-Language Models Against Backdooring and Poisoning via Fine-grained Knowledge Alignment
por: Ishmam, Alvi Md, et al.
Publicado: (2024)
por: Ishmam, Alvi Md, et al.
Publicado: (2024)
KETA: Kinematic-Phrases-Enhanced Text-to-Motion Generation via Fine-grained Alignment
por: Jiang, Yu, et al.
Publicado: (2025)
por: Jiang, Yu, et al.
Publicado: (2025)
Cross-modal Full-mode Fine-grained Alignment for Text-to-Image Person Retrieval
por: Yin, Hao, et al.
Publicado: (2025)
por: Yin, Hao, et al.
Publicado: (2025)
DeBiFormer: Vision Transformer with Deformable Agent Bi-level Routing Attention
por: Long, Nguyen Huu Bao, et al.
Publicado: (2024)
por: Long, Nguyen Huu Bao, et al.
Publicado: (2024)
3DAlign-DAER: Dynamic Attention Policy and Efficient Retrieval Strategy for Fine-grained 3D-Text Alignment at Scale
por: Fan, Yijia, et al.
Publicado: (2025)
por: Fan, Yijia, et al.
Publicado: (2025)
EViT: An Eagle Vision Transformer with Bi-Fovea Self-Attention
por: Shi, Yulong, et al.
Publicado: (2023)
por: Shi, Yulong, et al.
Publicado: (2023)
FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model
por: Xie, Chunyu, et al.
Publicado: (2025)
por: Xie, Chunyu, et al.
Publicado: (2025)
BiPVL-Seg: Bidirectional Progressive Vision-Language Fusion with Global-Local Alignment for Medical Image Segmentation
por: Sultan, Rafi Ibn, et al.
Publicado: (2025)
por: Sultan, Rafi Ibn, et al.
Publicado: (2025)
Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations
por: Cui, Yibo, et al.
Publicado: (2025)
por: Cui, Yibo, et al.
Publicado: (2025)
GraSP-VL: Length as a Semantic Granularity Interface for Vision-Language Representations
por: Li, Zesheng, et al.
Publicado: (2026)
por: Li, Zesheng, et al.
Publicado: (2026)
Fine-grained Text to Image Synthesis
por: Ouyang, Xu, et al.
Publicado: (2024)
por: Ouyang, Xu, et al.
Publicado: (2024)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
por: Xiao, Yicheng, et al.
Publicado: (2025)
por: Xiao, Yicheng, et al.
Publicado: (2025)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
por: Wang, Zhecan, et al.
Publicado: (2023)
por: Wang, Zhecan, et al.
Publicado: (2023)
MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models
por: Chen, Kaixiang, et al.
Publicado: (2026)
por: Chen, Kaixiang, et al.
Publicado: (2026)
Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments
por: Li, Haoyuan, et al.
Publicado: (2026)
por: Li, Haoyuan, et al.
Publicado: (2026)
BiTDiff: Fine-Grained 3D Conducting Motion Generation via BiMamba-Transformer Diffusion
por: Jia, Tianzhi, et al.
Publicado: (2026)
por: Jia, Tianzhi, et al.
Publicado: (2026)
Invisible Watermarks, Visible Gains: Steering Machine Unlearning with Bi-Level Watermarking Design
por: Sun, Yuhao, et al.
Publicado: (2025)
por: Sun, Yuhao, et al.
Publicado: (2025)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
por: Ying, Zonghao, et al.
Publicado: (2024)
por: Ying, Zonghao, et al.
Publicado: (2024)
Mask-adaptive Gated Convolution and Bi-directional Progressive Fusion Network for Depth Completion
por: Huang, Tingxuan, et al.
Publicado: (2024)
por: Huang, Tingxuan, et al.
Publicado: (2024)
FaithScore: Fine-grained Evaluations of Hallucinations in Large Vision-Language Models
por: Jing, Liqiang, et al.
Publicado: (2023)
por: Jing, Liqiang, et al.
Publicado: (2023)
Adapting Vision-Language Model with Fine-grained Semantics for Open-Vocabulary Segmentation
por: Chng, Yong Xien, et al.
Publicado: (2024)
por: Chng, Yong Xien, et al.
Publicado: (2024)
Ejemplares similares
-
Attribute-based Visual Reprogramming for Vision-Language Models
por: Cai, Chengyi, et al.
Publicado: (2025) -
Sample-Specific Noise Injection For Diffusion-Based Adversarial Purification
por: Sun, Yuhao, et al.
Publicado: (2025) -
Bayesian-guided Label Mapping for Visual Reprogramming
por: Cai, Chengyi, et al.
Publicado: (2024) -
Understanding Model Reprogramming for CLIP via Decoupling Visual Prompts
por: Cai, Chengyi, et al.
Publicado: (2025) -
Sample-specific Masks for Visual Reprogramming-based Prompting
por: Cai, Chengyi, et al.
Publicado: (2024)