Locality Alignment Improves Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Covert, Ian, Sun, Tony, Zou, James, Hashimoto, Tatsunori |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models
por: Thapa, Rahul, et al.
Publicado: (2024)
por: Thapa, Rahul, et al.
Publicado: (2024)
Improving Concept Alignment in Vision-Language Concept Bottleneck Models
por: Selvaraj, Nithish Muthuchamy, et al.
Publicado: (2024)
por: Selvaraj, Nithish Muthuchamy, et al.
Publicado: (2024)
Improved Alignment of Modalities in Large Vision Language Models
por: Jangra, Kartik, et al.
Publicado: (2025)
por: Jangra, Kartik, et al.
Publicado: (2025)
Synth-Align: Improving Trustworthiness in Vision-Language Model with Synthetic Preference Data Alignment
por: Wijaya, Robert, et al.
Publicado: (2024)
por: Wijaya, Robert, et al.
Publicado: (2024)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
por: Yan, Ziang, et al.
Publicado: (2024)
por: Yan, Ziang, et al.
Publicado: (2024)
Low-Pass Filtering Improves Behavioral Alignment of Vision Models
por: Wolff, Max, et al.
Publicado: (2026)
por: Wolff, Max, et al.
Publicado: (2026)
Improving Large Vision-Language Models' Understanding for Flow Field Data
por: Zhang, Xiaomei, et al.
Publicado: (2025)
por: Zhang, Xiaomei, et al.
Publicado: (2025)
Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
por: Lin, Tao, et al.
Publicado: (2025)
por: Lin, Tao, et al.
Publicado: (2025)
Vision Language Models as Values Detectors
por: Abbo, Giulio Antonio, et al.
Publicado: (2025)
por: Abbo, Giulio Antonio, et al.
Publicado: (2025)
Enhancing Vision-Language Model with Unmasked Token Alignment
por: Liu, Jihao, et al.
Publicado: (2024)
por: Liu, Jihao, et al.
Publicado: (2024)
Assessing and Learning Alignment of Unimodal Vision and Language Models
por: Zhang, Le, et al.
Publicado: (2024)
por: Zhang, Le, et al.
Publicado: (2024)
Bootstrap Fine-Grained Vision-Language Alignment for Unified Zero-Shot Anomaly Localization
por: Deng, Hanqiu, et al.
Publicado: (2023)
por: Deng, Hanqiu, et al.
Publicado: (2023)
Test-time Alignment-Enhanced Adapter for Vision-Language Models
por: Tong, Baoshun, et al.
Publicado: (2024)
por: Tong, Baoshun, et al.
Publicado: (2024)
Modest-Align: Data-Efficient Alignment for Vision-Language Models
por: Liu, Jiaxiang, et al.
Publicado: (2025)
por: Liu, Jiaxiang, et al.
Publicado: (2025)
Mechanisms of Object Localization in Vision-Language Models
por: Schaumlöffel, Timothy, et al.
Publicado: (2026)
por: Schaumlöffel, Timothy, et al.
Publicado: (2026)
T-REN: Learning Text-Aligned Region Tokens Improves Dense Vision-Language Alignment and Scalability
por: Khosla, Savya, et al.
Publicado: (2026)
por: Khosla, Savya, et al.
Publicado: (2026)
Focus on What Matters: Enhancing Medical Vision-Language Models with Automatic Attention Alignment Tuning
por: Chang, Aofei, et al.
Publicado: (2025)
por: Chang, Aofei, et al.
Publicado: (2025)
Decoupled Global-Local Alignment for Improving Compositional Understanding
por: Hu, Xiaoxing, et al.
Publicado: (2025)
por: Hu, Xiaoxing, et al.
Publicado: (2025)
Safety Alignment for Vision Language Models
por: Liu, Zhendong, et al.
Publicado: (2024)
por: Liu, Zhendong, et al.
Publicado: (2024)
DPA: Dual Prototypes Alignment for Unsupervised Adaptation of Vision-Language Models
por: Ali, Eman, et al.
Publicado: (2024)
por: Ali, Eman, et al.
Publicado: (2024)
ComAlign: Compositional Alignment in Vision-Language Models
por: Abdollah, Ali, et al.
Publicado: (2024)
por: Abdollah, Ali, et al.
Publicado: (2024)
See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment
por: Azeez, Mohammad Anas, et al.
Publicado: (2026)
por: Azeez, Mohammad Anas, et al.
Publicado: (2026)
Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations
por: Cui, Yibo, et al.
Publicado: (2025)
por: Cui, Yibo, et al.
Publicado: (2025)
Beginning with You: Perceptual-Initialization Improves Vision-Language Representation and Alignment
por: Hu, Yang, et al.
Publicado: (2025)
por: Hu, Yang, et al.
Publicado: (2025)
TagAlign: Improving Vision-Language Alignment with Multi-Tag Classification
por: Liu, Qinying, et al.
Publicado: (2023)
por: Liu, Qinying, et al.
Publicado: (2023)
Modular Prompt Learning Improves Vision-Language Models
por: Huang, Zhenhan, et al.
Publicado: (2025)
por: Huang, Zhenhan, et al.
Publicado: (2025)
Are Large Pre-trained Vision Language Models Effective Construction Safety Inspectors?
por: Chen, Xuezheng, et al.
Publicado: (2025)
por: Chen, Xuezheng, et al.
Publicado: (2025)
Pruning All-Rounder: Rethinking and Improving Inference Efficiency for Large Vision Language Models
por: Suo, Wei, et al.
Publicado: (2024)
por: Suo, Wei, et al.
Publicado: (2024)
HPT++: Hierarchically Prompting Vision-Language Models with Multi-Granularity Knowledge Generation and Improved Structure Modeling
por: Wang, Yubin, et al.
Publicado: (2024)
por: Wang, Yubin, et al.
Publicado: (2024)
Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment
por: Jiang, Jerry, et al.
Publicado: (2026)
por: Jiang, Jerry, et al.
Publicado: (2026)
Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models
por: Lv, Weiyi, et al.
Publicado: (2025)
por: Lv, Weiyi, et al.
Publicado: (2025)
Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models
por: Johnson, Emily, et al.
Publicado: (2025)
por: Johnson, Emily, et al.
Publicado: (2025)
Visual Alignment of Medical Vision-Language Models for Grounded Radiology Report Generation
por: Bose, Sarosij, et al.
Publicado: (2025)
por: Bose, Sarosij, et al.
Publicado: (2025)
Masked Diffusion Vision-Language Models for Temporal Action Localization
por: Wang, Fengshun, et al.
Publicado: (2026)
por: Wang, Fengshun, et al.
Publicado: (2026)
Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models
por: Imran, Muhammad, et al.
Publicado: (2025)
por: Imran, Muhammad, et al.
Publicado: (2025)
Vision-Language Feature Alignment for Road Anomaly Segmentation
por: He, Zhuolin, et al.
Publicado: (2026)
por: He, Zhuolin, et al.
Publicado: (2026)
Iterated Learning Improves Compositionality in Large Vision-Language Models
por: Zheng, Chenhao, et al.
Publicado: (2024)
por: Zheng, Chenhao, et al.
Publicado: (2024)
Out-of-Domain Robustness via Targeted Augmentations
por: Gao, Irena, et al.
Publicado: (2023)
por: Gao, Irena, et al.
Publicado: (2023)
Improving Adversarial Transferability in MLLMs via Dynamic Vision-Language Alignment Attack
por: Gu, Chenhe, et al.
Publicado: (2025)
por: Gu, Chenhe, et al.
Publicado: (2025)
Natural Language Inference Improves Compositionality in Vision-Language Models
por: Cascante-Bonilla, Paola, et al.
Publicado: (2024)
por: Cascante-Bonilla, Paola, et al.
Publicado: (2024)
Ejemplares similares
-
Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models
por: Thapa, Rahul, et al.
Publicado: (2024) -
Improving Concept Alignment in Vision-Language Concept Bottleneck Models
por: Selvaraj, Nithish Muthuchamy, et al.
Publicado: (2024) -
Improved Alignment of Modalities in Large Vision Language Models
por: Jangra, Kartik, et al.
Publicado: (2025) -
Synth-Align: Improving Trustworthiness in Vision-Language Model with Synthetic Preference Data Alignment
por: Wijaya, Robert, et al.
Publicado: (2024) -
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
por: Yan, Ziang, et al.
Publicado: (2024)