Conceptual Codebook Learning for Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Yi, Yu, Ke, Wu, Siqi, He, Zhihai |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Concept-Guided Prompt Learning for Generalization in Vision-Language Models
by: Zhang, Yi, et al.
Published: (2024)
by: Zhang, Yi, et al.
Published: (2024)
NODE-Adapter: Neural Ordinary Differential Equations for Better Vision-Language Reasoning
by: Zhang, Yi, et al.
Published: (2024)
by: Zhang, Yi, et al.
Published: (2024)
Training-Free Test-Time Adaptation with Brownian Distance Covariance in Vision-Language Models
by: Zhang, Yi, et al.
Published: (2026)
by: Zhang, Yi, et al.
Published: (2026)
LG-VQ: Language-Guided Codebook Learning
by: Liang, Guotao, et al.
Published: (2024)
by: Liang, Guotao, et al.
Published: (2024)
Conditional Latent Coding with Learnable Synthesized Reference for Deep Image Compression
by: Wu, Siqi, et al.
Published: (2025)
by: Wu, Siqi, et al.
Published: (2025)
Towards Improved Text-Aligned Codebook Learning: Multi-Hierarchical Codebook-Text Alignment with Long Text
by: Liang, Guotao, et al.
Published: (2025)
by: Liang, Guotao, et al.
Published: (2025)
MiniVLN: Efficient Vision-and-Language Navigation by Progressive Knowledge Distillation
by: Zhu, Junyou, et al.
Published: (2024)
by: Zhu, Junyou, et al.
Published: (2024)
Understanding the Implicit User Intention via Reasoning with Large Language Model for Image Editing
by: Wang, Yijia, et al.
Published: (2025)
by: Wang, Yijia, et al.
Published: (2025)
UMIT: Unifying Medical Imaging Tasks via Vision-Language Models
by: Yu, Haiyang, et al.
Published: (2025)
by: Yu, Haiyang, et al.
Published: (2025)
Exploiting Discriminative Codebook Prior for Autoregressive Image Generation
by: Tang, Longxiang, et al.
Published: (2025)
by: Tang, Longxiang, et al.
Published: (2025)
Codebook Transfer with Part-of-Speech for Vector-Quantized Image Modeling
by: Zhang, Baoquan, et al.
Published: (2024)
by: Zhang, Baoquan, et al.
Published: (2024)
Learning by Correction: Efficient Tuning Task for Zero-Shot Generative Vision-Language Reasoning
by: Li, Rongjie, et al.
Published: (2024)
by: Li, Rongjie, et al.
Published: (2024)
Learning Visual Conditioning Tokens to Correct Domain Shift for Fully Test-time Adaptation
by: Tang, Yushun, et al.
Published: (2024)
by: Tang, Yushun, et al.
Published: (2024)
Conceptualizing Embeddings: Sparse Disentanglement for Vision-Language Models
by: Kubaty, Piotr, et al.
Published: (2026)
by: Kubaty, Piotr, et al.
Published: (2026)
ToVE: Efficient Vision-Language Learning via Knowledge Transfer from Vision Experts
by: Wu, Yuanchen, et al.
Published: (2025)
by: Wu, Yuanchen, et al.
Published: (2025)
Domain-Conditioned Transformer for Fully Test-time Adaptation
by: Tang, Yushun, et al.
Published: (2024)
by: Tang, Yushun, et al.
Published: (2024)
Progressive Conditioned Scale-Shift Recalibration of Self-Attention for Online Test-time Adaptation
by: Tang, Yushun, et al.
Published: (2025)
by: Tang, Yushun, et al.
Published: (2025)
Boosting Continual Learning of Vision-Language Models via Mixture-of-Experts Adapters
by: Yu, Jiazuo, et al.
Published: (2024)
by: Yu, Jiazuo, et al.
Published: (2024)
DexVLG: Dexterous Vision-Language-Grasp Model at Scale
by: He, Jiawei, et al.
Published: (2025)
by: He, Jiawei, et al.
Published: (2025)
Domain Generalization via Discrete Codebook Learning
by: Long, Shaocong, et al.
Published: (2025)
by: Long, Shaocong, et al.
Published: (2025)
Unified Reinforcement and Imitation Learning for Vision-Language Models
by: Lee, Byung-Kwan, et al.
Published: (2025)
by: Lee, Byung-Kwan, et al.
Published: (2025)
Feature Projection Learning for Better Vision-Language Reasoning
by: Zhang, Yi, et al.
Published: (2026)
by: Zhang, Yi, et al.
Published: (2026)
Co-Training Vision Language Models for Remote Sensing Multi-task Learning
by: Li, Qingyun, et al.
Published: (2025)
by: Li, Qingyun, et al.
Published: (2025)
Dual Codebook VQ: Enhanced Image Reconstruction with Reduced Codebook Size
by: Malidarreh, Parisa Boodaghi, et al.
Published: (2025)
by: Malidarreh, Parisa Boodaghi, et al.
Published: (2025)
Mixture of Prompt Learning for Vision Language Models
by: Du, Yu, et al.
Published: (2024)
by: Du, Yu, et al.
Published: (2024)
Cascade Prompt Learning for Vision-Language Model Adaptation
by: Wu, Ge, et al.
Published: (2024)
by: Wu, Ge, et al.
Published: (2024)
CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
by: Du, Fan, et al.
Published: (2026)
by: Du, Fan, et al.
Published: (2026)
Structural Graph Probing of Vision-Language Models
by: He, Haoyu, et al.
Published: (2026)
by: He, Haoyu, et al.
Published: (2026)
Cropper: Vision-Language Model for Image Cropping through In-Context Learning
by: Lee, Seung Hyun, et al.
Published: (2024)
by: Lee, Seung Hyun, et al.
Published: (2024)
Jailbreak Large Vision-Language Models Through Multi-Modal Linkage
by: Wang, Yu, et al.
Published: (2024)
by: Wang, Yu, et al.
Published: (2024)
LMOD: A Large Multimodal Ophthalmology Dataset and Benchmark for Large Vision-Language Models
by: Qin, Zhenyue, et al.
Published: (2024)
by: Qin, Zhenyue, et al.
Published: (2024)
Dynamic Execution Commitment of Vision-Language-Action Models
by: Chen, Feng, et al.
Published: (2026)
by: Chen, Feng, et al.
Published: (2026)
UniCode: Learning a Unified Codebook for Multimodal Large Language Models
by: Zheng, Sipeng, et al.
Published: (2024)
by: Zheng, Sipeng, et al.
Published: (2024)
GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
by: Pan, Yu, et al.
Published: (2026)
by: Pan, Yu, et al.
Published: (2026)
PointGAC: Geometric-Aware Codebook for Masked Point Cloud Modeling
by: Li, Abiao, et al.
Published: (2025)
by: Li, Abiao, et al.
Published: (2025)
Cross-Modal Few-Shot Learning with Second-Order Neural Ordinary Differential Equations
by: Zhang, Yi, et al.
Published: (2024)
by: Zhang, Yi, et al.
Published: (2024)
ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
by: Liu, Hongbo, et al.
Published: (2025)
by: Liu, Hongbo, et al.
Published: (2025)
Hierarchical Cross-modal Prompt Learning for Vision-Language Models
by: Zheng, Hao, et al.
Published: (2025)
by: Zheng, Hao, et al.
Published: (2025)
Detecting and Evaluating Medical Hallucinations in Large Vision Language Models
by: Chen, Jiawei, et al.
Published: (2024)
by: Chen, Jiawei, et al.
Published: (2024)
Modular Prompt Learning Improves Vision-Language Models
by: Huang, Zhenhan, et al.
Published: (2025)
by: Huang, Zhenhan, et al.
Published: (2025)
Similar Items
-
Concept-Guided Prompt Learning for Generalization in Vision-Language Models
by: Zhang, Yi, et al.
Published: (2024) -
NODE-Adapter: Neural Ordinary Differential Equations for Better Vision-Language Reasoning
by: Zhang, Yi, et al.
Published: (2024) -
Training-Free Test-Time Adaptation with Brownian Distance Covariance in Vision-Language Models
by: Zhang, Yi, et al.
Published: (2026) -
LG-VQ: Language-Guided Codebook Learning
by: Liang, Guotao, et al.
Published: (2024) -
Conditional Latent Coding with Learnable Synthesized Reference for Deep Image Compression
by: Wu, Siqi, et al.
Published: (2025)