Hyperdimensional Cross-Modal Alignment of Frozen Language and Image Models for Efficient Image Captioning
Fuente:
arXiv
Salvato in:
| Autori principali: | Dalvi, Abhishek, Honavar, Vasant |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hyperdimensional Representation Learning for Node Classification and Link Prediction
di: Dalvi, Abhishek, et al.
Pubblicazione: (2024)
di: Dalvi, Abhishek, et al.
Pubblicazione: (2024)
Image Captions are Natural Prompts for Text-to-Image Models
di: Lei, Shiye, et al.
Pubblicazione: (2023)
di: Lei, Shiye, et al.
Pubblicazione: (2023)
Generalizable Geometric Image Caption Synthesis
di: Xin, Yue, et al.
Pubblicazione: (2025)
di: Xin, Yue, et al.
Pubblicazione: (2025)
C-HDNet: Hyperdimensional Computing for Causal Effect Estimation from Observational Data Under Network Interference
di: Dalvi, Abhishek, et al.
Pubblicazione: (2025)
di: Dalvi, Abhishek, et al.
Pubblicazione: (2025)
Post-pre-training for Modality Alignment in Vision-Language Foundation Models
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
di: Lai, Zhengfeng, et al.
Pubblicazione: (2024)
di: Lai, Zhengfeng, et al.
Pubblicazione: (2024)
Semi-Supervised Image Captioning Considering Wasserstein Graph Matching
di: Yang, Yang
Pubblicazione: (2024)
di: Yang, Yang
Pubblicazione: (2024)
SynC: Synthetic Image Caption Dataset Refinement with One-to-many Mapping for Zero-shot Image Captioning
di: Kim, Si-Woo, et al.
Pubblicazione: (2025)
di: Kim, Si-Woo, et al.
Pubblicazione: (2025)
Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)
di: Merchant, Nicholas, et al.
Pubblicazione: (2025)
di: Merchant, Nicholas, et al.
Pubblicazione: (2025)
Alignment-Guided Score Matching for Text-to-Image Alignment in Diffusion Models
di: Lee, Jaa-Yeon, et al.
Pubblicazione: (2026)
di: Lee, Jaa-Yeon, et al.
Pubblicazione: (2026)
How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions
di: Brack, Manuel, et al.
Pubblicazione: (2025)
di: Brack, Manuel, et al.
Pubblicazione: (2025)
RubiCap: Rubric-Guided Reinforcement Learning for Dense Image Captioning
di: Huang, Tzu-Heng, et al.
Pubblicazione: (2026)
di: Huang, Tzu-Heng, et al.
Pubblicazione: (2026)
Aligning Forest and Trees in Images & Long Captions for Visually Grounded Understanding
di: Woo, Byeongju, et al.
Pubblicazione: (2026)
di: Woo, Byeongju, et al.
Pubblicazione: (2026)
Learning Hyperspectral Images with Curated Text Prompts for Efficient Multimodal Alignment
di: Chatterjee, Abhiroop, et al.
Pubblicazione: (2025)
di: Chatterjee, Abhiroop, et al.
Pubblicazione: (2025)
U-Net in Medical Image Segmentation: A Review of Its Applications Across Modalities
di: Neha, Fnu, et al.
Pubblicazione: (2024)
di: Neha, Fnu, et al.
Pubblicazione: (2024)
TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks
di: Hu, Yuanze, et al.
Pubblicazione: (2025)
di: Hu, Yuanze, et al.
Pubblicazione: (2025)
CLEFT: Language-Image Contrastive Learning with Efficient Large Language Model and Prompt Fine-Tuning
di: Du, Yuexi, et al.
Pubblicazione: (2024)
di: Du, Yuexi, et al.
Pubblicazione: (2024)
When Better Eyes Lead to Blindness: A Diagnostic Study of the Information Bottleneck in CNN-LSTM Image Captioning Models
di: Gupta, Hitesh Kumar
Pubblicazione: (2025)
di: Gupta, Hitesh Kumar
Pubblicazione: (2025)
GMAIL: Generative Modality Alignment for generated Image Learning
di: Mo, Shentong, et al.
Pubblicazione: (2026)
di: Mo, Shentong, et al.
Pubblicazione: (2026)
An Examination of the Robustness of Reference-Free Image Captioning Evaluation Metrics
di: Ahmadi, Saba, et al.
Pubblicazione: (2023)
di: Ahmadi, Saba, et al.
Pubblicazione: (2023)
Multi-View and Multi-Scale Alignment for Contrastive Language-Image Pre-training in Mammography
di: Du, Yuexi, et al.
Pubblicazione: (2024)
di: Du, Yuexi, et al.
Pubblicazione: (2024)
CompCap: Improving Multimodal Large Language Models with Composite Captions
di: Chen, Xiaohui, et al.
Pubblicazione: (2024)
di: Chen, Xiaohui, et al.
Pubblicazione: (2024)
Frozen Transformers in Language Models Are Effective Visual Encoder Layers
di: Pang, Ziqi, et al.
Pubblicazione: (2023)
di: Pang, Ziqi, et al.
Pubblicazione: (2023)
MTA: Multimodal Task Alignment for BEV Perception and Captioning
di: Ma, Yunsheng, et al.
Pubblicazione: (2024)
di: Ma, Yunsheng, et al.
Pubblicazione: (2024)
Mitigate the Gap: Investigating Approaches for Improving Cross-Modal Alignment in CLIP
di: Eslami, Sedigheh, et al.
Pubblicazione: (2024)
di: Eslami, Sedigheh, et al.
Pubblicazione: (2024)
Zero-Residual Concept Erasure via Progressive Alignment in Text-to-Image Model
di: Chen, Hongxu, et al.
Pubblicazione: (2025)
di: Chen, Hongxu, et al.
Pubblicazione: (2025)
CIC-BART-SSA: Controllable Image Captioning with Structured Semantic Augmentation
di: Basioti, Kalliopi, et al.
Pubblicazione: (2024)
di: Basioti, Kalliopi, et al.
Pubblicazione: (2024)
Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models
di: Lian, Chenyu, et al.
Pubblicazione: (2025)
di: Lian, Chenyu, et al.
Pubblicazione: (2025)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
Improving GFlowNets for Text-to-Image Diffusion Alignment
di: Zhang, Dinghuai, et al.
Pubblicazione: (2024)
di: Zhang, Dinghuai, et al.
Pubblicazione: (2024)
E$^{2}$GAN: Efficient Training of Efficient GANs for Image-to-Image Translation
di: Gong, Yifan, et al.
Pubblicazione: (2024)
di: Gong, Yifan, et al.
Pubblicazione: (2024)
LLM as a Neural Architect: Controlled Generation of Image Captioning Models Under Strict API Contracts
di: Jesani, Krunal, et al.
Pubblicazione: (2025)
di: Jesani, Krunal, et al.
Pubblicazione: (2025)
Modeling Caption Diversity in Contrastive Vision-Language Pretraining
di: Lavoie, Samuel, et al.
Pubblicazione: (2024)
di: Lavoie, Samuel, et al.
Pubblicazione: (2024)
ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning
di: Kim, Taewhan, et al.
Pubblicazione: (2024)
di: Kim, Taewhan, et al.
Pubblicazione: (2024)
AlignGuard: Scalable Safety Alignment for Text-to-Image Generation
di: Liu, Runtao, et al.
Pubblicazione: (2024)
di: Liu, Runtao, et al.
Pubblicazione: (2024)
AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment
di: Kao, Kuei-Chun, et al.
Pubblicazione: (2026)
di: Kao, Kuei-Chun, et al.
Pubblicazione: (2026)
Whose View of Safety? A Deep DIVE Dataset for Pluralistic Alignment of Text-to-Image Models
di: Rastogi, Charvi, et al.
Pubblicazione: (2025)
di: Rastogi, Charvi, et al.
Pubblicazione: (2025)
Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation
di: Kim, Taehoon, et al.
Pubblicazione: (2025)
di: Kim, Taehoon, et al.
Pubblicazione: (2025)
Frozen Forecasting: A Unified Evaluation
di: Walker, Jacob C, et al.
Pubblicazione: (2025)
di: Walker, Jacob C, et al.
Pubblicazione: (2025)
U-Sketch: An Efficient Approach for Sketch to Image Diffusion Models
di: Mitsouras, Ilias, et al.
Pubblicazione: (2024)
di: Mitsouras, Ilias, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Hyperdimensional Representation Learning for Node Classification and Link Prediction
di: Dalvi, Abhishek, et al.
Pubblicazione: (2024) -
Image Captions are Natural Prompts for Text-to-Image Models
di: Lei, Shiye, et al.
Pubblicazione: (2023) -
Generalizable Geometric Image Caption Synthesis
di: Xin, Yue, et al.
Pubblicazione: (2025) -
C-HDNet: Hyperdimensional Computing for Causal Effect Estimation from Observational Data Under Network Interference
di: Dalvi, Abhishek, et al.
Pubblicazione: (2025) -
Post-pre-training for Modality Alignment in Vision-Language Foundation Models
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)