Unifying Vision-Language Latents for Zero-label Image Caption Enhancement
Fuente:
arXiv
Saved in:
| Main Authors: | Byun, Sanghyun, Guack, Jung Ick, Odema, Mohanad, Lee, Baisub, Song, Jacob, Chung, Woo Seong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
3-Model Speculative Decoding
by: Byun, Sanghyun, et al.
Published: (2025)
by: Byun, Sanghyun, et al.
Published: (2025)
APCE: Adaptive Progressive Context Expansion for Long Context Processing
by: Lee, Baisub, et al.
Published: (2025)
by: Lee, Baisub, et al.
Published: (2025)
MultiDepth: Multi-Sample Priors for Refining Monocular Metric Depth Estimations in Indoor Scenes
by: Byun, Sanghyun, et al.
Published: (2024)
by: Byun, Sanghyun, et al.
Published: (2024)
SynC: Synthetic Image Caption Dataset Refinement with One-to-many Mapping for Zero-shot Image Captioning
by: Kim, Si-Woo, et al.
Published: (2025)
by: Kim, Si-Woo, et al.
Published: (2025)
SpiralThinker: Latent Reasoning through an Iterative Process with Text-Latent Interleaving
by: Piao, Shengmin, et al.
Published: (2025)
by: Piao, Shengmin, et al.
Published: (2025)
IFCap: Image-like Retrieval and Frequency-based Entity Filtering for Zero-shot Captioning
by: Lee, Soeun, et al.
Published: (2024)
by: Lee, Soeun, et al.
Published: (2024)
OneNet: A Channel-Wise 1D Convolutional U-Net
by: Byun, Sanghyun, et al.
Published: (2024)
by: Byun, Sanghyun, et al.
Published: (2024)
TROPE: TRaining-Free Object-Part Enhancement for Seamlessly Improving Fine-Grained Zero-Shot Image Captioning
by: Feinglass, Joshua, et al.
Published: (2024)
by: Feinglass, Joshua, et al.
Published: (2024)
BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset, and Vision-Language Models Derived from Scientific Literature
by: Lozano, Alejandro, et al.
Published: (2025)
by: Lozano, Alejandro, et al.
Published: (2025)
ICU: Conquering Language Barriers in Vision-and-Language Modeling by Dividing the Tasks into Image Captioning and Language Understanding
by: Wu, Guojun
Published: (2023)
by: Wu, Guojun
Published: (2023)
LBC: Language-Based-Classifier for Out-Of-Variable Generalization
by: Noh, Kangjun, et al.
Published: (2024)
by: Noh, Kangjun, et al.
Published: (2024)
Image-Caption Encoding for Improving Zero-Shot Generalization
by: Yu, Eric Yang, et al.
Published: (2024)
by: Yu, Eric Yang, et al.
Published: (2024)
From Image Captioning to Visual Storytelling
by: Passadakis, Admitos, et al.
Published: (2025)
by: Passadakis, Admitos, et al.
Published: (2025)
Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning
by: Luo, Jianjie, et al.
Published: (2024)
by: Luo, Jianjie, et al.
Published: (2024)
ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning
by: Kim, Taewhan, et al.
Published: (2024)
by: Kim, Taewhan, et al.
Published: (2024)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
by: Liu, Zheng, et al.
Published: (2024)
by: Liu, Zheng, et al.
Published: (2024)
Linear Alignment of Vision-language Models for Image Captioning
by: Paischer, Fabian, et al.
Published: (2023)
by: Paischer, Fabian, et al.
Published: (2023)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
by: Wang, Zhecan, et al.
Published: (2023)
by: Wang, Zhecan, et al.
Published: (2023)
ACoRN: Noise-Robust Abstractive Compression in Retrieval-Augmented Language Models
by: Kim, Singon, et al.
Published: (2025)
by: Kim, Singon, et al.
Published: (2025)
CPR: Mitigating Large Language Model Hallucinations with Curative Prompt Refinement
by: Shim, Jung-Woo, et al.
Published: (2025)
by: Shim, Jung-Woo, et al.
Published: (2025)
Multi-stage Prompt Refinement for Mitigating Hallucinations in Large Language Models
by: Shim, Jung-Woo, et al.
Published: (2025)
by: Shim, Jung-Woo, et al.
Published: (2025)
Image Captioning via Compact Bidirectional Architecture
by: Song, Zijie, et al.
Published: (2022)
by: Song, Zijie, et al.
Published: (2022)
Semantic and Expressive Variation in Image Captions Across Languages
by: Ye, Andre, et al.
Published: (2023)
by: Ye, Andre, et al.
Published: (2023)
A Unified Framework with Novel Metrics for Evaluating the Effectiveness of XAI Techniques in LLMs
by: Mersha, Melkamu Abay, et al.
Published: (2025)
by: Mersha, Melkamu Abay, et al.
Published: (2025)
See or Guess: Counterfactually Regularized Image Captioning
by: Cao, Qian, et al.
Published: (2024)
by: Cao, Qian, et al.
Published: (2024)
LitE-SQL: A Lightweight and Efficient Text-to-SQL Framework with Vector-based Schema Linking and Execution-Guided Self-Correction
by: Piao, Shengmin, et al.
Published: (2025)
by: Piao, Shengmin, et al.
Published: (2025)
ZSE-Cap: A Zero-Shot Ensemble for Image Retrieval and Prompt-Guided Captioning
by: Dinh, Duc-Tai, et al.
Published: (2025)
by: Dinh, Duc-Tai, et al.
Published: (2025)
Modeling Caption Diversity in Contrastive Vision-Language Pretraining
by: Lavoie, Samuel, et al.
Published: (2024)
by: Lavoie, Samuel, et al.
Published: (2024)
Confidence-guided Refinement Reasoning for Zero-shot Question Answering
by: Jang, Youwon, et al.
Published: (2025)
by: Jang, Youwon, et al.
Published: (2025)
Guidance-Based Prompt Data Augmentation in Specialized Domains for Named Entity Recognition
by: Kang, Hyeonseok, et al.
Published: (2024)
by: Kang, Hyeonseok, et al.
Published: (2024)
Thinking with Many Minds: Using Large Language Models for Multi-Perspective Problem-Solving
by: Park, Sanghyun, et al.
Published: (2025)
by: Park, Sanghyun, et al.
Published: (2025)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
by: Jiang, Houcheng, et al.
Published: (2026)
by: Jiang, Houcheng, et al.
Published: (2026)
UnifiedVisual: A Framework for Constructing Unified Vision-Language Datasets
by: Wang, Pengyu, et al.
Published: (2025)
by: Wang, Pengyu, et al.
Published: (2025)
KiC: Keyword-inspired Cascade for Cost-Efficient Text Generation with LLMs
by: Kim, Woo-Chan, et al.
Published: (2025)
by: Kim, Woo-Chan, et al.
Published: (2025)
XLQA: A Benchmark for Locale-Aware Multilingual Open-Domain Question Answering
by: Roh, Keon-Woo, et al.
Published: (2025)
by: Roh, Keon-Woo, et al.
Published: (2025)
ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue
by: Li, Zhangpu, et al.
Published: (2024)
by: Li, Zhangpu, et al.
Published: (2024)
Altogether: Image Captioning via Re-aligning Alt-text
by: Xu, Hu, et al.
Published: (2024)
by: Xu, Hu, et al.
Published: (2024)
How Language Directions Align with Token Geometry in Multilingual LLMs
by: Kim, JaeSeong, et al.
Published: (2025)
by: Kim, JaeSeong, et al.
Published: (2025)
Unified Triplet-Level Hallucination Evaluation for Large Vision-Language Models
by: Wu, Junjie, et al.
Published: (2024)
by: Wu, Junjie, et al.
Published: (2024)
MAGIC-Enhanced Keyword Prompting for Zero-Shot Audio Captioning with CLIP Models
by: Govindarajan, Vijay, et al.
Published: (2025)
by: Govindarajan, Vijay, et al.
Published: (2025)
Similar Items
-
3-Model Speculative Decoding
by: Byun, Sanghyun, et al.
Published: (2025) -
APCE: Adaptive Progressive Context Expansion for Long Context Processing
by: Lee, Baisub, et al.
Published: (2025) -
MultiDepth: Multi-Sample Priors for Refining Monocular Metric Depth Estimations in Indoor Scenes
by: Byun, Sanghyun, et al.
Published: (2024) -
SynC: Synthetic Image Caption Dataset Refinement with One-to-many Mapping for Zero-shot Image Captioning
by: Kim, Si-Woo, et al.
Published: (2025) -
SpiralThinker: Latent Reasoning through an Iterative Process with Text-Latent Interleaving
by: Piao, Shengmin, et al.
Published: (2025)