Emergent Natural Language with Communication Games for Improving Image Captioning Capabilities without Additional Data
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dutta, Parag, Dukkipati, Ambedkar |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Semi-supervised Deep Transfer for Regression without Domain Alignment
par: Biswas, Mainak, et autres
Publié: (2025)
par: Biswas, Mainak, et autres
Publié: (2025)
Saddle-Free Guidance: Improved On-Manifold Sampling without Labels or Additional Training
par: Yeats, Eric, et autres
Publié: (2025)
par: Yeats, Eric, et autres
Publié: (2025)
Image Captions are Natural Prompts for Text-to-Image Models
par: Lei, Shiye, et autres
Publié: (2023)
par: Lei, Shiye, et autres
Publié: (2023)
Image-Caption Encoding for Improving Zero-Shot Generalization
par: Yu, Eric Yang, et autres
Publié: (2024)
par: Yu, Eric Yang, et autres
Publié: (2024)
Pixels to Prose: Understanding the art of Image Captioning
par: Singh, Hrishikesh, et autres
Publié: (2024)
par: Singh, Hrishikesh, et autres
Publié: (2024)
Pretrained Image-Text Models are Secretly Video Captioners
par: Zhang, Chunhui, et autres
Publié: (2025)
par: Zhang, Chunhui, et autres
Publié: (2025)
Differentially Private Representation Learning via Image Captioning
par: Sander, Tom, et autres
Publié: (2024)
par: Sander, Tom, et autres
Publié: (2024)
Modeling Image-Caption Rating from Comparative Judgments
par: Minni, Kezia, et autres
Publié: (2026)
par: Minni, Kezia, et autres
Publié: (2026)
Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)
par: Merchant, Nicholas, et autres
Publié: (2025)
par: Merchant, Nicholas, et autres
Publié: (2025)
CompCap: Improving Multimodal Large Language Models with Composite Captions
par: Chen, Xiaohui, et autres
Publié: (2024)
par: Chen, Xiaohui, et autres
Publié: (2024)
ICC: Quantifying Image Caption Concreteness for Multimodal Dataset Curation
par: Yanuka, Moran, et autres
Publié: (2024)
par: Yanuka, Moran, et autres
Publié: (2024)
Using Images from a Video Game to Improve the Detection of Truck Axles
par: Marcomini, Leandro Arab, et autres
Publié: (2025)
par: Marcomini, Leandro Arab, et autres
Publié: (2025)
Infusing Environmental Captions for Long-Form Video Language Grounding
par: Lee, Hyogun, et autres
Publié: (2024)
par: Lee, Hyogun, et autres
Publié: (2024)
Hyperdimensional Cross-Modal Alignment of Frozen Language and Image Models for Efficient Image Captioning
par: Dalvi, Abhishek, et autres
Publié: (2026)
par: Dalvi, Abhishek, et autres
Publié: (2026)
AIM: Additional Image Guided Generation of Transferable Adversarial Attacks
par: Li, Teng, et autres
Publié: (2025)
par: Li, Teng, et autres
Publié: (2025)
Vision4PPG: Emergent PPG Analysis Capability of Vision Foundation Models for Vital Signs like Blood Pressure
par: Kataria, Saurabh, et autres
Publié: (2025)
par: Kataria, Saurabh, et autres
Publié: (2025)
Linear Alignment of Vision-language Models for Image Captioning
par: Paischer, Fabian, et autres
Publié: (2023)
par: Paischer, Fabian, et autres
Publié: (2023)
Generalizable Geometric Image Caption Synthesis
par: Xin, Yue, et autres
Publié: (2025)
par: Xin, Yue, et autres
Publié: (2025)
PICS: Pipeline for Image Captioning and Search
par: Rosario, Grant, et autres
Publié: (2024)
par: Rosario, Grant, et autres
Publié: (2024)
It's a (Blind) Match! Towards Vision-Language Correspondence without Parallel Data
par: Schnaus, Dominik, et autres
Publié: (2025)
par: Schnaus, Dominik, et autres
Publié: (2025)
Improving Image Captioning Descriptiveness by Ranking and LLM-based Fusion
par: Celona, Luigi, et autres
Publié: (2023)
par: Celona, Luigi, et autres
Publié: (2023)
Image Captioning as an Assistive Technology: Lessons Learned from VizWiz 2020 Challenge
par: Dognin, Pierre, et autres
Publié: (2020)
par: Dognin, Pierre, et autres
Publié: (2020)
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
par: Lai, Zhengfeng, et autres
Publié: (2024)
par: Lai, Zhengfeng, et autres
Publié: (2024)
STAND: Semantic Anchoring Constraint with Dual-Granularity Disambiguation for Remote Sensing Image Change Captioning
par: Gong, Yanpei, et autres
Publié: (2026)
par: Gong, Yanpei, et autres
Publié: (2026)
Concept-Aware Batch Sampling Improves Language-Image Pretraining
par: Ghosh, Adhiraj, et autres
Publié: (2025)
par: Ghosh, Adhiraj, et autres
Publié: (2025)
Learning an Image Editing Model without Image Editing Pairs
par: Kumari, Nupur, et autres
Publié: (2025)
par: Kumari, Nupur, et autres
Publié: (2025)
Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models
par: Agarwal, Sakshi, et autres
Publié: (2026)
par: Agarwal, Sakshi, et autres
Publié: (2026)
From Pixels to Prose: A Large Dataset of Dense Image Captions
par: Singla, Vasu, et autres
Publié: (2024)
par: Singla, Vasu, et autres
Publié: (2024)
OCT Data is All You Need: How Vision Transformers with and without Pre-training Benefit Imaging
par: Han, Zihao, et autres
Publié: (2025)
par: Han, Zihao, et autres
Publié: (2025)
Improved Generation of Synthetic Imaging Data Using Feature-Aligned Diffusion
par: Nair, Lakshmi
Publié: (2024)
par: Nair, Lakshmi
Publié: (2024)
No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models
par: Pham, Hai X., et autres
Publié: (2026)
par: Pham, Hai X., et autres
Publié: (2026)
Good Representation, Better Explanation: Role of Convolutional Neural Networks in Transformer-Based Remote Sensing Image Captioning
par: Das, Swadhin, et autres
Publié: (2025)
par: Das, Swadhin, et autres
Publié: (2025)
Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning
par: Luo, Jianjie, et autres
Publié: (2024)
par: Luo, Jianjie, et autres
Publié: (2024)
Large VLM-based Stylized Sports Captioning
par: Dhar, Sauptik, et autres
Publié: (2025)
par: Dhar, Sauptik, et autres
Publié: (2025)
Bridge the Modality and Capability Gaps in Vision-Language Model Selection
par: Yi, Chao, et autres
Publié: (2024)
par: Yi, Chao, et autres
Publié: (2024)
SynC: Synthetic Image Caption Dataset Refinement with One-to-many Mapping for Zero-shot Image Captioning
par: Kim, Si-Woo, et autres
Publié: (2025)
par: Kim, Si-Woo, et autres
Publié: (2025)
Learning without Forgetting for Vision-Language Models
par: Zhou, Da-Wei, et autres
Publié: (2023)
par: Zhou, Da-Wei, et autres
Publié: (2023)
VeCLIP: Improving CLIP Training via Visual-enriched Captions
par: Lai, Zhengfeng, et autres
Publié: (2023)
par: Lai, Zhengfeng, et autres
Publié: (2023)
GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning
par: Raju, S M Taslim Uddin, et autres
Publié: (2025)
par: Raju, S M Taslim Uddin, et autres
Publié: (2025)
Learning to Rank Caption Chains for Video-Text Alignment
par: Blume, Ansel, et autres
Publié: (2026)
par: Blume, Ansel, et autres
Publié: (2026)
Documents similaires
-
Semi-supervised Deep Transfer for Regression without Domain Alignment
par: Biswas, Mainak, et autres
Publié: (2025) -
Saddle-Free Guidance: Improved On-Manifold Sampling without Labels or Additional Training
par: Yeats, Eric, et autres
Publié: (2025) -
Image Captions are Natural Prompts for Text-to-Image Models
par: Lei, Shiye, et autres
Publié: (2023) -
Image-Caption Encoding for Improving Zero-Shot Generalization
par: Yu, Eric Yang, et autres
Publié: (2024) -
Pixels to Prose: Understanding the art of Image Captioning
par: Singh, Hrishikesh, et autres
Publié: (2024)