AC-Lite : A Lightweight Image Captioning Model for Low-Resource Assamese Language
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Choudhury, Pankaj, Aggarwal, Yogesh, Jadhav, Prabhanjan, Guha, Prithwijit, Nandi, Sukumar |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FDLite: A Single Stage Lightweight Face Detector Network
par: Aggarwal, Yogesh, et autres
Publié: (2024)
par: Aggarwal, Yogesh, et autres
Publié: (2024)
IDA-UIE: An Iterative Framework for Deep Network-based Degradation Aware Underwater Image Enhancement
par: Singh, Pranjali, et autres
Publié: (2024)
par: Singh, Pranjali, et autres
Publié: (2024)
AeroLite: Tag-Guided Lightweight Generation of Aerial Image Captions
par: Zi, Xing, et autres
Publié: (2025)
par: Zi, Xing, et autres
Publié: (2025)
LowCLIP: Adapting the CLIP Model Architecture for Low-Resource Languages in Multimodal Image Retrieval Task
par: Asgarov, Ali, et autres
Publié: (2024)
par: Asgarov, Ali, et autres
Publié: (2024)
Unifying Vision-Language Latents for Zero-label Image Caption Enhancement
par: Byun, Sanghyun, et autres
Publié: (2025)
par: Byun, Sanghyun, et autres
Publié: (2025)
Precision or Recall? An Analysis of Image Captions for Training Text-to-Image Generation Model
par: Cheng, Sheng, et autres
Publié: (2024)
par: Cheng, Sheng, et autres
Publié: (2024)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
par: Liu, Zheng, et autres
Publié: (2024)
par: Liu, Zheng, et autres
Publié: (2024)
From Image Captioning to Visual Storytelling
par: Passadakis, Admitos, et autres
Publié: (2025)
par: Passadakis, Admitos, et autres
Publié: (2025)
Distinctive Image Captioning: Leveraging Ground Truth Captions in CLIP Guided Reinforcement Learning
par: Chaffin, Antoine, et autres
Publié: (2024)
par: Chaffin, Antoine, et autres
Publié: (2024)
BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset, and Vision-Language Models Derived from Scientific Literature
par: Lozano, Alejandro, et autres
Publié: (2025)
par: Lozano, Alejandro, et autres
Publié: (2025)
Image Captioning via Compact Bidirectional Architecture
par: Song, Zijie, et autres
Publié: (2022)
par: Song, Zijie, et autres
Publié: (2022)
MUNIChus: Multilingual News Image Captioning Benchmark
par: Chen, Yuji, et autres
Publié: (2026)
par: Chen, Yuji, et autres
Publié: (2026)
Evaluating Vision Language Model Adaptations for Radiology Report Generation in Low-Resource Languages
par: Salmè, Marco, et autres
Publié: (2025)
par: Salmè, Marco, et autres
Publié: (2025)
Diffusion-RSCC: Diffusion Probabilistic Model for Change Captioning in Remote Sensing Images
par: Yu, Xiaofei, et autres
Publié: (2024)
par: Yu, Xiaofei, et autres
Publié: (2024)
Understanding Retrieval Robustness for Retrieval-Augmented Image Captioning
par: Li, Wenyan, et autres
Publié: (2024)
par: Li, Wenyan, et autres
Publié: (2024)
Temporal Image Caption Retrieval Competition -- Description and Results
par: Pokrywka, Jakub, et autres
Publié: (2024)
par: Pokrywka, Jakub, et autres
Publié: (2024)
The Devil is in the EOS: Sequence Training for Detailed Image Captioning
par: Mohamed, Abdelrahman, et autres
Publié: (2025)
par: Mohamed, Abdelrahman, et autres
Publié: (2025)
ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning
par: Kim, Taewhan, et autres
Publié: (2024)
par: Kim, Taewhan, et autres
Publié: (2024)
DreamLite: A Lightweight On-Device Unified Model for Image Generation and Editing
par: Feng, Kailai, et autres
Publié: (2026)
par: Feng, Kailai, et autres
Publié: (2026)
LLMVA-GEBC: Large Language Model with Video Adapter for Generic Event Boundary Captioning
par: Tang, Yolo Yunlong, et autres
Publié: (2023)
par: Tang, Yolo Yunlong, et autres
Publié: (2023)
TransLPRNet: Lite Vision-Language Network for Single/Dual-line Chinese License Plate Recognition
par: Xu, Guangzhu, et autres
Publié: (2025)
par: Xu, Guangzhu, et autres
Publié: (2025)
VIXEN: Visual Text Comparison Network for Image Difference Captioning
par: Black, Alexander, et autres
Publié: (2024)
par: Black, Alexander, et autres
Publié: (2024)
Transformer based Multitask Learning for Image Captioning and Object Detection
par: Basak, Debolena, et autres
Publié: (2024)
par: Basak, Debolena, et autres
Publié: (2024)
Altogether: Image Captioning via Re-aligning Alt-text
par: Xu, Hu, et autres
Publié: (2024)
par: Xu, Hu, et autres
Publié: (2024)
OmniCaptioner: One Captioner to Rule Them All
par: Lu, Yiting, et autres
Publié: (2025)
par: Lu, Yiting, et autres
Publié: (2025)
Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis
par: Bucciarelli, Davide, et autres
Publié: (2024)
par: Bucciarelli, Davide, et autres
Publié: (2024)
Linear Alignment of Vision-language Models for Image Captioning
par: Paischer, Fabian, et autres
Publié: (2023)
par: Paischer, Fabian, et autres
Publié: (2023)
See or Guess: Counterfactually Regularized Image Captioning
par: Cao, Qian, et autres
Publié: (2024)
par: Cao, Qian, et autres
Publié: (2024)
Improving Image Captioning by Mimicking Human Reformulation Feedback at Inference-time
par: Berger, Uri, et autres
Publié: (2025)
par: Berger, Uri, et autres
Publié: (2025)
CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era
par: Cheng, Kanzhi, et autres
Publié: (2025)
par: Cheng, Kanzhi, et autres
Publié: (2025)
Discovering Meaningful Units with Visually Grounded Semantics from Image Captions
par: Behjati, Melika, et autres
Publié: (2025)
par: Behjati, Melika, et autres
Publié: (2025)
#PraCegoVer: A Large Dataset for Image Captioning in Portuguese
par: Santos, Gabriel Oliveira dos, et autres
Publié: (2021)
par: Santos, Gabriel Oliveira dos, et autres
Publié: (2021)
SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluation
par: Chen, Xiaofu, et autres
Publié: (2025)
par: Chen, Xiaofu, et autres
Publié: (2025)
Towards Adaptable and Interactive Image Captioning with Data Augmentation and Episodic Memory
par: Anagnostopoulou, Aliki, et autres
Publié: (2023)
par: Anagnostopoulou, Aliki, et autres
Publié: (2023)
MolSight: Molecular Property Prediction with Images
par: Baranwal, Aaditya, et autres
Publié: (2026)
par: Baranwal, Aaditya, et autres
Publié: (2026)
READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling
par: Nguyen, Thong, et autres
Publié: (2023)
par: Nguyen, Thong, et autres
Publié: (2023)
Semantic and Expressive Variation in Image Captions Across Languages
par: Ye, Andre, et autres
Publié: (2023)
par: Ye, Andre, et autres
Publié: (2023)
Regional Attention-Enhanced Swin Transformer for Clinically Relevant Medical Image Captioning
par: Naz, Zubia, et autres
Publié: (2025)
par: Naz, Zubia, et autres
Publié: (2025)
EAMA : Entity-Aware Multimodal Alignment Based Approach for News Image Captioning
par: Zhang, Junzhe, et autres
Publié: (2024)
par: Zhang, Junzhe, et autres
Publié: (2024)
Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions
par: Shen, Yijun, et autres
Publié: (2025)
par: Shen, Yijun, et autres
Publié: (2025)
Documents similaires
-
FDLite: A Single Stage Lightweight Face Detector Network
par: Aggarwal, Yogesh, et autres
Publié: (2024) -
IDA-UIE: An Iterative Framework for Deep Network-based Degradation Aware Underwater Image Enhancement
par: Singh, Pranjali, et autres
Publié: (2024) -
AeroLite: Tag-Guided Lightweight Generation of Aerial Image Captions
par: Zi, Xing, et autres
Publié: (2025) -
LowCLIP: Adapting the CLIP Model Architecture for Low-Resource Languages in Multimodal Image Retrieval Task
par: Asgarov, Ali, et autres
Publié: (2024) -
Unifying Vision-Language Latents for Zero-label Image Caption Enhancement
par: Byun, Sanghyun, et autres
Publié: (2025)