Towards Generative Class Prompt Learning for Fine-grained Visual Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chattopadhyay, Soumitri, Biswas, Sanket, Vivoli, Emanuele, Lladós, Josep |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SketchGPT: Autoregressive Modeling for Sketch Generation and Recognition
par: Tiwari, Adarsh, et autres
Publié: (2024)
par: Tiwari, Adarsh, et autres
Publié: (2024)
GeoContrastNet: Contrastive Key-Value Edge Learning for Language-Agnostic Document Understanding
par: Biescas, Nil, et autres
Publié: (2024)
par: Biescas, Nil, et autres
Publié: (2024)
GraphKD: Exploring Knowledge Distillation Towards Document Object Detection with Structured Graph Creation
par: Banerjee, Ayan, et autres
Publié: (2024)
par: Banerjee, Ayan, et autres
Publié: (2024)
Diving into the Depths of Spotting Text in Multi-Domain Noisy Scenes
par: Das, Alloy, et autres
Publié: (2023)
par: Das, Alloy, et autres
Publié: (2023)
FastTextSpotter: A High-Efficiency Transformer for Multilingual Scene Text Spotting
par: Das, Alloy, et autres
Publié: (2024)
par: Das, Alloy, et autres
Publié: (2024)
NoTeS-Bank: Benchmarking Neural Transcription and Search for Scientific Notes Understanding
par: Pal, Aniket, et autres
Publié: (2025)
par: Pal, Aniket, et autres
Publié: (2025)
On The Robustness of Foundational 3D Medical Image Segmentation Models Against Imprecise Visual Prompts
par: Chattopadhyay, Soumitri, et autres
Publié: (2026)
par: Chattopadhyay, Soumitri, et autres
Publié: (2026)
Zero-shot Domain Generalization of Foundational Models for 3D Medical Image Segmentation: An Experimental Study
par: Chattopadhyay, Soumitri, et autres
Publié: (2025)
par: Chattopadhyay, Soumitri, et autres
Publié: (2025)
GlobalDoc: A Cross-Modal Vision-Language Framework for Real-World Document Image Retrieval and Classification
par: Bakkali, Souhail, et autres
Publié: (2023)
par: Bakkali, Souhail, et autres
Publié: (2023)
Taming CLIP for Fine-grained and Structured Visual Understanding of Museum Exhibits
par: Balauca, Ada-Astrid, et autres
Publié: (2024)
par: Balauca, Ada-Astrid, et autres
Publié: (2024)
CoMix: A Comprehensive Benchmark for Multi-Task Comic Understanding
par: Vivoli, Emanuele, et autres
Publié: (2024)
par: Vivoli, Emanuele, et autres
Publié: (2024)
DistilDoc: Knowledge Distillation for Visually-Rich Document Applications
par: Van Landeghem, Jordy, et autres
Publié: (2024)
par: Van Landeghem, Jordy, et autres
Publié: (2024)
FASTER: A Font-Agnostic Scene Text Editing and Rendering Framework
par: Das, Alloy, et autres
Publié: (2023)
par: Das, Alloy, et autres
Publié: (2023)
Generative Sign-description Prompts with Multi-positive Contrastive Learning for Sign Language Recognition
par: Liang, Siyu, et autres
Publié: (2025)
par: Liang, Siyu, et autres
Publié: (2025)
UniCoRN: Latent Diffusion-based Unified Controllable Image Restoration Network across Multiple Degradations
par: Mandal, Debabrata, et autres
Publié: (2025)
par: Mandal, Debabrata, et autres
Publié: (2025)
LayeredDoc: Domain Adaptive Document Restoration with a Layer Separation Approach
par: Pilligua, Maria, et autres
Publié: (2024)
par: Pilligua, Maria, et autres
Publié: (2024)
HoloMine: A Synthetic Dataset for Buried Landmines Recognition using Microwave Holographic Imaging
par: Vivoli, Emanuele, et autres
Publié: (2025)
par: Vivoli, Emanuele, et autres
Publié: (2025)
TaleDiffusion: Multi-Character Story Generation with Dialogue Rendering
par: Banerjee, Ayan, et autres
Publié: (2025)
par: Banerjee, Ayan, et autres
Publié: (2025)
Fine-grained Spatiotemporal Grounding on Egocentric Videos
par: Liang, Shuo, et autres
Publié: (2025)
par: Liang, Shuo, et autres
Publié: (2025)
CraftGraffiti: Exploring Human Identity with Custom Graffiti Art via Facial-Preserving Diffusion Models
par: Banerjee, Ayan, et autres
Publié: (2025)
par: Banerjee, Ayan, et autres
Publié: (2025)
Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language Models
par: Kim, Jeonghwan, et autres
Publié: (2024)
par: Kim, Jeonghwan, et autres
Publié: (2024)
Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion Recognition
par: Guo, Zirun, et autres
Publié: (2024)
par: Guo, Zirun, et autres
Publié: (2024)
RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback
par: Yu, Tianyu, et autres
Publié: (2023)
par: Yu, Tianyu, et autres
Publié: (2023)
ComiCap: A VLMs pipeline for dense captioning of Comic Panels
par: Vivoli, Emanuele, et autres
Publié: (2024)
par: Vivoli, Emanuele, et autres
Publié: (2024)
The OCR Quest for Generalization: Learning to recognize low-resource alphabets with model editing
par: Rodríguez, Adrià Molina, et autres
Publié: (2025)
par: Rodríguez, Adrià Molina, et autres
Publié: (2025)
DocSynthv2: A Practical Autoregressive Modeling for Document Generation
par: Biswas, Sanket, et autres
Publié: (2024)
par: Biswas, Sanket, et autres
Publié: (2024)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
par: Wang, Zhecan, et autres
Publié: (2023)
par: Wang, Zhecan, et autres
Publié: (2023)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
par: Jie, Shibo, et autres
Publié: (2024)
par: Jie, Shibo, et autres
Publié: (2024)
AttriStory: Fine-grained Attribute Realization for Visual Storytelling with Diffusion Models
par: Sreenivas, Manogna, et autres
Publié: (2026)
par: Sreenivas, Manogna, et autres
Publié: (2026)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
par: Liu, Zikang, et autres
Publié: (2025)
par: Liu, Zikang, et autres
Publié: (2025)
Exploring Typographic Visual Prompts Injection Threats in Cross-Modality Generation Models
par: Cheng, Hao, et autres
Publié: (2025)
par: Cheng, Hao, et autres
Publié: (2025)
TextInVision: Text and Prompt Complexity Driven Visual Text Generation Benchmark
par: Fallah, Forouzan, et autres
Publié: (2025)
par: Fallah, Forouzan, et autres
Publié: (2025)
CoSMo: A Multimodal Transformer for Page Stream Segmentation in Comic Books
par: Ortega, Marc Serra, et autres
Publié: (2025)
par: Ortega, Marc Serra, et autres
Publié: (2025)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
par: Song, Wei, et autres
Publié: (2025)
par: Song, Wei, et autres
Publié: (2025)
AnchorOPT: Towards Optimizing Dynamic Anchors for Adaptive Prompt Learning
par: Li, Zheng, et autres
Publié: (2025)
par: Li, Zheng, et autres
Publié: (2025)
Democratizing Fine-grained Visual Recognition with Large Language Models
par: Liu, Mingxuan, et autres
Publié: (2024)
par: Liu, Mingxuan, et autres
Publié: (2024)
You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction
par: Lawrence, Logan, et autres
Publié: (2025)
par: Lawrence, Logan, et autres
Publié: (2025)
Dynamically Scaled Temperature in Self-Supervised Contrastive Learning
par: Manna, Siladittya, et autres
Publié: (2023)
par: Manna, Siladittya, et autres
Publié: (2023)
Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning
par: Bai, Tianyi, et autres
Publié: (2025)
par: Bai, Tianyi, et autres
Publié: (2025)
Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization
par: Deng, Haolin, et autres
Publié: (2026)
par: Deng, Haolin, et autres
Publié: (2026)
Documents similaires
-
SketchGPT: Autoregressive Modeling for Sketch Generation and Recognition
par: Tiwari, Adarsh, et autres
Publié: (2024) -
GeoContrastNet: Contrastive Key-Value Edge Learning for Language-Agnostic Document Understanding
par: Biescas, Nil, et autres
Publié: (2024) -
GraphKD: Exploring Knowledge Distillation Towards Document Object Detection with Structured Graph Creation
par: Banerjee, Ayan, et autres
Publié: (2024) -
Diving into the Depths of Spotting Text in Multi-Domain Noisy Scenes
par: Das, Alloy, et autres
Publié: (2023) -
FastTextSpotter: A High-Efficiency Transformer for Multilingual Scene Text Spotting
par: Das, Alloy, et autres
Publié: (2024)