One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bianchi, Lorenzo, Pacini, Giacomo, Carrara, Fabio, Messina, Nicola, Amato, Giuseppe, Falchi, Fabrizio |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CountingDINO: A Training-free Pipeline for Class-Agnostic Counting using Unsupervised Backbones
par: Pacini, Giacomo, et autres
Publié: (2025)
par: Pacini, Giacomo, et autres
Publié: (2025)
Is CLIP the main roadblock for fine-grained open-world perception?
par: Bianchi, Lorenzo, et autres
Publié: (2024)
par: Bianchi, Lorenzo, et autres
Publié: (2024)
Does it Really Count? Assessing Semantic Grounding in Text-Guided Class-Agnostic Counting
par: Pacini, Giacomo, et autres
Publié: (2026)
par: Pacini, Giacomo, et autres
Publié: (2026)
The devil is in the fine-grained details: Evaluating open-vocabulary object detectors for fine-grained understanding
par: Bianchi, Lorenzo, et autres
Publié: (2023)
par: Bianchi, Lorenzo, et autres
Publié: (2023)
OmniCaptioner: One Captioner to Rule Them All
par: Lu, Yiting, et autres
Publié: (2025)
par: Lu, Yiting, et autres
Publié: (2025)
Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary Segmentation
par: Barsellotti, Luca, et autres
Publié: (2024)
par: Barsellotti, Luca, et autres
Publié: (2024)
Mind the Prompt: A Novel Benchmark for Prompt-based Class-Agnostic Counting
par: Ciampi, Luca, et autres
Publié: (2024)
par: Ciampi, Luca, et autres
Publié: (2024)
Learning Egocentric In-Hand Object Segmentation through Weak Supervision from Human Narrations
par: Messina, Nicola, et autres
Publié: (2025)
par: Messina, Nicola, et autres
Publié: (2025)
Maybe you are looking for CroQS: Cross-modal Query Suggestion for Text-to-Image Retrieval
par: Pacini, Giacomo, et autres
Publié: (2024)
par: Pacini, Giacomo, et autres
Publié: (2024)
Semi-Supervised Biomedical Image Segmentation via Diffusion Models and Teacher-Student Co-Training
par: Ciampi, Luca, et autres
Publié: (2025)
par: Ciampi, Luca, et autres
Publié: (2025)
Biologically-inspired Semi-supervised Semantic Segmentation for Biomedical Imaging
par: Ciampi, Luca, et autres
Publié: (2024)
par: Ciampi, Luca, et autres
Publié: (2024)
CA3D: Convolutional-Attentional 3D Nets for Efficient Video Activity Recognition on the Edge
par: Lagani, Gabriele, et autres
Publié: (2025)
par: Lagani, Gabriele, et autres
Publié: (2025)
Synthetic Captions for Open-Vocabulary Zero-Shot Segmentation
par: Lebailly, Tim, et autres
Publié: (2025)
par: Lebailly, Tim, et autres
Publié: (2025)
Joint-Dataset Learning and Cross-Consistent Regularization for Text-to-Motion Retrieval
par: Messina, Nicola, et autres
Publié: (2024)
par: Messina, Nicola, et autres
Publié: (2024)
Negative Entity Suppression for Zero-Shot Captioning with Synthetic Images
par: Lu, Zimao, et autres
Publié: (2025)
par: Lu, Zimao, et autres
Publié: (2025)
Image-Caption Encoding for Improving Zero-Shot Generalization
par: Yu, Eric Yang, et autres
Publié: (2024)
par: Yu, Eric Yang, et autres
Publié: (2024)
RETTA: Retrieval-Enhanced Test-Time Adaptation for Zero-Shot Video Captioning
par: Ma, Yunchuan, et autres
Publié: (2024)
par: Ma, Yunchuan, et autres
Publié: (2024)
CapS-Adapter: Caption-based MultiModal Adapter in Zero-Shot Classification
par: Wang, Qijie, et autres
Publié: (2024)
par: Wang, Qijie, et autres
Publié: (2024)
Shot2Tactic-Caption: Multi-Scale Captioning of Badminton Videos for Tactical Understanding
par: Ding, Ning, et autres
Publié: (2025)
par: Ding, Ning, et autres
Publié: (2025)
Unifying Vision-Language Latents for Zero-label Image Caption Enhancement
par: Byun, Sanghyun, et autres
Publié: (2025)
par: Byun, Sanghyun, et autres
Publié: (2025)
The Devil is in the Distributions: Explicit Modeling of Scene Content is Key in Zero-Shot Video Captioning
par: Tian, Mingkai, et autres
Publié: (2025)
par: Tian, Mingkai, et autres
Publié: (2025)
TPCap: Unlocking Zero-Shot Image Captioning with Trigger-Augmented and Multi-Modal Purification Modules
par: Zhang, Ruoyu, et autres
Publié: (2025)
par: Zhang, Ruoyu, et autres
Publié: (2025)
Adversarial Magnification to Deceive Deepfake Detection through Super Resolution
par: Coccomini, Davide Alessandro, et autres
Publié: (2024)
par: Coccomini, Davide Alessandro, et autres
Publié: (2024)
One Framework to Rule Them All: Unifying Multimodal Tasks with LLM Neural-Tuning
par: Sun, Hao, et autres
Publié: (2024)
par: Sun, Hao, et autres
Publié: (2024)
FungalZSL: Zero-Shot Fungal Classification with Image Captioning Using a Synthetic Data Approach
par: Rani, Anju, et autres
Publié: (2025)
par: Rani, Anju, et autres
Publié: (2025)
Deepfake Detection without Deepfakes: Generalization via Synthetic Frequency Patterns Injection
par: Coccomini, Davide Alessandro, et autres
Publié: (2024)
par: Coccomini, Davide Alessandro, et autres
Publié: (2024)
Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning
par: Luo, Jianjie, et autres
Publié: (2024)
par: Luo, Jianjie, et autres
Publié: (2024)
CaptionQA: Is Your Caption as Useful as the Image Itself?
par: Yang, Shijia, et autres
Publié: (2025)
par: Yang, Shijia, et autres
Publié: (2025)
SynC: Synthetic Image Caption Dataset Refinement with One-to-many Mapping for Zero-shot Image Captioning
par: Kim, Si-Woo, et autres
Publié: (2025)
par: Kim, Si-Woo, et autres
Publié: (2025)
Exploring Strengths and Weaknesses of Super-Resolution Attack in Deepfake Detection
par: Coccomini, Davide Alessandro, et autres
Publié: (2024)
par: Coccomini, Davide Alessandro, et autres
Publié: (2024)
CaptionSmiths: Flexibly Controlling Language Pattern in Image Captioning
par: Saito, Kuniaki, et autres
Publié: (2025)
par: Saito, Kuniaki, et autres
Publié: (2025)
CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects
par: Fiastre, Gabriel, et autres
Publié: (2025)
par: Fiastre, Gabriel, et autres
Publié: (2025)
One Dinomaly2 Detect Them All: A Unified Framework for Full-Spectrum Unsupervised Anomaly Detection
par: Guo, Jia, et autres
Publié: (2025)
par: Guo, Jia, et autres
Publié: (2025)
SGCap: Decoding Semantic Group for Zero-shot Video Captioning
par: Pan, Zeyu, et autres
Publié: (2025)
par: Pan, Zeyu, et autres
Publié: (2025)
MeaCap: Memory-Augmented Zero-shot Image Captioning
par: Zeng, Zequn, et autres
Publié: (2024)
par: Zeng, Zequn, et autres
Publié: (2024)
LoomNet: Enhancing Multi-View Image Generation via Latent Space Weaving
par: Federico, Giulio, et autres
Publié: (2025)
par: Federico, Giulio, et autres
Publié: (2025)
SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning
par: Zhang, Lin, et autres
Publié: (2025)
par: Zhang, Lin, et autres
Publié: (2025)
MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites
par: Lei, Zhenxin, et autres
Publié: (2025)
par: Lei, Zhenxin, et autres
Publié: (2025)
SoccerNet-Caption: Dense Video Captioning for Soccer Broadcasts Commentaries
par: Mkhallati, Hassan, et autres
Publié: (2023)
par: Mkhallati, Hassan, et autres
Publié: (2023)
One RL to See Them All: Visual Triple Unified Reinforcement Learning
par: Ma, Yan, et autres
Publié: (2025)
par: Ma, Yan, et autres
Publié: (2025)
Documents similaires
-
CountingDINO: A Training-free Pipeline for Class-Agnostic Counting using Unsupervised Backbones
par: Pacini, Giacomo, et autres
Publié: (2025) -
Is CLIP the main roadblock for fine-grained open-world perception?
par: Bianchi, Lorenzo, et autres
Publié: (2024) -
Does it Really Count? Assessing Semantic Grounding in Text-Guided Class-Agnostic Counting
par: Pacini, Giacomo, et autres
Publié: (2026) -
The devil is in the fine-grained details: Evaluating open-vocabulary object detectors for fine-grained understanding
par: Bianchi, Lorenzo, et autres
Publié: (2023) -
OmniCaptioner: One Captioner to Rule Them All
par: Lu, Yiting, et autres
Publié: (2025)