Parrot Captions Teach CLIP to Spot Text
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Yiqi, He, Conghui, Wang, Alex Jinpeng, Wang, Bin, Li, Weijia, Shou, Mike Zheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Sparkle: Realizing Lively Instruction-Guided Video Background Replacement via Decoupled Guidance
por: Zeng, Ziyun, et al.
Publicado: (2026)
por: Zeng, Ziyun, et al.
Publicado: (2026)
Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
por: Wang, Alex Jinpeng, et al.
Publicado: (2024)
por: Wang, Alex Jinpeng, et al.
Publicado: (2024)
Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents
por: Lin, Yiqi, et al.
Publicado: (2025)
por: Lin, Yiqi, et al.
Publicado: (2025)
Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance
por: Lin, Yiqi, et al.
Publicado: (2026)
por: Lin, Yiqi, et al.
Publicado: (2026)
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
por: Wang, Jiaqi, et al.
Publicado: (2025)
por: Wang, Jiaqi, et al.
Publicado: (2025)
GloTSFormer: Global Video Text Spotting Transformer
por: Wang, Han, et al.
Publicado: (2024)
por: Wang, Han, et al.
Publicado: (2024)
TextEditBench: Evaluating Reasoning-aware Text Editing Beyond Rendering
por: Gui, Rui, et al.
Publicado: (2025)
por: Gui, Rui, et al.
Publicado: (2025)
Captured by Captions: On Memorization and its Mitigation in CLIP Models
por: Wang, Wenhao, et al.
Publicado: (2025)
por: Wang, Wenhao, et al.
Publicado: (2025)
AdaptCLIP: Adapting CLIP for Universal Visual Anomaly Detection
por: Gao, Bin-Bin, et al.
Publicado: (2025)
por: Gao, Bin-Bin, et al.
Publicado: (2025)
Is Your Text-to-Image Model Robust to Caption Noise?
por: Yu, Weichen, et al.
Publicado: (2024)
por: Yu, Weichen, et al.
Publicado: (2024)
AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
por: Gu, Yuchao, et al.
Publicado: (2026)
por: Gu, Yuchao, et al.
Publicado: (2026)
RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards
por: Ye, Junyan, et al.
Publicado: (2025)
por: Ye, Junyan, et al.
Publicado: (2025)
No Captions, No Problem: Captionless 3D-CLIP Alignment with Hard Negatives via CLIP Knowledge and LLMs
por: Sbrolli, Cristian, et al.
Publicado: (2024)
por: Sbrolli, Cristian, et al.
Publicado: (2024)
VIGC: Visual Instruction Generation and Correction
por: Wang, Bin, et al.
Publicado: (2023)
por: Wang, Bin, et al.
Publicado: (2023)
VeCLIP: Improving CLIP Training via Visual-enriched Captions
por: Lai, Zhengfeng, et al.
Publicado: (2023)
por: Lai, Zhengfeng, et al.
Publicado: (2023)
InstructOCR: Instruction Boosting Scene Text Spotting
por: Duan, Chen, et al.
Publicado: (2024)
por: Duan, Chen, et al.
Publicado: (2024)
VC4VG: Optimizing Video Captions for Text-to-Video Generation
por: Du, Yang, et al.
Publicado: (2025)
por: Du, Yang, et al.
Publicado: (2025)
Updating CLIP to Prefer Descriptions Over Captions
por: Zur, Amir, et al.
Publicado: (2024)
por: Zur, Amir, et al.
Publicado: (2024)
Text-only Synthesis for Image Captioning
por: Zhou, Qing, et al.
Publicado: (2024)
por: Zhou, Qing, et al.
Publicado: (2024)
Genixer: Empowering Multimodal Large Language Models as a Powerful Data Generator
por: Zhao, Henry Hengyuan, et al.
Publicado: (2023)
por: Zhao, Henry Hengyuan, et al.
Publicado: (2023)
CLIP-based Synergistic Knowledge Transfer for Text-based Person Retrieval
por: Liu, Yating, et al.
Publicado: (2023)
por: Liu, Yating, et al.
Publicado: (2023)
Mining Fine-Grained Image-Text Alignment for Zero-Shot Captioning via Text-Only Training
por: Qiu, Longtian, et al.
Publicado: (2024)
por: Qiu, Longtian, et al.
Publicado: (2024)
VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
por: Liu, Ye, et al.
Publicado: (2025)
por: Liu, Ye, et al.
Publicado: (2025)
CLIP-MUSED: CLIP-Guided Multi-Subject Visual Neural Information Semantic Decoding
por: Zhou, Qiongyi, et al.
Publicado: (2024)
por: Zhou, Qiongyi, et al.
Publicado: (2024)
Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing
por: Zeng, Ziyun, et al.
Publicado: (2025)
por: Zeng, Ziyun, et al.
Publicado: (2025)
CILF-CIAE: CLIP-driven Image-Language Fusion for Correcting Inverse Age Estimation
por: Shou, Yuntao, et al.
Publicado: (2023)
por: Shou, Yuntao, et al.
Publicado: (2023)
Enhancing Multimodal Understanding with CLIP-Based Image-to-Text Transformation
por: Che, Chang, et al.
Publicado: (2024)
por: Che, Chang, et al.
Publicado: (2024)
ComCLIP: Training-Free Compositional Image and Text Matching
por: Jiang, Kenan, et al.
Publicado: (2022)
por: Jiang, Kenan, et al.
Publicado: (2022)
CountCLIP -- [Re] Teaching CLIP to Count to Ten
por: Mestha, Harshvardhan, et al.
Publicado: (2024)
por: Mestha, Harshvardhan, et al.
Publicado: (2024)
Text-Enhanced Panoptic Symbol Spotting in CAD Drawings
por: Liu, Xianlin, et al.
Publicado: (2025)
por: Liu, Xianlin, et al.
Publicado: (2025)
Towards Fine-Grained Human Motion Video Captioning
por: Song, Guorui, et al.
Publicado: (2025)
por: Song, Guorui, et al.
Publicado: (2025)
SCT: A Simple Baseline for Parameter-Efficient Fine-Tuning via Salient Channels
por: Zhao, Henry Hengyuan, et al.
Publicado: (2023)
por: Zhao, Henry Hengyuan, et al.
Publicado: (2023)
UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios
por: Zhou, Baichuan, et al.
Publicado: (2024)
por: Zhou, Baichuan, et al.
Publicado: (2024)
Beyond Pedestrians: Caption-Guided CLIP Framework for High-Difficulty Video-based Person Re-Identification
por: Hamano, Shogo, et al.
Publicado: (2026)
por: Hamano, Shogo, et al.
Publicado: (2026)
VideoGUI: A Benchmark for GUI Automation from Instructional Videos
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning
por: Dang, Jisheng, et al.
Publicado: (2025)
por: Dang, Jisheng, et al.
Publicado: (2025)
ShowUI-$π$: Flow-based Generative Models as GUI Dexterous Hands
por: Hu, Siyuan, et al.
Publicado: (2025)
por: Hu, Siyuan, et al.
Publicado: (2025)
One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
por: Bai, Zechen, et al.
Publicado: (2024)
por: Bai, Zechen, et al.
Publicado: (2024)
FG-CLIP: Fine-Grained Visual and Textual Alignment
por: Xie, Chunyu, et al.
Publicado: (2025)
por: Xie, Chunyu, et al.
Publicado: (2025)
Explaining Caption-Image Interactions in CLIP Models with Second-Order Attributions
por: Möller, Lucas, et al.
Publicado: (2024)
por: Möller, Lucas, et al.
Publicado: (2024)
Ejemplares similares
-
Sparkle: Realizing Lively Instruction-Guided Video Background Replacement via Decoupled Guidance
por: Zeng, Ziyun, et al.
Publicado: (2026) -
Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
por: Wang, Alex Jinpeng, et al.
Publicado: (2024) -
Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents
por: Lin, Yiqi, et al.
Publicado: (2025) -
Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance
por: Lin, Yiqi, et al.
Publicado: (2026) -
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
por: Wang, Jiaqi, et al.
Publicado: (2025)