MOFI: Learning Image Representations from Noisy Entity Annotated Images
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Wentao, Timofeev, Aleksei, Chen, Chen, Zhang, Bowen, Duan, Kun, Liu, Shuangning, Zheng, Yantao, Shlens, Jonathon, Du, Xianzhi, Gan, Zhe, Yang, Yinfei |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VeCLIP: Improving CLIP Training via Visual-enriched Captions
par: Lai, Zhengfeng, et autres
Publié: (2023)
par: Lai, Zhengfeng, et autres
Publié: (2023)
Compressing LLMs: The Truth is Rarely Pure and Never Simple
par: Jaiswal, Ajay, et autres
Publié: (2023)
par: Jaiswal, Ajay, et autres
Publié: (2023)
Guiding Instruction-based Image Editing via Multimodal Large Language Models
par: Fu, Tsu-Jui, et autres
Publié: (2023)
par: Fu, Tsu-Jui, et autres
Publié: (2023)
UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing
par: Fu, Tsu-Jui, et autres
Publié: (2025)
par: Fu, Tsu-Jui, et autres
Publié: (2025)
Entity Alignment with Noisy Annotations from Large Language Models
par: Chen, Shengyuan, et autres
Publié: (2024)
par: Chen, Shengyuan, et autres
Publié: (2024)
Contrastive Localized Language-Image Pre-Training
par: Chen, Hong-You, et autres
Publié: (2024)
par: Chen, Hong-You, et autres
Publié: (2024)
GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing
par: Qian, Yusu, et autres
Publié: (2025)
par: Qian, Yusu, et autres
Publié: (2025)
CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling
par: Wang, Xinze, et autres
Publié: (2025)
par: Wang, Xinze, et autres
Publié: (2025)
How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts
par: Qian, Yusu, et autres
Publié: (2024)
par: Qian, Yusu, et autres
Publié: (2024)
UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning
par: Tian, Rui, et autres
Publié: (2025)
par: Tian, Rui, et autres
Publié: (2025)
Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing
par: Qian, Yusu, et autres
Publié: (2025)
par: Qian, Yusu, et autres
Publié: (2025)
Collaborative Group: Composed Image Retrieval via Consensus Learning from Noisy Annotations
par: Zhang, Xu, et autres
Publié: (2023)
par: Zhang, Xu, et autres
Publié: (2023)
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
par: Lai, Zhengfeng, et autres
Publié: (2024)
par: Lai, Zhengfeng, et autres
Publié: (2024)
Dual Advancement of Representation Learning and Clustering for Sparse and Noisy Images
par: Li, Wenlin, et autres
Publié: (2024)
par: Li, Wenlin, et autres
Publié: (2024)
LensVLM: Selective Context Expansion for Compressed Visual Representation of Text
par: Xie, Roy, et autres
Publié: (2026)
par: Xie, Roy, et autres
Publié: (2026)
Ambient-Pix2PixGAN for Translating Medical Images from Noisy Data
par: Chen, Wentao, et autres
Publié: (2024)
par: Chen, Wentao, et autres
Publié: (2024)
Ambient Denoising Diffusion Generative Adversarial Networks for Establishing Stochastic Object Models from Noisy Image Data
par: Xu, Xichen, et autres
Publié: (2025)
par: Xu, Xichen, et autres
Publié: (2025)
EliGen: Entity-Level Controlled Image Generation with Regional Attention
par: Zhang, Hong, et autres
Publié: (2025)
par: Zhang, Hong, et autres
Publié: (2025)
MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning
par: Zhang, Haotian, et autres
Publié: (2024)
par: Zhang, Haotian, et autres
Publié: (2024)
Learning Visual Composition through Improved Semantic Guidance
par: Stone, Austin, et autres
Publié: (2024)
par: Stone, Austin, et autres
Publié: (2024)
Legend: Leveraging Representation Engineering to Annotate Safety Margin for Preference Datasets
par: Feng, Duanyu, et autres
Publié: (2024)
par: Feng, Duanyu, et autres
Publié: (2024)
Adaptive Label Correction for Robust Medical Image Segmentation with Noisy Labels
par: Qian, Chengxuan, et autres
Publié: (2025)
par: Qian, Chengxuan, et autres
Publié: (2025)
Entity Image and Mixed-Modal Image Retrieval Datasets
par: Blaga, Cristian-Ioan, et autres
Publié: (2025)
par: Blaga, Cristian-Ioan, et autres
Publié: (2025)
Reverse Region-to-Entity Annotation for Pixel-Level Visual Entity Linking
par: Xu, Zhengfei, et autres
Publié: (2024)
par: Xu, Zhengfei, et autres
Publié: (2024)
MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
par: Qian, Yusu, et autres
Publié: (2024)
par: Qian, Yusu, et autres
Publié: (2024)
CytoCrowd: A Multi-Annotator Benchmark Dataset for Cytology Image Analysis
par: Si, Yonghao, et autres
Publié: (2026)
par: Si, Yonghao, et autres
Publié: (2026)
Generative Annotation for ASR Named Entity Correction
par: Luo, Yuanchang, et autres
Publié: (2025)
par: Luo, Yuanchang, et autres
Publié: (2025)
Label Filling via Mixed Supervision for Medical Image Segmentation from Noisy Annotations
par: Li, Ming, et autres
Publié: (2024)
par: Li, Ming, et autres
Publié: (2024)
Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions
par: Shen, Yijun, et autres
Publié: (2025)
par: Shen, Yijun, et autres
Publié: (2025)
PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection
par: Qian, Yusu, et autres
Publié: (2025)
par: Qian, Yusu, et autres
Publié: (2025)
DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation
par: Chen, Chen, et autres
Publié: (2025)
par: Chen, Chen, et autres
Publié: (2025)
Extracting Biomedical Entities from Noisy Audio Transcripts
par: Ebadi, Nima, et autres
Publié: (2024)
par: Ebadi, Nima, et autres
Publié: (2024)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
par: Liu, Zheng, et autres
Publié: (2024)
par: Liu, Zheng, et autres
Publié: (2024)
Image-level Regression for Uncertainty-aware Retinal Image Segmentation
par: Dang, Trung, et autres
Publié: (2024)
par: Dang, Trung, et autres
Publié: (2024)
Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs
par: You, Keen, et autres
Publié: (2024)
par: You, Keen, et autres
Publié: (2024)
EntityCLIP: Entity-Centric Image-Text Matching via Multimodal Attentive Contrastive Learning
par: Wang, Yaxiong, et autres
Publié: (2024)
par: Wang, Yaxiong, et autres
Publié: (2024)
Powerful Lossy Compression for Noisy Images
par: Cai, Shilv, et autres
Publié: (2024)
par: Cai, Shilv, et autres
Publié: (2024)
Towards flexible perception with visual memory
par: Geirhos, Robert, et autres
Publié: (2024)
par: Geirhos, Robert, et autres
Publié: (2024)
Different Tastes of Entities: Investigating Human Label Variation in Named Entity Annotations
par: Peng, Siyao, et autres
Publié: (2024)
par: Peng, Siyao, et autres
Publié: (2024)
SFR-Net: Learning Scale-Frustum Representations for Ultra-Wide Area Remote Sensing Image Segmentation
par: Zhong, Chuyu, et autres
Publié: (2026)
par: Zhong, Chuyu, et autres
Publié: (2026)
Documents similaires
-
VeCLIP: Improving CLIP Training via Visual-enriched Captions
par: Lai, Zhengfeng, et autres
Publié: (2023) -
Compressing LLMs: The Truth is Rarely Pure and Never Simple
par: Jaiswal, Ajay, et autres
Publié: (2023) -
Guiding Instruction-based Image Editing via Multimodal Large Language Models
par: Fu, Tsu-Jui, et autres
Publié: (2023) -
UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing
par: Fu, Tsu-Jui, et autres
Publié: (2025) -
Entity Alignment with Noisy Annotations from Large Language Models
par: Chen, Shengyuan, et autres
Publié: (2024)