Are Multimodal Large Language Models Good Annotators for Image Tagging?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xie, Ming-Kun, Xiao, Jia-Hao, Kou, Zhiqiang, Li, Zhongnian, Niu, Gang, Sugiyama, Masashi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
What Makes "Good" Distractors for Object Hallucination Evaluation in Large Vision-Language Models?
par: Xie, Ming-Kun, et autres
Publié: (2025)
par: Xie, Ming-Kun, et autres
Publié: (2025)
Counterfactual Reasoning for Multi-Label Image Classification via Patching-Based Training
par: Xie, Ming-Kun, et autres
Publié: (2024)
par: Xie, Ming-Kun, et autres
Publié: (2024)
Exploring Multi-Grained Concept Annotations for Multimodal Large Language Models
par: Xu, Xiao, et autres
Publié: (2024)
par: Xu, Xiao, et autres
Publié: (2024)
Multi-Label Knowledge Distillation
par: Yang, Penghui, et autres
Publié: (2023)
par: Yang, Penghui, et autres
Publié: (2023)
Tag2Text: Guiding Vision-Language Model via Image Tagging
par: Huang, Xinyu, et autres
Publié: (2023)
par: Huang, Xinyu, et autres
Publié: (2023)
Transfer Attack for Bad and Good: Explain and Boost Adversarial Transferability across Multimodal Large Language Models
par: Cheng, Hao, et autres
Publié: (2024)
par: Cheng, Hao, et autres
Publié: (2024)
Reminding Multimodal Large Language Models of Object-aware Knowledge with Retrieved Tags
par: Qi, Daiqing, et autres
Publié: (2024)
par: Qi, Daiqing, et autres
Publié: (2024)
Weak-to-Strong Diffusion with Reflection
par: Bai, Lichen, et autres
Publié: (2025)
par: Bai, Lichen, et autres
Publié: (2025)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
par: Wu, Xun, et autres
Publié: (2024)
par: Wu, Xun, et autres
Publié: (2024)
Robust Multi-View Learning via Representation Fusion of Sample-Level Attention and Alignment of Simulated Perturbation
par: Xu, Jie, et autres
Publié: (2025)
par: Xu, Jie, et autres
Publié: (2025)
MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models
par: Hu, Lulu, et autres
Publié: (2026)
par: Hu, Lulu, et autres
Publié: (2026)
Test-Time Computing for Referring Multimodal Large Language Models
par: Wu, Mingrui, et autres
Publié: (2026)
par: Wu, Mingrui, et autres
Publié: (2026)
Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models
par: Zhang, Guosheng, et autres
Publié: (2025)
par: Zhang, Guosheng, et autres
Publié: (2025)
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
par: Liu, Haowei, et autres
Publié: (2024)
par: Liu, Haowei, et autres
Publié: (2024)
MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
par: Li, Jiale, et autres
Publié: (2025)
par: Li, Jiale, et autres
Publié: (2025)
Tag-Enriched Multi-Attention with Large Language Models for Cross-Domain Sequential Recommendation
par: Wu, Wangyu, et autres
Publié: (2025)
par: Wu, Wangyu, et autres
Publié: (2025)
Semantic Alignment for Multimodal Large Language Models
par: Wu, Tao, et autres
Publié: (2024)
par: Wu, Tao, et autres
Publié: (2024)
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
par: Zhang, Leixin, et autres
Publié: (2024)
par: Zhang, Leixin, et autres
Publié: (2024)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
par: Wu, Sijing, et autres
Publié: (2026)
par: Wu, Sijing, et autres
Publié: (2026)
Multimodal Large Language Models as Image Classifiers
par: Kisel, Nikita, et autres
Publié: (2026)
par: Kisel, Nikita, et autres
Publié: (2026)
Large Language Models are Good Prompt Learners for Low-Shot Image Classification
par: Zheng, Zhaoheng, et autres
Publié: (2023)
par: Zheng, Zhaoheng, et autres
Publié: (2023)
GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
par: Fang, Rongyao, et autres
Publié: (2025)
par: Fang, Rongyao, et autres
Publié: (2025)
Seeing the Undefined: Chain-of-Action for Generative Semantic Labels
par: Wei, Meng, et autres
Publié: (2024)
par: Wei, Meng, et autres
Publié: (2024)
Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning
par: Hao, Pengfei, et autres
Publié: (2025)
par: Hao, Pengfei, et autres
Publié: (2025)
MM-R1: Unleashing the Power of Unified Multimodal Large Language Models for Personalized Image Generation
par: Liang, Qian, et autres
Publié: (2025)
par: Liang, Qian, et autres
Publié: (2025)
Large Language Models for Multimodal Deformable Image Registration
par: Ma, Mingrui, et autres
Publié: (2024)
par: Ma, Mingrui, et autres
Publié: (2024)
Safety of Multimodal Large Language Models on Images and Texts
par: Liu, Xin, et autres
Publié: (2024)
par: Liu, Xin, et autres
Publié: (2024)
ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection
par: Huang, Tai-Ming, et autres
Publié: (2025)
par: Huang, Tai-Ming, et autres
Publié: (2025)
A Category-theoretical Meta-analysis of Definitions of Disentanglement
par: Zhang, Yivan, et autres
Publié: (2023)
par: Zhang, Yivan, et autres
Publié: (2023)
Jailbreaking Attack against Multimodal Large Language Model
par: Niu, Zhenxing, et autres
Publié: (2024)
par: Niu, Zhenxing, et autres
Publié: (2024)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
par: Li, Yifan, et autres
Publié: (2024)
par: Li, Yifan, et autres
Publié: (2024)
LAD-Reasoner: Tiny Multimodal Models are Good Reasoners for Logical Anomaly Detection
par: Li, Weijia, et autres
Publié: (2025)
par: Li, Weijia, et autres
Publié: (2025)
ForenX: Towards Explainable AI-Generated Image Detection with Multimodal Large Language Models
par: Tan, Chuangchuang, et autres
Publié: (2025)
par: Tan, Chuangchuang, et autres
Publié: (2025)
Vision-Language Model Fine-Tuning via Simple Parameter-Efficient Modification
par: Li, Ming, et autres
Publié: (2024)
par: Li, Ming, et autres
Publié: (2024)
Visual Autoregressive Modeling for Image Super-Resolution
par: Qu, Yunpeng, et autres
Publié: (2025)
par: Qu, Yunpeng, et autres
Publié: (2025)
MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine
par: Xie, Yunfei, et autres
Publié: (2024)
par: Xie, Yunfei, et autres
Publié: (2024)
ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection
par: Sun, Zhihao, et autres
Publié: (2024)
par: Sun, Zhihao, et autres
Publié: (2024)
Dynamic Pyramid Network for Efficient Multimodal Large Language Model
par: Ai, Hao, et autres
Publié: (2025)
par: Ai, Hao, et autres
Publié: (2025)
Vision Large Language Models Are Good Noise Handlers in Engagement Analysis
par: Vedernikov, Alexander, et autres
Publié: (2025)
par: Vedernikov, Alexander, et autres
Publié: (2025)
LLMGeo: Benchmarking Large Language Models on Image Geolocation In-the-wild
par: Wang, Zhiqiang, et autres
Publié: (2024)
par: Wang, Zhiqiang, et autres
Publié: (2024)
Documents similaires
-
What Makes "Good" Distractors for Object Hallucination Evaluation in Large Vision-Language Models?
par: Xie, Ming-Kun, et autres
Publié: (2025) -
Counterfactual Reasoning for Multi-Label Image Classification via Patching-Based Training
par: Xie, Ming-Kun, et autres
Publié: (2024) -
Exploring Multi-Grained Concept Annotations for Multimodal Large Language Models
par: Xu, Xiao, et autres
Publié: (2024) -
Multi-Label Knowledge Distillation
par: Yang, Penghui, et autres
Publié: (2023) -
Tag2Text: Guiding Vision-Language Model via Image Tagging
par: Huang, Xinyu, et autres
Publié: (2023)