Exploring the Distinctiveness and Fidelity of the Descriptions Generated by Large Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Yuhang, Wu, Zihan, Gao, Chongyang, Peng, Jiawei, Yang, Xu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2026)
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2026)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
di: Wu, Xun, et al.
Pubblicazione: (2024)
di: Wu, Xun, et al.
Pubblicazione: (2024)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
CLIP-PCQA: Exploring Subjective-Aligned Vision-Language Modeling for Point Cloud Quality Assessment
di: Liu, Yating, et al.
Pubblicazione: (2025)
di: Liu, Yating, et al.
Pubblicazione: (2025)
InstructFLIP: Exploring Unified Vision-Language Model for Face Anti-spoofing
di: Lin, Kun-Hsiang, et al.
Pubblicazione: (2025)
di: Lin, Kun-Hsiang, et al.
Pubblicazione: (2025)
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
di: Xie, Jingjing, et al.
Pubblicazione: (2024)
di: Xie, Jingjing, et al.
Pubblicazione: (2024)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
Visual Semantic Description Generation with MLLMs for Image-Text Matching
di: Chen, Junyu, et al.
Pubblicazione: (2025)
di: Chen, Junyu, et al.
Pubblicazione: (2025)
DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
Hallu-PI: Evaluating Hallucination in Multi-modal Large Language Models within Perturbed Inputs
di: Ding, Peng, et al.
Pubblicazione: (2024)
di: Ding, Peng, et al.
Pubblicazione: (2024)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
di: Sun, Yanpeng, et al.
Pubblicazione: (2024)
di: Sun, Yanpeng, et al.
Pubblicazione: (2024)
Prompt-Aware Adaptive Elastic Weight Consolidation for Continual Learning in Medical Vision-Language Models
di: Gao, Ziyuan, et al.
Pubblicazione: (2025)
di: Gao, Ziyuan, et al.
Pubblicazione: (2025)
POINTS1.5: Building a Vision-Language Model towards Real World Applications
di: Liu, Yuan, et al.
Pubblicazione: (2024)
di: Liu, Yuan, et al.
Pubblicazione: (2024)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
di: Chow, Wei, et al.
Pubblicazione: (2024)
di: Chow, Wei, et al.
Pubblicazione: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2025)
di: Wu, Qiong, et al.
Pubblicazione: (2025)
Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models
di: Jin, Hyundong, et al.
Pubblicazione: (2025)
di: Jin, Hyundong, et al.
Pubblicazione: (2025)
Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models
di: Zhou, Yuchen, et al.
Pubblicazione: (2025)
di: Zhou, Yuchen, et al.
Pubblicazione: (2025)
Towards Real-World Adverse Weather Image Restoration: Enhancing Clearness and Semantics with Vision-Language Models
di: Xu, Jiaqi, et al.
Pubblicazione: (2024)
di: Xu, Jiaqi, et al.
Pubblicazione: (2024)
Segmentation-Based Attention Entropy: Detecting and Mitigating Object Hallucinations in Large Vision-Language Models
di: Song, Jiale, et al.
Pubblicazione: (2026)
di: Song, Jiale, et al.
Pubblicazione: (2026)
Scene Graph Generation with Role-Playing Large Language Models
di: Chen, Guikun, et al.
Pubblicazione: (2024)
di: Chen, Guikun, et al.
Pubblicazione: (2024)
DAE-Talker: High Fidelity Speech-Driven Talking Face Generation with Diffusion Autoencoder
di: Du, Chenpeng, et al.
Pubblicazione: (2023)
di: Du, Chenpeng, et al.
Pubblicazione: (2023)
CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model
di: Luo, Yuxuan, et al.
Pubblicazione: (2025)
di: Luo, Yuxuan, et al.
Pubblicazione: (2025)
G4G:A Generic Framework for High Fidelity Talking Face Generation with Fine-grained Intra-modal Alignment
di: Zhang, Juan, et al.
Pubblicazione: (2024)
di: Zhang, Juan, et al.
Pubblicazione: (2024)
Hierarchical Sub-action Tree for Continuous Sign Language Recognition
di: Yang, Dejie, et al.
Pubblicazione: (2025)
di: Yang, Dejie, et al.
Pubblicazione: (2025)
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
Unveiling Encoder-Free Vision-Language Models
di: Diao, Haiwen, et al.
Pubblicazione: (2024)
di: Diao, Haiwen, et al.
Pubblicazione: (2024)
PDA: Text-Augmented Defense Framework for Robust Vision-Language Models against Adversarial Image Attacks
di: Xu, Jingning, et al.
Pubblicazione: (2026)
di: Xu, Jingning, et al.
Pubblicazione: (2026)
Efficient Vision Language Model Fine-tuning for Text-based Person Anomaly Search
di: He, Jiayi, et al.
Pubblicazione: (2025)
di: He, Jiayi, et al.
Pubblicazione: (2025)
Group-based Distinctive Image Captioning with Memory Difference Encoding and Attention
di: Wang, Jiuniu, et al.
Pubblicazione: (2025)
di: Wang, Jiuniu, et al.
Pubblicazione: (2025)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
di: Feng, X., et al.
Pubblicazione: (2024)
di: Feng, X., et al.
Pubblicazione: (2024)
HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter
di: Zhao, Yumiao, et al.
Pubblicazione: (2024)
di: Zhao, Yumiao, et al.
Pubblicazione: (2024)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
di: Xu, Yifang, et al.
Pubblicazione: (2025)
di: Xu, Yifang, et al.
Pubblicazione: (2025)
PP-Motion: Physical-Perceptual Fidelity Evaluation for Human Motion Generation
di: Zhao, Sihan, et al.
Pubblicazione: (2025)
di: Zhao, Sihan, et al.
Pubblicazione: (2025)
ComAlign: Compositional Alignment in Vision-Language Models
di: Abdollah, Ali, et al.
Pubblicazione: (2024)
di: Abdollah, Ali, et al.
Pubblicazione: (2024)
Mitigating Image Captioning Hallucinations in Vision-Language Models
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
FoodMLLM-JP: Leveraging Multimodal Large Language Models for Japanese Recipe Generation
di: Imajuku, Yuki, et al.
Pubblicazione: (2024)
di: Imajuku, Yuki, et al.
Pubblicazione: (2024)
Towards Training-free Multimodal Hate Localisation with Large Language Models
di: Sun, Yueming, et al.
Pubblicazione: (2026)
di: Sun, Yueming, et al.
Pubblicazione: (2026)
MAO: Efficient Model-Agnostic Optimization of Prompt Tuning for Vision-Language Models
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing
di: Chen, Liyang, et al.
Pubblicazione: (2025)
di: Chen, Liyang, et al.
Pubblicazione: (2025)
DuoTeach: Dual Role Self-Teaching for Coarse-to-Fine Decision Coordination in Vision--Language Models
di: Yang, Wei, et al.
Pubblicazione: (2025)
di: Yang, Wei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2026) -
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
di: Wu, Xun, et al.
Pubblicazione: (2024) -
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
di: Zhu, Hongyi, et al.
Pubblicazione: (2024) -
CLIP-PCQA: Exploring Subjective-Aligned Vision-Language Modeling for Point Cloud Quality Assessment
di: Liu, Yating, et al.
Pubblicazione: (2025) -
InstructFLIP: Exploring Unified Vision-Language Model for Face Anti-spoofing
di: Lin, Kun-Hsiang, et al.
Pubblicazione: (2025)