Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xiaomeng, Larson, Martha, Zhao, Zhengyu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing Descriptive Captions with Visual Attributes for Multimodal Perception
par: Sun, Yanpeng, et autres
Publié: (2024)
par: Sun, Yanpeng, et autres
Publié: (2024)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
par: Atuhurra, Jesse, et autres
Publié: (2024)
par: Atuhurra, Jesse, et autres
Publié: (2024)
Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training
par: Liang, Mingliang, et autres
Publié: (2024)
par: Liang, Mingliang, et autres
Publié: (2024)
Attribute-based Visual Reprogramming for Vision-Language Models
par: Cai, Chengyi, et autres
Publié: (2025)
par: Cai, Chengyi, et autres
Publié: (2025)
AnyText2: Visual Text Generation and Editing With Customizable Attributes
par: Tuo, Yuxiang, et autres
Publié: (2024)
par: Tuo, Yuxiang, et autres
Publié: (2024)
FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models
par: Wu, Tong, et autres
Publié: (2024)
par: Wu, Tong, et autres
Publié: (2024)
Beyond Text: Frozen Large Language Models in Visual Signal Comprehension
par: Zhu, Lei, et autres
Publié: (2024)
par: Zhu, Lei, et autres
Publié: (2024)
SAVER: Mitigating Hallucinations in Large Vision-Language Models via Style-Aware Visual Early Revision
par: Li, Zhaoxu, et autres
Publié: (2025)
par: Li, Zhaoxu, et autres
Publié: (2025)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
par: Li, Sijie, et autres
Publié: (2026)
par: Li, Sijie, et autres
Publié: (2026)
Exploiting Text-Image Latent Spaces for the Description of Visual Concepts
par: Schmalwasser, Laines, et autres
Publié: (2024)
par: Schmalwasser, Laines, et autres
Publié: (2024)
Semantic-Preserving Cross-Style Visual Reasoning for Robust Multi-Modal Understanding in Large Vision-Language Models
par: Nakayama, Aya, et autres
Publié: (2025)
par: Nakayama, Aya, et autres
Publié: (2025)
Tango: Taming Visual Signals for Efficient Video Large Language Models
par: Yin, Shukang, et autres
Publié: (2026)
par: Yin, Shukang, et autres
Publié: (2026)
Visual Perception by Large Language Model's Weights
par: Ma, Feipeng, et autres
Publié: (2024)
par: Ma, Feipeng, et autres
Publié: (2024)
Visually Descriptive Language Model for Vector Graphics Reasoning
par: Wang, Zhenhailong, et autres
Publié: (2024)
par: Wang, Zhenhailong, et autres
Publié: (2024)
EvdCLIP: Improving Vision-Language Retrieval with Entity Visual Descriptions from Large Language Models
par: Meng, GuangHao, et autres
Publié: (2025)
par: Meng, GuangHao, et autres
Publié: (2025)
Text-to-CAD Generation Through Infusing Visual Feedback in Large Language Models
par: Wang, Ruiyu, et autres
Publié: (2025)
par: Wang, Ruiyu, et autres
Publié: (2025)
Visual Text Processing: A Comprehensive Review and Unified Evaluation
par: Shu, Yan, et autres
Publié: (2025)
par: Shu, Yan, et autres
Publié: (2025)
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
par: Cai, Kaitong, et autres
Publié: (2025)
par: Cai, Kaitong, et autres
Publié: (2025)
Visual Semantic Description Generation with MLLMs for Image-Text Matching
par: Chen, Junyu, et autres
Publié: (2025)
par: Chen, Junyu, et autres
Publié: (2025)
DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning
par: Majeedi, Abrar, et autres
Publié: (2026)
par: Majeedi, Abrar, et autres
Publié: (2026)
Large Language Models are Universal Reasoners for Visual Generation
par: Ren, Sucheng, et autres
Publié: (2026)
par: Ren, Sucheng, et autres
Publié: (2026)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
par: Jin, Yizhang, et autres
Publié: (2024)
par: Jin, Yizhang, et autres
Publié: (2024)
Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models
par: Li, Xin, et autres
Publié: (2024)
par: Li, Xin, et autres
Publié: (2024)
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
par: Xiong, Guangzhi, et autres
Publié: (2026)
par: Xiong, Guangzhi, et autres
Publié: (2026)
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
LLM-AD: Large Language Model based Audio Description System
par: Chu, Peng, et autres
Publié: (2024)
par: Chu, Peng, et autres
Publié: (2024)
AlignCAT: Visual-Linguistic Alignment of Category and Attribute for Weakly Supervised Visual Grounding
par: Wang, Yidan, et autres
Publié: (2025)
par: Wang, Yidan, et autres
Publié: (2025)
Descrip3D: Enhancing Large Language Model-based 3D Scene Understanding with Object-Level Text Descriptions
par: Xue, Jintang, et autres
Publié: (2025)
par: Xue, Jintang, et autres
Publié: (2025)
Learning to Produce Semi-dense Correspondences for Visual Localization
par: Giang, Khang Truong, et autres
Publié: (2024)
par: Giang, Khang Truong, et autres
Publié: (2024)
Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization
par: Chen, Tsai-Shien, et autres
Publié: (2025)
par: Chen, Tsai-Shien, et autres
Publié: (2025)
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
par: Li, Bohao, et autres
Publié: (2024)
par: Li, Bohao, et autres
Publié: (2024)
HyperSeg: Towards Universal Visual Segmentation with Large Language Model
par: Wei, Cong, et autres
Publié: (2024)
par: Wei, Cong, et autres
Publié: (2024)
StyleTextGen: Style-Conditioned Multilingual Scene Text Generation
par: Chen, Zeyu, et autres
Publié: (2026)
par: Chen, Zeyu, et autres
Publié: (2026)
Self-Adapting Large Visual-Language Models to Edge Devices across Visual Modalities
par: Cai, Kaiwen, et autres
Publié: (2024)
par: Cai, Kaiwen, et autres
Publié: (2024)
Self-Training Large Language Models for Improved Visual Program Synthesis With Visual Reinforcement
par: Khan, Zaid, et autres
Publié: (2024)
par: Khan, Zaid, et autres
Publié: (2024)
Language Model as Visual Explainer
par: Yang, Xingyi, et autres
Publié: (2024)
par: Yang, Xingyi, et autres
Publié: (2024)
ControlLoc: Physical-World Hijacking Attack on Visual Perception in Autonomous Driving
par: Ma, Chen, et autres
Publié: (2024)
par: Ma, Chen, et autres
Publié: (2024)
Visual In-Context Learning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
Visual Style Prompting with Swapping Self-Attention
par: Jeong, Jaeseok, et autres
Publié: (2024)
par: Jeong, Jaeseok, et autres
Publié: (2024)
Enhancing Visual Representation for Text-based Person Searching
par: Shen, Wei, et autres
Publié: (2024)
par: Shen, Wei, et autres
Publié: (2024)
Documents similaires
-
Enhancing Descriptive Captions with Visual Attributes for Multimodal Perception
par: Sun, Yanpeng, et autres
Publié: (2024) -
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
par: Atuhurra, Jesse, et autres
Publié: (2024) -
Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training
par: Liang, Mingliang, et autres
Publié: (2024) -
Attribute-based Visual Reprogramming for Vision-Language Models
par: Cai, Chengyi, et autres
Publié: (2025) -
AnyText2: Visual Text Generation and Editing With Customizable Attributes
par: Tuo, Yuxiang, et autres
Publié: (2024)