PUMGPT: A Large Vision-Language Model for Product Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xue, Wei, Guo, Zongyi, Cui, Baoliang, Xing, Zheng, Zeng, Xiaoyi, Wang, Xiufei, Wu, Shuhui, Lu, Weiming |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
par: Huang, Qidong, et autres
Publié: (2024)
par: Huang, Qidong, et autres
Publié: (2024)
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
par: Xing, Long, et autres
Publié: (2024)
par: Xing, Long, et autres
Publié: (2024)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
par: Lu, Yifan, et autres
Publié: (2025)
par: Lu, Yifan, et autres
Publié: (2025)
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
par: Wei, Yanbin, et autres
Publié: (2026)
par: Wei, Yanbin, et autres
Publié: (2026)
Are Vision LLMs Road-Ready? A Comprehensive Benchmark for Safety-Critical Driving Video Understanding
par: Zeng, Tong, et autres
Publié: (2025)
par: Zeng, Tong, et autres
Publié: (2025)
Toward Interactive Regional Understanding in Vision-Large Language Models
par: Lee, Jungbeom, et autres
Publié: (2024)
par: Lee, Jungbeom, et autres
Publié: (2024)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
Incentivizing Reasoning for Advanced Instruction-Following of Large Language Models
par: Qin, Yulei, et autres
Publié: (2025)
par: Qin, Yulei, et autres
Publié: (2025)
Vision-centric Token Compression in Large Language Model
par: Xing, Ling, et autres
Publié: (2025)
par: Xing, Ling, et autres
Publié: (2025)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
par: Luo, Chuwei, et autres
Publié: (2022)
par: Luo, Chuwei, et autres
Publié: (2022)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
par: Lu, Jiaying, et autres
Publié: (2023)
par: Lu, Jiaying, et autres
Publié: (2023)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
par: Deng, Yihe, et autres
Publié: (2024)
par: Deng, Yihe, et autres
Publié: (2024)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
par: Zhu, Yingjie, et autres
Publié: (2024)
par: Zhu, Yingjie, et autres
Publié: (2024)
Where do Large Vision-Language Models Look at when Answering Questions?
par: Xing, Xiaoying, et autres
Publié: (2025)
par: Xing, Xiaoying, et autres
Publié: (2025)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
par: Du, Mengfei, et autres
Publié: (2024)
par: Du, Mengfei, et autres
Publié: (2024)
SignLLM: Sign Language Production Large Language Models
par: Fang, Sen, et autres
Publié: (2024)
par: Fang, Sen, et autres
Publié: (2024)
Vision-Language Models Do Not Understand Negation
par: Alhamoud, Kumail, et autres
Publié: (2025)
par: Alhamoud, Kumail, et autres
Publié: (2025)
ChartHal: A Fine-grained Framework Evaluating Hallucination of Large Vision Language Models in Chart Understanding
par: Wang, Xingqi, et autres
Publié: (2025)
par: Wang, Xingqi, et autres
Publié: (2025)
Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models
par: Liang, Qiao, et autres
Publié: (2025)
par: Liang, Qiao, et autres
Publié: (2025)
Do Vision-Language Models Really Understand Visual Language?
par: Hou, Yifan, et autres
Publié: (2024)
par: Hou, Yifan, et autres
Publié: (2024)
Exploiting GPT-4 Vision for Zero-shot Point Cloud Understanding
par: Sun, Qi, et autres
Publié: (2024)
par: Sun, Qi, et autres
Publié: (2024)
On the Limits of Token Reduction for Efficient Unified Vision Language Training
par: Chen, Siyi, et autres
Publié: (2026)
par: Chen, Siyi, et autres
Publié: (2026)
Do Vision-Language Models Understand Compound Nouns?
par: Kumar, Sonal, et autres
Publié: (2024)
par: Kumar, Sonal, et autres
Publié: (2024)
Do Vision-Language Models Understand Visual Persuasiveness?
par: Park, Gyuwon
Publié: (2025)
par: Park, Gyuwon
Publié: (2025)
Understanding Museum Exhibits using Vision-Language Reasoning
par: Balauca, Ada-Astrid, et autres
Publié: (2024)
par: Balauca, Ada-Astrid, et autres
Publié: (2024)
A Survey on Hallucination in Large Vision-Language Models
par: Liu, Hanchao, et autres
Publié: (2024)
par: Liu, Hanchao, et autres
Publié: (2024)
PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
par: Zhang, Jianshu, et autres
Publié: (2026)
par: Zhang, Jianshu, et autres
Publié: (2026)
VTCBench: Can Vision-Language Models Understand Long Context with Vision-Text Compression?
par: Zhao, Hongbo, et autres
Publié: (2025)
par: Zhao, Hongbo, et autres
Publié: (2025)
Video Understanding with Large Language Models: A Survey
par: Tang, Yolo Y., et autres
Publié: (2023)
par: Tang, Yolo Y., et autres
Publié: (2023)
LayoutLLM: Layout Instruction Tuning with Large Language Models for Document Understanding
par: Luo, Chuwei, et autres
Publié: (2024)
par: Luo, Chuwei, et autres
Publié: (2024)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
par: Li, Hongxing, et autres
Publié: (2025)
par: Li, Hongxing, et autres
Publié: (2025)
From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models
par: Shang, Yuying, et autres
Publié: (2024)
par: Shang, Yuying, et autres
Publié: (2024)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
par: Zhou, Chenyu, et autres
Publié: (2024)
par: Zhou, Chenyu, et autres
Publié: (2024)
Inference-Time Structural Reasoning for Compositional Vision-Language Understanding
par: Bhattacharya, Amartya
Publié: (2026)
par: Bhattacharya, Amartya
Publié: (2026)
Can We Predict Performance of Large Models across Vision-Language Tasks?
par: Zhao, Qinyu, et autres
Publié: (2024)
par: Zhao, Qinyu, et autres
Publié: (2024)
InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model
par: Dong, Xiaoyi, et autres
Publié: (2024)
par: Dong, Xiaoyi, et autres
Publié: (2024)
Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts
par: Wu, Xuyang, et autres
Publié: (2024)
par: Wu, Xuyang, et autres
Publié: (2024)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
par: Wang, Zhecan, et autres
Publié: (2023)
par: Wang, Zhecan, et autres
Publié: (2023)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
par: Ma, Shuailei, et autres
Publié: (2023)
par: Ma, Shuailei, et autres
Publié: (2023)
OViP: Online Vision-Language Preference Learning for VLM Hallucination
par: Liu, Shujun, et autres
Publié: (2025)
par: Liu, Shujun, et autres
Publié: (2025)
Documents similaires
-
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
par: Huang, Qidong, et autres
Publié: (2024) -
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
par: Xing, Long, et autres
Publié: (2024) -
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
par: Lu, Yifan, et autres
Publié: (2025) -
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
par: Wei, Yanbin, et autres
Publié: (2026) -
Are Vision LLMs Road-Ready? A Comprehensive Benchmark for Safety-Critical Driving Video Understanding
par: Zeng, Tong, et autres
Publié: (2025)