ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yuan, Zhengqing, He, Yunhong, Wang, Kun, Ye, Yanfang, Sun, Lichao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2023)
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2023)
3D4D: An Interactive, Editable, 4D World Model via 3D Video Generation
von: He, Yunhong, et al.
Veröffentlicht: (2025)
von: He, Yunhong, et al.
Veröffentlicht: (2025)
ViT-1.58b: Mobile Vision Transformers in the 1-bit Era
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2024)
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2024)
MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPU
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2026)
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2026)
Horizon-LM: A RAM-Centric Architecture for LLM Training
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2026)
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2026)
WordArt Designer API: User-Driven Artistic Typography Synthesis with Large Language Models on ModelScope
von: He, Jun-Yan, et al.
Veröffentlicht: (2024)
von: He, Jun-Yan, et al.
Veröffentlicht: (2024)
CLIP-Adapter: Better Vision-Language Models with Feature Adapters
von: Gao, Peng, et al.
Veröffentlicht: (2021)
von: Gao, Peng, et al.
Veröffentlicht: (2021)
MLP-KAN: Unifying Deep Representation and Function Learning
von: He, Yunhong, et al.
Veröffentlicht: (2024)
von: He, Yunhong, et al.
Veröffentlicht: (2024)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
von: You, Haoxuan, et al.
Veröffentlicht: (2023)
von: You, Haoxuan, et al.
Veröffentlicht: (2023)
FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models
von: Cai, Hengxing, et al.
Veröffentlicht: (2025)
von: Cai, Hengxing, et al.
Veröffentlicht: (2025)
Fortifying Ethical Boundaries in AI: Advanced Strategies for Enhancing Security in Large Language Models
von: He, Yunhong, et al.
Veröffentlicht: (2024)
von: He, Yunhong, et al.
Veröffentlicht: (2024)
Cross-Modal Adapter for Vision-Language Retrieval
von: Jiang, Haojun, et al.
Veröffentlicht: (2022)
von: Jiang, Haojun, et al.
Veröffentlicht: (2022)
Exploiting GPT-4 Vision for Zero-shot Point Cloud Understanding
von: Sun, Qi, et al.
Veröffentlicht: (2024)
von: Sun, Qi, et al.
Veröffentlicht: (2024)
TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions
von: He, Xingwei, et al.
Veröffentlicht: (2024)
von: He, Xingwei, et al.
Veröffentlicht: (2024)
GeoGPT4V: Towards Geometric Multi-modal Large Language Models with Geometric Image Generation
von: Cai, Shihao, et al.
Veröffentlicht: (2024)
von: Cai, Shihao, et al.
Veröffentlicht: (2024)
MedGPT-oss: Training a General-Purpose Vision-Language Model for Biomedicine
von: Zhang, Kai, et al.
Veröffentlicht: (2026)
von: Zhang, Kai, et al.
Veröffentlicht: (2026)
Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings
von: Agrawal, Aakriti, et al.
Veröffentlicht: (2025)
von: Agrawal, Aakriti, et al.
Veröffentlicht: (2025)
SAISA: Towards Multimodal Large Language Models with Both Training and Inference Efficiency
von: Yuan, Qianhao, et al.
Veröffentlicht: (2025)
von: Yuan, Qianhao, et al.
Veröffentlicht: (2025)
TransMed: Large Language Models Enhance Vision Transformer for Biomedical Image Classification
von: Zheng, Kaipeng, et al.
Veröffentlicht: (2023)
von: Zheng, Kaipeng, et al.
Veröffentlicht: (2023)
Toward Interactive Regional Understanding in Vision-Large Language Models
von: Lee, Jungbeom, et al.
Veröffentlicht: (2024)
von: Lee, Jungbeom, et al.
Veröffentlicht: (2024)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
von: Liu, Zikang, et al.
Veröffentlicht: (2025)
von: Liu, Zikang, et al.
Veröffentlicht: (2025)
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
von: Yang, Zongxin, et al.
Veröffentlicht: (2024)
von: Yang, Zongxin, et al.
Veröffentlicht: (2024)
LLMVA-GEBC: Large Language Model with Video Adapter for Generic Event Boundary Captioning
von: Tang, Yolo Yunlong, et al.
Veröffentlicht: (2023)
von: Tang, Yolo Yunlong, et al.
Veröffentlicht: (2023)
Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models
von: Liang, Qiao, et al.
Veröffentlicht: (2025)
von: Liang, Qiao, et al.
Veröffentlicht: (2025)
Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
von: Zha, Yuheng, et al.
Veröffentlicht: (2025)
von: Zha, Yuheng, et al.
Veröffentlicht: (2025)
PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
von: Zhang, Jianshu, et al.
Veröffentlicht: (2026)
von: Zhang, Jianshu, et al.
Veröffentlicht: (2026)
Light Up the Shadows: Enhance Long-Tailed Entity Grounding with Concept-Guided Vision-Language Models
von: Zhang, Yikai, et al.
Veröffentlicht: (2024)
von: Zhang, Yikai, et al.
Veröffentlicht: (2024)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
von: Deng, Yihe, et al.
Veröffentlicht: (2024)
von: Deng, Yihe, et al.
Veröffentlicht: (2024)
TruthPrInt: Mitigating Large Vision-Language Models Object Hallucination Via Latent Truthful-Guided Pre-Intervention
von: Duan, Jinhao, et al.
Veröffentlicht: (2025)
von: Duan, Jinhao, et al.
Veröffentlicht: (2025)
TTT-Unet: Enhancing U-Net with Test-Time Training Layers for Biomedical Image Segmentation
von: Zhou, Rong, et al.
Veröffentlicht: (2024)
von: Zhou, Rong, et al.
Veröffentlicht: (2024)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
von: Li, Zhaowei, et al.
Veröffentlicht: (2024)
von: Li, Zhaowei, et al.
Veröffentlicht: (2024)
DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
von: Wang, Zhaowei, et al.
Veröffentlicht: (2024)
von: Wang, Zhaowei, et al.
Veröffentlicht: (2024)
NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision
von: Li, Xiang, et al.
Veröffentlicht: (2024)
von: Li, Xiang, et al.
Veröffentlicht: (2024)
$\left|\,\circlearrowright\,\boxed{\text{BUS}}\,\right|$: A Large and Diverse Multimodal Benchmark for evaluating the ability of Vision-Language Models to understand Rebus Puzzles
von: Das, Trishanu, et al.
Veröffentlicht: (2025)
von: Das, Trishanu, et al.
Veröffentlicht: (2025)
E3D-GPT: Enhanced 3D Visual Foundation for Medical Vision-Language Model
von: Lai, Haoran, et al.
Veröffentlicht: (2024)
von: Lai, Haoran, et al.
Veröffentlicht: (2024)
Towards Efficient and Robust VQA-NLE Data Generation with Large Vision-Language Models
von: Irawan, Patrick Amadeus, et al.
Veröffentlicht: (2024)
von: Irawan, Patrick Amadeus, et al.
Veröffentlicht: (2024)
No Tokens Wasted: Leveraging Long Context in Biomedical Vision-Language Models
von: Sun, Min Woo, et al.
Veröffentlicht: (2025)
von: Sun, Min Woo, et al.
Veröffentlicht: (2025)
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
von: Nie, Yuxiang, et al.
Veröffentlicht: (2025)
von: Nie, Yuxiang, et al.
Veröffentlicht: (2025)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
von: Wang, Shengkang, et al.
Veröffentlicht: (2024)
von: Wang, Shengkang, et al.
Veröffentlicht: (2024)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
von: Lu, Jiaying, et al.
Veröffentlicht: (2023)
von: Lu, Jiaying, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2023) -
3D4D: An Interactive, Editable, 4D World Model via 3D Video Generation
von: He, Yunhong, et al.
Veröffentlicht: (2025) -
ViT-1.58b: Mobile Vision Transformers in the 1-bit Era
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2024) -
MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPU
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2026) -
Horizon-LM: A RAM-Centric Architecture for LLM Training
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2026)