Kosmos-G: Generating Images in Context with Multimodal Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Pan, Xichen, Dong, Li, Huang, Shaohan, Peng, Zhiliang, Chen, Wenhu, Wei, Furu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Multimodal Latent Language Modeling with Next-Token Diffusion
von: Sun, Yutao, et al.
Veröffentlicht: (2024)
von: Sun, Yutao, et al.
Veröffentlicht: (2024)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
von: Wu, Xun, et al.
Veröffentlicht: (2024)
von: Wu, Xun, et al.
Veröffentlicht: (2024)
VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
von: Jiang, Lingjie, et al.
Veröffentlicht: (2025)
von: Jiang, Lingjie, et al.
Veröffentlicht: (2025)
Optimizing Prompts for Text-to-Image Generation
von: Hao, Yaru, et al.
Veröffentlicht: (2022)
von: Hao, Yaru, et al.
Veröffentlicht: (2022)
KOSMOS-2.5: A Multimodal Literate Model
von: Lv, Tengchao, et al.
Veröffentlicht: (2023)
von: Lv, Tengchao, et al.
Veröffentlicht: (2023)
On Domain-Adaptive Post-Training for Multimodal Large Language Models
von: Cheng, Daixuan, et al.
Veröffentlicht: (2024)
von: Cheng, Daixuan, et al.
Veröffentlicht: (2024)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
von: Luo, Fuwen, et al.
Veröffentlicht: (2024)
von: Luo, Fuwen, et al.
Veröffentlicht: (2024)
The Impact of Image Resolution on Biomedical Multimodal Large Language Models
von: Chen, Liangyu, et al.
Veröffentlicht: (2025)
von: Chen, Liangyu, et al.
Veröffentlicht: (2025)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
von: Pi, Renjie, et al.
Veröffentlicht: (2024)
von: Pi, Renjie, et al.
Veröffentlicht: (2024)
TimeSoccer: An End-to-End Multimodal Large Language Model for Soccer Commentary Generation
von: You, Ling, et al.
Veröffentlicht: (2025)
von: You, Ling, et al.
Veröffentlicht: (2025)
MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts
von: Liang, Hao, et al.
Veröffentlicht: (2024)
von: Liang, Hao, et al.
Veröffentlicht: (2024)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
von: Huang, Yipo, et al.
Veröffentlicht: (2024)
von: Huang, Yipo, et al.
Veröffentlicht: (2024)
VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
von: Jiang, Ziyan, et al.
Veröffentlicht: (2024)
von: Jiang, Ziyan, et al.
Veröffentlicht: (2024)
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
von: HyperAI Team, et al.
Veröffentlicht: (2025)
von: HyperAI Team, et al.
Veröffentlicht: (2025)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
von: Deng, Yihe, et al.
Veröffentlicht: (2024)
von: Deng, Yihe, et al.
Veröffentlicht: (2024)
Model Composition for Multimodal Large Language Models
von: Chen, Chi, et al.
Veröffentlicht: (2024)
von: Chen, Chi, et al.
Veröffentlicht: (2024)
Detecting Offensive Memes with Social Biases in Singapore Context Using Multimodal Large Language Models
von: Yuxuan, Cao, et al.
Veröffentlicht: (2025)
von: Yuxuan, Cao, et al.
Veröffentlicht: (2025)
AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization
von: Du, Yiyang, et al.
Veröffentlicht: (2025)
von: Du, Yiyang, et al.
Veröffentlicht: (2025)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
von: Liang, Yuci, et al.
Veröffentlicht: (2024)
von: Liang, Yuci, et al.
Veröffentlicht: (2024)
UniChange: Unifying Change Detection with Multimodal Large Language Model
von: Zhang, Xu, et al.
Veröffentlicht: (2025)
von: Zhang, Xu, et al.
Veröffentlicht: (2025)
Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models
von: Li, You, et al.
Veröffentlicht: (2025)
von: Li, You, et al.
Veröffentlicht: (2025)
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
von: Zhang, Leixin, et al.
Veröffentlicht: (2024)
von: Zhang, Leixin, et al.
Veröffentlicht: (2024)
MMRQA: Signal-Enhanced Multimodal Large Language Models for MRI Quality Assessment
von: Jia, Fankai, et al.
Veröffentlicht: (2025)
von: Jia, Fankai, et al.
Veröffentlicht: (2025)
Reminding Multimodal Large Language Models of Object-aware Knowledge with Retrieved Tags
von: Qi, Daiqing, et al.
Veröffentlicht: (2024)
von: Qi, Daiqing, et al.
Veröffentlicht: (2024)
Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages
von: Hu, Jinyi, et al.
Veröffentlicht: (2023)
von: Hu, Jinyi, et al.
Veröffentlicht: (2023)
Evolver: Chain-of-Evolution Prompting to Boost Large Multimodal Models for Hateful Meme Detection
von: Huang, Jinfa, et al.
Veröffentlicht: (2024)
von: Huang, Jinfa, et al.
Veröffentlicht: (2024)
SNIFFER: Multimodal Large Language Model for Explainable Out-of-Context Misinformation Detection
von: Qi, Peng, et al.
Veröffentlicht: (2024)
von: Qi, Peng, et al.
Veröffentlicht: (2024)
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
von: Zhu, Wenxin, et al.
Veröffentlicht: (2025)
von: Zhu, Wenxin, et al.
Veröffentlicht: (2025)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
von: Chen, Jiaxing, et al.
Veröffentlicht: (2024)
von: Chen, Jiaxing, et al.
Veröffentlicht: (2024)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
von: Jiang, Chaoya, et al.
Veröffentlicht: (2024)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2024)
Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
von: Zhao, Haozhe, et al.
Veröffentlicht: (2024)
von: Zhao, Haozhe, et al.
Veröffentlicht: (2024)
OmChat: A Recipe to Train Multimodal Language Models with Strong Long Context and Video Understanding
von: Zhao, Tiancheng, et al.
Veröffentlicht: (2024)
von: Zhao, Tiancheng, et al.
Veröffentlicht: (2024)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
von: Wu, Yuhang, et al.
Veröffentlicht: (2024)
von: Wu, Yuhang, et al.
Veröffentlicht: (2024)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
von: Li, Yifan, et al.
Veröffentlicht: (2024)
von: Li, Yifan, et al.
Veröffentlicht: (2024)
Frequency-Modulated Visual Restoration for Matryoshka Large Multimodal Models
von: Pan, Qingtao, et al.
Veröffentlicht: (2026)
von: Pan, Qingtao, et al.
Veröffentlicht: (2026)
Visual In-Context Learning for Large Vision-Language Models
von: Zhou, Yucheng, et al.
Veröffentlicht: (2024)
von: Zhou, Yucheng, et al.
Veröffentlicht: (2024)
PixelWorld: How Far Are We from Perceiving Everything as Pixels?
von: Lyu, Zhiheng, et al.
Veröffentlicht: (2025)
von: Lyu, Zhiheng, et al.
Veröffentlicht: (2025)
SK-VQA: Synthetic Knowledge Generation at Scale for Training Context-Augmented Multimodal LLMs
von: Su, Xin, et al.
Veröffentlicht: (2024)
von: Su, Xin, et al.
Veröffentlicht: (2024)
SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning
von: Xu, Mengya, et al.
Veröffentlicht: (2025)
von: Xu, Mengya, et al.
Veröffentlicht: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
von: Zhang, Huanyu, et al.
Veröffentlicht: (2025)
von: Zhang, Huanyu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Multimodal Latent Language Modeling with Next-Token Diffusion
von: Sun, Yutao, et al.
Veröffentlicht: (2024) -
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
von: Wu, Xun, et al.
Veröffentlicht: (2024) -
VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
von: Jiang, Lingjie, et al.
Veröffentlicht: (2025) -
Optimizing Prompts for Text-to-Image Generation
von: Hao, Yaru, et al.
Veröffentlicht: (2022) -
KOSMOS-2.5: A Multimodal Literate Model
von: Lv, Tengchao, et al.
Veröffentlicht: (2023)