Generative Multimodal Models are In-Context Learners
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Quan, Cui, Yufeng, Zhang, Xiaosong, Zhang, Fan, Yu, Qiying, Luo, Zhengxiong, Wang, Yueze, Rao, Yongming, Liu, Jingjing, Huang, Tiejun, Wang, Xinlong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Emu: Generative Pretraining in Multimodality
di: Sun, Quan, et al.
Pubblicazione: (2023)
di: Sun, Quan, et al.
Pubblicazione: (2023)
EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters
di: Sun, Quan, et al.
Pubblicazione: (2024)
di: Sun, Quan, et al.
Pubblicazione: (2024)
CapsFusion: Rethinking Image-Text Data at Scale
di: Yu, Qiying, et al.
Pubblicazione: (2023)
di: Yu, Qiying, et al.
Pubblicazione: (2023)
Emu3: Next-Token Prediction is All You Need
di: Wang, Xinlong, et al.
Pubblicazione: (2024)
di: Wang, Xinlong, et al.
Pubblicazione: (2024)
Emu3.5: Native Multimodal Models are World Learners
di: Cui, Yufeng, et al.
Pubblicazione: (2025)
di: Cui, Yufeng, et al.
Pubblicazione: (2025)
Unveiling Encoder-Free Vision-Language Models
di: Diao, Haiwen, et al.
Pubblicazione: (2024)
di: Diao, Haiwen, et al.
Pubblicazione: (2024)
DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception
di: Li, Xiaotong, et al.
Pubblicazione: (2024)
di: Li, Xiaotong, et al.
Pubblicazione: (2024)
You See it, You Got it: Learning 3D Creation on Pose-Free Videos at Scale
di: Ma, Baorui, et al.
Pubblicazione: (2024)
di: Ma, Baorui, et al.
Pubblicazione: (2024)
Autoregressive Video Generation without Vector Quantization
di: Deng, Haoge, et al.
Pubblicazione: (2024)
di: Deng, Haoge, et al.
Pubblicazione: (2024)
Efficient Multimodal Learning from Data-centric Perspective
di: He, Muyang, et al.
Pubblicazione: (2024)
di: He, Muyang, et al.
Pubblicazione: (2024)
EVA-02: A Visual Representation for Neon Genesis
di: Fang, Yuxin, et al.
Pubblicazione: (2023)
di: Fang, Yuxin, et al.
Pubblicazione: (2023)
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
di: Diao, Haiwen, et al.
Pubblicazione: (2025)
di: Diao, Haiwen, et al.
Pubblicazione: (2025)
End-to-End Vision Tokenizer Tuning
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
Uniform Discrete Diffusion with Metric Path for Video Generation
di: Deng, Haoge, et al.
Pubblicazione: (2025)
di: Deng, Haoge, et al.
Pubblicazione: (2025)
Diffusion Feedback Helps CLIP See Better
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
OmniGen2: Towards Instruction-Aligned Multimodal Generation
di: Wu, Chenyuan, et al.
Pubblicazione: (2025)
di: Wu, Chenyuan, et al.
Pubblicazione: (2025)
CaMML: Context-Aware Multimodal Learner for Large Models
di: Chen, Yixin, et al.
Pubblicazione: (2024)
di: Chen, Yixin, et al.
Pubblicazione: (2024)
Video Diffusion Transformers are In-Context Learners
di: Fei, Zhengcong, et al.
Pubblicazione: (2024)
di: Fei, Zhengcong, et al.
Pubblicazione: (2024)
OmniGen: Unified Image Generation
di: Xiao, Shitao, et al.
Pubblicazione: (2024)
di: Xiao, Shitao, et al.
Pubblicazione: (2024)
Universal Prompt Optimizer for Safe Text-to-Image Generation
di: Wu, Zongyu, et al.
Pubblicazione: (2024)
di: Wu, Zongyu, et al.
Pubblicazione: (2024)
BREEN: Bridge Data-Efficient Encoder-Free Multimodal Learning with Learnable Queries
di: Li, Tianle, et al.
Pubblicazione: (2025)
di: Li, Tianle, et al.
Pubblicazione: (2025)
Parameter-efficient Tuning of Large-scale Multimodal Foundation Model
di: Wang, Haixin, et al.
Pubblicazione: (2023)
di: Wang, Haixin, et al.
Pubblicazione: (2023)
X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again
di: Geng, Zigang, et al.
Pubblicazione: (2025)
di: Geng, Zigang, et al.
Pubblicazione: (2025)
Histopathology Image Report Generation by Vision Language Model with Multimodal In-Context Learning
di: Liu, Shih-Wen, et al.
Pubblicazione: (2025)
di: Liu, Shih-Wen, et al.
Pubblicazione: (2025)
Video2Layout: Recall and Reconstruct Metric-Grounded Cognitive Map for Spatial Reasoning
di: Huang, Yibin, et al.
Pubblicazione: (2025)
di: Huang, Yibin, et al.
Pubblicazione: (2025)
SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs
di: Wang, Jiahui, et al.
Pubblicazione: (2025)
di: Wang, Jiahui, et al.
Pubblicazione: (2025)
Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation
di: Liao, Chao, et al.
Pubblicazione: (2025)
di: Liao, Chao, et al.
Pubblicazione: (2025)
ProMotion: Prototypes As Motion Learners
di: Lu, Yawen, et al.
Pubblicazione: (2024)
di: Lu, Yawen, et al.
Pubblicazione: (2024)
X-3D: Explicit 3D Structure Modeling for Point Cloud Recognition
di: Sun, Shuofeng, et al.
Pubblicazione: (2024)
di: Sun, Shuofeng, et al.
Pubblicazione: (2024)
Learning the Degradation Distribution for Blind Image Super-Resolution
di: Luo, Zhengxiong, et al.
Pubblicazione: (2022)
di: Luo, Zhengxiong, et al.
Pubblicazione: (2022)
Region-Level Context-Aware Multimodal Understanding
di: Wei, Hongliang, et al.
Pubblicazione: (2025)
di: Wei, Hongliang, et al.
Pubblicazione: (2025)
CI-VID: A Coherent Interleaved Text-Video Dataset
di: Ju, Yiming, et al.
Pubblicazione: (2025)
di: Ju, Yiming, et al.
Pubblicazione: (2025)
GS-Bias: Global-Spatial Bias Learner for Single-Image Test-Time Adaptation of Vision-Language Models
di: Huang, Zhaohong, et al.
Pubblicazione: (2025)
di: Huang, Zhaohong, et al.
Pubblicazione: (2025)
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
di: Jiang, Jingjing, et al.
Pubblicazione: (2025)
di: Jiang, Jingjing, et al.
Pubblicazione: (2025)
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
di: Dong, Yuhao, et al.
Pubblicazione: (2024)
di: Dong, Yuhao, et al.
Pubblicazione: (2024)
VimRAG: Navigating Massive Visual Context in Retrieval-Augmented Generation via Multimodal Memory Graph
di: Wang, Qiuchen, et al.
Pubblicazione: (2026)
di: Wang, Qiuchen, et al.
Pubblicazione: (2026)
Exploring Efficient Asymmetric Blind-Spots for Self-Supervised Denoising in Real-World Scenarios
di: Chen, Shiyan, et al.
Pubblicazione: (2023)
di: Chen, Shiyan, et al.
Pubblicazione: (2023)
Directly Denoising Diffusion Models
di: Zhang, Dan, et al.
Pubblicazione: (2024)
di: Zhang, Dan, et al.
Pubblicazione: (2024)
Unified Directly Denoising for Both Variance Preserving and Variance Exploding Diffusion Models
di: Wang, Jingjing, et al.
Pubblicazione: (2024)
di: Wang, Jingjing, et al.
Pubblicazione: (2024)
How Long Can Unified Multimodal Models Generate Images Reliably? Taming Long-Horizon Interleaved Image Generation via Context Curation
di: Chen, Haoyu, et al.
Pubblicazione: (2026)
di: Chen, Haoyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Emu: Generative Pretraining in Multimodality
di: Sun, Quan, et al.
Pubblicazione: (2023) -
EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters
di: Sun, Quan, et al.
Pubblicazione: (2024) -
CapsFusion: Rethinking Image-Text Data at Scale
di: Yu, Qiying, et al.
Pubblicazione: (2023) -
Emu3: Next-Token Prediction is All You Need
di: Wang, Xinlong, et al.
Pubblicazione: (2024) -
Emu3.5: Native Multimodal Models are World Learners
di: Cui, Yufeng, et al.
Pubblicazione: (2025)