LLM-I: LLMs are Naturally Interleaved Multimodal Creators
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Zirun, Zhang, Feng, Jia, Kai, Jin, Tao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Smoothing the Shift: Towards Stable Test-Time Adaptation under Complex Multimodal Noises
par: Guo, Zirun, et autres
Publié: (2025)
par: Guo, Zirun, et autres
Publié: (2025)
ConceptGuard: Continual Personalized Text-to-Image Generation with Forgetting and Confusion Mitigation
par: Guo, Zirun, et autres
Publié: (2025)
par: Guo, Zirun, et autres
Publié: (2025)
A Wander Through the Multimodal Landscape: Efficient Transfer Learning via Low-rank Sequence Multimodal Adapter
par: Guo, Zirun, et autres
Publié: (2024)
par: Guo, Zirun, et autres
Publié: (2024)
Classifier-guided Gradient Modulation for Enhanced Multimodal Learning
par: Guo, Zirun, et autres
Publié: (2024)
par: Guo, Zirun, et autres
Publié: (2024)
Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning
par: Guo, Zirun, et autres
Publié: (2025)
par: Guo, Zirun, et autres
Publié: (2025)
Efficient Prompting for Continual Adaptation to Missing Modalities
par: Guo, Zirun, et autres
Publié: (2025)
par: Guo, Zirun, et autres
Publié: (2025)
Thinking with Programming Vision: Towards a Unified View for Thinking with Images
par: Guo, Zirun, et autres
Publié: (2025)
par: Guo, Zirun, et autres
Publié: (2025)
Multimodal Prompt Learning with Missing Modalities for Sentiment Analysis and Emotion Recognition
par: Guo, Zirun, et autres
Publié: (2024)
par: Guo, Zirun, et autres
Publié: (2024)
APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization
par: Hong, Minjie, et autres
Publié: (2025)
par: Hong, Minjie, et autres
Publié: (2025)
LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
par: Li, Feng, et autres
Publié: (2024)
par: Li, Feng, et autres
Publié: (2024)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
par: Xia, Peng, et autres
Publié: (2024)
par: Xia, Peng, et autres
Publié: (2024)
LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model
par: Jin, Jiachun, et autres
Publié: (2026)
par: Jin, Jiachun, et autres
Publié: (2026)
Multimodal LLMs under Pairwise Modalities
par: Li, Yan, et autres
Publié: (2026)
par: Li, Yan, et autres
Publié: (2026)
Farm-LightSeek: An Edge-centric Multimodal Agricultural IoT Data Analytics Framework with Lightweight LLMs
par: Jiang, Dawen, et autres
Publié: (2025)
par: Jiang, Dawen, et autres
Publié: (2025)
Skipping Computations in Multimodal LLMs
par: Shukor, Mustafa, et autres
Publié: (2024)
par: Shukor, Mustafa, et autres
Publié: (2024)
Iwin Transformer: Hierarchical Vision Transformer using Interleaved Windows
par: Huo, Simin, et autres
Publié: (2025)
par: Huo, Simin, et autres
Publié: (2025)
Model-agnostic Adversarial Attack and Defense for Vision-Language-Action Models
par: Xu, Haochuan, et autres
Publié: (2025)
par: Xu, Haochuan, et autres
Publié: (2025)
Scale, Don't Fine-tune: Guiding Multimodal LLMs for Efficient Visual Place Recognition at Test-Time
par: Cheng, Jintao, et autres
Publié: (2025)
par: Cheng, Jintao, et autres
Publié: (2025)
Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning
par: Li, Ang, et autres
Publié: (2025)
par: Li, Ang, et autres
Publié: (2025)
CrossLLM-Mamba: Multimodal State Space Fusion of LLMs for RNA Interaction Prediction
par: Sadia, Rabeya Tus, et autres
Publié: (2026)
par: Sadia, Rabeya Tus, et autres
Publié: (2026)
Using Interleaved Ensemble Unlearning to Keep Backdoors at Bay for Finetuning Vision Transformers
par: Li, Zeyu Michael
Publié: (2024)
par: Li, Zeyu Michael
Publié: (2024)
Interleaved-Modal Chain-of-Thought
par: Gao, Jun, et autres
Publié: (2024)
par: Gao, Jun, et autres
Publié: (2024)
Decoupling Stability and Plasticity for Multi-Modal Test-Time Adaptation
par: He, Yongbo, et autres
Publié: (2026)
par: He, Yongbo, et autres
Publié: (2026)
PersonaX: Multimodal Datasets with LLM-Inferred Behavior Traits
par: Li, Loka, et autres
Publié: (2025)
par: Li, Loka, et autres
Publié: (2025)
MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs
par: Ye, Wenqian, et autres
Publié: (2024)
par: Ye, Wenqian, et autres
Publié: (2024)
MM-Spatial: Exploring 3D Spatial Understanding in Multimodal LLMs
par: Daxberger, Erik, et autres
Publié: (2025)
par: Daxberger, Erik, et autres
Publié: (2025)
Implicit Multimodal Alignment: On the Generalization of Frozen LLMs to Multimodal Inputs
par: Shukor, Mustafa, et autres
Publié: (2024)
par: Shukor, Mustafa, et autres
Publié: (2024)
Goal-oriented Backdoor Attack against Vision-Language-Action Models via Physical Objects
par: Zhou, Zirun, et autres
Publié: (2025)
par: Zhou, Zirun, et autres
Publié: (2025)
How Visual Representations Map to Language Feature Space in Multimodal LLMs
par: Venhoff, Constantin, et autres
Publié: (2025)
par: Venhoff, Constantin, et autres
Publié: (2025)
FIS-DiT: Breaking the Few-Step Video Inference Barrier via Training-Free Frame Interleaved Sparsity
par: Tang, Jian, et autres
Publié: (2026)
par: Tang, Jian, et autres
Publié: (2026)
Interleaving Reasoning for Better Text-to-Image Generation
par: Huang, Wenxuan, et autres
Publié: (2025)
par: Huang, Wenxuan, et autres
Publié: (2025)
Efficient Vocabulary-Free Fine-Grained Visual Recognition in the Age of Multimodal LLMs
par: Kuchibhotla, Hari Chandana, et autres
Publié: (2025)
par: Kuchibhotla, Hari Chandana, et autres
Publié: (2025)
On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks
par: Neuhaus, Yannic, et autres
Publié: (2026)
par: Neuhaus, Yannic, et autres
Publié: (2026)
Contrastive Learning for Multimodal Human Activity Recognition with Limited Labeled Data
par: Jing, Long, et autres
Publié: (2026)
par: Jing, Long, et autres
Publié: (2026)
CX-Mind: A Pioneering Multimodal Large Language Model for Interleaved Reasoning in Chest X-ray via Curriculum-Guided Reinforcement Learning
par: Li, Wenjie, et autres
Publié: (2025)
par: Li, Wenjie, et autres
Publié: (2025)
M$^{2}$Chat: Empowering VLM for Multimodal LLM Interleaved Text-Image Generation
par: Chi, Xiaowei, et autres
Publié: (2023)
par: Chi, Xiaowei, et autres
Publié: (2023)
Toward Unified Multimodal Representation Learning for Autonomous Driving
par: Tao, Ximeng, et autres
Publié: (2026)
par: Tao, Ximeng, et autres
Publié: (2026)
DreamLLM: Synergistic Multimodal Comprehension and Creation
par: Dong, Runpei, et autres
Publié: (2023)
par: Dong, Runpei, et autres
Publié: (2023)
CrunchLLM: Multitask LLMs for Structured Business Reasoning and Outcome Prediction
par: Sadia, Rabeya Tus, et autres
Publié: (2025)
par: Sadia, Rabeya Tus, et autres
Publié: (2025)
Test-Time Multimodal Backdoor Detection by Contrastive Prompting
par: Niu, Yuwei, et autres
Publié: (2024)
par: Niu, Yuwei, et autres
Publié: (2024)
Documents similaires
-
Smoothing the Shift: Towards Stable Test-Time Adaptation under Complex Multimodal Noises
par: Guo, Zirun, et autres
Publié: (2025) -
ConceptGuard: Continual Personalized Text-to-Image Generation with Forgetting and Confusion Mitigation
par: Guo, Zirun, et autres
Publié: (2025) -
A Wander Through the Multimodal Landscape: Efficient Transfer Learning via Low-rank Sequence Multimodal Adapter
par: Guo, Zirun, et autres
Publié: (2024) -
Classifier-guided Gradient Modulation for Enhanced Multimodal Learning
par: Guo, Zirun, et autres
Publié: (2024) -
Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning
par: Guo, Zirun, et autres
Publié: (2025)