Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Zhiyang, Liu, Minqian, Shen, Ying, Rimchala, Joy, Zhang, Jiaxin, Wang, Qifan, Cheng, Yu, Huang, Lifu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Holistic Evaluation for Interleaved Text-and-Image Generation
par: Liu, Minqian, et autres
Publié: (2024)
par: Liu, Minqian, et autres
Publié: (2024)
R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
par: Chen, Kaijie, et autres
Publié: (2025)
par: Chen, Kaijie, et autres
Publié: (2025)
Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning
par: Xu, Zhiyang, et autres
Publié: (2024)
par: Xu, Zhiyang, et autres
Publié: (2024)
LaTtE-Flow: Layerwise Timestep-Expert Flow-based Transformer
par: Shen, Ying, et autres
Publié: (2025)
par: Shen, Ying, et autres
Publié: (2025)
Multimodal Instruction Tuning with Conditional Mixture of LoRA
par: Shen, Ying, et autres
Publié: (2024)
par: Shen, Ying, et autres
Publié: (2024)
Inference Compute-Optimal Video Vision Language Models
par: Wang, Peiqi, et autres
Publié: (2025)
par: Wang, Peiqi, et autres
Publié: (2025)
AR-RAG: Autoregressive Retrieval Augmentation for Image Generation
par: Qi, Jingyuan, et autres
Publié: (2025)
par: Qi, Jingyuan, et autres
Publié: (2025)
SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models
par: Zhang, Yue, et autres
Publié: (2024)
par: Zhang, Yue, et autres
Publié: (2024)
RIG: Synergizing Reasoning and Imagination in End-to-End Generalist Policy
par: Zhao, Zhonghan, et autres
Publié: (2025)
par: Zhao, Zhonghan, et autres
Publié: (2025)
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
par: Xu, Shicheng, et autres
Publié: (2024)
par: Xu, Shicheng, et autres
Publié: (2024)
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
par: Xu, Yige, et autres
Publié: (2026)
par: Xu, Yige, et autres
Publié: (2026)
Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning
par: Li, Ang, et autres
Publié: (2025)
par: Li, Ang, et autres
Publié: (2025)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
par: Huang, Qidong, et autres
Publié: (2024)
par: Huang, Qidong, et autres
Publié: (2024)
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
par: Wang, Haibo, et autres
Publié: (2026)
par: Wang, Haibo, et autres
Publié: (2026)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
par: Zhou, Chenyu, et autres
Publié: (2024)
par: Zhou, Chenyu, et autres
Publié: (2024)
Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment
par: Chen, Dongping, et autres
Publié: (2024)
par: Chen, Dongping, et autres
Publié: (2024)
SuperFlow: Training Flow Matching Models with RL on the Fly
par: Chen, Kaijie, et autres
Publié: (2025)
par: Chen, Kaijie, et autres
Publié: (2025)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
par: Jiang, Lei, et autres
Publié: (2025)
par: Jiang, Lei, et autres
Publié: (2025)
Cross-Modal Adapter for Vision-Language Retrieval
par: Jiang, Haojun, et autres
Publié: (2022)
par: Jiang, Haojun, et autres
Publié: (2022)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
par: Tian, Changyao, et autres
Publié: (2024)
par: Tian, Changyao, et autres
Publié: (2024)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
par: Xia, Peng, et autres
Publié: (2024)
par: Xia, Peng, et autres
Publié: (2024)
Modality-Agnostic fMRI Decoding of Vision and Language
par: Nikolaus, Mitja, et autres
Publié: (2024)
par: Nikolaus, Mitja, et autres
Publié: (2024)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
par: Wang, Haibo, et autres
Publié: (2024)
par: Wang, Haibo, et autres
Publié: (2024)
Head-wise Modality Specialization within MLLMs for Robust Fake News Detection under Missing Modality
par: Qian, Kai, et autres
Publié: (2026)
par: Qian, Kai, et autres
Publié: (2026)
Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads
par: Kou, Siqi, et autres
Publié: (2024)
par: Kou, Siqi, et autres
Publié: (2024)
LoMo: Local Modality Substitution for Deeper Vision-Language Fusion
par: Han, Feng, et autres
Publié: (2026)
par: Han, Feng, et autres
Publié: (2026)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
par: Zhu, Tinghui, et autres
Publié: (2024)
par: Zhu, Tinghui, et autres
Publié: (2024)
Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings
par: Agrawal, Aakriti, et autres
Publié: (2025)
par: Agrawal, Aakriti, et autres
Publié: (2025)
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
par: Zhang, Wenqi, et autres
Publié: (2025)
par: Zhang, Wenqi, et autres
Publié: (2025)
PresentAgent-2: Towards Generalist Multimodal Presentation Agents
par: Wu, Wei, et autres
Publié: (2026)
par: Wu, Wei, et autres
Publié: (2026)
Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking
par: Wu, Shengqiong, et autres
Publié: (2026)
par: Wu, Shengqiong, et autres
Publié: (2026)
Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation
par: Liang, Yupu, et autres
Publié: (2025)
par: Liang, Yupu, et autres
Publié: (2025)
Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space
par: Chen, Chao, et autres
Publié: (2025)
par: Chen, Chao, et autres
Publié: (2025)
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
par: Lei, Xuanyu, et autres
Publié: (2024)
par: Lei, Xuanyu, et autres
Publié: (2024)
Summarization of Multimodal Presentations with Vision-Language Models: Study of the Effect of Modalities and Structure
par: Gigant, Théo, et autres
Publié: (2025)
par: Gigant, Théo, et autres
Publié: (2025)
The Hard Positive Truth about Vision-Language Compositionality
par: Kamath, Amita, et autres
Publié: (2024)
par: Kamath, Amita, et autres
Publié: (2024)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
par: Gao, Junyuan, et autres
Publié: (2025)
par: Gao, Junyuan, et autres
Publié: (2025)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
par: Jin, Zhuoran, et autres
Publié: (2025)
par: Jin, Zhuoran, et autres
Publié: (2025)
VisionPangu: A Compact and Fine-Grained Multimodal Assistant with 1.7B Parameters
par: Fan, Jiaxin, et autres
Publié: (2026)
par: Fan, Jiaxin, et autres
Publié: (2026)
GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents
par: Luo, Run, et autres
Publié: (2025)
par: Luo, Run, et autres
Publié: (2025)
Documents similaires
-
Holistic Evaluation for Interleaved Text-and-Image Generation
par: Liu, Minqian, et autres
Publié: (2024) -
R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
par: Chen, Kaijie, et autres
Publié: (2025) -
Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning
par: Xu, Zhiyang, et autres
Publié: (2024) -
LaTtE-Flow: Layerwise Timestep-Expert Flow-based Transformer
par: Shen, Ying, et autres
Publié: (2025) -
Multimodal Instruction Tuning with Conditional Mixture of LoRA
par: Shen, Ying, et autres
Publié: (2024)