MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Yanghao, Qian, Rui, Pan, Bowen, Zhang, Haotian, Huang, Haoshuo, Zhang, Bowen, Tong, Jialing, You, Haoxuan, Du, Xianzhi, Gan, Zhe, Kim, Hyunjik, Jia, Chao, Wang, Zhenbang, Yang, Yinfei, Gao, Mingfei, Dou, Zi-Yi, Hu, Wenze, Gao, Chang, Li, Dongxu, Dufter, Philipp, Wang, Zirui, Yin, Guoli, Zhang, Zhengdong, Chen, Chen, Zhao, Yang, Pang, Ruoming, Chen, Zhifeng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Improve Vision Language Model Chain-of-thought Reasoning
by: Zhang, Ruohong, et al.
Published: (2024)
by: Zhang, Ruohong, et al.
Published: (2024)
EC-DIT: Scaling Diffusion Transformers with Adaptive Expert-Choice Routing
by: Sun, Haotian, et al.
Published: (2024)
by: Sun, Haotian, et al.
Published: (2024)
Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models
by: Zhang, Haotian, et al.
Published: (2024)
by: Zhang, Haotian, et al.
Published: (2024)
MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning
by: Zhang, Haotian, et al.
Published: (2024)
by: Zhang, Haotian, et al.
Published: (2024)
MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA
by: Ye, Hanrong, et al.
Published: (2024)
by: Ye, Hanrong, et al.
Published: (2024)
Compressing LLMs: The Truth is Rarely Pure and Never Simple
by: Jaiswal, Ajay, et al.
Published: (2023)
by: Jaiswal, Ajay, et al.
Published: (2023)
CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling
by: Wang, Xinze, et al.
Published: (2025)
by: Wang, Xinze, et al.
Published: (2025)
DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation
by: Chen, Chen, et al.
Published: (2025)
by: Chen, Chen, et al.
Published: (2025)
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
by: Lai, Zhengfeng, et al.
Published: (2024)
by: Lai, Zhengfeng, et al.
Published: (2024)
Deprotonated of layered double hydroxides during electrocatalytic water oxidation for multi‐cations intercalation
by: Bowen Jin, et al.
Published: (2024)
by: Bowen Jin, et al.
Published: (2024)
Guiding Instruction-based Image Editing via Multimodal Large Language Models
by: Fu, Tsu-Jui, et al.
Published: (2023)
by: Fu, Tsu-Jui, et al.
Published: (2023)
VeCLIP: Improving CLIP Training via Visual-enriched Captions
by: Lai, Zhengfeng, et al.
Published: (2023)
by: Lai, Zhengfeng, et al.
Published: (2023)
MOFI: Learning Image Representations from Noisy Entity Annotated Images
by: Wu, Wentao, et al.
Published: (2023)
by: Wu, Wentao, et al.
Published: (2023)
Renormalizable Cosmology Based on Gauss-Bonnet Theory with Torsion
by: Hu, Zirui, et al.
Published: (2024)
by: Hu, Zirui, et al.
Published: (2024)
UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing
by: Fu, Tsu-Jui, et al.
Published: (2025)
by: Fu, Tsu-Jui, et al.
Published: (2025)
How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts
by: Qian, Yusu, et al.
Published: (2024)
by: Qian, Yusu, et al.
Published: (2024)
Contrastive Localized Language-Image Pre-Training
by: Chen, Hong-You, et al.
Published: (2024)
by: Chen, Hong-You, et al.
Published: (2024)
MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training
by: McKinzie, Brandon, et al.
Published: (2024)
by: McKinzie, Brandon, et al.
Published: (2024)
Oriented Metal Stripping for Highly Reversible Zinc Anode
by: Shimeng Zhang, et al.
Published: (2024)
by: Shimeng Zhang, et al.
Published: (2024)
SO-Bench: A Structural Output Evaluation of Multimodal LLMs
by: Feng, Di, et al.
Published: (2025)
by: Feng, Di, et al.
Published: (2025)
Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing
by: Qian, Yusu, et al.
Published: (2025)
by: Qian, Yusu, et al.
Published: (2025)
AdapEdit: Spatio-Temporal Guided Adaptive Editing Algorithm for Text-Based Continuity-Sensitive Image Editing
by: Ma, Zhiyuan, et al.
Published: (2023)
by: Ma, Zhiyuan, et al.
Published: (2023)
Revisiting MoE and Dense Speed-Accuracy Comparisons for LLM Training
by: Du, Xianzhi, et al.
Published: (2024)
by: Du, Xianzhi, et al.
Published: (2024)
Autoregressive Video Generation beyond Next Frames Prediction
by: Ren, Sucheng, et al.
Published: (2025)
by: Ren, Sucheng, et al.
Published: (2025)
Joint CFO-Channel Estimation under Strong Inter-Cell Interference for Low-Altitude Radio Mapping
by: Li, Bowen, et al.
Published: (2025)
by: Li, Bowen, et al.
Published: (2025)
RSCaMa: Remote Sensing Image Change Captioning with State Space Model
by: Liu, Chenyang, et al.
Published: (2024)
by: Liu, Chenyang, et al.
Published: (2024)
Spectral Scalpel: Amplifying Adjacent Action Discrepancy via Frequency-Selective Filtering for Skeleton-Based Action Segmentation
by: Ji, Haoyu, et al.
Published: (2026)
by: Ji, Haoyu, et al.
Published: (2026)
A Systematic Comparison of Prompting and Multi-Agent Methods for LLM-based Stance Detection
by: Dai, Genan, et al.
Published: (2026)
by: Dai, Genan, et al.
Published: (2026)
Text-Derived Relational Graph-Enhanced Network for Skeleton-Based Action Segmentation
by: Ji, Haoyu, et al.
Published: (2025)
by: Ji, Haoyu, et al.
Published: (2025)
GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing
by: Qian, Yusu, et al.
Published: (2025)
by: Qian, Yusu, et al.
Published: (2025)
When Annotators Agree but Labels Disagree: The Projection Problem in Stance Detection
by: Zhang, Bowen
Published: (2026)
by: Zhang, Bowen
Published: (2026)
Big AI Models for 6G Wireless Networks: Opportunities, Challenges, and Research Directions
by: Chen, Zirui, et al.
Published: (2023)
by: Chen, Zirui, et al.
Published: (2023)
Identification and Tectonic Significance of Ocean Island‐Seamount Systems in the Middle Segment of the Yarlung Zangbo Suture Zone
by: Youpeng Zhang, et al.
Published: (2026)
by: Youpeng Zhang, et al.
Published: (2026)
Derived Weil Representation and Relative Langlands Duality
by: Fu, Haoshuo
Published: (2026)
by: Fu, Haoshuo
Published: (2026)
Structure Modeling Activation Free Fourier Network for Spacecraft Image Denoising
by: Yang, Jingfan, et al.
Published: (2024)
by: Yang, Jingfan, et al.
Published: (2024)
Safe-SD: Safe and Traceable Stable Diffusion with Text Prompt Trigger for Invisible Generative Watermarking
by: Ma, Zhiyuan, et al.
Published: (2024)
by: Ma, Zhiyuan, et al.
Published: (2024)
TaCo: Capturing Spatio-Temporal Semantic Consistency in Remote Sensing Change Detection
by: Guo, Han, et al.
Published: (2025)
by: Guo, Han, et al.
Published: (2025)
Context-Aware Autoregressive Models for Multi-Conditional Image Generation
by: Chen, Yixiao, et al.
Published: (2025)
by: Chen, Yixiao, et al.
Published: (2025)
STIV: Scalable Text and Image Conditioned Video Generation
by: Lin, Zongyu, et al.
Published: (2024)
by: Lin, Zongyu, et al.
Published: (2024)
UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation
by: Tian, Rui, et al.
Published: (2025)
by: Tian, Rui, et al.
Published: (2025)
Similar Items
-
Improve Vision Language Model Chain-of-thought Reasoning
by: Zhang, Ruohong, et al.
Published: (2024) -
EC-DIT: Scaling Diffusion Transformers with Adaptive Expert-Choice Routing
by: Sun, Haotian, et al.
Published: (2024) -
Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models
by: Zhang, Haotian, et al.
Published: (2024) -
MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning
by: Zhang, Haotian, et al.
Published: (2024) -
MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA
by: Ye, Hanrong, et al.
Published: (2024)