MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Haotian, Gao, Mingfei, Gan, Zhe, Dufter, Philipp, Wenzel, Nina, Huang, Forrest, Shah, Dhruti, Du, Xianzhi, Zhang, Bowen, Li, Yanghao, Dodge, Sam, You, Keen, Yang, Zhen, Timofeev, Aleksei, Xu, Mingze, Chen, Hong-You, Fauconnier, Jean-Philippe, Lai, Zhengfeng, You, Haoxuan, Wang, Zirui, Dehghan, Afshin, Grasch, Peter, Yang, Yinfei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MM-Spatial: Exploring 3D Spatial Understanding in Multimodal LLMs
par: Daxberger, Erik, et autres
Publié: (2025)
par: Daxberger, Erik, et autres
Publié: (2025)
SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models
par: Xu, Mingze, et autres
Publié: (2024)
par: Xu, Mingze, et autres
Publié: (2024)
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
par: Amirloo, Elmira, et autres
Publié: (2024)
par: Amirloo, Elmira, et autres
Publié: (2024)
SlowFast-LLaVA-1.5: A Family of Token-Efficient Video Large Language Models for Long-Form Video Understanding
par: Xu, Mingze, et autres
Publié: (2025)
par: Xu, Mingze, et autres
Publié: (2025)
MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA
par: Ye, Hanrong, et autres
Publié: (2024)
par: Ye, Hanrong, et autres
Publié: (2024)
Contrastive Localized Language-Image Pre-Training
par: Chen, Hong-You, et autres
Publié: (2024)
par: Chen, Hong-You, et autres
Publié: (2024)
MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training
par: McKinzie, Brandon, et autres
Publié: (2024)
par: McKinzie, Brandon, et autres
Publié: (2024)
UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation
par: Tian, Rui, et autres
Publié: (2025)
par: Tian, Rui, et autres
Publié: (2025)
MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
par: Qian, Yusu, et autres
Publié: (2024)
par: Qian, Yusu, et autres
Publié: (2024)
Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models
par: Zhang, Haotian, et autres
Publié: (2024)
par: Zhang, Haotian, et autres
Publié: (2024)
Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs
par: You, Keen, et autres
Publié: (2024)
par: You, Keen, et autres
Publié: (2024)
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
par: Lai, Zhengfeng, et autres
Publié: (2024)
par: Lai, Zhengfeng, et autres
Publié: (2024)
UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning
par: Tian, Rui, et autres
Publié: (2025)
par: Tian, Rui, et autres
Publié: (2025)
AToken: A Unified Tokenizer for Vision
par: Lu, Jiasen, et autres
Publié: (2025)
par: Lu, Jiasen, et autres
Publié: (2025)
VeCLIP: Improving CLIP Training via Visual-enriched Captions
par: Lai, Zhengfeng, et autres
Publié: (2023)
par: Lai, Zhengfeng, et autres
Publié: (2023)
MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
par: Li, Yanghao, et autres
Publié: (2025)
par: Li, Yanghao, et autres
Publié: (2025)
Towards Strategic Persuasion with Language Models
par: Cheng, Zirui, et autres
Publié: (2025)
par: Cheng, Zirui, et autres
Publié: (2025)
CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling
par: Wang, Xinze, et autres
Publié: (2025)
par: Wang, Xinze, et autres
Publié: (2025)
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant
par: Wang, Haibo, et autres
Publié: (2025)
par: Wang, Haibo, et autres
Publié: (2025)
Ferret-UI 2: Mastering Universal User Interface Understanding Across Platforms
par: Li, Zhangheng, et autres
Publié: (2024)
par: Li, Zhangheng, et autres
Publié: (2024)
How Does the Textual Information Affect the Retrieval of Multimodal In-Context Learning?
par: Luo, Yang, et autres
Publié: (2024)
par: Luo, Yang, et autres
Publié: (2024)
Diffuse to Detect: A Generalizable Framework for Anomaly Detection with Diffusion Models Applications to UAVs and Beyond
par: Gong, Mingze, et autres
Publié: (2025)
par: Gong, Mingze, et autres
Publié: (2025)
Interpreting Post colonialism in Ben Okri’s The Famished Road
par: Dhruti Raval
Publié: (2019)
par: Dhruti Raval
Publié: (2019)
Ferret-UI Lite: Lessons from Building Small On-Device GUI Agents
par: Yang, Zhen, et autres
Publié: (2025)
par: Yang, Zhen, et autres
Publié: (2025)
ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal Parallelism
par: Liu, Zedong, et autres
Publié: (2025)
par: Liu, Zedong, et autres
Publié: (2025)
SO-Bench: A Structural Output Evaluation of Multimodal LLMs
par: Feng, Di, et autres
Publié: (2025)
par: Feng, Di, et autres
Publié: (2025)
MOFI: Learning Image Representations from Noisy Entity Annotated Images
par: Wu, Wentao, et autres
Publié: (2023)
par: Wu, Wentao, et autres
Publié: (2023)
Decentralized Re-equilibration and Comparative Statics in Matching Markets with Contracts
par: Yang, Yi-You
Publié: (2023)
par: Yang, Yi-You
Publié: (2023)
Improve Vision Language Model Chain-of-thought Reasoning
par: Zhang, Ruohong, et autres
Publié: (2024)
par: Zhang, Ruohong, et autres
Publié: (2024)
Plug-and-Play 1.x-Bit KV Cache Quantization for Video Large Language Models
par: Tao, Keda, et autres
Publié: (2025)
par: Tao, Keda, et autres
Publié: (2025)
DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
par: Tao, Keda, et autres
Publié: (2024)
par: Tao, Keda, et autres
Publié: (2024)
COCO is "ALL'' You Need for Visual Instruction Fine-tuning
par: Han, Xiaotian, et autres
Publié: (2024)
par: Han, Xiaotian, et autres
Publié: (2024)
When Structure Doesn't Help: LLMs Do Not Read Text-Attributed Graphs as Effectively as We Expected
par: Xu, Haotian, et autres
Publié: (2025)
par: Xu, Haotian, et autres
Publié: (2025)
Rooms from Motion: Un-posed Indoor 3D Object Detection as Localization and Mapping
par: Lazarow, Justin, et autres
Publié: (2025)
par: Lazarow, Justin, et autres
Publié: (2025)
Helen: Optimizing CTR Prediction Models with Frequency-wise Hessian Eigenvalue Regularization
par: Zhu, Zirui, et autres
Publié: (2024)
par: Zhu, Zirui, et autres
Publié: (2024)
Nonlinear spin-Wave Doppler effect for flexible tuning of magnonic frequencies
par: Hou, Jinchen, et autres
Publié: (2026)
par: Hou, Jinchen, et autres
Publié: (2026)
Anderson localization for 1-d quasi-periodic Schrödinger operators with degenerate weights
par: Dong, Yingdu, et autres
Publié: (2026)
par: Dong, Yingdu, et autres
Publié: (2026)
A physics-informed and attention-based graph learning approach for regional electric vehicle charging demand prediction
par: Qu, Haohao, et autres
Publié: (2023)
par: Qu, Haohao, et autres
Publié: (2023)
Citywide Electric Vehicle Charging Demand Prediction Approach Considering Urban Region and Dynamic Influences
par: Kuang, Haoxuan, et autres
Publié: (2024)
par: Kuang, Haoxuan, et autres
Publié: (2024)
Fusión conceptual y analogía
par: Gilles Fauconnier
Publié: (2005)
par: Gilles Fauconnier
Publié: (2005)
Documents similaires
-
MM-Spatial: Exploring 3D Spatial Understanding in Multimodal LLMs
par: Daxberger, Erik, et autres
Publié: (2025) -
SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models
par: Xu, Mingze, et autres
Publié: (2024) -
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
par: Amirloo, Elmira, et autres
Publié: (2024) -
SlowFast-LLaVA-1.5: A Family of Token-Efficient Video Large Language Models for Long-Form Video Understanding
par: Xu, Mingze, et autres
Publié: (2025) -
MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA
par: Ye, Hanrong, et autres
Publié: (2024)