COCO is "ALL'' You Need for Visual Instruction Fine-tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Han, Xiaotian, Wang, Yiqi, Zhai, Bohan, You, Quanzeng, Yang, Hongxia |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
InfiMM-HD: A Leap Forward in High-Resolution Multimodal Understanding
por: Liu, Haogeng, et al.
Publicado: (2024)
por: Liu, Haogeng, et al.
Publicado: (2024)
Law of Vision Representation in MLLMs
por: Yang, Shijia, et al.
Publicado: (2024)
por: Yang, Shijia, et al.
Publicado: (2024)
Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model
por: Liu, Haogeng, et al.
Publicado: (2024)
por: Liu, Haogeng, et al.
Publicado: (2024)
DreamClear: High-Capacity Real-World Image Restoration with Privacy-Safe Dataset Curation
por: Ai, Yuang, et al.
Publicado: (2024)
por: Ai, Yuang, et al.
Publicado: (2024)
ViTAR: Vision Transformer with Any Resolution
por: Fan, Qihang, et al.
Publicado: (2024)
por: Fan, Qihang, et al.
Publicado: (2024)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
por: Liu, Zikang, et al.
Publicado: (2025)
por: Liu, Zikang, et al.
Publicado: (2025)
InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning
por: Han, Xiaotian, et al.
Publicado: (2024)
por: Han, Xiaotian, et al.
Publicado: (2024)
Learning Stackable and Skippable LEGO Bricks for Efficient, Reconfigurable, and Variable-Resolution Diffusion Modeling
por: Zheng, Huangjie, et al.
Publicado: (2023)
por: Zheng, Huangjie, et al.
Publicado: (2023)
From COCO to COCO-FP: A Deep Dive into Background False Positives for COCO Detectors
por: Liu, Longfei, et al.
Publicado: (2024)
por: Liu, Longfei, et al.
Publicado: (2024)
Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?
por: Yan, Renye, et al.
Publicado: (2026)
por: Yan, Renye, et al.
Publicado: (2026)
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
por: Sinha, Sanchit, et al.
Publicado: (2026)
por: Sinha, Sanchit, et al.
Publicado: (2026)
Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
por: Li, Juncheng, et al.
Publicado: (2023)
por: Li, Juncheng, et al.
Publicado: (2023)
MotIF: Motion Instruction Fine-tuning
por: Hwang, Minyoung, et al.
Publicado: (2024)
por: Hwang, Minyoung, et al.
Publicado: (2024)
You Only Need One Stage: Novel-View Synthesis From A Single Blind Face Image
por: Wang, Taoyue, et al.
Publicado: (2026)
por: Wang, Taoyue, et al.
Publicado: (2026)
ParameterNet: Parameters Are All You Need
por: Han, Kai, et al.
Publicado: (2023)
por: Han, Kai, et al.
Publicado: (2023)
Visually Dehallucinative Instruction Generation: Know What You Don't Know
por: Cha, Sungguk, et al.
Publicado: (2024)
por: Cha, Sungguk, et al.
Publicado: (2024)
COCONut: Modernizing COCO Segmentation
por: Deng, Xueqing, et al.
Publicado: (2024)
por: Deng, Xueqing, et al.
Publicado: (2024)
Generalize Your Face Forgery Detectors: An Insertable Adaptation Module Is All You Need
por: Si, Xiaotian, et al.
Publicado: (2024)
por: Si, Xiaotian, et al.
Publicado: (2024)
FineVision: Open Data Is All You Need
por: Wiedmann, Luis, et al.
Publicado: (2025)
por: Wiedmann, Luis, et al.
Publicado: (2025)
Pix2Cap-COCO: Advancing Visual Comprehension via Pixel-Level Captioning
por: You, Zuyao, et al.
Publicado: (2025)
por: You, Zuyao, et al.
Publicado: (2025)
Fine-tuning MLLMs Without Forgetting Is Easier Than You Think
por: Li, He, et al.
Publicado: (2026)
por: Li, He, et al.
Publicado: (2026)
Oasis: One Image is All You Need for Multimodal Instruction Data Synthesis
por: Zhang, Letian, et al.
Publicado: (2025)
por: Zhang, Letian, et al.
Publicado: (2025)
CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models
por: Zhou, Nan, et al.
Publicado: (2026)
por: Zhou, Nan, et al.
Publicado: (2026)
Point What You Mean: Visually Grounded Instruction Policy
por: Yu, Hang, et al.
Publicado: (2025)
por: Yu, Hang, et al.
Publicado: (2025)
Multi-modal Instruction Tuned LLMs with Fine-grained Visual Perception
por: He, Junwen, et al.
Publicado: (2024)
por: He, Junwen, et al.
Publicado: (2024)
3D-COCO: extension of MS-COCO dataset for image detection and 3D reconstruction modules
por: Bideaux, Maxence, et al.
Publicado: (2024)
por: Bideaux, Maxence, et al.
Publicado: (2024)
IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation
por: Wu, Hao, et al.
Publicado: (2026)
por: Wu, Hao, et al.
Publicado: (2026)
Semantic-guided Fine-tuning of Foundation Model for Long-tailed Visual Recognition
por: Peng, Yufei, et al.
Publicado: (2025)
por: Peng, Yufei, et al.
Publicado: (2025)
Is Discretization Fusion All You Need for Collaborative Perception?
por: Yang, Kang, et al.
Publicado: (2025)
por: Yang, Kang, et al.
Publicado: (2025)
VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction Editing Data and Long Captions
por: Wang, Ziteng, et al.
Publicado: (2025)
por: Wang, Ziteng, et al.
Publicado: (2025)
Fine-Tuning Without Forgetting: Adaptation of YOLOv8 Preserves COCO Performance
por: Gandhi, Vishal, et al.
Publicado: (2025)
por: Gandhi, Vishal, et al.
Publicado: (2025)
Evian: Towards Explainable Visual Instruction-tuning Data Auditing
por: Jia, Zimu, et al.
Publicado: (2026)
por: Jia, Zimu, et al.
Publicado: (2026)
FIND: Fine-tuning Initial Noise Distribution with Policy Optimization for Diffusion Models
por: Chen, Changgu, et al.
Publicado: (2024)
por: Chen, Changgu, et al.
Publicado: (2024)
Robust RGB-T Tracking via Learnable Visual Fourier Prompt Fine-tuning and Modality Fusion Prompt Generation
por: Yang, Hongtao, et al.
Publicado: (2025)
por: Yang, Hongtao, et al.
Publicado: (2025)
Visual Instruction Tuning with Chain of Region-of-Interest
por: Chen, Yixin, et al.
Publicado: (2025)
por: Chen, Yixin, et al.
Publicado: (2025)
Exploiting Layer Normalization Fine-tuning in Visual Transformer Foundation Models for Classification
por: Tan, Zhaorui, et al.
Publicado: (2025)
por: Tan, Zhaorui, et al.
Publicado: (2025)
Efficiency in Focus: LayerNorm as a Catalyst for Fine-tuning Medical Visual Language Pre-trained Models
por: Chen, Jiawei, et al.
Publicado: (2024)
por: Chen, Jiawei, et al.
Publicado: (2024)
Motion Graph Unleashed: A Novel Approach to Video Prediction
por: Zhong, Yiqi, et al.
Publicado: (2024)
por: Zhong, Yiqi, et al.
Publicado: (2024)
Maintaining Structural Integrity in Parameter Spaces for Parameter Efficient Fine-tuning
por: Si, Chongjie, et al.
Publicado: (2024)
por: Si, Chongjie, et al.
Publicado: (2024)
Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation
por: Zhou, Yucheng, et al.
Publicado: (2025)
por: Zhou, Yucheng, et al.
Publicado: (2025)
Ejemplares similares
-
InfiMM-HD: A Leap Forward in High-Resolution Multimodal Understanding
por: Liu, Haogeng, et al.
Publicado: (2024) -
Law of Vision Representation in MLLMs
por: Yang, Shijia, et al.
Publicado: (2024) -
Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model
por: Liu, Haogeng, et al.
Publicado: (2024) -
DreamClear: High-Capacity Real-World Image Restoration with Privacy-Safe Dataset Curation
por: Ai, Yuang, et al.
Publicado: (2024) -
ViTAR: Vision Transformer with Any Resolution
por: Fan, Qihang, et al.
Publicado: (2024)