MultiModal Fine-tuning with Synthetic Captions
Fuente:
arXiv
Saved in:
| Main Authors: | Enomoto, Shohei, Yamaguchi, Shin'ya |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Test-time Similarity Modification for Person Re-identification toward Temporal Distribution Shift
by: Adachi, Kazuki, et al.
Published: (2024)
by: Adachi, Kazuki, et al.
Published: (2024)
Adaptive Random Feature Regularization on Fine-tuning Deep Neural Networks
by: Yamaguchi, Shin'ya, et al.
Published: (2024)
by: Yamaguchi, Shin'ya, et al.
Published: (2024)
Test-time Adaptation Meets Image Enhancement: Improving Accuracy via Uncertainty-aware Logit Switching
by: Enomoto, Shohei, et al.
Published: (2024)
by: Enomoto, Shohei, et al.
Published: (2024)
Uniformity First: Uniformity-aware Test-time Adaptation of Vision-language Models against Image Corruption
by: Adachi, Kazuki, et al.
Published: (2025)
by: Adachi, Kazuki, et al.
Published: (2025)
Learning Robust Convolutional Neural Networks with Relevant Feature Focusing via Explanations
by: Adachi, Kazuki, et al.
Published: (2022)
by: Adachi, Kazuki, et al.
Published: (2022)
Explanation Bottleneck Models
by: Yamaguchi, Shin'ya, et al.
Published: (2024)
by: Yamaguchi, Shin'ya, et al.
Published: (2024)
CapS-Adapter: Caption-based MultiModal Adapter in Zero-Shot Classification
by: Wang, Qijie, et al.
Published: (2024)
by: Wang, Qijie, et al.
Published: (2024)
Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought
by: Yamaguchi, Shin'ya, et al.
Published: (2025)
by: Yamaguchi, Shin'ya, et al.
Published: (2025)
Pseudo Multi-Source Domain Generalization: Bridging the Gap Between Single and Multi-Source Domain Generalization
by: Enomoto, Shohei
Published: (2025)
by: Enomoto, Shohei
Published: (2025)
Enhancing Visual Prompting through Expanded Transformation Space and Overfitting Mitigation
by: Enomoto, Shohei
Published: (2025)
by: Enomoto, Shohei
Published: (2025)
Difference Vector Equalization for Robust Fine-tuning of Vision-Language Models
by: Suzuki, Satoshi, et al.
Published: (2025)
by: Suzuki, Satoshi, et al.
Published: (2025)
Post-pre-training for Modality Alignment in Vision-Language Foundation Models
by: Yamaguchi, Shin'ya, et al.
Published: (2025)
by: Yamaguchi, Shin'ya, et al.
Published: (2025)
MultiModal Action Conditioned Video Generation
by: Li, Yichen, et al.
Published: (2025)
by: Li, Yichen, et al.
Published: (2025)
Understanding Pure Textual Reasoning for Blind Image Quality Assessment
by: Li, Yuan, et al.
Published: (2026)
by: Li, Yuan, et al.
Published: (2026)
Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models
by: Zeng, Zhen, et al.
Published: (2024)
by: Zeng, Zhen, et al.
Published: (2024)
Parallel In-context Learning for Large Vision Language Models
by: Yamaguchi, Shin'ya, et al.
Published: (2026)
by: Yamaguchi, Shin'ya, et al.
Published: (2026)
Zero-shot Concept Bottleneck Models
by: Yamaguchi, Shin'ya, et al.
Published: (2025)
by: Yamaguchi, Shin'ya, et al.
Published: (2025)
EntProp: High Entropy Propagation for Improving Accuracy and Robustness
by: Enomoto, Shohei
Published: (2024)
by: Enomoto, Shohei
Published: (2024)
M3: 3D-Spatial MultiModal Memory
by: Zou, Xueyan, et al.
Published: (2025)
by: Zou, Xueyan, et al.
Published: (2025)
MMA-Diffusion: MultiModal Attack on Diffusion Models
by: Yang, Yijun, et al.
Published: (2023)
by: Yang, Yijun, et al.
Published: (2023)
Re-M3Dr: Rebalanced MultiModal Mean Deviation Regression
by: Yin, Haojie, et al.
Published: (2026)
by: Yin, Haojie, et al.
Published: (2026)
ControlEdit: A MultiModal Local Clothing Image Editing Method
by: Cheng, Di, et al.
Published: (2024)
by: Cheng, Di, et al.
Published: (2024)
ProM3E: Probabilistic Masked MultiModal Embedding Model for Ecology
by: Sastry, Srikumar, et al.
Published: (2025)
by: Sastry, Srikumar, et al.
Published: (2025)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
by: Hao, Yunzhuo, et al.
Published: (2025)
by: Hao, Yunzhuo, et al.
Published: (2025)
MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning
by: Zheng, Xuhui, et al.
Published: (2025)
by: Zheng, Xuhui, et al.
Published: (2025)
HAMMR: HierArchical MultiModal React agents for generic VQA
by: Castrejon, Lluis, et al.
Published: (2024)
by: Castrejon, Lluis, et al.
Published: (2024)
LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models
by: Qiu, Han, et al.
Published: (2024)
by: Qiu, Han, et al.
Published: (2024)
Building Reasonable Inference for Vision-Language Models in Blind Image Quality Assessment
by: Li, Yuan, et al.
Published: (2025)
by: Li, Yuan, et al.
Published: (2025)
Investigate the Low-level Visual Perception in Vision-Language based Image Quality Assessment
by: Li, Yuan, et al.
Published: (2025)
by: Li, Yuan, et al.
Published: (2025)
CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder
by: Ma, Lichen, et al.
Published: (2024)
by: Ma, Lichen, et al.
Published: (2024)
TeamPath: Building MultiModal Pathology Experts with Reasoning AI Copilots
by: Liu, Tianyu, et al.
Published: (2025)
by: Liu, Tianyu, et al.
Published: (2025)
MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings
by: Li, Zijie, et al.
Published: (2026)
by: Li, Zijie, et al.
Published: (2026)
Dynamic Test-Time Augmentation via Differentiable Functions
by: Enomoto, Shohei, et al.
Published: (2022)
by: Enomoto, Shohei, et al.
Published: (2022)
M3FAS: An Accurate and Robust MultiModal Mobile Face Anti-Spoofing System
by: Kong, Chenqi, et al.
Published: (2023)
by: Kong, Chenqi, et al.
Published: (2023)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
by: Chen, Yuheng, et al.
Published: (2026)
by: Chen, Yuheng, et al.
Published: (2026)
MMA-DFER: MultiModal Adaptation of unimodal models for Dynamic Facial Expression Recognition in-the-wild
by: Chumachenko, Kateryna, et al.
Published: (2024)
by: Chumachenko, Kateryna, et al.
Published: (2024)
M$^2$CD: A Unified MultiModal Framework for Optical-SAR Change Detection with Mixture of Experts and Self-Distillation
by: Liu, Ziyuan, et al.
Published: (2025)
by: Liu, Ziyuan, et al.
Published: (2025)
M3R: Localized Rainfall Nowcasting with Meteorology-Informed MultiModal Attention
by: Panta, Sanjeev, et al.
Published: (2026)
by: Panta, Sanjeev, et al.
Published: (2026)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
by: Yan, Bei, et al.
Published: (2024)
by: Yan, Bei, et al.
Published: (2024)
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding
by: Zou, Heqing, et al.
Published: (2024)
by: Zou, Heqing, et al.
Published: (2024)
Similar Items
-
Test-time Similarity Modification for Person Re-identification toward Temporal Distribution Shift
by: Adachi, Kazuki, et al.
Published: (2024) -
Adaptive Random Feature Regularization on Fine-tuning Deep Neural Networks
by: Yamaguchi, Shin'ya, et al.
Published: (2024) -
Test-time Adaptation Meets Image Enhancement: Improving Accuracy via Uncertainty-aware Logit Switching
by: Enomoto, Shohei, et al.
Published: (2024) -
Uniformity First: Uniformity-aware Test-time Adaptation of Vision-language Models against Image Corruption
by: Adachi, Kazuki, et al.
Published: (2025) -
Learning Robust Convolutional Neural Networks with Relevant Feature Focusing via Explanations
by: Adachi, Kazuki, et al.
Published: (2022)