Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Jiao, Qirui, Chen, Daoyuan, Huang, Yilun, Ding, Bolin, Li, Yaliang, Shen, Ying |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
From Training-Free to Adaptive: Empirical Insights into MLLMs' Understanding of Detection Information
von: Jiao, Qirui, et al.
Veröffentlicht: (2024)
von: Jiao, Qirui, et al.
Veröffentlicht: (2024)
DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?
von: Jiao, Qirui, et al.
Veröffentlicht: (2025)
von: Jiao, Qirui, et al.
Veröffentlicht: (2025)
HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks
von: Zhou, Ting, et al.
Veröffentlicht: (2024)
von: Zhou, Ting, et al.
Veröffentlicht: (2024)
Data-Juicer Sandbox: A Feedback-Driven Suite for Multimodal Data-Model Co-development
von: Chen, Daoyuan, et al.
Veröffentlicht: (2024)
von: Chen, Daoyuan, et al.
Veröffentlicht: (2024)
The Synergy between Data and Multi-Modal Large Language Models: A Survey from Co-Development Perspective
von: Qin, Zhen, et al.
Veröffentlicht: (2024)
von: Qin, Zhen, et al.
Veröffentlicht: (2024)
MindGYM: What Matters in Question Synthesis for Thinking-Centric Fine-Tuning?
von: Xu, Zhe, et al.
Veröffentlicht: (2025)
von: Xu, Zhe, et al.
Veröffentlicht: (2025)
ArtAug: Enhancing Text-to-Image Generation through Synthesis-Understanding Interaction
von: Duan, Zhongjie, et al.
Veröffentlicht: (2024)
von: Duan, Zhongjie, et al.
Veröffentlicht: (2024)
ImgTrojan: Jailbreaking Vision-Language Models with ONE Image
von: Tao, Xijia, et al.
Veröffentlicht: (2024)
von: Tao, Xijia, et al.
Veröffentlicht: (2024)
ImgCoT: Compressing Long Chain of Thought into Compact Visual Tokens for Efficient Reasoning of Large Language Model
von: Chen, Xiaoshu, et al.
Veröffentlicht: (2026)
von: Chen, Xiaoshu, et al.
Veröffentlicht: (2026)
SegGen: Supercharging Segmentation Models with Text2Mask and Mask2Img Synthesis
von: Ye, Hanrong, et al.
Veröffentlicht: (2023)
von: Ye, Hanrong, et al.
Veröffentlicht: (2023)
ArchSIBench: Benchmarking the Architectural Spatial Intelligence of Vision-Language Models
von: Shen, Qirui, et al.
Veröffentlicht: (2026)
von: Shen, Qirui, et al.
Veröffentlicht: (2026)
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
von: Wang, Yizhou, et al.
Veröffentlicht: (2025)
von: Wang, Yizhou, et al.
Veröffentlicht: (2025)
Towards a Multimodal Large Language Model with Pixel-Level Insight for Biomedicine
von: Huang, Xiaoshuang, et al.
Veröffentlicht: (2024)
von: Huang, Xiaoshuang, et al.
Veröffentlicht: (2024)
Adversarial Prompt Injection Attack on Multimodal Large Language Models
von: Ding, Meiwen, et al.
Veröffentlicht: (2026)
von: Ding, Meiwen, et al.
Veröffentlicht: (2026)
HieraFashDiff: Hierarchical Fashion Design with Multi-stage Diffusion Models
von: Xie, Zhifeng, et al.
Veröffentlicht: (2024)
von: Xie, Zhifeng, et al.
Veröffentlicht: (2024)
Active-O3: Empowering Multimodal Large Language Models with Active Perception via GRPO
von: Zhu, Muzhi, et al.
Veröffentlicht: (2025)
von: Zhu, Muzhi, et al.
Veröffentlicht: (2025)
Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding
von: Li, Yinghui, et al.
Veröffentlicht: (2026)
von: Li, Yinghui, et al.
Veröffentlicht: (2026)
6Img-to-3D: Few-Image Large-Scale Outdoor Driving Scene Reconstruction
von: Gieruc, Théo, et al.
Veröffentlicht: (2024)
von: Gieruc, Théo, et al.
Veröffentlicht: (2024)
Img2Loc: Revisiting Image Geolocalization using Multi-modality Foundation Models and Image-based Retrieval-Augmented Generation
von: Zhou, Zhongliang, et al.
Veröffentlicht: (2024)
von: Zhou, Zhongliang, et al.
Veröffentlicht: (2024)
DisCo-Diff: Enhancing Continuous Diffusion Models with Discrete Latents
von: Xu, Yilun, et al.
Veröffentlicht: (2024)
von: Xu, Yilun, et al.
Veröffentlicht: (2024)
Toward Cognitive Supersensing in Multimodal Large Language Model
von: Li, Boyi, et al.
Veröffentlicht: (2026)
von: Li, Boyi, et al.
Veröffentlicht: (2026)
Contextual Object Detection with Multimodal Large Language Models
von: Zang, Yuhang, et al.
Veröffentlicht: (2023)
von: Zang, Yuhang, et al.
Veröffentlicht: (2023)
Genixer: Empowering Multimodal Large Language Models as a Powerful Data Generator
von: Zhao, Henry Hengyuan, et al.
Veröffentlicht: (2023)
von: Zhao, Henry Hengyuan, et al.
Veröffentlicht: (2023)
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
von: Zhang, Zilun, et al.
Veröffentlicht: (2025)
von: Zhang, Zilun, et al.
Veröffentlicht: (2025)
EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
von: Qiu, Lu, et al.
Veröffentlicht: (2024)
von: Qiu, Lu, et al.
Veröffentlicht: (2024)
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
von: Sun, Fengyuan, et al.
Veröffentlicht: (2025)
von: Sun, Fengyuan, et al.
Veröffentlicht: (2025)
Can Multimodal Large Language Models Truly Understand Small Objects?
von: Han, Fujun, et al.
Veröffentlicht: (2026)
von: Han, Fujun, et al.
Veröffentlicht: (2026)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
von: Ye, Zhipeng, et al.
Veröffentlicht: (2026)
von: Ye, Zhipeng, et al.
Veröffentlicht: (2026)
A Survey on Benchmarks of Multimodal Large Language Models
von: Li, Jian, et al.
Veröffentlicht: (2024)
von: Li, Jian, et al.
Veröffentlicht: (2024)
AgroNVILA: Perception-Reasoning Decoupling for Multi-view Agricultural Multimodal Large Language Models
von: Zhang, Jiarui, et al.
Veröffentlicht: (2026)
von: Zhang, Jiarui, et al.
Veröffentlicht: (2026)
Model Composition for Multimodal Large Language Models
von: Chen, Chi, et al.
Veröffentlicht: (2024)
von: Chen, Chi, et al.
Veröffentlicht: (2024)
What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models
von: Fan, Yingqi, et al.
Veröffentlicht: (2026)
von: Fan, Yingqi, et al.
Veröffentlicht: (2026)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
von: Shen, Yuxiang, et al.
Veröffentlicht: (2026)
von: Shen, Yuxiang, et al.
Veröffentlicht: (2026)
DiffCAP: Diffusion-based Cumulative Adversarial Purification for Vision Language Models
von: Fu, Jia, et al.
Veröffentlicht: (2025)
von: Fu, Jia, et al.
Veröffentlicht: (2025)
Language Models Can See Better: Visual Contrastive Decoding For LLM Multimodal Reasoning
von: Pang, Yuqi, et al.
Veröffentlicht: (2025)
von: Pang, Yuqi, et al.
Veröffentlicht: (2025)
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
von: Huang, Wenxuan, et al.
Veröffentlicht: (2026)
von: Huang, Wenxuan, et al.
Veröffentlicht: (2026)
Mitigating Hallucinations in Video Large Language Models via Spatiotemporal-Semantic Contrastive Decoding
von: Gao, Yuansheng, et al.
Veröffentlicht: (2026)
von: Gao, Yuansheng, et al.
Veröffentlicht: (2026)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
von: Yin, Jianghao, et al.
Veröffentlicht: (2026)
von: Yin, Jianghao, et al.
Veröffentlicht: (2026)
VDC: Versatile Data Cleanser based on Visual-Linguistic Inconsistency by Multimodal Large Language Models
von: Zhu, Zihao, et al.
Veröffentlicht: (2023)
von: Zhu, Zihao, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
From Training-Free to Adaptive: Empirical Insights into MLLMs' Understanding of Detection Information
von: Jiao, Qirui, et al.
Veröffentlicht: (2024) -
DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?
von: Jiao, Qirui, et al.
Veröffentlicht: (2025) -
HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks
von: Zhou, Ting, et al.
Veröffentlicht: (2024) -
Data-Juicer Sandbox: A Feedback-Driven Suite for Multimodal Data-Model Co-development
von: Chen, Daoyuan, et al.
Veröffentlicht: (2024) -
The Synergy between Data and Multi-Modal Large Language Models: A Survey from Co-Development Perspective
von: Qin, Zhen, et al.
Veröffentlicht: (2024)