C3L: Content Correlated Vision-Language Instruction Tuning Data Generation via Contrastive Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Ji, Suo, Wei, Wang, Peng, Zhang, Yanning |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers
par: Ma, Ji, et autres
Publié: (2025)
par: Ma, Ji, et autres
Publié: (2025)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
par: Ma, Ji, et autres
Publié: (2026)
par: Ma, Ji, et autres
Publié: (2026)
Pruning All-Rounder: Rethinking and Improving Inference Efficiency for Large Vision Language Models
par: Suo, Wei, et autres
Publié: (2024)
par: Suo, Wei, et autres
Publié: (2024)
Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models
par: Fu, Mingyu, et autres
Publié: (2025)
par: Fu, Mingyu, et autres
Publié: (2025)
Octopus: Alleviating Hallucination via Dynamic Contrastive Decoding
par: Suo, Wei, et autres
Publié: (2025)
par: Suo, Wei, et autres
Publié: (2025)
A Plug-and-Play Method for Rare Human-Object Interactions Detection by Bridging Domain Gap
par: Zhang, Lijun, et autres
Publié: (2024)
par: Zhang, Lijun, et autres
Publié: (2024)
Hallucination-aware intermediate representation edit in large vision-language models
par: Suo, Wei, et autres
Publié: (2026)
par: Suo, Wei, et autres
Publié: (2026)
InstructTA: Instruction-Tuned Targeted Attack for Large Vision-Language Models
par: Wang, Xunguang, et autres
Publié: (2023)
par: Wang, Xunguang, et autres
Publié: (2023)
DiffV2IR: Visible-to-Infrared Diffusion Model via Vision-Language Understanding
par: Ran, Lingyan, et autres
Publié: (2025)
par: Ran, Lingyan, et autres
Publié: (2025)
Visual Prompt Selection for In-Context Learning Segmentation
par: Suo, Wei, et autres
Publié: (2024)
par: Suo, Wei, et autres
Publié: (2024)
Unifying Visual and Vision-Language Tracking via Contrastive Learning
par: Ma, Yinchao, et autres
Publié: (2024)
par: Ma, Yinchao, et autres
Publié: (2024)
Reflective Instruction Tuning: Mitigating Hallucinations in Large Vision-Language Models
par: Zhang, Jinrui, et autres
Publié: (2024)
par: Zhang, Jinrui, et autres
Publié: (2024)
SlowFastVAD: Video Anomaly Detection via Integrating Simple Detector and RAG-Enhanced Vision-Language Model
par: Ding, Zongcan, et autres
Publié: (2025)
par: Ding, Zongcan, et autres
Publié: (2025)
On the Evaluation and Refinement of Vision-Language Instruction Tuning Datasets
par: Liao, Ning, et autres
Publié: (2023)
par: Liao, Ning, et autres
Publié: (2023)
Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions
par: Ma, Chenrui, et autres
Publié: (2025)
par: Ma, Chenrui, et autres
Publié: (2025)
Generating Content for HDR Deghosting from Frequency View
par: Hu, Tao, et autres
Publié: (2024)
par: Hu, Tao, et autres
Publié: (2024)
SEAGULL: No-reference Image Quality Assessment for Regions of Interest via Vision-Language Instruction Tuning
par: Chen, Zewen, et autres
Publié: (2024)
par: Chen, Zewen, et autres
Publié: (2024)
VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning
par: Luo, Run, et autres
Publié: (2025)
par: Luo, Run, et autres
Publié: (2025)
Ultrasound Vision-Language Alignment via Contrastive Learning
par: Lyu, Zhuoyang, et autres
Publié: (2026)
par: Lyu, Zhuoyang, et autres
Publié: (2026)
Instruction-Free Tuning of Large Vision Language Models for Medical Instruction Following
par: Kang, Myeongkyun, et autres
Publié: (2026)
par: Kang, Myeongkyun, et autres
Publié: (2026)
From Generalist to Specialist: Adapting Vision Language Models via Task-Specific Visual Instruction Tuning
par: Bai, Yang, et autres
Publié: (2024)
par: Bai, Yang, et autres
Publié: (2024)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
par: Cao, Meng, et autres
Publié: (2024)
par: Cao, Meng, et autres
Publié: (2024)
MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine
par: Zhang, Renrui, et autres
Publié: (2024)
par: Zhang, Renrui, et autres
Publié: (2024)
MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning
par: Ma, Yiwei, et autres
Publié: (2025)
par: Ma, Yiwei, et autres
Publié: (2025)
Mitigating Dialogue Hallucination for Large Vision Language Models via Adversarial Instruction Tuning
par: Park, Dongmin, et autres
Publié: (2024)
par: Park, Dongmin, et autres
Publié: (2024)
Compositional Image Retrieval via Instruction-Aware Contrastive Learning
par: Zhong, Wenliang, et autres
Publié: (2024)
par: Zhong, Wenliang, et autres
Publié: (2024)
Visual Prompt Tuning in Null Space for Continual Learning
par: Lu, Yue, et autres
Publié: (2024)
par: Lu, Yue, et autres
Publié: (2024)
Instruction Tuning of Large Language Models for Tabular Data Generation-in One Day
par: Abdollahzadeh, Milad, et autres
Publié: (2025)
par: Abdollahzadeh, Milad, et autres
Publié: (2025)
GLAD: Generalizable Tuning for Vision-Language Models
par: Peng, Yuqi, et autres
Publié: (2025)
par: Peng, Yuqi, et autres
Publié: (2025)
Vision and Intention Boost Large Language Model in Long-Term Action Anticipation
par: Cao, Congqi, et autres
Publié: (2025)
par: Cao, Congqi, et autres
Publié: (2025)
InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
par: Yang, Shuai, et autres
Publié: (2025)
par: Yang, Shuai, et autres
Publié: (2025)
Raw Data Matters: Enhancing Prompt Tuning by Internal Augmentation on Vision-Language Models
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning
par: Bangde, Yashwant Pravinrao, et autres
Publié: (2026)
par: Bangde, Yashwant Pravinrao, et autres
Publié: (2026)
Prescribing the Right Remedy: Mitigating Hallucinations in Large Vision-Language Models via Targeted Instruction Tuning
par: Hu, Rui, et autres
Publié: (2024)
par: Hu, Rui, et autres
Publié: (2024)
SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model
par: Zhan, Yang, et autres
Publié: (2024)
par: Zhan, Yang, et autres
Publié: (2024)
LEGO: Learning EGOcentric Action Frame Generation via Visual Instruction Tuning
par: Lai, Bolin, et autres
Publié: (2023)
par: Lai, Bolin, et autres
Publié: (2023)
World-Consistent Data Generation for Vision-and-Language Navigation
par: Zhong, Yu, et autres
Publié: (2024)
par: Zhong, Yu, et autres
Publié: (2024)
Tuned Contrastive Learning
par: Animesh, Chaitanya, et autres
Publié: (2023)
par: Animesh, Chaitanya, et autres
Publié: (2023)
TAME: Test-Time Adversarial Prompt Tuning via Mixture-of-Experts for Vision-Language Models
par: Wang, Xin, et autres
Publié: (2026)
par: Wang, Xin, et autres
Publié: (2026)
VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer
par: Hou, Yanning, et autres
Publié: (2026)
par: Hou, Yanning, et autres
Publié: (2026)
Documents similaires
-
Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers
par: Ma, Ji, et autres
Publié: (2025) -
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
par: Ma, Ji, et autres
Publié: (2026) -
Pruning All-Rounder: Rethinking and Improving Inference Efficiency for Large Vision Language Models
par: Suo, Wei, et autres
Publié: (2024) -
Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models
par: Fu, Mingyu, et autres
Publié: (2025) -
Octopus: Alleviating Hallucination via Dynamic Contrastive Decoding
par: Suo, Wei, et autres
Publié: (2025)