ICONS: Influence Consensus for Vision-Language Data Selection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Xindi, Xia, Mengzhou, Shao, Rulin, Deng, Zhiwei, Koh, Pang Wei, Russakovsky, Olga |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Vision-Language Dataset Distillation
par: Wu, Xindi, et autres
Publié: (2023)
par: Wu, Xindi, et autres
Publié: (2023)
Beyond Objects: Contextual Synthetic Data Generation for Fine-Grained Classification
par: Yang, William, et autres
Publié: (2025)
par: Yang, William, et autres
Publié: (2025)
Analyzing the Roles of Language and Vision in Learning from Limited Data
par: Chen, Allison, et autres
Publié: (2024)
par: Chen, Allison, et autres
Publié: (2024)
ConceptMix: A Compositional Image Generation Benchmark with Controllable Difficulty
par: Wu, Xindi, et autres
Publié: (2024)
par: Wu, Xindi, et autres
Publié: (2024)
Visual Compositional Tuning
par: Wu, Xindi, et autres
Publié: (2025)
par: Wu, Xindi, et autres
Publié: (2025)
Exploring How Generative MLLMs Perceive More Than CLIP with the Same Vision Encoder
par: Li, Siting, et autres
Publié: (2024)
par: Li, Siting, et autres
Publié: (2024)
Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning
par: Xu, Zhiyang, et autres
Publié: (2024)
par: Xu, Zhiyang, et autres
Publié: (2024)
CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs
par: Wang, Zirui, et autres
Publié: (2024)
par: Wang, Zirui, et autres
Publié: (2024)
Unifying Specialized Visual Encoders for Video Language Models
par: Chung, Jihoon, et autres
Publié: (2025)
par: Chung, Jihoon, et autres
Publié: (2025)
Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models
par: Weng, Fenghua, et autres
Publié: (2025)
par: Weng, Fenghua, et autres
Publié: (2025)
A Sampling-Based Domain Generalization Study with Diffusion Generative Models
par: Zhu, Ye, et autres
Publié: (2023)
par: Zhu, Ye, et autres
Publié: (2023)
CAST: Cross-modal Alignment Similarity Test for Vision Language Models
par: Dagan, Gautier, et autres
Publié: (2024)
par: Dagan, Gautier, et autres
Publié: (2024)
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
par: Deng, Yihe, et autres
Publié: (2025)
par: Deng, Yihe, et autres
Publié: (2025)
Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models
par: Wang, Weihang, et autres
Publié: (2025)
par: Wang, Weihang, et autres
Publié: (2025)
Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
par: Zha, Yuheng, et autres
Publié: (2025)
par: Zha, Yuheng, et autres
Publié: (2025)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
par: Deng, Yihe, et autres
Publié: (2024)
par: Deng, Yihe, et autres
Publié: (2024)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
par: Ye, Jiacheng, et autres
Publié: (2025)
par: Ye, Jiacheng, et autres
Publié: (2025)
MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
par: Zhang, Yin, et autres
Publié: (2026)
par: Zhang, Yin, et autres
Publié: (2026)
Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling
par: Chen, Qiyuan, et autres
Publié: (2026)
par: Chen, Qiyuan, et autres
Publié: (2026)
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
par: Wang, Zihu, et autres
Publié: (2025)
par: Wang, Zihu, et autres
Publié: (2025)
Video Models Reason Early: Exploiting Plan Commitment for Maze Solving
par: Newman, Kaleb, et autres
Publié: (2026)
par: Newman, Kaleb, et autres
Publié: (2026)
ImageNet-OOD: Deciphering Modern Out-of-Distribution Detection Algorithms
par: Yang, William, et autres
Publié: (2023)
par: Yang, William, et autres
Publié: (2023)
D2D: Detector-to-Differentiable Critic for Improved Numeracy in Text-to-Image Generation
par: Yoo, Nobline, et autres
Publié: (2025)
par: Yoo, Nobline, et autres
Publié: (2025)
JPEG-LM: LLMs as Image Generators with Canonical Codec Representations
par: Han, Xiaochuang, et autres
Publié: (2024)
par: Han, Xiaochuang, et autres
Publié: (2024)
FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models
par: Cai, Hengxing, et autres
Publié: (2025)
par: Cai, Hengxing, et autres
Publié: (2025)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
par: Wu, Xueqing, et autres
Publié: (2026)
par: Wu, Xueqing, et autres
Publié: (2026)
VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models
par: Kumar, Gokul Karthik, et autres
Publié: (2025)
par: Kumar, Gokul Karthik, et autres
Publié: (2025)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
par: Li, Yue, et autres
Publié: (2025)
par: Li, Yue, et autres
Publié: (2025)
Few-Shot Adversarial Prompt Learning on Vision-Language Models
par: Zhou, Yiwei, et autres
Publié: (2024)
par: Zhou, Yiwei, et autres
Publié: (2024)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
par: Lee, Kang-il, et autres
Publié: (2024)
par: Lee, Kang-il, et autres
Publié: (2024)
PUMGPT: A Large Vision-Language Model for Product Understanding
par: Xue, Wei, et autres
Publié: (2023)
par: Xue, Wei, et autres
Publié: (2023)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
par: Jian, Pu, et autres
Publié: (2025)
par: Jian, Pu, et autres
Publié: (2025)
Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models
par: Shao, Zhenwei, et autres
Publié: (2025)
par: Shao, Zhenwei, et autres
Publié: (2025)
Enhancing Fine-Grained Image Classifications via Cascaded Vision Language Models
par: Wei, Canshi
Publié: (2024)
par: Wei, Canshi
Publié: (2024)
SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models
par: Lim, Gyubeum, et autres
Publié: (2025)
par: Lim, Gyubeum, et autres
Publié: (2025)
Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts
par: Wu, Jialin, et autres
Publié: (2023)
par: Wu, Jialin, et autres
Publié: (2023)
LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
par: Irawan, Patrick Amadeus, et autres
Publié: (2026)
par: Irawan, Patrick Amadeus, et autres
Publié: (2026)
The Hard Positive Truth about Vision-Language Compositionality
par: Kamath, Amita, et autres
Publié: (2024)
par: Kamath, Amita, et autres
Publié: (2024)
Scalable Vision Language Model Training via High Quality Data Curation
par: Dong, Hongyuan, et autres
Publié: (2025)
par: Dong, Hongyuan, et autres
Publié: (2025)
HPE-CogVLM: Advancing Vision Language Models with a Head Pose Grounding Task
par: Tian, Yu, et autres
Publié: (2024)
par: Tian, Yu, et autres
Publié: (2024)
Documents similaires
-
Vision-Language Dataset Distillation
par: Wu, Xindi, et autres
Publié: (2023) -
Beyond Objects: Contextual Synthetic Data Generation for Fine-Grained Classification
par: Yang, William, et autres
Publié: (2025) -
Analyzing the Roles of Language and Vision in Learning from Limited Data
par: Chen, Allison, et autres
Publié: (2024) -
ConceptMix: A Compositional Image Generation Benchmark with Controllable Difficulty
par: Wu, Xindi, et autres
Publié: (2024) -
Visual Compositional Tuning
par: Wu, Xindi, et autres
Publié: (2025)