Seeing the Image: Prioritizing Visual Correlation by Contrastive Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiao, Xin, Wu, Bohong, Wang, Jiacong, Li, Chunyuan, Zhou, Xun, Guo, Haoyuan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
World to Code: Multi-modal Data Generation via Self-Instructed Compositional Captioning and Filtering
par: Wang, Jiacong, et autres
Publié: (2024)
par: Wang, Jiacong, et autres
Publié: (2024)
VGR: Visual Grounded Reasoning
par: Wang, Jiacong, et autres
Publié: (2025)
par: Wang, Jiacong, et autres
Publié: (2025)
A Cross-Modal Rumor Detection Scheme via Contrastive Learning by Exploring Text and Image internal Correlations
par: Ma, Bin, et autres
Publié: (2025)
par: Ma, Bin, et autres
Publié: (2025)
LLaVA-OneVision: Easy Visual Task Transfer
par: Li, Bo, et autres
Publié: (2024)
par: Li, Bo, et autres
Publié: (2024)
Improved Baselines with Visual Instruction Tuning
par: Liu, Haotian, et autres
Publié: (2023)
par: Liu, Haotian, et autres
Publié: (2023)
Benchmarking and Improving Detail Image Caption
par: Dong, Hongyuan, et autres
Publié: (2024)
par: Dong, Hongyuan, et autres
Publié: (2024)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
par: Zhou, Ziwei, et autres
Publié: (2025)
par: Zhou, Ziwei, et autres
Publié: (2025)
More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models
par: Liu, Chengzhi, et autres
Publié: (2025)
par: Liu, Chengzhi, et autres
Publié: (2025)
Symmetrical Visual Contrastive Optimization: Aligning Vision-Language Models with Minimal Contrastive Images
par: Wu, Shengguang, et autres
Publié: (2025)
par: Wu, Shengguang, et autres
Publié: (2025)
VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation
par: Yu, Seonghoon, et autres
Publié: (2026)
par: Yu, Seonghoon, et autres
Publié: (2026)
Chatting with Images for Introspective Visual Thinking
par: Wu, Junfei, et autres
Publié: (2026)
par: Wu, Junfei, et autres
Publié: (2026)
Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Models
par: He, Zoe Wanying, et autres
Publié: (2025)
par: He, Zoe Wanying, et autres
Publié: (2025)
Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology
par: Wang, Haochen, et autres
Publié: (2025)
par: Wang, Haochen, et autres
Publié: (2025)
Seeing Culture: A Benchmark for Visual Reasoning and Grounding
par: Satar, Burak, et autres
Publié: (2025)
par: Satar, Burak, et autres
Publié: (2025)
SAM2Point: Segment Any 3D as Videos in Zero-shot and Promptable Manners
par: Guo, Ziyu, et autres
Publié: (2024)
par: Guo, Ziyu, et autres
Publié: (2024)
Graphic Design with Large Multimodal Model
par: Cheng, Yutao, et autres
Publié: (2024)
par: Cheng, Yutao, et autres
Publié: (2024)
Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
par: Xu, Haolei, et autres
Publié: (2026)
par: Xu, Haolei, et autres
Publié: (2026)
Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding
par: Cho, Beomsik, et autres
Publié: (2025)
par: Cho, Beomsik, et autres
Publié: (2025)
Pixels, Patterns, but No Poetry: To See The World like Humans
par: Gao, Hongcheng, et autres
Publié: (2025)
par: Gao, Hongcheng, et autres
Publié: (2025)
Contrastive Visual Data Augmentation
par: Zhou, Yu, et autres
Publié: (2025)
par: Zhou, Yu, et autres
Publié: (2025)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
par: Zhang, Wenqiao, et autres
Publié: (2024)
par: Zhang, Wenqiao, et autres
Publié: (2024)
Better Language Models Exhibit Higher Visual Alignment
par: Ruthardt, Jona, et autres
Publié: (2024)
par: Ruthardt, Jona, et autres
Publié: (2024)
Medical Image Synthesis via Fine-Grained Image-Text Alignment and Anatomy-Pathology Prompting
par: Chen, Wenting, et autres
Publié: (2024)
par: Chen, Wenting, et autres
Publié: (2024)
MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?
par: Zhang, Renrui, et autres
Publié: (2024)
par: Zhang, Renrui, et autres
Publié: (2024)
See It from My Perspective: How Language Affects Cultural Bias in Image Understanding
par: Ananthram, Amith, et autres
Publié: (2024)
par: Ananthram, Amith, et autres
Publié: (2024)
Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report Generation
par: Chen, Wenting, et autres
Publié: (2023)
par: Chen, Wenting, et autres
Publié: (2023)
Can Visual Encoder Learn to See Arrows?
par: Terashita, Naoyuki, et autres
Publié: (2025)
par: Terashita, Naoyuki, et autres
Publié: (2025)
On the Interplay of Human-AI Alignment,Fairness, and Performance Trade-offs in Medical Imaging
par: Luo, Haozhe, et autres
Publié: (2025)
par: Luo, Haozhe, et autres
Publié: (2025)
AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability
par: Zhao, Fei, et autres
Publié: (2024)
par: Zhao, Fei, et autres
Publié: (2024)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
par: Zhou, Qiji, et autres
Publié: (2024)
par: Zhou, Qiji, et autres
Publié: (2024)
Enhancing Visual Dialog State Tracking through Iterative Object-Entity Alignment in Multi-Round Conversations
par: Pang, Wei, et autres
Publié: (2024)
par: Pang, Wei, et autres
Publié: (2024)
Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models
par: Lee, Yi-Lun, et autres
Publié: (2024)
par: Lee, Yi-Lun, et autres
Publié: (2024)
VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images
par: Zhou, Guanyu, et autres
Publié: (2026)
par: Zhou, Guanyu, et autres
Publié: (2026)
Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation
par: Liang, Yupu, et autres
Publié: (2025)
par: Liang, Yupu, et autres
Publié: (2025)
Unbiased Visual Reasoning with Controlled Visual Inputs
par: Li, Zhaonan, et autres
Publié: (2025)
par: Li, Zhaonan, et autres
Publié: (2025)
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
par: Caffagni, Davide, et autres
Publié: (2025)
par: Caffagni, Davide, et autres
Publié: (2025)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
par: Wang, Xiyao, et autres
Publié: (2024)
par: Wang, Xiyao, et autres
Publié: (2024)
SHAPE : Self-Improved Visual Preference Alignment by Iteratively Generating Holistic Winner
par: Chen, Kejia, et autres
Publié: (2025)
par: Chen, Kejia, et autres
Publié: (2025)
Documents similaires
-
World to Code: Multi-modal Data Generation via Self-Instructed Compositional Captioning and Filtering
par: Wang, Jiacong, et autres
Publié: (2024) -
VGR: Visual Grounded Reasoning
par: Wang, Jiacong, et autres
Publié: (2025) -
A Cross-Modal Rumor Detection Scheme via Contrastive Learning by Exploring Text and Image internal Correlations
par: Ma, Bin, et autres
Publié: (2025) -
LLaVA-OneVision: Easy Visual Task Transfer
par: Li, Bo, et autres
Publié: (2024) -
Improved Baselines with Visual Instruction Tuning
par: Liu, Haotian, et autres
Publié: (2023)