Self-Supervised Visual Preference Alignment
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhu, Ke, Ge, Zheng, Zhao, Liang, Zhang, Xiangyu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Reconstructive Visual Instruction Tuning
von: Wang, Haochen, et al.
Veröffentlicht: (2024)
von: Wang, Haochen, et al.
Veröffentlicht: (2024)
Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models
von: Li, Shengzhi, et al.
Veröffentlicht: (2024)
von: Li, Shengzhi, et al.
Veröffentlicht: (2024)
Unified Lexical Representation for Interpretable Visual-Language Alignment
von: Li, Yifan, et al.
Veröffentlicht: (2024)
von: Li, Yifan, et al.
Veröffentlicht: (2024)
Continual SFT Matches Multimodal RLHF with Negative Supervision
von: Zhu, Ke, et al.
Veröffentlicht: (2024)
von: Zhu, Ke, et al.
Veröffentlicht: (2024)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)
Preference Alignment for Diffusion Model via Explicit Denoised Distribution Estimation
von: Shi, Dingyuan, et al.
Veröffentlicht: (2024)
von: Shi, Dingyuan, et al.
Veröffentlicht: (2024)
MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment
von: Liu, Jihao, et al.
Veröffentlicht: (2024)
von: Liu, Jihao, et al.
Veröffentlicht: (2024)
Feedback-Driven Vision-Language Alignment with Minimal Human Supervision
von: Giannone, Giorgio, et al.
Veröffentlicht: (2025)
von: Giannone, Giorgio, et al.
Veröffentlicht: (2025)
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
von: Khaki, Saeed, et al.
Veröffentlicht: (2024)
von: Khaki, Saeed, et al.
Veröffentlicht: (2024)
Universal Approximation of Visual Autoregressive Transformers
von: Chen, Yifang, et al.
Veröffentlicht: (2025)
von: Chen, Yifang, et al.
Veröffentlicht: (2025)
Naturally Supervised 3D Visual Grounding with Language-Regularized Concept Learners
von: Feng, Chun, et al.
Veröffentlicht: (2024)
von: Feng, Chun, et al.
Veröffentlicht: (2024)
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
von: Zheng, Naishan, et al.
Veröffentlicht: (2025)
von: Zheng, Naishan, et al.
Veröffentlicht: (2025)
Contrastive-to-Self-Supervised: A Two-Stage Framework for Script Similarity Learning
von: Roman, Claire, et al.
Veröffentlicht: (2026)
von: Roman, Claire, et al.
Veröffentlicht: (2026)
Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start
von: Chen, Kun, et al.
Veröffentlicht: (2025)
von: Chen, Kun, et al.
Veröffentlicht: (2025)
EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation
von: Wang, Yongxin, et al.
Veröffentlicht: (2024)
von: Wang, Yongxin, et al.
Veröffentlicht: (2024)
Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment
von: Chang, Kai-Po, et al.
Veröffentlicht: (2025)
von: Chang, Kai-Po, et al.
Veröffentlicht: (2025)
MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization
von: Zhu, Kangyu, et al.
Veröffentlicht: (2024)
von: Zhu, Kangyu, et al.
Veröffentlicht: (2024)
Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs
von: Pan, Zhiyu, et al.
Veröffentlicht: (2026)
von: Pan, Zhiyu, et al.
Veröffentlicht: (2026)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
von: Lu, Shiyin, et al.
Veröffentlicht: (2024)
von: Lu, Shiyin, et al.
Veröffentlicht: (2024)
Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation
von: Zhu, Mengdan, et al.
Veröffentlicht: (2025)
von: Zhu, Mengdan, et al.
Veröffentlicht: (2025)
Finding Distributed Object-Centric Properties in Self-Supervised Transformers
von: Rawlekar, Samyak, et al.
Veröffentlicht: (2026)
von: Rawlekar, Samyak, et al.
Veröffentlicht: (2026)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
von: Jiang, Jiachen, et al.
Veröffentlicht: (2025)
von: Jiang, Jiachen, et al.
Veröffentlicht: (2025)
Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs
von: Peng, Shangpin, et al.
Veröffentlicht: (2025)
von: Peng, Shangpin, et al.
Veröffentlicht: (2025)
MLLMs-Augmented Visual-Language Representation Learning
von: Liu, Yanqing, et al.
Veröffentlicht: (2023)
von: Liu, Yanqing, et al.
Veröffentlicht: (2023)
Zero-Shot Defense Against Toxic Images via Inherent Multimodal Alignment in LVLMs
von: Zhao, Wei, et al.
Veröffentlicht: (2025)
von: Zhao, Wei, et al.
Veröffentlicht: (2025)
DecisionNCE: Embodied Multimodal Representations via Implicit Preference Learning
von: Li, Jianxiong, et al.
Veröffentlicht: (2024)
von: Li, Jianxiong, et al.
Veröffentlicht: (2024)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
von: Wang, Fei, et al.
Veröffentlicht: (2024)
von: Wang, Fei, et al.
Veröffentlicht: (2024)
Explaining latent representations of generative models with large multimodal models
von: Zhu, Mengdan, et al.
Veröffentlicht: (2024)
von: Zhu, Mengdan, et al.
Veröffentlicht: (2024)
RetinalGPT: A Retinal Clinical Preference Conversational Assistant Powered by Large Vision-Language Models
von: Zhu, Wenhui, et al.
Veröffentlicht: (2025)
von: Zhu, Wenhui, et al.
Veröffentlicht: (2025)
Parrot: Multilingual Visual Instruction Tuning
von: Sun, Hai-Long, et al.
Veröffentlicht: (2024)
von: Sun, Hai-Long, et al.
Veröffentlicht: (2024)
Towards Visual Text Grounding of Multimodal Large Language Model
von: Li, Ming, et al.
Veröffentlicht: (2025)
von: Li, Ming, et al.
Veröffentlicht: (2025)
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
von: Chen, Junying, et al.
Veröffentlicht: (2024)
von: Chen, Junying, et al.
Veröffentlicht: (2024)
MouSi: Poly-Visual-Expert Vision-Language Models
von: Fan, Xiaoran, et al.
Veröffentlicht: (2024)
von: Fan, Xiaoran, et al.
Veröffentlicht: (2024)
PerceptionCLIP: Visual Classification by Inferring and Conditioning on Contexts
von: An, Bang, et al.
Veröffentlicht: (2023)
von: An, Bang, et al.
Veröffentlicht: (2023)
Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models
von: Karamcheti, Siddharth, et al.
Veröffentlicht: (2024)
von: Karamcheti, Siddharth, et al.
Veröffentlicht: (2024)
Learning to Edit Visual Programs with Self-Supervision
von: Jones, R. Kenny, et al.
Veröffentlicht: (2024)
von: Jones, R. Kenny, et al.
Veröffentlicht: (2024)
Impact of Noisy Supervision in Foundation Model Learning
von: Chen, Hao, et al.
Veröffentlicht: (2024)
von: Chen, Hao, et al.
Veröffentlicht: (2024)
MetaMetrics: Calibrating Metrics For Generation Tasks Using Human Preferences
von: Winata, Genta Indra, et al.
Veröffentlicht: (2024)
von: Winata, Genta Indra, et al.
Veröffentlicht: (2024)
Transferring Textual Preferences to Vision-Language Understanding through Model Merging
von: Li, Chen-An, et al.
Veröffentlicht: (2025)
von: Li, Chen-An, et al.
Veröffentlicht: (2025)
Self-Supervised Quantization-Aware Knowledge Distillation
von: Zhao, Kaiqi, et al.
Veröffentlicht: (2024)
von: Zhao, Kaiqi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Reconstructive Visual Instruction Tuning
von: Wang, Haochen, et al.
Veröffentlicht: (2024) -
Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models
von: Li, Shengzhi, et al.
Veröffentlicht: (2024) -
Unified Lexical Representation for Interpretable Visual-Language Alignment
von: Li, Yifan, et al.
Veröffentlicht: (2024) -
Continual SFT Matches Multimodal RLHF with Negative Supervision
von: Zhu, Ke, et al.
Veröffentlicht: (2024) -
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
von: Wang, Xiyao, et al.
Veröffentlicht: (2024)