Salvato in:
| Autori principali: | Yoon, Lauren Hyoseo, Yue, Yisong, Kim, Been |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2507.01201 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale
di: Koepke, A. Sophia, et al.
Pubblicazione: (2026)
di: Koepke, A. Sophia, et al.
Pubblicazione: (2026)
Self-Evolving Visual Concept Library using Vision-Language Critics
di: Sehgal, Atharva, et al.
Pubblicazione: (2025)
di: Sehgal, Atharva, et al.
Pubblicazione: (2025)
Escaping Plato's Cave: Towards the Alignment of 3D and Text Latent Spaces
di: Hadgi, Souhail, et al.
Pubblicazione: (2025)
di: Hadgi, Souhail, et al.
Pubblicazione: (2025)
Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models
di: Wang, Austin, et al.
Pubblicazione: (2026)
di: Wang, Austin, et al.
Pubblicazione: (2026)
Escaping the SpuriVerse: Can Large Vision-Language Models Generalize Beyond Seen Spurious Correlations?
di: Yang, Yiwei, et al.
Pubblicazione: (2025)
di: Yang, Yiwei, et al.
Pubblicazione: (2025)
Re-Align: Aligning Vision Language Models via Retrieval-Augmented Direct Preference Optimization
di: Xing, Shuo, et al.
Pubblicazione: (2025)
di: Xing, Shuo, et al.
Pubblicazione: (2025)
High-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion Decoding
di: Hong, Ji Woo, et al.
Pubblicazione: (2026)
di: Hong, Ji Woo, et al.
Pubblicazione: (2026)
Synchronizing Task Behavior: Aligning Multiple Tasks during Test-Time Training
di: Jeong, Wooseong, et al.
Pubblicazione: (2025)
di: Jeong, Wooseong, et al.
Pubblicazione: (2025)
Test-Time Training for Visual Foresight Vision-Language-Action Models
di: Park, Sangwu, et al.
Pubblicazione: (2026)
di: Park, Sangwu, et al.
Pubblicazione: (2026)
Unsupervised Representation Learning from Sparse Transformation Analysis
di: Song, Yue, et al.
Pubblicazione: (2024)
di: Song, Yue, et al.
Pubblicazione: (2024)
Align Your Tangent: Training Better Consistency Models via Manifold-Aligned Tangents
di: Kim, Beomsu, et al.
Pubblicazione: (2025)
di: Kim, Beomsu, et al.
Pubblicazione: (2025)
Aligned but Stereotypical? The Hidden Influence of System Prompts on Social Bias in LVLM-Based Text-to-Image Models
di: Park, NaHyeon, et al.
Pubblicazione: (2025)
di: Park, NaHyeon, et al.
Pubblicazione: (2025)
Interactive Post-Training for Vision-Language-Action Models
di: Tan, Shuhan, et al.
Pubblicazione: (2025)
di: Tan, Shuhan, et al.
Pubblicazione: (2025)
ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time
di: Ding, Yi, et al.
Pubblicazione: (2024)
di: Ding, Yi, et al.
Pubblicazione: (2024)
Patch-Prompt Aligned Bayesian Prompt Tuning for Vision-Language Models
di: Liu, Xinyang, et al.
Pubblicazione: (2023)
di: Liu, Xinyang, et al.
Pubblicazione: (2023)
Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks
di: Shandilya, Utkarsh, et al.
Pubblicazione: (2025)
di: Shandilya, Utkarsh, et al.
Pubblicazione: (2025)
Split Gibbs Discrete Diffusion Posterior Sampling
di: Chu, Wenda, et al.
Pubblicazione: (2025)
di: Chu, Wenda, et al.
Pubblicazione: (2025)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
Continual Learning in Vision-Language Models via Aligned Model Merging
di: Sokar, Ghada, et al.
Pubblicazione: (2025)
di: Sokar, Ghada, et al.
Pubblicazione: (2025)
Vision Language Models are Biased
di: Vo, An, et al.
Pubblicazione: (2025)
di: Vo, An, et al.
Pubblicazione: (2025)
Gradient-Aligned Calibration for Post-Training Quantization of Diffusion Models
di: Hoang, Dung Anh, et al.
Pubblicazione: (2026)
di: Hoang, Dung Anh, et al.
Pubblicazione: (2026)
VLG-CBM: Training Concept Bottleneck Models with Vision-Language Guidance
di: Srivastava, Divyansh, et al.
Pubblicazione: (2024)
di: Srivastava, Divyansh, et al.
Pubblicazione: (2024)
DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback
di: Chen, Yangyi, et al.
Pubblicazione: (2023)
di: Chen, Yangyi, et al.
Pubblicazione: (2023)
Reinforcement Learning Friendly Vision-Language Model for Minecraft
di: Jiang, Haobin, et al.
Pubblicazione: (2023)
di: Jiang, Haobin, et al.
Pubblicazione: (2023)
Kuramoto Orientation Diffusion Models
di: Song, Yue, et al.
Pubblicazione: (2025)
di: Song, Yue, et al.
Pubblicazione: (2025)
Learning Calibrated Uncertainties for Domain Shift: A Distributionally Robust Learning Approach
di: Wang, Haoxuan, et al.
Pubblicazione: (2020)
di: Wang, Haoxuan, et al.
Pubblicazione: (2020)
Breast Cancer VLMs: Clinically Practical Vision-Language Train-Inference Models
di: Zheng, Shunjie-Fabian, et al.
Pubblicazione: (2025)
di: Zheng, Shunjie-Fabian, et al.
Pubblicazione: (2025)
RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability
di: Park, Jonggwon, et al.
Pubblicazione: (2025)
di: Park, Jonggwon, et al.
Pubblicazione: (2025)
S-GRPO: Unified Post-Training for Large Vision-Language Models
di: Yan, Yuming, et al.
Pubblicazione: (2026)
di: Yan, Yuming, et al.
Pubblicazione: (2026)
Source-Free Domain Adaptation Guided by Vision and Vision-Language Pre-Training
di: Zhang, Wenyu, et al.
Pubblicazione: (2024)
di: Zhang, Wenyu, et al.
Pubblicazione: (2024)
Training Feature Attribution for Vision Models
di: Bacha, Aziz, et al.
Pubblicazione: (2025)
di: Bacha, Aziz, et al.
Pubblicazione: (2025)
On the Use of Anchoring for Training Vision Models
di: Narayanaswamy, Vivek, et al.
Pubblicazione: (2024)
di: Narayanaswamy, Vivek, et al.
Pubblicazione: (2024)
Information Router for Mitigating Modality Dominance in Vision-Language Models
di: Kim, Seulgi, et al.
Pubblicazione: (2026)
di: Kim, Seulgi, et al.
Pubblicazione: (2026)
Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
Training-Free Test-Time Adaptation with Brownian Distance Covariance in Vision-Language Models
di: Zhang, Yi, et al.
Pubblicazione: (2026)
di: Zhang, Yi, et al.
Pubblicazione: (2026)
Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
di: Zhou, Yiyang, et al.
Pubblicazione: (2023)
di: Zhou, Yiyang, et al.
Pubblicazione: (2023)
Voila-A: Aligning Vision-Language Models with User's Gaze Attention
di: Yan, Kun, et al.
Pubblicazione: (2023)
di: Yan, Kun, et al.
Pubblicazione: (2023)
TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks
di: Hu, Yuanze, et al.
Pubblicazione: (2025)
di: Hu, Yuanze, et al.
Pubblicazione: (2025)
CAPA: Contribution-Aware Pruning and FFN Approximation for Efficient Large Vision-Language Models
di: Jha, Samyak, et al.
Pubblicazione: (2026)
di: Jha, Samyak, et al.
Pubblicazione: (2026)
Mitigating Hallucinations in Vision-Language Models through Image-Guided Head Suppression
di: Sarkar, Sreetama, et al.
Pubblicazione: (2025)
di: Sarkar, Sreetama, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale
di: Koepke, A. Sophia, et al.
Pubblicazione: (2026) -
Self-Evolving Visual Concept Library using Vision-Language Critics
di: Sehgal, Atharva, et al.
Pubblicazione: (2025) -
Escaping Plato's Cave: Towards the Alignment of 3D and Text Latent Spaces
di: Hadgi, Souhail, et al.
Pubblicazione: (2025) -
Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models
di: Wang, Austin, et al.
Pubblicazione: (2026) -
Escaping the SpuriVerse: Can Large Vision-Language Models Generalize Beyond Seen Spurious Correlations?
di: Yang, Yiwei, et al.
Pubblicazione: (2025)