Reflexive Guidance: Improving OoDD in Vision-Language Models via Self-Guided Image-Adaptive Concept Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Jihyo, Lee, Seulbi, Hwang, Sangheum |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Focusing Where Vision Matters: Selective Training for Large Vision Language Models via Visual Information Gain
di: Lee, Seulbi, et al.
Pubblicazione: (2026)
di: Lee, Seulbi, et al.
Pubblicazione: (2026)
Enhanced OoD Detection through Cross-Modal Alignment of Multi-Modal Representations
di: Kim, Jeonghyeon, et al.
Pubblicazione: (2025)
di: Kim, Jeonghyeon, et al.
Pubblicazione: (2025)
Localized Concept Erasure in Text-to-Image Diffusion Models via High-Level Representation Misdirection
di: Lee, Uichan, et al.
Pubblicazione: (2026)
di: Lee, Uichan, et al.
Pubblicazione: (2026)
Parallel Rescaling: Rebalancing Consistency Guidance for Personalized Diffusion Models
di: Chae, JungWoo, et al.
Pubblicazione: (2025)
di: Chae, JungWoo, et al.
Pubblicazione: (2025)
StochCA: A Novel Approach for Exploiting Pretrained Models with Cross-Attention
di: Seo, Seungwon, et al.
Pubblicazione: (2024)
di: Seo, Seungwon, et al.
Pubblicazione: (2024)
Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance
di: Choi, June Suk, et al.
Pubblicazione: (2025)
di: Choi, June Suk, et al.
Pubblicazione: (2025)
Unlocking the Capabilities of Masked Generative Models for Image Synthesis via Self-Guidance
di: Hur, Jiwan, et al.
Pubblicazione: (2024)
di: Hur, Jiwan, et al.
Pubblicazione: (2024)
Concept-Guided Prompt Learning for Generalization in Vision-Language Models
di: Zhang, Yi, et al.
Pubblicazione: (2024)
di: Zhang, Yi, et al.
Pubblicazione: (2024)
GTA: Guided Transfer of Spatial Attention from Object-Centric Representations
di: Seo, SeokHyun, et al.
Pubblicazione: (2024)
di: Seo, SeokHyun, et al.
Pubblicazione: (2024)
ClimaOoD: Improving Anomaly Segmentation via Physically Realistic Synthetic Data
di: Liu, Yuxing, et al.
Pubblicazione: (2025)
di: Liu, Yuxing, et al.
Pubblicazione: (2025)
Improving Concept Alignment in Vision-Language Concept Bottleneck Models
di: Selvaraj, Nithish Muthuchamy, et al.
Pubblicazione: (2024)
di: Selvaraj, Nithish Muthuchamy, et al.
Pubblicazione: (2024)
Concept-skill Transferability-based Data Selection for Large Vision-Language Models
di: Lee, Jaewoo, et al.
Pubblicazione: (2024)
di: Lee, Jaewoo, et al.
Pubblicazione: (2024)
Safe and Robust Watermark Injection with a Single OoD Image
di: Yu, Shuyang, et al.
Pubblicazione: (2023)
di: Yu, Shuyang, et al.
Pubblicazione: (2023)
SpatiO: Adaptive Test-Time Orchestration of Vision-Language Agents for Spatial Reasoning
di: Hwang, Chan Yeong, et al.
Pubblicazione: (2026)
di: Hwang, Chan Yeong, et al.
Pubblicazione: (2026)
Generalizing Vision-Language Models with Dedicated Prompt Guidance
di: Li, Xinyao, et al.
Pubblicazione: (2025)
di: Li, Xinyao, et al.
Pubblicazione: (2025)
VLG-CBM: Training Concept Bottleneck Models with Vision-Language Guidance
di: Srivastava, Divyansh, et al.
Pubblicazione: (2024)
di: Srivastava, Divyansh, et al.
Pubblicazione: (2024)
Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining
di: Jang, Hyeonseo, et al.
Pubblicazione: (2026)
di: Jang, Hyeonseo, et al.
Pubblicazione: (2026)
Enhancing Zero-Shot Image Recognition in Vision-Language Models through Human-like Concept Guidance
di: Liu, Hui, et al.
Pubblicazione: (2025)
di: Liu, Hui, et al.
Pubblicazione: (2025)
Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
di: Xiao, Wenli, et al.
Pubblicazione: (2025)
di: Xiao, Wenli, et al.
Pubblicazione: (2025)
Locality-aware Concept Bottleneck Model
di: Jeon, Sujin, et al.
Pubblicazione: (2025)
di: Jeon, Sujin, et al.
Pubblicazione: (2025)
OoDIS: Anomaly Instance Segmentation and Detection Benchmark
di: Nekrasov, Alexey, et al.
Pubblicazione: (2024)
di: Nekrasov, Alexey, et al.
Pubblicazione: (2024)
FrOoDo: Framework for Out-of-Distribution Detection
di: Stieber, Jonathan, et al.
Pubblicazione: (2022)
di: Stieber, Jonathan, et al.
Pubblicazione: (2022)
Vision-Language Model Guided Image Restoration
di: Yang, Cuixin, et al.
Pubblicazione: (2025)
di: Yang, Cuixin, et al.
Pubblicazione: (2025)
Leveraging Vision-Language Models for Improving Domain Generalization in Image Classification
di: Addepalli, Sravanti, et al.
Pubblicazione: (2023)
di: Addepalli, Sravanti, et al.
Pubblicazione: (2023)
SAGE: Accelerating Vision-Language Models via Entropy-Guided Adaptive Speculative Decoding
di: Tong, Yujia, et al.
Pubblicazione: (2026)
di: Tong, Yujia, et al.
Pubblicazione: (2026)
Language-Grounded Multi-Domain Image Translation via Semantic Difference Guidance
di: Ryu, Jongwon, et al.
Pubblicazione: (2026)
di: Ryu, Jongwon, et al.
Pubblicazione: (2026)
Tag2Text: Guiding Vision-Language Model via Image Tagging
di: Huang, Xinyu, et al.
Pubblicazione: (2023)
di: Huang, Xinyu, et al.
Pubblicazione: (2023)
AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
Which Concepts to Forget and How to Refuse? Decomposing Concepts for Continual Unlearning in Large Vision-Language Models
di: Jin, Hyundong, et al.
Pubblicazione: (2026)
di: Jin, Hyundong, et al.
Pubblicazione: (2026)
Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models
di: Yu, Bo, et al.
Pubblicazione: (2026)
di: Yu, Bo, et al.
Pubblicazione: (2026)
General Vision Encoder Features as Guidance in Medical Image Registration
di: Kögl, Fryderyk, et al.
Pubblicazione: (2024)
di: Kögl, Fryderyk, et al.
Pubblicazione: (2024)
GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance
di: Kim, Junhyeok, et al.
Pubblicazione: (2025)
di: Kim, Junhyeok, et al.
Pubblicazione: (2025)
Leveraging Multimodal Large Language Models for All-in-One Image Restoration via a Mixture of Frequency Experts
di: Lee, Eunho, et al.
Pubblicazione: (2026)
di: Lee, Eunho, et al.
Pubblicazione: (2026)
Hierarchical Concept-to-Appearance Guidance for Multi-Subject Image Generation
di: Xu, Yijia, et al.
Pubblicazione: (2026)
di: Xu, Yijia, et al.
Pubblicazione: (2026)
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
JaiLIP: Jailbreaking Vision-Language Models via Loss Guided Image Perturbation
di: Mia, Md Jueal, et al.
Pubblicazione: (2025)
di: Mia, Md Jueal, et al.
Pubblicazione: (2025)
DiffuseHigh: Training-free Progressive High-Resolution Image Synthesis through Structure Guidance
di: Kim, Younghyun, et al.
Pubblicazione: (2024)
di: Kim, Younghyun, et al.
Pubblicazione: (2024)
ConceptPrism: Concept Disentanglement in Personalized Diffusion Models via Residual Token Optimization
di: Kim, Minseo, et al.
Pubblicazione: (2026)
di: Kim, Minseo, et al.
Pubblicazione: (2026)
VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis
di: Chu, Meng, et al.
Pubblicazione: (2025)
di: Chu, Meng, et al.
Pubblicazione: (2025)
Orthogonal Negative Guidance in Attention Feature Space for Text-to-Image Generation
di: Ko, Jungmin, et al.
Pubblicazione: (2026)
di: Ko, Jungmin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Focusing Where Vision Matters: Selective Training for Large Vision Language Models via Visual Information Gain
di: Lee, Seulbi, et al.
Pubblicazione: (2026) -
Enhanced OoD Detection through Cross-Modal Alignment of Multi-Modal Representations
di: Kim, Jeonghyeon, et al.
Pubblicazione: (2025) -
Localized Concept Erasure in Text-to-Image Diffusion Models via High-Level Representation Misdirection
di: Lee, Uichan, et al.
Pubblicazione: (2026) -
Parallel Rescaling: Rebalancing Consistency Guidance for Personalized Diffusion Models
di: Chae, JungWoo, et al.
Pubblicazione: (2025) -
StochCA: A Novel Approach for Exploiting Pretrained Models with Cross-Attention
di: Seo, Seungwon, et al.
Pubblicazione: (2024)