GTMA: Dynamic Representation Optimization for OOD Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Jensen, Liu, Ningyuan, Wang, Keze |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MAT-Agent: Adaptive Multi-Agent Training Optimization
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
Overcoming the Pitfalls of Vision-Language Model Finetuning for OOD Generalization
por: Zang, Yuhang, et al.
Publicado: (2024)
por: Zang, Yuhang, et al.
Publicado: (2024)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains
por: Zhang, Jesen, et al.
Publicado: (2025)
por: Zhang, Jesen, et al.
Publicado: (2025)
Conjugated Semantic Pool Improves OOD Detection with Pre-trained Vision-Language Models
por: Chen, Mengyuan, et al.
Publicado: (2024)
por: Chen, Mengyuan, et al.
Publicado: (2024)
Activation Matters: Test-time Activated Negative Labels for OOD Detection with Vision-Language Models
por: Zhang, Yabin, et al.
Publicado: (2026)
por: Zhang, Yabin, et al.
Publicado: (2026)
AdaNeg: Adaptive Negative Proxy Guided OOD Detection with Vision-Language Models
por: Zhang, Yabin, et al.
Publicado: (2024)
por: Zhang, Yabin, et al.
Publicado: (2024)
LAPT: Label-driven Automated Prompt Tuning for OOD Detection with Vision-Language Models
por: Zhang, Yabin, et al.
Publicado: (2024)
por: Zhang, Yabin, et al.
Publicado: (2024)
Retrieval-Augmented Prompt for OOD Detection
por: Han, Ruisong, et al.
Publicado: (2025)
por: Han, Ruisong, et al.
Publicado: (2025)
The Geometry of Representational Failures in Vision Language Models
por: Savietto, Daniele, et al.
Publicado: (2026)
por: Savietto, Daniele, et al.
Publicado: (2026)
Proto-OOD: Enhancing OOD Object Detection with Prototype Feature Similarity
por: Chen, Junkun, et al.
Publicado: (2024)
por: Chen, Junkun, et al.
Publicado: (2024)
Representation Calibration and Uncertainty Guidance for Class-Incremental Learning based on Vision Language Model
por: Tan, Jiantao, et al.
Publicado: (2025)
por: Tan, Jiantao, et al.
Publicado: (2025)
TTA-OOD: Test-time Augmentation for Improving Out-of-Distribution Detection in Gastrointestinal Vision
por: Pokhrel, Sandesh, et al.
Publicado: (2024)
por: Pokhrel, Sandesh, et al.
Publicado: (2024)
VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation
por: Li, Bo, et al.
Publicado: (2026)
por: Li, Bo, et al.
Publicado: (2026)
Masked Modeling for Self-supervised Representation Learning on Vision and Beyond
por: Li, Siyuan, et al.
Publicado: (2023)
por: Li, Siyuan, et al.
Publicado: (2023)
Towards Effective MLLM Jailbreaking Through Balanced On-Topicness and OOD-Intensity
por: Li, Zuoou, et al.
Publicado: (2025)
por: Li, Zuoou, et al.
Publicado: (2025)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
por: He, Yefei, et al.
Publicado: (2024)
por: He, Yefei, et al.
Publicado: (2024)
ResAgent: Entropy-based Prior Point Discovery and Visual Reasoning for Referring Expression Segmentation
por: Wang, Yihao, et al.
Publicado: (2026)
por: Wang, Yihao, et al.
Publicado: (2026)
3D-Agent:Tri-Modal Multi-Agent Collaboration for Scalable 3D Object Annotation
por: Zhang, Jusheng, et al.
Publicado: (2026)
por: Zhang, Jusheng, et al.
Publicado: (2026)
Dynamic Token Reduction during Generation for Vision Language Models
por: Liang, Xiaoyu, et al.
Publicado: (2025)
por: Liang, Xiaoyu, et al.
Publicado: (2025)
LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model
por: Mei, Xiaodong, et al.
Publicado: (2026)
por: Mei, Xiaodong, et al.
Publicado: (2026)
AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization
por: Liu, Chaohu, et al.
Publicado: (2025)
por: Liu, Chaohu, et al.
Publicado: (2025)
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
por: Liu, Ziyu, et al.
Publicado: (2024)
por: Liu, Ziyu, et al.
Publicado: (2024)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
por: Zhang, Jianke, et al.
Publicado: (2026)
por: Zhang, Jianke, et al.
Publicado: (2026)
PTTA: A Pure Text-to-Animation Framework for High-Quality Creation
por: Chen, Ruiqi, et al.
Publicado: (2025)
por: Chen, Ruiqi, et al.
Publicado: (2025)
LPOI: Listwise Preference Optimization for Vision Language Models
por: Zadeh, Fatemeh Pesaran, et al.
Publicado: (2025)
por: Zadeh, Fatemeh Pesaran, et al.
Publicado: (2025)
Pre-Trained Vision-Language Models as Partial Annotators
por: Wang, Qian-Wei, et al.
Publicado: (2024)
por: Wang, Qian-Wei, et al.
Publicado: (2024)
HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models
por: Zeng, Haoxi, et al.
Publicado: (2025)
por: Zeng, Haoxi, et al.
Publicado: (2025)
Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models
por: Jang, Young Kyun, et al.
Publicado: (2024)
por: Jang, Young Kyun, et al.
Publicado: (2024)
SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments
por: Jiang, Wen, et al.
Publicado: (2026)
por: Jiang, Wen, et al.
Publicado: (2026)
Egocentric Bias in Vision-Language Models
por: Wang, Maijunxian, et al.
Publicado: (2026)
por: Wang, Maijunxian, et al.
Publicado: (2026)
Seeing the Abstract: Translating the Abstract Language for Vision Language Models
por: Talon, Davide, et al.
Publicado: (2025)
por: Talon, Davide, et al.
Publicado: (2025)
Evolving Prompt Adaptation for Vision-Language Models
por: Zhang, Enming, et al.
Publicado: (2026)
por: Zhang, Enming, et al.
Publicado: (2026)
Top-Down Semantic Refinement for Image Captioning
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models
por: Wu, Sihao, et al.
Publicado: (2025)
por: Wu, Sihao, et al.
Publicado: (2025)
Safety Alignment for Vision Language Models
por: Liu, Zhendong, et al.
Publicado: (2024)
por: Liu, Zhendong, et al.
Publicado: (2024)
Demonstrating and Reducing Shortcuts in Vision-Language Representation Learning
por: Bleeker, Maurits, et al.
Publicado: (2024)
por: Bleeker, Maurits, et al.
Publicado: (2024)
\textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation
por: Zhu, Weiye, et al.
Publicado: (2026)
por: Zhu, Weiye, et al.
Publicado: (2026)
Adversarial Prompt Tuning for Vision-Language Models
por: Zhang, Jiaming, et al.
Publicado: (2023)
por: Zhang, Jiaming, et al.
Publicado: (2023)
VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models
por: Gao, Chongkai, et al.
Publicado: (2025)
por: Gao, Chongkai, et al.
Publicado: (2025)
Ejemplares similares
-
MAT-Agent: Adaptive Multi-Agent Training Optimization
por: Zhang, Jusheng, et al.
Publicado: (2025) -
Overcoming the Pitfalls of Vision-Language Model Finetuning for OOD Generalization
por: Zang, Yuhang, et al.
Publicado: (2024) -
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
por: Zhang, Jusheng, et al.
Publicado: (2025) -
Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains
por: Zhang, Jesen, et al.
Publicado: (2025) -
Conjugated Semantic Pool Improves OOD Detection with Pre-trained Vision-Language Models
por: Chen, Mengyuan, et al.
Publicado: (2024)