GTMA: Dynamic Representation Optimization for OOD Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Jensen, Liu, Ningyuan, Wang, Keze |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MAT-Agent: Adaptive Multi-Agent Training Optimization
par: Zhang, Jusheng, et autres
Publié: (2025)
par: Zhang, Jusheng, et autres
Publié: (2025)
Overcoming the Pitfalls of Vision-Language Model Finetuning for OOD Generalization
par: Zang, Yuhang, et autres
Publié: (2024)
par: Zang, Yuhang, et autres
Publié: (2024)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
par: Zhang, Jusheng, et autres
Publié: (2025)
par: Zhang, Jusheng, et autres
Publié: (2025)
Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains
par: Zhang, Jesen, et autres
Publié: (2025)
par: Zhang, Jesen, et autres
Publié: (2025)
Conjugated Semantic Pool Improves OOD Detection with Pre-trained Vision-Language Models
par: Chen, Mengyuan, et autres
Publié: (2024)
par: Chen, Mengyuan, et autres
Publié: (2024)
Activation Matters: Test-time Activated Negative Labels for OOD Detection with Vision-Language Models
par: Zhang, Yabin, et autres
Publié: (2026)
par: Zhang, Yabin, et autres
Publié: (2026)
AdaNeg: Adaptive Negative Proxy Guided OOD Detection with Vision-Language Models
par: Zhang, Yabin, et autres
Publié: (2024)
par: Zhang, Yabin, et autres
Publié: (2024)
LAPT: Label-driven Automated Prompt Tuning for OOD Detection with Vision-Language Models
par: Zhang, Yabin, et autres
Publié: (2024)
par: Zhang, Yabin, et autres
Publié: (2024)
Retrieval-Augmented Prompt for OOD Detection
par: Han, Ruisong, et autres
Publié: (2025)
par: Han, Ruisong, et autres
Publié: (2025)
The Geometry of Representational Failures in Vision Language Models
par: Savietto, Daniele, et autres
Publié: (2026)
par: Savietto, Daniele, et autres
Publié: (2026)
Proto-OOD: Enhancing OOD Object Detection with Prototype Feature Similarity
par: Chen, Junkun, et autres
Publié: (2024)
par: Chen, Junkun, et autres
Publié: (2024)
Representation Calibration and Uncertainty Guidance for Class-Incremental Learning based on Vision Language Model
par: Tan, Jiantao, et autres
Publié: (2025)
par: Tan, Jiantao, et autres
Publié: (2025)
TTA-OOD: Test-time Augmentation for Improving Out-of-Distribution Detection in Gastrointestinal Vision
par: Pokhrel, Sandesh, et autres
Publié: (2024)
par: Pokhrel, Sandesh, et autres
Publié: (2024)
VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation
par: Li, Bo, et autres
Publié: (2026)
par: Li, Bo, et autres
Publié: (2026)
Masked Modeling for Self-supervised Representation Learning on Vision and Beyond
par: Li, Siyuan, et autres
Publié: (2023)
par: Li, Siyuan, et autres
Publié: (2023)
Towards Effective MLLM Jailbreaking Through Balanced On-Topicness and OOD-Intensity
par: Li, Zuoou, et autres
Publié: (2025)
par: Li, Zuoou, et autres
Publié: (2025)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
par: He, Yefei, et autres
Publié: (2024)
par: He, Yefei, et autres
Publié: (2024)
ResAgent: Entropy-based Prior Point Discovery and Visual Reasoning for Referring Expression Segmentation
par: Wang, Yihao, et autres
Publié: (2026)
par: Wang, Yihao, et autres
Publié: (2026)
3D-Agent:Tri-Modal Multi-Agent Collaboration for Scalable 3D Object Annotation
par: Zhang, Jusheng, et autres
Publié: (2026)
par: Zhang, Jusheng, et autres
Publié: (2026)
Dynamic Token Reduction during Generation for Vision Language Models
par: Liang, Xiaoyu, et autres
Publié: (2025)
par: Liang, Xiaoyu, et autres
Publié: (2025)
LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model
par: Mei, Xiaodong, et autres
Publié: (2026)
par: Mei, Xiaodong, et autres
Publié: (2026)
AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization
par: Liu, Chaohu, et autres
Publié: (2025)
par: Liu, Chaohu, et autres
Publié: (2025)
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
par: Zhang, Jianke, et autres
Publié: (2026)
par: Zhang, Jianke, et autres
Publié: (2026)
PTTA: A Pure Text-to-Animation Framework for High-Quality Creation
par: Chen, Ruiqi, et autres
Publié: (2025)
par: Chen, Ruiqi, et autres
Publié: (2025)
LPOI: Listwise Preference Optimization for Vision Language Models
par: Zadeh, Fatemeh Pesaran, et autres
Publié: (2025)
par: Zadeh, Fatemeh Pesaran, et autres
Publié: (2025)
Pre-Trained Vision-Language Models as Partial Annotators
par: Wang, Qian-Wei, et autres
Publié: (2024)
par: Wang, Qian-Wei, et autres
Publié: (2024)
HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models
par: Zeng, Haoxi, et autres
Publié: (2025)
par: Zeng, Haoxi, et autres
Publié: (2025)
Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models
par: Jang, Young Kyun, et autres
Publié: (2024)
par: Jang, Young Kyun, et autres
Publié: (2024)
SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments
par: Jiang, Wen, et autres
Publié: (2026)
par: Jiang, Wen, et autres
Publié: (2026)
Egocentric Bias in Vision-Language Models
par: Wang, Maijunxian, et autres
Publié: (2026)
par: Wang, Maijunxian, et autres
Publié: (2026)
Seeing the Abstract: Translating the Abstract Language for Vision Language Models
par: Talon, Davide, et autres
Publié: (2025)
par: Talon, Davide, et autres
Publié: (2025)
Evolving Prompt Adaptation for Vision-Language Models
par: Zhang, Enming, et autres
Publié: (2026)
par: Zhang, Enming, et autres
Publié: (2026)
Top-Down Semantic Refinement for Image Captioning
par: Zhang, Jusheng, et autres
Publié: (2025)
par: Zhang, Jusheng, et autres
Publié: (2025)
Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models
par: Wu, Sihao, et autres
Publié: (2025)
par: Wu, Sihao, et autres
Publié: (2025)
Safety Alignment for Vision Language Models
par: Liu, Zhendong, et autres
Publié: (2024)
par: Liu, Zhendong, et autres
Publié: (2024)
Demonstrating and Reducing Shortcuts in Vision-Language Representation Learning
par: Bleeker, Maurits, et autres
Publié: (2024)
par: Bleeker, Maurits, et autres
Publié: (2024)
\textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation
par: Zhu, Weiye, et autres
Publié: (2026)
par: Zhu, Weiye, et autres
Publié: (2026)
Adversarial Prompt Tuning for Vision-Language Models
par: Zhang, Jiaming, et autres
Publié: (2023)
par: Zhang, Jiaming, et autres
Publié: (2023)
VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models
par: Gao, Chongkai, et autres
Publié: (2025)
par: Gao, Chongkai, et autres
Publié: (2025)
Documents similaires
-
MAT-Agent: Adaptive Multi-Agent Training Optimization
par: Zhang, Jusheng, et autres
Publié: (2025) -
Overcoming the Pitfalls of Vision-Language Model Finetuning for OOD Generalization
par: Zang, Yuhang, et autres
Publié: (2024) -
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
par: Zhang, Jusheng, et autres
Publié: (2025) -
Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains
par: Zhang, Jesen, et autres
Publié: (2025) -
Conjugated Semantic Pool Improves OOD Detection with Pre-trained Vision-Language Models
par: Chen, Mengyuan, et autres
Publié: (2024)