Enregistré dans:
| Auteurs principaux: | Peng, Bo, Hu, Yuanwei, Liu, Bo, Chen, Ling, Lu, Jie, Fang, Zhen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.09586 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models
par: Hu, Yuanwei, et autres
Publié: (2026)
par: Hu, Yuanwei, et autres
Publié: (2026)
On the Provable Importance of Gradients for Language-Assisted Image Clustering
par: Peng, Bo, et autres
Publié: (2025)
par: Peng, Bo, et autres
Publié: (2025)
Debiased Negative Mining Improves Out-of-distribution Detection with Pre-trained Vision-Language Models
par: Peng, Bo, et autres
Publié: (2026)
par: Peng, Bo, et autres
Publié: (2026)
Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability
par: Liu, Shizhan, et autres
Publié: (2025)
par: Liu, Shizhan, et autres
Publié: (2025)
Delving into Out-of-Distribution Detection with Medical Vision-Language Models
par: Ju, Lie, et autres
Publié: (2025)
par: Ju, Lie, et autres
Publié: (2025)
CELLO: Causal Evaluation of Large Vision-Language Models
par: Chen, Meiqi, et autres
Publié: (2024)
par: Chen, Meiqi, et autres
Publié: (2024)
Negative Label Guided OOD Detection with Pretrained Vision-Language Models
par: Jiang, Xue, et autres
Publié: (2024)
par: Jiang, Xue, et autres
Publié: (2024)
Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models
par: Lee, Yi-Lun, et autres
Publié: (2024)
par: Lee, Yi-Lun, et autres
Publié: (2024)
On the Learnability of Out-of-distribution Detection
par: Fang, Zhen, et autres
Publié: (2024)
par: Fang, Zhen, et autres
Publié: (2024)
DynRefer: Delving into Region-level Multimodal Tasks via Dynamic Resolution
par: Zhao, Yuzhong, et autres
Publié: (2024)
par: Zhao, Yuzhong, et autres
Publié: (2024)
Multi-Token Enhancing for Vision Representation Learning
par: Li, Zhong-Yu, et autres
Publié: (2024)
par: Li, Zhong-Yu, et autres
Publié: (2024)
Delving Deep into Semantic Relation Distillation
par: Yan, Zhaoyi, et autres
Publié: (2025)
par: Yan, Zhaoyi, et autres
Publié: (2025)
MedSAM3: Delving into Segment Anything with Medical Concepts
par: Liu, Anglin, et autres
Publié: (2025)
par: Liu, Anglin, et autres
Publié: (2025)
FADE: Few-shot/zero-shot Anomaly Detection Engine using Large Vision-Language Model
par: Li, Yuanwei, et autres
Publié: (2024)
par: Li, Yuanwei, et autres
Publié: (2024)
SVLTA: Benchmarking Vision-Language Temporal Alignment via Synthetic Video Situation
par: Du, Hao, et autres
Publié: (2025)
par: Du, Hao, et autres
Publié: (2025)
HSCP: A Two-Stage Spectral Clustering Framework for Resource-Constrained UAV Identification
par: Wang, Maoyu, et autres
Publié: (2025)
par: Wang, Maoyu, et autres
Publié: (2025)
Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models
par: Wang, Jiayu, et autres
Publié: (2024)
par: Wang, Jiayu, et autres
Publié: (2024)
Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision
par: Li, Ling, et autres
Publié: (2026)
par: Li, Ling, et autres
Publié: (2026)
SPEX: A Vision-Language Model for Land Cover Extraction on Spectral Remote Sensing Images
par: Si, Dongchen, et autres
Publié: (2025)
par: Si, Dongchen, et autres
Publié: (2025)
Delving into Mapping Uncertainty for Mapless Trajectory Prediction
par: Zhang, Zongzheng, et autres
Publié: (2025)
par: Zhang, Zongzheng, et autres
Publié: (2025)
CLIPSym: Delving into Symmetry Detection with CLIP
par: Yang, Tinghan, et autres
Publié: (2025)
par: Yang, Tinghan, et autres
Publié: (2025)
A Generative Framework for Self-Supervised Facial Representation Learning
par: He, Ruian, et autres
Publié: (2023)
par: He, Ruian, et autres
Publié: (2023)
Hyperspectral Image Classification via Efficient Global Spectral Supertoken Clustering
par: Liu, Peifu, et autres
Publié: (2026)
par: Liu, Peifu, et autres
Publié: (2026)
HGCLIP: Exploring Vision-Language Models with Graph Representations for Hierarchical Understanding
par: Xia, Peng, et autres
Publié: (2023)
par: Xia, Peng, et autres
Publié: (2023)
Beyond Visual Cues: Synchronously Exploring Target-Centric Semantics for Vision-Language Tracking
par: Ge, Jiawei, et autres
Publié: (2023)
par: Ge, Jiawei, et autres
Publié: (2023)
Delving into the Trajectory Long-tail Distribution for Muti-object Tracking
par: Chen, Sijia, et autres
Publié: (2024)
par: Chen, Sijia, et autres
Publié: (2024)
OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks
par: Fu, Ronghao, et autres
Publié: (2026)
par: Fu, Ronghao, et autres
Publié: (2026)
Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models
par: Luo, Yulin, et autres
Publié: (2026)
par: Luo, Yulin, et autres
Publié: (2026)
LiT: Delving into a Simple Linear Diffusion Transformer for Image Generation
par: Wang, Jiahao, et autres
Publié: (2025)
par: Wang, Jiahao, et autres
Publié: (2025)
Bridging the Modality Gap in Roadside LiDAR: A Training-Free Vision-Language Model Framework for Vehicle Classification
par: Li, Yiqiao, et autres
Publié: (2026)
par: Li, Yiqiao, et autres
Publié: (2026)
Delving into Dark Regions for Robust Shadow Detection
par: Guan, Huankang, et autres
Publié: (2024)
par: Guan, Huankang, et autres
Publié: (2024)
CAS-IQA: Teaching Vision-Language Models for Synthetic Angiography Quality Assessment
par: Wang, Bo, et autres
Publié: (2025)
par: Wang, Bo, et autres
Publié: (2025)
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
Backdooring Vision-Language Models with Out-Of-Distribution Data
par: Lyu, Weimin, et autres
Publié: (2024)
par: Lyu, Weimin, et autres
Publié: (2024)
Dynamic Rank Adaptation for Vision-Language Models
par: Wang, Jiahui, et autres
Publié: (2025)
par: Wang, Jiahui, et autres
Publié: (2025)
TrojVLM: Backdoor Attack Against Vision Language Models
par: Lyu, Weimin, et autres
Publié: (2024)
par: Lyu, Weimin, et autres
Publié: (2024)
From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model
par: Hu, Bing, et autres
Publié: (2026)
par: Hu, Bing, et autres
Publié: (2026)
SR$^{2}$-Net: A General Plug-and-Play Model for Spectral Refinement in Hyperspectral Image Super-Resolution
par: He, Ji-Xuan, et autres
Publié: (2026)
par: He, Ji-Xuan, et autres
Publié: (2026)
Balancing Complementarity and Consistency via Delayed Activation in Incomplete Multi-view Clustering
par: Li, Bo
Publié: (2024)
par: Li, Bo
Publié: (2024)
MiraGe: Multimodal Discriminative Representation Learning for Generalizable AI-Generated Image Detection
par: Shi, Kuo, et autres
Publié: (2025)
par: Shi, Kuo, et autres
Publié: (2025)
Documents similaires
-
Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models
par: Hu, Yuanwei, et autres
Publié: (2026) -
On the Provable Importance of Gradients for Language-Assisted Image Clustering
par: Peng, Bo, et autres
Publié: (2025) -
Debiased Negative Mining Improves Out-of-distribution Detection with Pre-trained Vision-Language Models
par: Peng, Bo, et autres
Publié: (2026) -
Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability
par: Liu, Shizhan, et autres
Publié: (2025) -
Delving into Out-of-Distribution Detection with Medical Vision-Language Models
par: Ju, Lie, et autres
Publié: (2025)