Enregistré dans:
| Auteurs principaux: | Liu, Zhipeng, Luo, Chunbo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2605.09802 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cross-Domain Generalization Limits of Vision Foundation Models in Facial Deepfake Detection
par: Delibasoglu, Ibrahim
Publié: (2026)
par: Delibasoglu, Ibrahim
Publié: (2026)
Multi-scale Quaternion CNN and BiGRU with Cross Self-attention Feature Fusion for Fault Diagnosis of Bearing
par: Liu, Huanbai, et autres
Publié: (2024)
par: Liu, Huanbai, et autres
Publié: (2024)
Anomaly-Aware Vision-Language Adapters for Zero-Shot Anomaly Detection
par: Aqeel, Muhammad, et autres
Publié: (2026)
par: Aqeel, Muhammad, et autres
Publié: (2026)
MFAF: An EVA02-Based Multi-scale Frequency Attention Fusion Method for Cross-View Geo-Localization
par: Liu, YiTong, et autres
Publié: (2025)
par: Liu, YiTong, et autres
Publié: (2025)
NVIDIA Nemotron Nano V2 VL
par: NVIDIA, et autres
Publié: (2025)
par: NVIDIA, et autres
Publié: (2025)
Exposing and Addressing Cross-Task Inconsistency in Unified Vision-Language Models
par: Maharana, Adyasha, et autres
Publié: (2023)
par: Maharana, Adyasha, et autres
Publié: (2023)
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
par: Kim, Sanghwan, et autres
Publié: (2024)
par: Kim, Sanghwan, et autres
Publié: (2024)
ROCKET-2: Steering Visuomotor Policy via Cross-View Goal Alignment
par: Cai, Shaofei, et autres
Publié: (2025)
par: Cai, Shaofei, et autres
Publié: (2025)
Visual Sync: Multi-Camera Synchronization via Cross-View Object Motion
par: Liu, Shaowei, et autres
Publié: (2025)
par: Liu, Shaowei, et autres
Publié: (2025)
HalluRNN: Mitigating Hallucinations via Recurrent Cross-Layer Reasoning in Large Vision-Language Models
par: Yu, Le, et autres
Publié: (2025)
par: Yu, Le, et autres
Publié: (2025)
Feature Purified Transformer With Cross-level Feature Guiding Decoder For Multi-class OOD and Anomaly Deteciton
par: Lin, Jerry Chun-Wei, et autres
Publié: (2024)
par: Lin, Jerry Chun-Wei, et autres
Publié: (2024)
CLASH: A Benchmark for Cross-Modal Contradiction Detection
par: Popordanoska, Teodora, et autres
Publié: (2025)
par: Popordanoska, Teodora, et autres
Publié: (2025)
ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models
par: Pach, Mateusz, et autres
Publié: (2025)
par: Pach, Mateusz, et autres
Publié: (2025)
VIFO: Visual Feature Empowered Multivariate Time Series Forecasting with Cross-Modal Fusion
par: Wang, Yanlong, et autres
Publié: (2025)
par: Wang, Yanlong, et autres
Publié: (2025)
R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?
par: Zhang, Jingyi, et autres
Publié: (2026)
par: Zhang, Jingyi, et autres
Publié: (2026)
Domain-Invariant Per-Frame Feature Extraction for Cross-Domain Imitation Learning with Visual Observations
par: Kim, Minung, et autres
Publié: (2025)
par: Kim, Minung, et autres
Publié: (2025)
Transferability-Guided Cross-Domain Cross-Task Transfer Learning
par: Tan, Yang, et autres
Publié: (2022)
par: Tan, Yang, et autres
Publié: (2022)
X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection
par: Kim, Youngseo, et autres
Publié: (2026)
par: Kim, Youngseo, et autres
Publié: (2026)
Vision-Language Meets the Skeleton: Progressively Distillation with Cross-Modal Knowledge for 3D Action Representation Learning
par: Chen, Yang, et autres
Publié: (2024)
par: Chen, Yang, et autres
Publié: (2024)
Multi-Layer Feature Fusion with Cross-Channel Attention-Based U-Net for Kidney Tumor Segmentation
par: Neha, Fnu, et autres
Publié: (2024)
par: Neha, Fnu, et autres
Publié: (2024)
VERA: Explainable Video Anomaly Detection via Verbalized Learning of Vision-Language Models
par: Ye, Muchao, et autres
Publié: (2024)
par: Ye, Muchao, et autres
Publié: (2024)
Soft Task-Aware Routing of Experts for Equivariant Representation Learning
par: Jeon, Jaebyeong, et autres
Publié: (2025)
par: Jeon, Jaebyeong, et autres
Publié: (2025)
Cross Dataset Analysis and Network Architecture Repair for Autonomous Car Lane Detection
par: Ganeriwala, Parth, et autres
Publié: (2024)
par: Ganeriwala, Parth, et autres
Publié: (2024)
CNC: Cross-modal Normality Constraint for Unsupervised Multi-class Anomaly Detection
par: Wang, Xiaolei, et autres
Publié: (2024)
par: Wang, Xiaolei, et autres
Publié: (2024)
Robust Building Damage Detection in Cross-Disaster Settings Using Domain Adaptation
par: Mouradi, Asmae, et autres
Publié: (2026)
par: Mouradi, Asmae, et autres
Publié: (2026)
Image Complexity-Aware Adaptive Retrieval for Efficient Vision-Language Models
par: Williams-Lekuona, Mikel, et autres
Publié: (2025)
par: Williams-Lekuona, Mikel, et autres
Publié: (2025)
How Culturally Aware are Vision-Language Models?
par: Burda-Lassen, Olena, et autres
Publié: (2024)
par: Burda-Lassen, Olena, et autres
Publié: (2024)
Exploring Curriculum Learning for Vision-Language Tasks: A Study on Small-Scale Multimodal Training
par: Saha, Rohan, et autres
Publié: (2024)
par: Saha, Rohan, et autres
Publié: (2024)
AgrI Challenge: A Data-Centric AI Competition for Cross-Team Validation in Agricultural Vision
par: Brahimi, Mohammed, et autres
Publié: (2026)
par: Brahimi, Mohammed, et autres
Publié: (2026)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
par: Zhang, Jingyi, et autres
Publié: (2025)
par: Zhang, Jingyi, et autres
Publié: (2025)
Uncertainty-Aware Test-Time Adaptation for Cross-Region Spatio-Temporal Fusion of Land Surface Temperature
par: Bouaziz, Sofiane, et autres
Publié: (2026)
par: Bouaziz, Sofiane, et autres
Publié: (2026)
Spurious Feature Eraser: Stabilizing Test-Time Adaptation for Vision-Language Foundation Model
par: Ma, Huan, et autres
Publié: (2024)
par: Ma, Huan, et autres
Publié: (2024)
Scaling Up Single Image Dehazing Algorithm by Cross-Data Vision Alignment for Richer Representation Learning and Beyond
par: Shi, Yukai, et autres
Publié: (2024)
par: Shi, Yukai, et autres
Publié: (2024)
Harnessing Vision-Language Models for Time Series Anomaly Detection
par: He, Zelin, et autres
Publié: (2025)
par: He, Zelin, et autres
Publié: (2025)
Adaptive Prompt Tuning: Vision Guided Prompt Tuning with Cross-Attention for Fine-Grained Few-Shot Learning
par: Brouwer, Eric, et autres
Publié: (2024)
par: Brouwer, Eric, et autres
Publié: (2024)
MedCLM: Learning to Localize and Reason via a CoT-Curriculum in Medical Vision-Language Models
par: Kim, Soo Yong, et autres
Publié: (2025)
par: Kim, Soo Yong, et autres
Publié: (2025)
Collaborative Temporal Feature Generation via Critic-Free Reinforcement Learning for Cross-User Sensor-Based Activity Recognition
par: Ye, Xiaozhou, et autres
Publié: (2026)
par: Ye, Xiaozhou, et autres
Publié: (2026)
Vision Learners Meet Web Image-Text Pairs
par: Zhao, Bingchen, et autres
Publié: (2023)
par: Zhao, Bingchen, et autres
Publié: (2023)
Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets
par: Koran, Alex, et autres
Publié: (2026)
par: Koran, Alex, et autres
Publié: (2026)
Documents similaires
-
Cross-Domain Generalization Limits of Vision Foundation Models in Facial Deepfake Detection
par: Delibasoglu, Ibrahim
Publié: (2026) -
Multi-scale Quaternion CNN and BiGRU with Cross Self-attention Feature Fusion for Fault Diagnosis of Bearing
par: Liu, Huanbai, et autres
Publié: (2024) -
Anomaly-Aware Vision-Language Adapters for Zero-Shot Anomaly Detection
par: Aqeel, Muhammad, et autres
Publié: (2026) -
MFAF: An EVA02-Based Multi-scale Frequency Attention Fusion Method for Cross-View Geo-Localization
par: Liu, YiTong, et autres
Publié: (2025) -
NVIDIA Nemotron Nano V2 VL
par: NVIDIA, et autres
Publié: (2025)