VLM-NCD:Novel Class Discovery with Vision-Based Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Su, Yuetong, Wei, Baoguo, Wang, Xinyu, Li, Xu, Li, Lixin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
par: Raoufi, Behnam, et autres
Publié: (2025)
par: Raoufi, Behnam, et autres
Publié: (2025)
Smelly, dense, and spreaded: The Object Detection for Olfactory References (ODOR) dataset
par: Zinnen, Mathias, et autres
Publié: (2025)
par: Zinnen, Mathias, et autres
Publié: (2025)
From Gaze to Insight: Bridging Human Visual Attention and Vision Language Model Explanation for Weakly-Supervised Medical Image Segmentation
par: Chen, Jingkun, et autres
Publié: (2025)
par: Chen, Jingkun, et autres
Publié: (2025)
WildfireVLM: AI-powered Analysis for Early Wildfire Detection and Risk Assessment Using Satellite Imagery
par: Ayanzadeh, Aydin, et autres
Publié: (2026)
par: Ayanzadeh, Aydin, et autres
Publié: (2026)
TACIT Benchmark: A Programmatic Visual Reasoning Benchmark for Generative and Discriminative Models
par: Medeiros, Daniel Nobrega
Publié: (2026)
par: Medeiros, Daniel Nobrega
Publié: (2026)
Polarization-Based Eye Tracking with Personalized Siamese Architectures
par: Kalkanli, Beyza, et autres
Publié: (2026)
par: Kalkanli, Beyza, et autres
Publié: (2026)
Semantic2Graph: Graph-based Multi-modal Feature Fusion for Action Segmentation in Videos
par: Zhang, Junbin, et autres
Publié: (2022)
par: Zhang, Junbin, et autres
Publié: (2022)
VDPP: Video Depth Post-Processing for Speed and Scalability
par: Yoon, Daewon, et autres
Publié: (2026)
par: Yoon, Daewon, et autres
Publié: (2026)
Predictive Modeling of Maritime Radar Data Using Transformer Architecture
par: Qesaraku, Bjorna, et autres
Publié: (2025)
par: Qesaraku, Bjorna, et autres
Publié: (2025)
IMKD: Intensity-Aware Multi-Level Knowledge Distillation for Camera-Radar Fusion
par: Mishra, Shashank, et autres
Publié: (2025)
par: Mishra, Shashank, et autres
Publié: (2025)
Corn Ear Detection and Orientation Estimation Using Deep Learning
par: Sprague, Nathan, et autres
Publié: (2024)
par: Sprague, Nathan, et autres
Publié: (2024)
Gr-IoU: Ground-Intersection over Union for Robust Multi-Object Tracking with 3D Geometric Constraints
par: Toida, Keisuke, et autres
Publié: (2024)
par: Toida, Keisuke, et autres
Publié: (2024)
Salient Concept-Aware Generative Data Augmentation
par: Zhao, Tianchen, et autres
Publié: (2025)
par: Zhao, Tianchen, et autres
Publié: (2025)
DSER: Spectral Epipolar Representation for Efficient Light Field Depth Estimation
par: Mohammad, Noor Islam S., et autres
Publié: (2025)
par: Mohammad, Noor Islam S., et autres
Publié: (2025)
Hierarchical Spatial Algorithms for High-Resolution Image Quantization and Feature Extraction
par: Mohammad, Noor Islam S.
Publié: (2025)
par: Mohammad, Noor Islam S.
Publié: (2025)
μ-Net: A Deep Learning-Based Architecture for μ-CT Segmentation
par: Bruno, Pierangela, et autres
Publié: (2024)
par: Bruno, Pierangela, et autres
Publié: (2024)
LRCP: Low-Rank Compressibility Guided Visual Token Pruning for Efficient LVLMs
par: Lu, Hongyu, et autres
Publié: (2026)
par: Lu, Hongyu, et autres
Publié: (2026)
HEDGE: Hallucination Estimation via Dense Geometric Entropy for VQA with Vision-Language Models
par: Gautam, Sushant, et autres
Publié: (2025)
par: Gautam, Sushant, et autres
Publié: (2025)
Point, Detect, Count: Multi-Task Medical Image Understanding with Instruction-Tuned Vision-Language Models
par: Gautam, Sushant, et autres
Publié: (2025)
par: Gautam, Sushant, et autres
Publié: (2025)
See What You Need: Query-Aware Visual Intelligence through Reasoning-Perception Loops
par: Dong, Zixuan, et autres
Publié: (2025)
par: Dong, Zixuan, et autres
Publié: (2025)
3DreamBooth: High-Fidelity 3D Subject-Driven Video Generation Model
par: Ko, Hyun-kyu, et autres
Publié: (2026)
par: Ko, Hyun-kyu, et autres
Publié: (2026)
Gaussian Splatting: 3D Reconstruction and Novel View Synthesis, a Review
par: Dalal, Anurag, et autres
Publié: (2024)
par: Dalal, Anurag, et autres
Publié: (2024)
Safe Road-Crossing by Autonomous Wheelchairs: a Novel Dataset and its Experimental Evaluation
par: Grigioni, Carlo, et autres
Publié: (2024)
par: Grigioni, Carlo, et autres
Publié: (2024)
OpenFusion++: An Open-vocabulary Real-time Scene Understanding System
par: Jin, Xiaofeng, et autres
Publié: (2025)
par: Jin, Xiaofeng, et autres
Publié: (2025)
Fairness Without Labels: Pseudo-Balancing for Bias Mitigation in Face Gender Classification
par: Dong, Haohua, et autres
Publié: (2025)
par: Dong, Haohua, et autres
Publié: (2025)
ROI-GS: Interest-based Local Quality 3D Gaussian Splatting
par: Bui, Quoc-Anh, et autres
Publié: (2025)
par: Bui, Quoc-Anh, et autres
Publié: (2025)
ROI-NeRFs: Hi-Fi Visualization of Objects of Interest within a Scene by NeRFs Composition
par: Bui, Quoc-Anh, et autres
Publié: (2025)
par: Bui, Quoc-Anh, et autres
Publié: (2025)
ARTPS: Depth-Enhanced Hybrid Anomaly Detection and Learnable Curiosity Score for Autonomous Rover Target Prioritization
par: Baydemir, Poyraz
Publié: (2025)
par: Baydemir, Poyraz
Publié: (2025)
TRACES: Temporal Recall with Contextual Embeddings for Real-Time Video Anomaly Detection
par: Siddiqui, Yousuf Ahmed, et autres
Publié: (2025)
par: Siddiqui, Yousuf Ahmed, et autres
Publié: (2025)
Is Single-View Mesh Reconstruction Ready for Robotics?
par: Nolte, Frederik, et autres
Publié: (2025)
par: Nolte, Frederik, et autres
Publié: (2025)
DeltaVLM: Interactive Remote Sensing Image Change Analysis via Instruction-guided Difference Perception
par: Deng, Pei, et autres
Publié: (2025)
par: Deng, Pei, et autres
Publié: (2025)
Rethinking VLMs for Image Forgery Detection and Localization
par: Guo, Shaofeng, et autres
Publié: (2026)
par: Guo, Shaofeng, et autres
Publié: (2026)
UNION: Unsupervised 3D Object Detection using Object Appearance-based Pseudo-Classes
par: Lentsch, Ted, et autres
Publié: (2024)
par: Lentsch, Ted, et autres
Publié: (2024)
Hierarchical Point-Patch Fusion with Adaptive Patch Codebook for 3D Shape Anomaly Detection
par: Kang, Xueyang, et autres
Publié: (2026)
par: Kang, Xueyang, et autres
Publié: (2026)
BG-YOLO: A Bidirectional-Guided Method for Underwater Object Detection
par: Zhang, Jian, et autres
Publié: (2024)
par: Zhang, Jian, et autres
Publié: (2024)
Do Generative Metrics Predict YOLO Performance? An Evaluation Across Models, Augmentation Ratios, and Dataset Complexity
par: Marian, Vasile, et autres
Publié: (2026)
par: Marian, Vasile, et autres
Publié: (2026)
Prompt Sensitivity in Vision-Language Grounding: How Small Changes in Wording Affect Object Detection
par: Deka, Dawar Jyoti, et autres
Publié: (2026)
par: Deka, Dawar Jyoti, et autres
Publié: (2026)
Rethinking Visual Intelligence: Insights from Video Pretraining
par: Acuaviva, Pablo, et autres
Publié: (2025)
par: Acuaviva, Pablo, et autres
Publié: (2025)
DeepShade: Enable Shade Simulation by Text-conditioned Image Generation
par: Da, Longchao, et autres
Publié: (2025)
par: Da, Longchao, et autres
Publié: (2025)
UVLM: A Universal Vision-Language Model Loader for Reproducible Multimodal Benchmarking
par: Perez, Joan, et autres
Publié: (2026)
par: Perez, Joan, et autres
Publié: (2026)
Documents similaires
-
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
par: Raoufi, Behnam, et autres
Publié: (2025) -
Smelly, dense, and spreaded: The Object Detection for Olfactory References (ODOR) dataset
par: Zinnen, Mathias, et autres
Publié: (2025) -
From Gaze to Insight: Bridging Human Visual Attention and Vision Language Model Explanation for Weakly-Supervised Medical Image Segmentation
par: Chen, Jingkun, et autres
Publié: (2025) -
WildfireVLM: AI-powered Analysis for Early Wildfire Detection and Risk Assessment Using Satellite Imagery
par: Ayanzadeh, Aydin, et autres
Publié: (2026) -
TACIT Benchmark: A Programmatic Visual Reasoning Benchmark for Generative and Discriminative Models
par: Medeiros, Daniel Nobrega
Publié: (2026)