Boosting Single-domain Generalized Object Detection via Vision-Language Knowledge Interaction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Xiaoran, Yang, Jiangang, Chong, Wenyue, Shi, Wenhui, Sun, Shichu, Xing, Jing, Liu, Jian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PhysAug: A Physical-guided and Frequency-based Data Augmentation for Single-Domain Generalized Object Detection
par: Xu, Xiaoran, et autres
Publié: (2024)
par: Xu, Xiaoran, et autres
Publié: (2024)
Towards Domain-Generalized Open-Vocabulary Object Detection: A Progressive Domain-invariant Cross-modal Alignment Method
par: Xu, Xiaoran, et autres
Publié: (2026)
par: Xu, Xiaoran, et autres
Publié: (2026)
Object Gaussian for Monocular 6D Pose Estimation from Sparse Views
par: Luo, Luqing, et autres
Publié: (2024)
par: Luo, Luqing, et autres
Publié: (2024)
Towards Zero-shot Human-Object Interaction Detection via Vision-Language Integration
par: Xue, Weiying, et autres
Publié: (2024)
par: Xue, Weiying, et autres
Publié: (2024)
Towards Robust Semantic Correspondence: A Benchmark and Insights
par: Chong, Wenyue
Publié: (2025)
par: Chong, Wenyue
Publié: (2025)
Bilateral Collaboration with Large Vision-Language Models for Open Vocabulary Human-Object Interaction Detection
par: Hu, Yupeng, et autres
Publié: (2025)
par: Hu, Yupeng, et autres
Publié: (2025)
Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models
par: Chen, Wenyue, et autres
Publié: (2026)
par: Chen, Wenyue, et autres
Publié: (2026)
Boosting Gaze Object Prediction via Pixel-level Supervision from Vision Foundation Model
par: Jin, Yang, et autres
Publié: (2024)
par: Jin, Yang, et autres
Publié: (2024)
Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
par: Zhao, Jianfei, et autres
Publié: (2025)
par: Zhao, Jianfei, et autres
Publié: (2025)
Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs
par: Cai, Zhaolin, et autres
Publié: (2025)
par: Cai, Zhaolin, et autres
Publié: (2025)
Language Prompt vs. Image Enhancement: Boosting Object Detection With CLIP in Hazy Environments
par: Pang, Jian, et autres
Publié: (2026)
par: Pang, Jian, et autres
Publié: (2026)
Contextualized Representation Learning for Effective Human-Object Interaction Detection
par: Li, Zhehao, et autres
Publié: (2025)
par: Li, Zhehao, et autres
Publié: (2025)
Boosting Open-Vocabulary Object Detection by Handling Background Samples
par: Zeng, Ruizhe, et autres
Publié: (2024)
par: Zeng, Ruizhe, et autres
Publié: (2024)
Boosting 3D Object Detection with Semantic-Aware Multi-Branch Framework
par: Jing, Hao, et autres
Publié: (2024)
par: Jing, Hao, et autres
Publié: (2024)
HALP: Detecting Hallucinations in Vision-Language Models without Generating a Single Token
par: Kogilathota, Sai Akhil, et autres
Publié: (2026)
par: Kogilathota, Sai Akhil, et autres
Publié: (2026)
Goal-oriented Backdoor Attack against Vision-Language-Action Models via Physical Objects
par: Zhou, Zirun, et autres
Publié: (2025)
par: Zhou, Zirun, et autres
Publié: (2025)
Spatial-Temporal Human-Object Interaction Detection
par: Sun, Xu, et autres
Publié: (2025)
par: Sun, Xu, et autres
Publié: (2025)
Towards Single-Source Domain Generalized Object Detection via Causal Visual Prompts
par: Li, Chen, et autres
Publié: (2025)
par: Li, Chen, et autres
Publié: (2025)
Taking A Closer Look at Interacting Objects: Interaction-Aware Open Vocabulary Scene Graph Generation
par: Li, Lin, et autres
Publié: (2025)
par: Li, Lin, et autres
Publié: (2025)
Boosting Salient Object Detection with Knowledge Distillated from Large Foundation Models
par: He, Miaoyang, et autres
Publié: (2025)
par: He, Miaoyang, et autres
Publié: (2025)
Adaptive Event Stream Slicing for Open-Vocabulary Event-Based Object Detection via Vision-Language Knowledge Distillation
par: Zhang, Jinchang, et autres
Publié: (2025)
par: Zhang, Jinchang, et autres
Publié: (2025)
Tiny Object Detection with Single Point Supervision
par: Zhu, Haoran, et autres
Publié: (2024)
par: Zhu, Haoran, et autres
Publié: (2024)
Frequency-Spatial Entanglement Learning for Camouflaged Object Detection
par: Sun, Yanguang, et autres
Publié: (2024)
par: Sun, Yanguang, et autres
Publié: (2024)
Boosting Object Detection with Zero-Shot Day-Night Domain Adaptation
par: Du, Zhipeng, et autres
Publié: (2023)
par: Du, Zhipeng, et autres
Publié: (2023)
Devils in Middle Layers of Large Vision-Language Models: Interpreting, Detecting and Mitigating Object Hallucinations via Attention Lens
par: Jiang, Zhangqi, et autres
Publié: (2024)
par: Jiang, Zhangqi, et autres
Publié: (2024)
Mining Instance-Centric Vision-Language Contexts for Human-Object Interaction Detection
par: Seo, Soo Won, et autres
Publié: (2026)
par: Seo, Soo Won, et autres
Publié: (2026)
Language-Driven Dual Style Mixing for Single-Domain Generalized Object Detection
par: Qin, Hongda, et autres
Publié: (2025)
par: Qin, Hongda, et autres
Publié: (2025)
HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction
par: Bao, Chen, et autres
Publié: (2024)
par: Bao, Chen, et autres
Publié: (2024)
WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model
par: Zhang, Songyan, et autres
Publié: (2024)
par: Zhang, Songyan, et autres
Publié: (2024)
Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning
par: Deng, Huilin, et autres
Publié: (2025)
par: Deng, Huilin, et autres
Publié: (2025)
SOOD++: Leveraging Unlabeled Data to Boost Oriented Object Detection
par: Liang, Dingkang, et autres
Publié: (2024)
par: Liang, Dingkang, et autres
Publié: (2024)
MOSE: Boosting Vision-based Roadside 3D Object Detection with Scene Cues
par: Chen, Xiahan, et autres
Publié: (2024)
par: Chen, Xiahan, et autres
Publié: (2024)
Interaction-Centric Knowledge Infusion and Transfer for Open-Vocabulary Scene Graph Generation
par: Li, Lin, et autres
Publié: (2025)
par: Li, Lin, et autres
Publié: (2025)
Dual-Integrated Low-Latency Single-Lens Infrared Computational Imaging for Object Detection
par: Wang, Xuquan, et autres
Publié: (2026)
par: Wang, Xuquan, et autres
Publié: (2026)
RadarDistill: Boosting Radar-based Object Detection Performance via Knowledge Distillation from LiDAR Features
par: Bang, Geonho, et autres
Publié: (2024)
par: Bang, Geonho, et autres
Publié: (2024)
BoostRad: Enhancing Object Detection by Boosting Radar Reflections
par: Haitman, Yuval, et autres
Publié: (2024)
par: Haitman, Yuval, et autres
Publié: (2024)
Decomposing and Composing: Towards Efficient Vision-Language Continual Learning via Rank-1 Expert Pool in a Single LoRA
par: Fa, Zhan, et autres
Publié: (2026)
par: Fa, Zhan, et autres
Publié: (2026)
Towards Prospective Medical Image Reconstruction via Knowledge-Informed Dynamic Optimal Transport
par: Zheng, Taoran, et autres
Publié: (2025)
par: Zheng, Taoran, et autres
Publié: (2025)
GEM: Boost Simple Network for Glass Surface Segmentation via Vision Foundation Models
par: Hao, Jing, et autres
Publié: (2023)
par: Hao, Jing, et autres
Publié: (2023)
RepSAM: Bridging Foundation Models to Robotic Vision via Representation-Guided Adaptation
par: Chu, Wenhui
Publié: (2026)
par: Chu, Wenhui
Publié: (2026)
Documents similaires
-
PhysAug: A Physical-guided and Frequency-based Data Augmentation for Single-Domain Generalized Object Detection
par: Xu, Xiaoran, et autres
Publié: (2024) -
Towards Domain-Generalized Open-Vocabulary Object Detection: A Progressive Domain-invariant Cross-modal Alignment Method
par: Xu, Xiaoran, et autres
Publié: (2026) -
Object Gaussian for Monocular 6D Pose Estimation from Sparse Views
par: Luo, Luqing, et autres
Publié: (2024) -
Towards Zero-shot Human-Object Interaction Detection via Vision-Language Integration
par: Xue, Weiying, et autres
Publié: (2024) -
Towards Robust Semantic Correspondence: A Benchmark and Insights
par: Chong, Wenyue
Publié: (2025)