Boosting Gaze Object Prediction via Pixel-level Supervision from Vision Foundation Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jin, Yang, Zhang, Lei, Yan, Shi, Fan, Bin, Wang, Binglu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GaTector+: A Unified Head-free Framework for Gaze Object and Gaze Following Prediction
par: Jin, Yang, et autres
Publié: (2025)
par: Jin, Yang, et autres
Publié: (2025)
TransGOP: Transformer-Based Gaze Object Prediction
par: Wang, Binglu, et autres
Publié: (2024)
par: Wang, Binglu, et autres
Publié: (2024)
Beyond Pixel-Wise Supervision for Medical Image Segmentation: From Traditional Models to Foundation Models
par: Shi, Yuyan, et autres
Publié: (2024)
par: Shi, Yuyan, et autres
Publié: (2024)
Enhancing Gaze Reasoning in Vision Foundation Models for Gaze Following
par: Wang, Shijing, et autres
Publié: (2026)
par: Wang, Shijing, et autres
Publié: (2026)
Evaluating Vision Foundation Models for Pixel and Object Classification in Microscopy
par: Teuber, Carolin, et autres
Publié: (2026)
par: Teuber, Carolin, et autres
Publié: (2026)
Towards Pixel-Level Prediction for Gaze Following: Benchmark and Approach
par: Liu, Feiyang, et autres
Publié: (2024)
par: Liu, Feiyang, et autres
Publié: (2024)
PixFoundation: Are We Heading in the Right Direction with Pixel-level Vision Foundation Models?
par: Siam, Mennatullah
Publié: (2025)
par: Siam, Mennatullah
Publié: (2025)
Vision-based Wearable Steering Assistance for People with Impaired Vision in Jogging
par: Liu, Xiaotong, et autres
Publié: (2024)
par: Liu, Xiaotong, et autres
Publié: (2024)
VL4Gaze: Unleashing Vision-Language Models for Gaze Following
par: Wang, Shijing, et autres
Publié: (2025)
par: Wang, Shijing, et autres
Publié: (2025)
Eyes on VLM: Benchmarking Gaze Following and Social Gaze Prediction in Vision Language Models
par: Wang, Hengfei, et autres
Publié: (2026)
par: Wang, Hengfei, et autres
Publié: (2026)
OAT: Object-Level Attention Transformer for Gaze Scanpath Prediction
par: Fang, Yini, et autres
Publié: (2024)
par: Fang, Yini, et autres
Publié: (2024)
Gaze-directed Vision GNN for Mitigating Shortcut Learning in Medical Image
par: Wu, Shaoxuan, et autres
Publié: (2024)
par: Wu, Shaoxuan, et autres
Publié: (2024)
Multimodal Large Models Are Effective Action Anticipators
par: Wang, Binglu, et autres
Publié: (2025)
par: Wang, Binglu, et autres
Publié: (2025)
PCLMix: Weakly Supervised Medical Image Segmentation via Pixel-Level Contrastive Learning and Dynamic Mix Augmentation
par: Lei, Yu, et autres
Publié: (2024)
par: Lei, Yu, et autres
Publié: (2024)
In Pursuit of Pixel Supervision for Visual Pre-training
par: Yang, Lihe, et autres
Publié: (2025)
par: Yang, Lihe, et autres
Publié: (2025)
GEM: Boost Simple Network for Glass Surface Segmentation via Vision Foundation Models
par: Hao, Jing, et autres
Publié: (2023)
par: Hao, Jing, et autres
Publié: (2023)
Boosting Single-domain Generalized Object Detection via Vision-Language Knowledge Interaction
par: Xu, Xiaoran, et autres
Publié: (2025)
par: Xu, Xiaoran, et autres
Publié: (2025)
Human Gaze Boosts Object-Centered Representation Learning
par: Schaumlöffel, Timothy, et autres
Publié: (2025)
par: Schaumlöffel, Timothy, et autres
Publié: (2025)
GazeMoDiff: Gaze-guided Diffusion Model for Stochastic Human Motion Prediction
par: Yan, Haodong, et autres
Publié: (2023)
par: Yan, Haodong, et autres
Publié: (2023)
PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
par: Liang, Wenqi, et autres
Publié: (2025)
par: Liang, Wenqi, et autres
Publié: (2025)
From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models
par: Shang, Yuying, et autres
Publié: (2024)
par: Shang, Yuying, et autres
Publié: (2024)
Towards Unbiased Source-Free Object Detection via Vision Foundation Models
par: Cai, Zhi, et autres
Publié: (2026)
par: Cai, Zhi, et autres
Publié: (2026)
Semi-Supervised Gaze Estimation via Disentangled Subspace Contrastive Learning
par: Tan, Qida, et autres
Publié: (2026)
par: Tan, Qida, et autres
Publié: (2026)
Articulate-Anything: Automatic Modeling of Articulated Objects via a Vision-Language Foundation Model
par: Le, Long, et autres
Publié: (2024)
par: Le, Long, et autres
Publié: (2024)
Gaze-guided Hand-Object Interaction Synthesis: Dataset and Method
par: Tian, Jie, et autres
Publié: (2024)
par: Tian, Jie, et autres
Publié: (2024)
Toddlers' Active Gaze Behavior Supports Self-Supervised Object Learning
par: Yu, Zhengyang, et autres
Publié: (2024)
par: Yu, Zhengyang, et autres
Publié: (2024)
FM-Fusion: Instance-aware Semantic Mapping Boosted by Vision-Language Foundation Models
par: Liu, Chuhao, et autres
Publié: (2024)
par: Liu, Chuhao, et autres
Publié: (2024)
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
par: Zhang, Tao, et autres
Publié: (2024)
par: Zhang, Tao, et autres
Publié: (2024)
General Geometry-aware Weakly Supervised 3D Object Detection
par: Zhang, Guowen, et autres
Publié: (2024)
par: Zhang, Guowen, et autres
Publié: (2024)
Boosting Semi-Supervised Object Detection in Remote Sensing Images With Active Teaching
par: Zhang, Boxuan, et autres
Publié: (2024)
par: Zhang, Boxuan, et autres
Publié: (2024)
RT-DETRv4: Painlessly Furthering Real-Time Object Detection with Vision Foundation Models
par: Liao, Zijun, et autres
Publié: (2025)
par: Liao, Zijun, et autres
Publié: (2025)
Boosting Salient Object Detection with Knowledge Distillated from Large Foundation Models
par: He, Miaoyang, et autres
Publié: (2025)
par: He, Miaoyang, et autres
Publié: (2025)
Gaze-Regularized Vision-Language-Action Models for Robotic Manipulation
par: Pani, Anupam, et autres
Publié: (2026)
par: Pani, Anupam, et autres
Publié: (2026)
Interpreting Object-level Foundation Models via Visual Precision Search
par: Chen, Ruoyu, et autres
Publié: (2024)
par: Chen, Ruoyu, et autres
Publié: (2024)
From Pixels to Words -- Towards Native One-Vision Models at Scale
par: Diao, Haiwen, et autres
Publié: (2026)
par: Diao, Haiwen, et autres
Publié: (2026)
There is No VAE: End-to-End Pixel-Space Generative Modeling via Self-Supervised Pre-training
par: Lei, Jiachen, et autres
Publié: (2025)
par: Lei, Jiachen, et autres
Publié: (2025)
One Language-Free Foundation Model Is Enough for Universal Vision Anomaly Detection
par: Gao, Bin-Bin, et autres
Publié: (2026)
par: Gao, Bin-Bin, et autres
Publié: (2026)
Vector-Quantized Vision Foundation Models for Object-Centric Learning
par: Zhao, Rongzhen, et autres
Publié: (2025)
par: Zhao, Rongzhen, et autres
Publié: (2025)
TextGaze: Gaze-Controllable Face Generation with Natural Language
par: Wang, Hengfei, et autres
Publié: (2024)
par: Wang, Hengfei, et autres
Publié: (2024)
From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models
par: Lin, Yihan, et autres
Publié: (2026)
par: Lin, Yihan, et autres
Publié: (2026)
Documents similaires
-
GaTector+: A Unified Head-free Framework for Gaze Object and Gaze Following Prediction
par: Jin, Yang, et autres
Publié: (2025) -
TransGOP: Transformer-Based Gaze Object Prediction
par: Wang, Binglu, et autres
Publié: (2024) -
Beyond Pixel-Wise Supervision for Medical Image Segmentation: From Traditional Models to Foundation Models
par: Shi, Yuyan, et autres
Publié: (2024) -
Enhancing Gaze Reasoning in Vision Foundation Models for Gaze Following
par: Wang, Shijing, et autres
Publié: (2026) -
Evaluating Vision Foundation Models for Pixel and Object Classification in Microscopy
par: Teuber, Carolin, et autres
Publié: (2026)