RGBD Gaze Tracking Using Transformer for Feature Fusion
Fuente:
arXiv
Saved in:
| Main Author: | Bauer, Tobias J. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DRMOT: A Dataset and Framework for RGBD Referring Multi-Object Tracking
by: Chen, Sijia, et al.
Published: (2026)
by: Chen, Sijia, et al.
Published: (2026)
LGBP-OrgaNet: Learnable Gaussian Band Pass Fusion of CNN and Transformer Features for Robust Organoid Segmentation and Tracking
by: Zhang, Jing, et al.
Published: (2025)
by: Zhang, Jing, et al.
Published: (2025)
GazeFusion: Saliency-Guided Image Generation
by: Zhang, Yunxiang, et al.
Published: (2024)
by: Zhang, Yunxiang, et al.
Published: (2024)
GazeFormer-MoE: Context-Aware Gaze Estimation via CLIP and MoE Transformer
by: Zhao, Xinyuan, et al.
Published: (2026)
by: Zhao, Xinyuan, et al.
Published: (2026)
CAViT -- Channel-Aware Vision Transformer for Dynamic Feature Fusion
by: Safdar, Aon, et al.
Published: (2026)
by: Safdar, Aon, et al.
Published: (2026)
Feature Fusion Transferability Aware Transformer for Unsupervised Domain Adaptation
by: Yu, Xiaowei, et al.
Published: (2024)
by: Yu, Xiaowei, et al.
Published: (2024)
DeepFake Detection in Dyadic Video Calls using Point of Gaze Tracking
by: Kohler, Odin, et al.
Published: (2025)
by: Kohler, Odin, et al.
Published: (2025)
3D Gaze Tracking for Studying Collaborative Interactions in Mixed-Reality Environments
by: Davalos, Eduardo, et al.
Published: (2024)
by: Davalos, Eduardo, et al.
Published: (2024)
Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs
by: Li, Yiwei, et al.
Published: (2026)
by: Li, Yiwei, et al.
Published: (2026)
DMAGaze: Gaze Estimation Based on Feature Disentanglement and Multi-Scale Attention
by: Chen, Haohan, et al.
Published: (2025)
by: Chen, Haohan, et al.
Published: (2025)
GazeMoE: Perception of Gaze Target with Mixture-of-Experts
by: Dai, Zhuangzhuang, et al.
Published: (2026)
by: Dai, Zhuangzhuang, et al.
Published: (2026)
Deep Learning-Based Direct Leaf Area Estimation using Two RGBD Datasets for Model Development
by: Jayasuriya, Namal, et al.
Published: (2025)
by: Jayasuriya, Namal, et al.
Published: (2025)
CR3DT: Camera-RADAR Fusion for 3D Detection and Tracking
by: Baumann, Nicolas, et al.
Published: (2024)
by: Baumann, Nicolas, et al.
Published: (2024)
An Innovative Framework for Breast Cancer Detection Using Pyramid Adaptive Atrous Convolution, Transformer Integration, and Multi-Scale Feature Fusion
by: Pour, Ehsan Sadeghi, et al.
Published: (2026)
by: Pour, Ehsan Sadeghi, et al.
Published: (2026)
Gaze-VLM:Bridging Gaze and VLMs through Attention Regularization for Egocentric Understanding
by: Pani, Anupam, et al.
Published: (2025)
by: Pani, Anupam, et al.
Published: (2025)
GazeVLM: A Vision-Language Model for Multi-Task Gaze Understanding
by: Mathew, Athul M., et al.
Published: (2025)
by: Mathew, Athul M., et al.
Published: (2025)
GazeQwen: Lightweight Gaze-Conditioned LLM Modulation for Streaming Video Understanding
by: Pham, Trong Thang, et al.
Published: (2026)
by: Pham, Trong Thang, et al.
Published: (2026)
AFFormer: Adaptive Feature Fusion Transformer for V2X Cooperative Perception under Channel Impairments
by: Zhou, Xi, et al.
Published: (2026)
by: Zhou, Xi, et al.
Published: (2026)
FovealNet: Advancing AI-Driven Gaze Tracking Solutions for Optimized Foveated Rendering System Performance in Virtual Reality
by: Liu, Wenxuan, et al.
Published: (2024)
by: Liu, Wenxuan, et al.
Published: (2024)
TPP-Gaze: Modelling Gaze Dynamics in Space and Time with Neural Temporal Point Processes
by: D'Amelio, Alessandro, et al.
Published: (2024)
by: D'Amelio, Alessandro, et al.
Published: (2024)
MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion
by: Hua, Wei, et al.
Published: (2025)
by: Hua, Wei, et al.
Published: (2025)
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders
by: Lee, Dohun, et al.
Published: (2025)
by: Lee, Dohun, et al.
Published: (2025)
D2Fusion: Dual-domain Fusion with Feature Superposition for Deepfake Detection
by: Qiu, Xueqi, et al.
Published: (2025)
by: Qiu, Xueqi, et al.
Published: (2025)
Feature Fusion for Human Activity Recognition using Parameter-Optimized Multi-Stage Graph Convolutional Network and Transformer Models
by: Belal, Mohammad, et al.
Published: (2024)
by: Belal, Mohammad, et al.
Published: (2024)
FastTrackTr:Towards Fast Multi-Object Tracking with Transformers
by: Liao, Pan, et al.
Published: (2024)
by: Liao, Pan, et al.
Published: (2024)
Learning Gaze-aware Compositional GAN
by: Aranjuelo, Nerea, et al.
Published: (2024)
by: Aranjuelo, Nerea, et al.
Published: (2024)
CSTrack: Enhancing RGB-X Tracking via Compact Spatiotemporal Features
by: Feng, X., et al.
Published: (2025)
by: Feng, X., et al.
Published: (2025)
Learning Spatio-Temporal Feature Representations for Video-Based Gaze Estimation
by: Personnic, Alexandre, et al.
Published: (2025)
by: Personnic, Alexandre, et al.
Published: (2025)
Lightweight Deepfake Detection Based on Multi-Feature Fusion
by: Yasir, Siddiqui Muhammad, et al.
Published: (2025)
by: Yasir, Siddiqui Muhammad, et al.
Published: (2025)
Frequency-aware Feature Fusion for Dense Image Prediction
by: Chen, Linwei, et al.
Published: (2024)
by: Chen, Linwei, et al.
Published: (2024)
MapFusion: A Novel BEV Feature Fusion Network for Multi-modal Map Construction
by: Hao, Xiaoshuai, et al.
Published: (2025)
by: Hao, Xiaoshuai, et al.
Published: (2025)
STNet: Deep Audio-Visual Fusion Network for Robust Speaker Tracking
by: Li, Yidi, et al.
Published: (2024)
by: Li, Yidi, et al.
Published: (2024)
Surformer v1: Transformer-Based Surface Classification Using Tactile and Vision Features
by: Kansana, Manish, et al.
Published: (2025)
by: Kansana, Manish, et al.
Published: (2025)
GazeSearch: Radiology Findings Search Benchmark
by: Pham, Trong Thang, et al.
Published: (2024)
by: Pham, Trong Thang, et al.
Published: (2024)
StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos
by: Lee, Daeun, et al.
Published: (2025)
by: Lee, Daeun, et al.
Published: (2025)
Dual Prompt-Driven Feature Encoding for Nighttime UAV Tracking
by: Wang, Yiheng, et al.
Published: (2026)
by: Wang, Yiheng, et al.
Published: (2026)
GazeTrack: High-Precision Eye Tracking Based on Regularization and Spatial Computing
by: Yang, Xiaoyin
Published: (2025)
by: Yang, Xiaoyin
Published: (2025)
Progressive Feature Fusion Network for Enhancing Image Quality Assessment
by: Wu, Kaiqun, et al.
Published: (2024)
by: Wu, Kaiqun, et al.
Published: (2024)
Local and Global Feature Attention Fusion Network for Face Recognition
by: Yu, Wang, et al.
Published: (2024)
by: Yu, Wang, et al.
Published: (2024)
Sparse BEV Fusion with Self-View Consistency for Multi-View Detection and Tracking
by: Toida, Keisuke, et al.
Published: (2025)
by: Toida, Keisuke, et al.
Published: (2025)
Similar Items
-
DRMOT: A Dataset and Framework for RGBD Referring Multi-Object Tracking
by: Chen, Sijia, et al.
Published: (2026) -
LGBP-OrgaNet: Learnable Gaussian Band Pass Fusion of CNN and Transformer Features for Robust Organoid Segmentation and Tracking
by: Zhang, Jing, et al.
Published: (2025) -
GazeFusion: Saliency-Guided Image Generation
by: Zhang, Yunxiang, et al.
Published: (2024) -
GazeFormer-MoE: Context-Aware Gaze Estimation via CLIP and MoE Transformer
by: Zhao, Xinyuan, et al.
Published: (2026) -
CAViT -- Channel-Aware Vision Transformer for Dynamic Feature Fusion
by: Safdar, Aon, et al.
Published: (2026)