ViTGaze: Gaze Following with Interaction Features in Vision Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Song, Yuehao, Wang, Xinggang, Yao, Jingfeng, Liu, Wenyu, Zhang, Jinglin, Xu, Xiangmin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PersonViT: Large-scale Self-supervised Vision Transformer for Person Re-Identification
par: Hu, Bin, et autres
Publié: (2024)
par: Hu, Bin, et autres
Publié: (2024)
FasterDiT: Towards Faster Diffusion Transformers Training without Architecture Modification
par: Yao, Jingfeng, et autres
Publié: (2024)
par: Yao, Jingfeng, et autres
Publié: (2024)
Matte Anything: Interactive Natural Image Matting with Segment Anything Models
par: Yao, Jingfeng, et autres
Publié: (2023)
par: Yao, Jingfeng, et autres
Publié: (2023)
EVA-X: A Foundation Model for General Chest X-ray Analysis with Self-supervised Learning
par: Yao, Jingfeng, et autres
Publié: (2024)
par: Yao, Jingfeng, et autres
Publié: (2024)
DeltaMIL: Gated Memory Integration for Efficient and Discriminative Whole Slide Image Analysis
par: Zhu, Yueting, et autres
Publié: (2025)
par: Zhu, Yueting, et autres
Publié: (2025)
DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models
par: Zeng, Lunbin, et autres
Publié: (2025)
par: Zeng, Lunbin, et autres
Publié: (2025)
MaTVLM: Hybrid Mamba-Transformer for Efficient Vision-Language Modeling
par: Li, Yingyue, et autres
Publié: (2025)
par: Li, Yingyue, et autres
Publié: (2025)
Turbo-VAED: Fast and Stable Transfer of Video-VAEs to Mobile Devices
par: Zou, Ya, et autres
Publié: (2025)
par: Zou, Ya, et autres
Publié: (2025)
RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework
par: Gao, Hao, et autres
Publié: (2026)
par: Gao, Hao, et autres
Publié: (2026)
Towards Scalable Pre-training of Visual Tokenizers for Generation
par: Yao, Jingfeng, et autres
Publié: (2025)
par: Yao, Jingfeng, et autres
Publié: (2025)
Causality-inspired Discriminative Feature Learning in Triple Domains for Gait Recognition
par: Xiong, Haijun, et autres
Publié: (2024)
par: Xiong, Haijun, et autres
Publié: (2024)
Cross-Layer Attentive Feature Upsampling for Low-latency Semantic Segmentation
par: Cheng, Tianheng, et autres
Publié: (2026)
par: Cheng, Tianheng, et autres
Publié: (2026)
Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models
par: Yao, Jingfeng, et autres
Publié: (2025)
par: Yao, Jingfeng, et autres
Publié: (2025)
DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
par: Zou, Jialv, et autres
Publié: (2025)
par: Zou, Jialv, et autres
Publié: (2025)
WeakTr: Exploring Plain Vision Transformer for Weakly-supervised Semantic Segmentation
par: Zhu, Lianghui, et autres
Publié: (2023)
par: Zhu, Lianghui, et autres
Publié: (2023)
LKCell: Efficient Cell Nuclei Instance Segmentation with Large Convolution Kernels
par: Cui, Ziwei, et autres
Publié: (2024)
par: Cui, Ziwei, et autres
Publié: (2024)
Enhancing Gaze Reasoning in Vision Foundation Models for Gaze Following
par: Wang, Shijing, et autres
Publié: (2026)
par: Wang, Shijing, et autres
Publié: (2026)
GaitGS: Temporal Feature Learning in Granularity and Span Dimension for Gait Recognition
par: Xiong, Haijun, et autres
Publié: (2023)
par: Xiong, Haijun, et autres
Publié: (2023)
ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense Predictions
par: Xia, Chunlong, et autres
Publié: (2024)
par: Xia, Chunlong, et autres
Publié: (2024)
VL4Gaze: Unleashing Vision-Language Models for Gaze Following
par: Wang, Shijing, et autres
Publié: (2025)
par: Wang, Shijing, et autres
Publié: (2025)
GaraMoSt: Parallel Multi-Granularity Motion and Structural Modeling for Efficient Multi-Frame Interpolation in DSA Images
par: Xu, Ziyang, et autres
Publié: (2024)
par: Xu, Ziyang, et autres
Publié: (2024)
ViTCN: Vision Transformer Contrastive Network For Reasoning
par: Song, Bo, et autres
Publié: (2024)
par: Song, Bo, et autres
Publié: (2024)
Polar Parametrization for Vision-based Surround-View 3D Detection
par: Chen, Shaoyu, et autres
Publié: (2022)
par: Chen, Shaoyu, et autres
Publié: (2022)
PointCore: Efficient Unsupervised Point Cloud Anomaly Detector Using Local-Global Features
par: Zhao, Baozhu, et autres
Publié: (2024)
par: Zhao, Baozhu, et autres
Publié: (2024)
MoSt-DSA: Modeling Motion and Structural Interactions for Direct Multi-Frame Interpolation in DSA Images
par: Xu, Ziyang, et autres
Publié: (2024)
par: Xu, Ziyang, et autres
Publié: (2024)
MolSight: Optical Chemical Structure Recognition with SMILES Pretraining, Multi-Granularity Learning and Reinforcement Learning
par: Zhang, Wenrui, et autres
Publié: (2025)
par: Zhang, Wenrui, et autres
Publié: (2025)
Eyes on VLM: Benchmarking Gaze Following and Social Gaze Prediction in Vision Language Models
par: Wang, Hengfei, et autres
Publié: (2026)
par: Wang, Hengfei, et autres
Publié: (2026)
MobileI2V: Fast and High-Resolution Image-to-Video on Mobile Devices
par: Zhang, Shuai, et autres
Publié: (2025)
par: Zhang, Shuai, et autres
Publié: (2025)
Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model
par: Zhu, Lianghui, et autres
Publié: (2024)
par: Zhu, Lianghui, et autres
Publié: (2024)
ViT-5: Vision Transformers for The Mid-2020s
par: Wang, Feng, et autres
Publié: (2026)
par: Wang, Feng, et autres
Publié: (2026)
Visual Generation Tuning
par: Guo, Jiahao, et autres
Publié: (2025)
par: Guo, Jiahao, et autres
Publié: (2025)
OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models
par: Zou, Jialv, et autres
Publié: (2025)
par: Zou, Jialv, et autres
Publié: (2025)
MIM4D: Masked Modeling with Multi-View Video for Autonomous Driving Representation Learning
par: Zou, Jialv, et autres
Publié: (2024)
par: Zou, Jialv, et autres
Publié: (2024)
ReViT: Enhancing Vision Transformers Feature Diversity with Attention Residual Connections
par: Diko, Anxhelo, et autres
Publié: (2024)
par: Diko, Anxhelo, et autres
Publié: (2024)
ViT-Explainer: An Interactive Walkthrough of the Vision Transformer Pipeline
par: Hernandez, Juan Manuel, et autres
Publié: (2026)
par: Hernandez, Juan Manuel, et autres
Publié: (2026)
YOLO-World: Real-Time Open-Vocabulary Object Detection
par: Cheng, Tianheng, et autres
Publié: (2024)
par: Cheng, Tianheng, et autres
Publié: (2024)
Gait Recognition via Collaborating Discriminative and Generative Diffusion Models
par: Xiong, Haijun, et autres
Publié: (2025)
par: Xiong, Haijun, et autres
Publié: (2025)
ViTAR: Vision Transformer with Any Resolution
par: Fan, Qihang, et autres
Publié: (2024)
par: Fan, Qihang, et autres
Publié: (2024)
EA-ViT: Efficient Adaptation for Elastic Vision Transformer
par: Zhu, Chen, et autres
Publié: (2025)
par: Zhu, Chen, et autres
Publié: (2025)
GaussTR: Foundation Model-Aligned Gaussian Transformer for Self-Supervised 3D Spatial Understanding
par: Jiang, Haoyi, et autres
Publié: (2024)
par: Jiang, Haoyi, et autres
Publié: (2024)
Documents similaires
-
PersonViT: Large-scale Self-supervised Vision Transformer for Person Re-Identification
par: Hu, Bin, et autres
Publié: (2024) -
FasterDiT: Towards Faster Diffusion Transformers Training without Architecture Modification
par: Yao, Jingfeng, et autres
Publié: (2024) -
Matte Anything: Interactive Natural Image Matting with Segment Anything Models
par: Yao, Jingfeng, et autres
Publié: (2023) -
EVA-X: A Foundation Model for General Chest X-ray Analysis with Self-supervised Learning
par: Yao, Jingfeng, et autres
Publié: (2024) -
DeltaMIL: Gated Memory Integration for Efficient and Discriminative Whole Slide Image Analysis
par: Zhu, Yueting, et autres
Publié: (2025)