ARGaze: Autoregressive Transformers for Online Egocentric Gaze Estimation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Jia, Zhao, Wenjie, Deng, Shijian, Lai, Bolin, Wu, Yuheng, Chen, RUijia, Froehlich, Jon E., Zhao, Yuhang, Tian, Yapeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
In the Eye of Transformer: Global-Local Correlation for Egocentric Gaze Estimation
par: Lai, Bolin, et autres
Publié: (2022)
par: Lai, Bolin, et autres
Publié: (2022)
Towards Online Multi-Modal Social Interaction Understanding
par: Li, Xinpeng, et autres
Publié: (2025)
par: Li, Xinpeng, et autres
Publié: (2025)
Listen to Look into the Future: Audio-Visual Egocentric Gaze Anticipation
par: Lai, Bolin, et autres
Publié: (2023)
par: Lai, Bolin, et autres
Publié: (2023)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
par: Wang, Kai, et autres
Publié: (2024)
par: Wang, Kai, et autres
Publié: (2024)
Omni-MMSI: Toward Identity-attributed Social Interaction Understanding
par: Li, Xinpeng, et autres
Publié: (2026)
par: Li, Xinpeng, et autres
Publié: (2026)
Toward Gaze Target Detection of Young Autistic Children
par: Deng, Shijian, et autres
Publié: (2025)
par: Deng, Shijian, et autres
Publié: (2025)
Egocentric Gaze Estimation via Neck-Mounted Camera
par: Huang, Haoyu, et autres
Publié: (2026)
par: Huang, Haoyu, et autres
Publié: (2026)
MetaRank: Task-Aware Metric Selection for Model Transferability Estimation
par: Liu, Yuhang, et autres
Publié: (2025)
par: Liu, Yuhang, et autres
Publié: (2025)
Mitigating the ID-OOD Tradeoff in Open-Set Test-Time Adaptation
par: Zhao, Wenjie, et autres
Publié: (2026)
par: Zhao, Wenjie, et autres
Publié: (2026)
Personalized Federated Learning for Egocentric Video Gaze Estimation with Comprehensive Parameter Frezzing
par: Feng, Yuhu, et autres
Publié: (2025)
par: Feng, Yuhu, et autres
Publié: (2025)
GazeFormer-MoE: Context-Aware Gaze Estimation via CLIP and MoE Transformer
par: Zhao, Xinyuan, et autres
Publié: (2026)
par: Zhao, Xinyuan, et autres
Publié: (2026)
GMGaze: MoE-Based Context-Aware Gaze Estimation with CLIP and Multiscale Transformer
par: Zhao, Xinyuan, et autres
Publié: (2026)
par: Zhao, Xinyuan, et autres
Publié: (2026)
Infinite Gaze Generation for Videos with Autoregressive Diffusion
par: Kang, Jenna, et autres
Publié: (2026)
par: Kang, Jenna, et autres
Publié: (2026)
From Waveforms to Pixels: A Survey on Audio-Visual Segmentation
par: Li, Jia, et autres
Publié: (2025)
par: Li, Jia, et autres
Publié: (2025)
SecureGaze: Defending Gaze Estimation Against Backdoor Attacks
par: Du, Lingyu, et autres
Publié: (2025)
par: Du, Lingyu, et autres
Publié: (2025)
Gaze-VLM:Bridging Gaze and VLMs through Attention Regularization for Egocentric Understanding
par: Pani, Anupam, et autres
Publié: (2025)
par: Pani, Anupam, et autres
Publié: (2025)
Explainable AI-Generated Image Detection RewardBench
par: Yang, Michael, et autres
Publié: (2025)
par: Yang, Michael, et autres
Publié: (2025)
EgoCampus: Egocentric Pedestrian Eye Gaze Model and Dataset
par: John, Ronan, et autres
Publié: (2025)
par: John, Ronan, et autres
Publié: (2025)
Gazing Into Missteps: Leveraging Eye-Gaze for Unsupervised Mistake Detection in Egocentric Videos of Skilled Human Activities
par: Mazzamuto, Michele, et autres
Publié: (2024)
par: Mazzamuto, Michele, et autres
Publié: (2024)
Gaze Beyond the Frame: Forecasting Egocentric 3D Visual Span
par: Yun, Heeseung, et autres
Publié: (2025)
par: Yun, Heeseung, et autres
Publié: (2025)
Efficient Self-Improvement in Multimodal Large Language Models: A Model-Level Judge-Free Approach
par: Deng, Shijian, et autres
Publié: (2024)
par: Deng, Shijian, et autres
Publié: (2024)
PRVQL: Progressive Knowledge-guided Refinement for Robust Egocentric Visual Query Localization
par: Fan, Bing, et autres
Publié: (2025)
par: Fan, Bing, et autres
Publié: (2025)
Differential Contrastive Training for Gaze Estimation
par: Zhang, Lin, et autres
Publié: (2025)
par: Zhang, Lin, et autres
Publié: (2025)
Distillation Dynamics: Towards Understanding Feature-Based Distillation in Vision Transformers
par: Tian, Huiyuan, et autres
Publié: (2025)
par: Tian, Huiyuan, et autres
Publié: (2025)
Eyes on Target: Gaze-Aware Object Detection in Egocentric Video
par: Lall, Vishakha, et autres
Publié: (2025)
par: Lall, Vishakha, et autres
Publié: (2025)
Merging Multiple Datasets for Improved Appearance-Based Gaze Estimation
par: Wu, Liang, et autres
Publié: (2024)
par: Wu, Liang, et autres
Publié: (2024)
In the Eye of MLLM: Benchmarking Egocentric Video Intent Understanding with Gaze-Guided Prompting
par: Peng, Taiying, et autres
Publié: (2025)
par: Peng, Taiying, et autres
Publié: (2025)
EgoPrompt: Prompt Learning for Egocentric Action Recognition
par: Lyu, Huaihai, et autres
Publié: (2025)
par: Lyu, Huaihai, et autres
Publié: (2025)
From Per-Image Low-Rank to Encoding Mismatch: Rethinking Feature Distillation in Vision Transformers
par: Tian, Huiyuan, et autres
Publié: (2025)
par: Tian, Huiyuan, et autres
Publié: (2025)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
par: Pian, Weiguo, et autres
Publié: (2026)
par: Pian, Weiguo, et autres
Publié: (2026)
Improving Domain Generalization on Gaze Estimation via Branch-out Auxiliary Regularization
par: Zhao, Ruijie, et autres
Publié: (2024)
par: Zhao, Ruijie, et autres
Publié: (2024)
Continual Audio-Visual Sound Separation
par: Pian, Weiguo, et autres
Publié: (2024)
par: Pian, Weiguo, et autres
Publié: (2024)
GazeShift: Unsupervised Gaze Estimation and Dataset for VR
par: Shapira, Gil, et autres
Publié: (2026)
par: Shapira, Gil, et autres
Publié: (2026)
H2ST: Hierarchical Two-Sample Tests for Continual Out-of-Distribution Detection
par: Liu, Yuhang, et autres
Publié: (2025)
par: Liu, Yuhang, et autres
Publié: (2025)
OmniGaze: Reward-inspired Generalizable Gaze Estimation In The Wild
par: Qu, Hongyu, et autres
Publié: (2025)
par: Qu, Hongyu, et autres
Publié: (2025)
Gaze Label Alignment: Alleviating Domain Shift for Gaze Estimation
par: Zeng, Guanzhong, et autres
Publié: (2024)
par: Zeng, Guanzhong, et autres
Publié: (2024)
Leveraging Gaze and Set-of-Mark in VLLMs for Human-Object Interaction Anticipation from Egocentric Videos
par: Materia, Daniele, et autres
Publié: (2026)
par: Materia, Daniele, et autres
Publié: (2026)
EyeCue: Driver Cognitive Distraction Detection via Gaze-Empowered Egocentric Video Understanding
par: Zhang, Lang, et autres
Publié: (2026)
par: Zhang, Lang, et autres
Publié: (2026)
SGAP-Gaze: Scene Grid Attention Based Point-of-Gaze Estimation Network for Driver Gaze
par: Sharma, Pavan Kumar, et autres
Publié: (2026)
par: Sharma, Pavan Kumar, et autres
Publié: (2026)
Quantifying the Impact of Motion on 2D Gaze Estimation in Real-World Mobile Interactions
par: Lei, Yaxiong, et autres
Publié: (2025)
par: Lei, Yaxiong, et autres
Publié: (2025)
Documents similaires
-
In the Eye of Transformer: Global-Local Correlation for Egocentric Gaze Estimation
par: Lai, Bolin, et autres
Publié: (2022) -
Towards Online Multi-Modal Social Interaction Understanding
par: Li, Xinpeng, et autres
Publié: (2025) -
Listen to Look into the Future: Audio-Visual Egocentric Gaze Anticipation
par: Lai, Bolin, et autres
Publié: (2023) -
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
par: Wang, Kai, et autres
Publié: (2024) -
Omni-MMSI: Toward Identity-attributed Social Interaction Understanding
par: Li, Xinpeng, et autres
Publié: (2026)