Gaze-Regularized VLMs for Ego-Centric Behavior Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pani, Anupam, Yang, Yanchao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Gaze-VLM:Bridging Gaze and VLMs through Attention Regularization for Egocentric Understanding
par: Pani, Anupam, et autres
Publié: (2025)
par: Pani, Anupam, et autres
Publié: (2025)
Gaze-Regularized Vision-Language-Action Models for Robotic Manipulation
par: Pani, Anupam, et autres
Publié: (2026)
par: Pani, Anupam, et autres
Publié: (2026)
ObjectRelator: Enabling Cross-View Object Relation Understanding Across Ego-Centric and Exo-Centric Perspectives
par: Fu, Yuqian, et autres
Publié: (2024)
par: Fu, Yuqian, et autres
Publié: (2024)
EgoExOR: An Ego-Exo-Centric Operating Room Dataset for Surgical Activity Understanding
par: Özsoy, Ege, et autres
Publié: (2025)
par: Özsoy, Ege, et autres
Publié: (2025)
Understanding Dynamic Scenes in Ego Centric 4D Point Clouds
par: Huang, Junsheng, et autres
Publié: (2025)
par: Huang, Junsheng, et autres
Publié: (2025)
From My View to Yours: Ego-to-Exo Transfer in VLMs for Understanding Activities of Daily Living
par: Reilly, Dominick, et autres
Publié: (2025)
par: Reilly, Dominick, et autres
Publié: (2025)
Eye Gaze Tells You Where to Compute: Gaze-Driven Efficient VLMs
par: Chen, Qinyu, et autres
Publié: (2025)
par: Chen, Qinyu, et autres
Publié: (2025)
EgoSound: Benchmarking Sound Understanding in Egocentric Videos
par: Zhu, Bingwen, et autres
Publié: (2026)
par: Zhu, Bingwen, et autres
Publié: (2026)
Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos
par: Ge, Mengmeng, et autres
Publié: (2026)
par: Ge, Mengmeng, et autres
Publié: (2026)
EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving
par: Schäfer, Finn Rasmus, et autres
Publié: (2026)
par: Schäfer, Finn Rasmus, et autres
Publié: (2026)
EgoCampus: Egocentric Pedestrian Eye Gaze Model and Dataset
par: John, Ronan, et autres
Publié: (2025)
par: John, Ronan, et autres
Publié: (2025)
ECHO: Ego-Centric modeling of Human-Object interactions
par: Petrov, Ilya A., et autres
Publié: (2025)
par: Petrov, Ilya A., et autres
Publié: (2025)
VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality
par: Bandraupalli, Srihari, et autres
Publié: (2025)
par: Bandraupalli, Srihari, et autres
Publié: (2025)
From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation
par: Mahdi, Mohammad, et autres
Publié: (2026)
par: Mahdi, Mohammad, et autres
Publié: (2026)
GazeNLQ @ Ego4D Natural Language Queries Challenge 2025
par: Lin, Wei-Cheng, et autres
Publié: (2025)
par: Lin, Wei-Cheng, et autres
Publié: (2025)
ENIGMA-360: An Ego-Exo Dataset for Human Behavior Understanding in Industrial Scenarios
par: Ragusa, Francesco, et autres
Publié: (2026)
par: Ragusa, Francesco, et autres
Publié: (2026)
A Review of Driver Gaze Estimation and Application in Gaze Behavior Understanding
par: Sharma, Pavan Kumar, et autres
Publié: (2023)
par: Sharma, Pavan Kumar, et autres
Publié: (2023)
EgoFSD: Ego-Centric Fully Sparse Paradigm with Uncertainty Denoising and Iterative Refinement for Efficient End-to-End Self-Driving
par: Su, Haisheng, et autres
Publié: (2024)
par: Su, Haisheng, et autres
Publié: (2024)
EgoNight: Towards Egocentric Vision Understanding at Night with a Challenging Benchmark
par: Zhang, Deheng, et autres
Publié: (2025)
par: Zhang, Deheng, et autres
Publié: (2025)
EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning
par: Wang, Zeyu, et autres
Publié: (2026)
par: Wang, Zeyu, et autres
Publié: (2026)
Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
par: Gholami, Mohsen, et autres
Publié: (2025)
par: Gholami, Mohsen, et autres
Publié: (2025)
EgoAVU: Egocentric Audio-Visual Understanding
par: Seth, Ashish, et autres
Publié: (2026)
par: Seth, Ashish, et autres
Publié: (2026)
Leveraging Driver Field-of-View for Multimodal Ego-Trajectory Prediction
par: Akbiyik, M. Eren, et autres
Publié: (2023)
par: Akbiyik, M. Eren, et autres
Publié: (2023)
Contour Errors: An Ego-Centric Metric for Reliable 3D Multi-Object Tracking
par: Kaul, Sharang, et autres
Publié: (2025)
par: Kaul, Sharang, et autres
Publié: (2025)
Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs
par: Li, Yiwei, et autres
Publié: (2026)
par: Li, Yiwei, et autres
Publié: (2026)
Event-Free Moving Object Segmentation from Moving Ego Vehicle
par: Zhou, Zhuyun, et autres
Publié: (2023)
par: Zhou, Zhuyun, et autres
Publié: (2023)
On the Perception Bottleneck of VLMs for Chart Understanding
par: Liu, Junteng, et autres
Publié: (2025)
par: Liu, Junteng, et autres
Publié: (2025)
CIVET: Systematic Evaluation of Understanding in VLMs
par: Rizzoli, Massimo, et autres
Publié: (2025)
par: Rizzoli, Massimo, et autres
Publié: (2025)
Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis
par: Mahdi, Mohammad, et autres
Publié: (2025)
par: Mahdi, Mohammad, et autres
Publié: (2025)
Linear Scaling Video VLMs for Long Video Understanding
par: Eyzaguirre, Cristobal, et autres
Publié: (2026)
par: Eyzaguirre, Cristobal, et autres
Publié: (2026)
EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding
par: Sun, Shitong, et autres
Publié: (2026)
par: Sun, Shitong, et autres
Publié: (2026)
DenseGrounding: Improving Dense Language-Vision Semantics for Ego-Centric 3D Visual Grounding
par: Zheng, Henry, et autres
Publié: (2025)
par: Zheng, Henry, et autres
Publié: (2025)
EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs
par: Dai, Yang, et autres
Publié: (2026)
par: Dai, Yang, et autres
Publié: (2026)
Omni-Scene: Omni-Gaussian Representation for Ego-Centric Sparse-View Scene Reconstruction
par: Wei, Dongxu, et autres
Publié: (2024)
par: Wei, Dongxu, et autres
Publié: (2024)
EgoSpot:Egocentric Multimodal Control for Hands-Free Mobile Manipulation
par: Zhang, Ganlin, et autres
Publié: (2023)
par: Zhang, Ganlin, et autres
Publié: (2023)
Improving Domain Generalization on Gaze Estimation via Branch-out Auxiliary Regularization
par: Zhao, Ruijie, et autres
Publié: (2024)
par: Zhao, Ruijie, et autres
Publié: (2024)
Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025
par: Fu, Yuqian, et autres
Publié: (2025)
par: Fu, Yuqian, et autres
Publié: (2025)
EgoInteract: Synthetic Egocentric Videos Generation for Interaction Understanding and Anticipation
par: Leonardi, Rosario, et autres
Publié: (2026)
par: Leonardi, Rosario, et autres
Publié: (2026)
Understanding and Modeling the Effects of Task and Context on Drivers' Gaze Allocation
par: Kotseruba, Iuliia, et autres
Publié: (2023)
par: Kotseruba, Iuliia, et autres
Publié: (2023)
MomentSeg: Moment-Centric Sampling for Enhanced Video Pixel Understanding
par: Dai, Ming, et autres
Publié: (2025)
par: Dai, Ming, et autres
Publié: (2025)
Documents similaires
-
Gaze-VLM:Bridging Gaze and VLMs through Attention Regularization for Egocentric Understanding
par: Pani, Anupam, et autres
Publié: (2025) -
Gaze-Regularized Vision-Language-Action Models for Robotic Manipulation
par: Pani, Anupam, et autres
Publié: (2026) -
ObjectRelator: Enabling Cross-View Object Relation Understanding Across Ego-Centric and Exo-Centric Perspectives
par: Fu, Yuqian, et autres
Publié: (2024) -
EgoExOR: An Ego-Exo-Centric Operating Room Dataset for Surgical Activity Understanding
par: Özsoy, Ege, et autres
Publié: (2025) -
Understanding Dynamic Scenes in Ego Centric 4D Point Clouds
par: Huang, Junsheng, et autres
Publié: (2025)