Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Choi, Yura, Miles, Roy, Potamias, Rolandos Alexandros, Elezi, Ismail, Deng, Jiankang, Zafeiriou, Stefanos |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
WiLoR: End-to-end 3D Hand Localization and Reconstruction in-the-wild
par: Potamias, Rolandos Alexandros, et autres
Publié: (2024)
par: Potamias, Rolandos Alexandros, et autres
Publié: (2024)
SAGS: Structure-Aware 3D Gaussian Splatting
par: Ververas, Evangelos, et autres
Publié: (2024)
par: Ververas, Evangelos, et autres
Publié: (2024)
Signs as Tokens: A Retrieval-Enhanced Multilingual Sign Language Generator
par: Zuo, Ronglai, et autres
Publié: (2024)
par: Zuo, Ronglai, et autres
Publié: (2024)
ImHead: A Large-scale Implicit Morphable Model for Localized Head Modeling
par: Potamias, Rolandos Alexandros, et autres
Publié: (2025)
par: Potamias, Rolandos Alexandros, et autres
Publié: (2025)
Design2Cloth: 3D Cloth Generation from 2D Masks
par: Zheng, Jiali, et autres
Publié: (2024)
par: Zheng, Jiali, et autres
Publié: (2024)
HaWoR: World-Space Hand Motion Reconstruction from Egocentric Videos
par: Zhang, Jinglei, et autres
Publié: (2025)
par: Zhang, Jinglei, et autres
Publié: (2025)
Dex2HOI: Dexterous Bimanual Two-Object Interaction Generation
par: Pratikaki, Chrysa, et autres
Publié: (2026)
par: Pratikaki, Chrysa, et autres
Publié: (2026)
HO-Flow: Generalizable Hand-Object Interaction Generation with Latent Flow Matching
par: Chen, Zerui, et autres
Publié: (2026)
par: Chen, Zerui, et autres
Publié: (2026)
Neural Sign Actors: A diffusion model for 3D sign language production from text
par: Baltatzis, Vasileios, et autres
Publié: (2023)
par: Baltatzis, Vasileios, et autres
Publié: (2023)
MaDiS: Taming Masked Diffusion Language Models for Sign Language Generation
par: Zuo, Ronglai, et autres
Publié: (2026)
par: Zuo, Ronglai, et autres
Publié: (2026)
ShapeFusion: A 3D diffusion model for localized shape editing
par: Potamias, Rolandos Alexandros, et autres
Publié: (2024)
par: Potamias, Rolandos Alexandros, et autres
Publié: (2024)
$V_kD:$ Improving Knowledge Distillation using Orthogonal Projections
par: Miles, Roy, et autres
Publié: (2024)
par: Miles, Roy, et autres
Publié: (2024)
STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits
par: Papantoniou, Foivos Paraperas, et autres
Publié: (2025)
par: Papantoniou, Foivos Paraperas, et autres
Publié: (2025)
Arc2Avatar: Generating Expressive 3D Avatars from a Single Image via ID Guidance
par: Gerogiannis, Dimitrios, et autres
Publié: (2025)
par: Gerogiannis, Dimitrios, et autres
Publié: (2025)
Locally Adaptive Neural 3D Morphable Models
par: Tarasiou, Michail, et autres
Publié: (2024)
par: Tarasiou, Michail, et autres
Publié: (2024)
DreamCAD: Scaling Multi-modal CAD Generation using Differentiable Parametric Surfaces
par: Khan, Mohammad Sadil, et autres
Publié: (2026)
par: Khan, Mohammad Sadil, et autres
Publié: (2026)
VeLoRA: Memory Efficient Training using Rank-1 Sub-Token Projections
par: Miles, Roy, et autres
Publié: (2024)
par: Miles, Roy, et autres
Publié: (2024)
VTimeCoT: Thinking by Drawing for Video Temporal Grounding and Reasoning
par: Zhang, Jinglei, et autres
Publié: (2025)
par: Zhang, Jinglei, et autres
Publié: (2025)
AnimateMe: 4D Facial Expressions via Diffusion Models
par: Gerogiannis, Dimitrios, et autres
Publié: (2024)
par: Gerogiannis, Dimitrios, et autres
Publié: (2024)
ID-to-3D: Expressive ID-guided 3D Heads via Score Distillation Sampling
par: Babiloni, Francesca, et autres
Publié: (2024)
par: Babiloni, Francesca, et autres
Publié: (2024)
SATGround: A Spatially-Aware Approach for Visual Grounding in Remote Sensing
par: Toker, Aysim, et autres
Publié: (2025)
par: Toker, Aysim, et autres
Publié: (2025)
StableHand: Quality-Aware Flow Matching for World-Space Dual-Hand Motion Estimation from Egocentric Video
par: Zeng, Huajian, et autres
Publié: (2026)
par: Zeng, Huajian, et autres
Publié: (2026)
CEDex: Cross-Embodiment Dexterous Grasp Generation at Scale from Human-like Contact Representations
par: Wu, Zhiyuan, et autres
Publié: (2025)
par: Wu, Zhiyuan, et autres
Publié: (2025)
Interact2Ar: Full-Body Human-Human Interaction Generation via Autoregressive Diffusion Models
par: Ruiz-Ponce, Pablo, et autres
Publié: (2025)
par: Ruiz-Ponce, Pablo, et autres
Publié: (2025)
UniMorphGrasp: Diffusion Model with Morphology-Awareness for Cross-Embodiment Dexterous Grasp Generation
par: Wu, Zhiyuan, et autres
Publié: (2026)
par: Wu, Zhiyuan, et autres
Publié: (2026)
G3DR: Generative 3D Reconstruction in ImageNet
par: Reddy, Pradyumna, et autres
Publié: (2024)
par: Reddy, Pradyumna, et autres
Publié: (2024)
Deep Active Learning: A Reality Check
par: Gashi, Edrina, et autres
Publié: (2024)
par: Gashi, Edrina, et autres
Publié: (2024)
RetouchLLM: Training-free Code-based Image Retouching with Vision Language Models
par: Ye-Bin, Moon, et autres
Publié: (2025)
par: Ye-Bin, Moon, et autres
Publié: (2025)
ZeroGS: Training 3D Gaussian Splatting from Unposed Images
par: Chen, Yu, et autres
Publié: (2024)
par: Chen, Yu, et autres
Publié: (2024)
EgoGrasp: World-Space Hand-Object Interaction Estimation from Egocentric Videos
par: Fu, Hongming, et autres
Publié: (2026)
par: Fu, Hongming, et autres
Publié: (2026)
Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching
par: Miles, Roy, et autres
Publié: (2026)
par: Miles, Roy, et autres
Publié: (2026)
Improving face generation quality and prompt following with synthetic captions
par: Tarasiou, Michail, et autres
Publié: (2024)
par: Tarasiou, Michail, et autres
Publié: (2024)
From Attention to Activation: Unravelling the Enigmas of Large Language Models
par: Kaul, Prannay, et autres
Publié: (2024)
par: Kaul, Prannay, et autres
Publié: (2024)
HORT: Monocular Hand-held Objects Reconstruction with Transformers
par: Chen, Zerui, et autres
Publié: (2025)
par: Chen, Zerui, et autres
Publié: (2025)
Arc2Face: A Foundation Model for ID-Consistent Human Faces
par: Papantoniou, Foivos Paraperas, et autres
Publié: (2024)
par: Papantoniou, Foivos Paraperas, et autres
Publié: (2024)
Spatio-temporal Prompting Network for Robust Video Feature Extraction
par: Sun, Guanxiong, et autres
Publié: (2024)
par: Sun, Guanxiong, et autres
Publié: (2024)
DermaFlux: Synthetic Skin Lesion Generation with Rectified Flows for Enhanced Image Classification
par: Galanakis, Stathis, et autres
Publié: (2026)
par: Galanakis, Stathis, et autres
Publié: (2026)
What Am I Missing? Question-Answering as Hidden State Probing
par: Luo, Chu Fei, et autres
Publié: (2026)
par: Luo, Chu Fei, et autres
Publié: (2026)
Three Heads Are Better Than One: Complementary Experts for Long-Tailed Semi-supervised Learning
par: Ma, Chengcheng, et autres
Publié: (2023)
par: Ma, Chengcheng, et autres
Publié: (2023)
"Principal Components" Enable A New Language of Images
par: Wen, Xin, et autres
Publié: (2025)
par: Wen, Xin, et autres
Publié: (2025)
Documents similaires
-
WiLoR: End-to-end 3D Hand Localization and Reconstruction in-the-wild
par: Potamias, Rolandos Alexandros, et autres
Publié: (2024) -
SAGS: Structure-Aware 3D Gaussian Splatting
par: Ververas, Evangelos, et autres
Publié: (2024) -
Signs as Tokens: A Retrieval-Enhanced Multilingual Sign Language Generator
par: Zuo, Ronglai, et autres
Publié: (2024) -
ImHead: A Large-scale Implicit Morphable Model for Localized Head Modeling
par: Potamias, Rolandos Alexandros, et autres
Publié: (2025) -
Design2Cloth: 3D Cloth Generation from 2D Masks
par: Zheng, Jiali, et autres
Publié: (2024)