THOR: Thermal-guided Hand-Object Reasoning via Adaptive Vision Sampling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shahi, Soroush, Shahabi, Farzad, Nabulsi, Rama, Fernandes, Glenn, Katsaggelos, Aggelos, Alshurafa, Nabil |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CPDR: Towards Highly-Efficient Salient Object Detection via Crossed Post-decoder Refinement
par: Li, Yijie, et autres
Publié: (2025)
par: Li, Yijie, et autres
Publié: (2025)
Brighteye: Glaucoma Screening with Color Fundus Photographs based on Vision Transformer
par: Lin, Hui, et autres
Publié: (2024)
par: Lin, Hui, et autres
Publié: (2024)
Physics-Informed Image Restoration via Progressive PDE Integration
par: Likhite, Shamika, et autres
Publié: (2025)
par: Likhite, Shamika, et autres
Publié: (2025)
MetaSR: Content-Adaptive Metadata Orchestration for Generative Super-Resolution
par: Guo, Jiaqi, et autres
Publié: (2026)
par: Guo, Jiaqi, et autres
Publié: (2026)
VDPI: Video Deblurring with Pseudo-inverse Modeling
par: Huang, Zhihao, et autres
Publié: (2024)
par: Huang, Zhihao, et autres
Publié: (2024)
Real-World Atmospheric Turbulence Correction via Domain Adaptation
par: Wang, Xijun, et autres
Publié: (2024)
par: Wang, Xijun, et autres
Publié: (2024)
THOR: Text to Human-Object Interaction Diffusion via Relation Intervention
par: Wu, Qianyang, et autres
Publié: (2024)
par: Wu, Qianyang, et autres
Publié: (2024)
Advancing Limited-Angle CT Reconstruction Through Diffusion-Based Sinogram Completion
par: Guo, Jiaqi, et autres
Publié: (2025)
par: Guo, Jiaqi, et autres
Publié: (2025)
Vision-Language Enhanced Foundation Model for Semi-supervised Medical Image Segmentation
par: Guo, Jiaqi, et autres
Publié: (2025)
par: Guo, Jiaqi, et autres
Publié: (2025)
Cross-Temporal Spectrogram Autoencoder (CTSAE): Unsupervised Dimensionality Reduction for Clustering Gravitational Wave Glitches
par: Li, Yi, et autres
Publié: (2024)
par: Li, Yi, et autres
Publié: (2024)
Probabilistic smooth attention for deep multiple instance learning in medical imaging
par: Castro-Macías, Francisco M., et autres
Publié: (2025)
par: Castro-Macías, Francisco M., et autres
Publié: (2025)
Gaze-guided Hand-Object Interaction Synthesis: Dataset and Method
par: Tian, Jie, et autres
Publié: (2024)
par: Tian, Jie, et autres
Publié: (2024)
Explainable Transformer Prototypes for Medical Diagnoses
par: Demir, Ugur, et autres
Publié: (2024)
par: Demir, Ugur, et autres
Publié: (2024)
HandBooster: Boosting 3D Hand-Mesh Reconstruction by Conditional Synthesis and Sampling of Hand-Object Interactions
par: Xu, Hao, et autres
Publié: (2024)
par: Xu, Hao, et autres
Publié: (2024)
TOUCH: Text-guided Controllable Generation of Free-Form Hand-Object Interactions
par: Han, Guangyi, et autres
Publié: (2025)
par: Han, Guangyi, et autres
Publié: (2025)
Sm: enhanced localization in Multiple Instance Learning for medical imaging classification
par: Castro-Macías, Francisco M., et autres
Publié: (2024)
par: Castro-Macías, Francisco M., et autres
Publié: (2024)
HOI-Ref: Hand-Object Interaction Referral in Egocentric Vision
par: Bansal, Siddhant, et autres
Publié: (2024)
par: Bansal, Siddhant, et autres
Publié: (2024)
THOR2: Topological Analysis for 3D Shape and Color-Based Human-Inspired Object Recognition in Unseen Environments
par: Samani, Ekta U., et autres
Publié: (2024)
par: Samani, Ekta U., et autres
Publié: (2024)
HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction
par: Bao, Chen, et autres
Publié: (2024)
par: Bao, Chen, et autres
Publié: (2024)
DRL-STNet: Unsupervised Domain Adaptation for Cross-modality Medical Image Segmentation via Disentangled Representation Learning
par: Lin, Hui, et autres
Publié: (2024)
par: Lin, Hui, et autres
Publié: (2024)
Text2HOI: Text-guided 3D Motion Generation for Hand-Object Interaction
par: Cha, Junuk, et autres
Publié: (2024)
par: Cha, Junuk, et autres
Publié: (2024)
A General Method to Incorporate Spatial Information into Loss Functions for GAN-based Super-resolution Models
par: Wang, Xijun, et autres
Publié: (2024)
par: Wang, Xijun, et autres
Publié: (2024)
Zero-Shot Personalization of Objects via Textual Inversion
par: Roy, Aniket, et autres
Publié: (2026)
par: Roy, Aniket, et autres
Publié: (2026)
Interpretable Image Classification with Adaptive Prototype-based Vision Transformers
par: Ma, Chiyu, et autres
Publié: (2024)
par: Ma, Chiyu, et autres
Publié: (2024)
HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models
par: Sayem, MD Khalequzzaman Chowdhury, et autres
Publié: (2026)
par: Sayem, MD Khalequzzaman Chowdhury, et autres
Publié: (2026)
From Objects to Events: Unlocking Complex Visual Understanding in Object Detectors via LLM-guided Symbolic Reasoning
par: Zeng, Yuhui, et autres
Publié: (2025)
par: Zeng, Yuhui, et autres
Publié: (2025)
SimA: Simple Softmax-free Attention for Vision Transformers
par: Koohpayegani, Soroush Abbasi, et autres
Publié: (2022)
par: Koohpayegani, Soroush Abbasi, et autres
Publié: (2022)
Hand-Centric Motion Refinement for 3D Hand-Object Interaction via Hierarchical Spatial-Temporal Modeling
par: Hao, Yuze, et autres
Publié: (2024)
par: Hao, Yuze, et autres
Publié: (2024)
MEgoHand: Multimodal Egocentric Hand-Object Interaction Motion Generation
par: Zhou, Bohan, et autres
Publié: (2025)
par: Zhou, Bohan, et autres
Publié: (2025)
AVI-HT: Adaptive Vision-IMU Fusion for 3D Hand Tracking
par: Kou, Ziyi, et autres
Publié: (2026)
par: Kou, Ziyi, et autres
Publié: (2026)
Caption-Driven Explainability: Probing CNNs for Bias via CLIP
par: Koller, Patrick, et autres
Publié: (2025)
par: Koller, Patrick, et autres
Publié: (2025)
3D Hand Reconstruction via Aggregating Intra and Inter Graphs Guided by Prior Knowledge for Hand-Object Interaction Scenario
par: Shuang, Feng, et autres
Publié: (2024)
par: Shuang, Feng, et autres
Publié: (2024)
Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation
par: Ma, Weijian, et autres
Publié: (2026)
par: Ma, Weijian, et autres
Publié: (2026)
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
par: Diao, Xingjian, et autres
Publié: (2026)
par: Diao, Xingjian, et autres
Publié: (2026)
Focused Active Learning for Histopathological Image Classification
par: Schmidt, Arne, et autres
Publié: (2024)
par: Schmidt, Arne, et autres
Publié: (2024)
Vision-guided and Mask-enhanced Adaptive Denoising for Prompt-based Image Editing
par: Wang, Kejie, et autres
Publié: (2024)
par: Wang, Kejie, et autres
Publié: (2024)
UniHOPE: A Unified Approach for Hand-Only and Hand-Object Pose Estimation
par: Wang, Yinqiao, et autres
Publié: (2025)
par: Wang, Yinqiao, et autres
Publié: (2025)
A Computer Vision Approach for Autonomous Cars to Drive Safe at Construction Zone
par: Ahammed, Abu Shad, et autres
Publié: (2024)
par: Ahammed, Abu Shad, et autres
Publié: (2024)
HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness
par: Xue, Zihui, et autres
Publié: (2024)
par: Xue, Zihui, et autres
Publié: (2024)
CLIP-HandID: Vision-Language Model for Hand-Based Person Identification
par: Baisa, Nathanael L., et autres
Publié: (2025)
par: Baisa, Nathanael L., et autres
Publié: (2025)
Documents similaires
-
CPDR: Towards Highly-Efficient Salient Object Detection via Crossed Post-decoder Refinement
par: Li, Yijie, et autres
Publié: (2025) -
Brighteye: Glaucoma Screening with Color Fundus Photographs based on Vision Transformer
par: Lin, Hui, et autres
Publié: (2024) -
Physics-Informed Image Restoration via Progressive PDE Integration
par: Likhite, Shamika, et autres
Publié: (2025) -
MetaSR: Content-Adaptive Metadata Orchestration for Generative Super-Resolution
par: Guo, Jiaqi, et autres
Publié: (2026) -
VDPI: Video Deblurring with Pseudo-inverse Modeling
par: Huang, Zhihao, et autres
Publié: (2024)