Diffusion-Refined VQA Annotations for Semi-Supervised Gaze Following
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Miao, Qiaomu, Graikos, Alexandros, Zhang, Jingwei, Mondal, Sounak, Hoai, Minh, Samaras, Dimitris |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multi-view Gaze Target Estimation
par: Miao, Qiaomu, et autres
Publié: (2025)
par: Miao, Qiaomu, et autres
Publié: (2025)
Look Hear: Gaze Prediction for Speech-directed Human Attention
par: Mondal, Sounak, et autres
Publié: (2024)
par: Mondal, Sounak, et autres
Publié: (2024)
Fast constrained sampling in pre-trained diffusion models
par: Graikos, Alexandros, et autres
Publié: (2024)
par: Graikos, Alexandros, et autres
Publié: (2024)
PathSegDiff: Pathology Segmentation using Diffusion model representations
par: Danisetty, Sachin Kumar, et autres
Publié: (2025)
par: Danisetty, Sachin Kumar, et autres
Publié: (2025)
$\infty$-Brush: Controllable Large Image Synthesis with Diffusion Models in Infinite Dimensions
par: Le, Minh-Quan, et autres
Publié: (2024)
par: Le, Minh-Quan, et autres
Publié: (2024)
Few-shot Personalized Scanpath Prediction
par: Xue, Ruoyu, et autres
Publié: (2025)
par: Xue, Ruoyu, et autres
Publié: (2025)
GriDiT: Factorized Grid-Based Diffusion for Efficient Long Image Sequence Generation
par: Tomar, Snehal Singh, et autres
Publié: (2025)
par: Tomar, Snehal Singh, et autres
Publié: (2025)
Mitigating Diffusion Model Hallucinations with Dynamic Guidance
par: Triaridis, Kostas, et autres
Publié: (2025)
par: Triaridis, Kostas, et autres
Publié: (2025)
One Attention, One Scale: Phase-Aligned Rotary Positional Embeddings for Mixed-Resolution Diffusion Transformer
par: Wu, Haoyu, et autres
Publié: (2025)
par: Wu, Haoyu, et autres
Publié: (2025)
Unifying Top-down and Bottom-up Scanpath Prediction Using Transformers
par: Yang, Zhibo, et autres
Publié: (2023)
par: Yang, Zhibo, et autres
Publié: (2023)
Personalized Image Descriptions from Attention Sequences
par: Xue, Ruoyu, et autres
Publié: (2025)
par: Xue, Ruoyu, et autres
Publié: (2025)
Learned representation-guided diffusion models for large-image generation
par: Graikos, Alexandros, et autres
Publié: (2023)
par: Graikos, Alexandros, et autres
Publié: (2023)
Poppy: Polarization-based Plug-and-Play Guidance for Enhancing Monocular Normal Estimation
par: Kim, Irene, et autres
Publié: (2026)
par: Kim, Irene, et autres
Publié: (2026)
ZoomLDM: Latent Diffusion Model for multi-scale image generation
par: Yellapragada, Srikar, et autres
Publié: (2024)
par: Yellapragada, Srikar, et autres
Publié: (2024)
Weighting Pseudo-Labels via High-Activation Feature Index Similarity and Object Detection for Semi-Supervised Segmentation
par: Howlader, Prantik, et autres
Publié: (2024)
par: Howlader, Prantik, et autres
Publié: (2024)
Generating metamers of human scene understanding
par: Raina, Ritik, et autres
Publié: (2026)
par: Raina, Ritik, et autres
Publié: (2026)
Beyond Pixels: Semi-Supervised Semantic Segmentation with a Multi-scale Patch-based Multi-Label Classifier
par: Howlader, Prantik, et autres
Publié: (2024)
par: Howlader, Prantik, et autres
Publié: (2024)
CORA: Consistency-Guided Semi-Supervised Framework for Reasoning Segmentation
par: Howlader, Prantik, et autres
Publié: (2025)
par: Howlader, Prantik, et autres
Publié: (2025)
TopoDiffusionNet: A Topology-aware Diffusion Model
par: Gupta, Saumya, et autres
Publié: (2024)
par: Gupta, Saumya, et autres
Publié: (2024)
PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards
par: Le, Minh-Quan, et autres
Publié: (2026)
par: Le, Minh-Quan, et autres
Publié: (2026)
LBMamba: Locally Bi-directional Mamba
par: Zhang, Jingwei, et autres
Publié: (2025)
par: Zhang, Jingwei, et autres
Publié: (2025)
Enhancing Gaze Reasoning in Vision Foundation Models for Gaze Following
par: Wang, Shijing, et autres
Publié: (2026)
par: Wang, Shijing, et autres
Publié: (2026)
Gen-SIS: Generative Self-augmentation Improves Self-supervised Learning
par: Belagali, Varun, et autres
Publié: (2024)
par: Belagali, Varun, et autres
Publié: (2024)
Self-supervised co-salient object detection via feature correspondence at multiple scales
par: Chakraborty, Souradeep, et autres
Publié: (2024)
par: Chakraborty, Souradeep, et autres
Publié: (2024)
What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards
par: Le, Minh-Quan, et autres
Publié: (2025)
par: Le, Minh-Quan, et autres
Publié: (2025)
Shadow Removal Refinement via Material-Consistent Shadow Edges
par: Hu, Shilin, et autres
Publié: (2024)
par: Hu, Shilin, et autres
Publié: (2024)
Pathology Image Compression with Pre-trained Autoencoders
par: Yellapragada, Srikar, et autres
Publié: (2025)
par: Yellapragada, Srikar, et autres
Publié: (2025)
Enhancing 3D Gaze Estimation in the Wild using Weak Supervision with Gaze Following Labels
par: Vuillecard, Pierre, et autres
Publié: (2025)
par: Vuillecard, Pierre, et autres
Publié: (2025)
Multi-Prototype Embedding Refinement for Semi-Supervised Medical Image Segmentation
par: Bi, Yali, et autres
Publié: (2025)
par: Bi, Yali, et autres
Publié: (2025)
Embedding Physical Reasoning into Diffusion-Based Shadow Generation
par: Hu, Shilin, et autres
Publié: (2025)
par: Hu, Shilin, et autres
Publié: (2025)
Assessing Sample Quality via the Latent Space of Generative Models
par: Xu, Jingyi, et autres
Publié: (2024)
par: Xu, Jingyi, et autres
Publié: (2024)
Semi-Supervised Gaze Estimation via Disentangled Subspace Contrastive Learning
par: Tan, Qida, et autres
Publié: (2026)
par: Tan, Qida, et autres
Publié: (2026)
MI-NeRF: Learning a Single Face NeRF from Multiple Identities
par: Chatziagapi, Aggelina, et autres
Publié: (2024)
par: Chatziagapi, Aggelina, et autres
Publié: (2024)
MIGS: Multi-Identity Gaussian Splatting via Tensor Decomposition
par: Chatziagapi, Aggelina, et autres
Publié: (2024)
par: Chatziagapi, Aggelina, et autres
Publié: (2024)
DualMat: PBR Material Estimation via Coherent Dual-Path Diffusion
par: Huang, Yifeng, et autres
Publié: (2025)
par: Huang, Yifeng, et autres
Publié: (2025)
Importance-Based Token Merging for Efficient Image and Video Generation
par: Wu, Haoyu, et autres
Publié: (2024)
par: Wu, Haoyu, et autres
Publié: (2024)
JEAN: Joint Expression and Audio-guided NeRF-based Talking Face Generation
par: Chakkera, Sai Tanmay Reddy, et autres
Publié: (2024)
par: Chakkera, Sai Tanmay Reddy, et autres
Publié: (2024)
Learning 3D Reconstruction with Priors in Test Time
par: Zhou, Lei, et autres
Publié: (2026)
par: Zhou, Lei, et autres
Publié: (2026)
MedXplain-VQA: Multi-Component Explainable Medical Visual Question Answering
par: Nguyen, Hai-Dang, et autres
Publié: (2025)
par: Nguyen, Hai-Dang, et autres
Publié: (2025)
2DMamba: Efficient State Space Model for Image Representation with Applications on Giga-Pixel Whole Slide Image Classification
par: Zhang, Jingwei, et autres
Publié: (2024)
par: Zhang, Jingwei, et autres
Publié: (2024)
Documents similaires
-
Multi-view Gaze Target Estimation
par: Miao, Qiaomu, et autres
Publié: (2025) -
Look Hear: Gaze Prediction for Speech-directed Human Attention
par: Mondal, Sounak, et autres
Publié: (2024) -
Fast constrained sampling in pre-trained diffusion models
par: Graikos, Alexandros, et autres
Publié: (2024) -
PathSegDiff: Pathology Segmentation using Diffusion model representations
par: Danisetty, Sachin Kumar, et autres
Publié: (2025) -
$\infty$-Brush: Controllable Large Image Synthesis with Diffusion Models in Infinite Dimensions
par: Le, Minh-Quan, et autres
Publié: (2024)