RegFormer: Transferable Relational Grounding for Efficient Weakly-Supervised Human-Object Interaction Detection
Fuente:
arXiv
Guardado en:
| Autores principales: | Park, Jihwan, Yang, Chanhyeong, Park, Jinyoung, Song, Taehoon, Kim, Hyunwoo J. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Visual Diversity and Region-aware Prompt Learning for Zero-shot HOI Detection
por: Yang, Chanhyeong, et al.
Publicado: (2025)
por: Yang, Chanhyeong, et al.
Publicado: (2025)
Super-class guided Transformer for Zero-Shot Attribute Classification
por: Kim, Sehyung, et al.
Publicado: (2025)
por: Kim, Sehyung, et al.
Publicado: (2025)
Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization
por: Park, Jihwan, et al.
Publicado: (2025)
por: Park, Jihwan, et al.
Publicado: (2025)
Groupwise Query Specialization and Quality-Aware Multi-Assignment for Transformer-based Visual Relationship Detection
por: Kim, Jongha, et al.
Publicado: (2024)
por: Kim, Jongha, et al.
Publicado: (2024)
RegFormer++: An Efficient Large-Scale 3D LiDAR Point Registration Network with Projection-Aware 2D Transformer
por: Liu, Jiuming, et al.
Publicado: (2026)
por: Liu, Jiuming, et al.
Publicado: (2026)
Blockwise Flow Matching: Improving Flow Matching Models For Efficient High-Quality Generation
por: Park, Dogyun, et al.
Publicado: (2025)
por: Park, Dogyun, et al.
Publicado: (2025)
Robust Multimodal 3D Object Detection via Modality-Agnostic Decoding and Proximity-based Modality Ensemble
por: Cha, Juhan, et al.
Publicado: (2024)
por: Cha, Juhan, et al.
Publicado: (2024)
Prompt Learning via Meta-Regularization
por: Park, Jinyoung, et al.
Publicado: (2024)
por: Park, Jinyoung, et al.
Publicado: (2024)
DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
por: Park, Jinyoung, et al.
Publicado: (2025)
por: Park, Jinyoung, et al.
Publicado: (2025)
Weakly Supervised Video Scene Graph Generation via Natural Language Supervision
por: Kim, Kibum, et al.
Publicado: (2025)
por: Kim, Kibum, et al.
Publicado: (2025)
Retrieve What's Missing: Coverage-Maximizing Retrieval for Consistent Long Video Generation
por: Joo, Minseok, et al.
Publicado: (2026)
por: Joo, Minseok, et al.
Publicado: (2026)
Towards Efficient Vision State Space Models via Token Merging
por: Park, Jinyoung, et al.
Publicado: (2025)
por: Park, Jinyoung, et al.
Publicado: (2025)
VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning
por: Lee, Ji Soo, et al.
Publicado: (2025)
por: Lee, Ji Soo, et al.
Publicado: (2025)
Probabilistic Vision-Language Representation for Weakly Supervised Temporal Action Localization
por: Lim, Geuntaek, et al.
Publicado: (2024)
por: Lim, Geuntaek, et al.
Publicado: (2024)
Cross Pseudo Labeling For Weakly Supervised Video Anomaly Detection
por: Lee, Dayeon, et al.
Publicado: (2026)
por: Lee, Dayeon, et al.
Publicado: (2026)
Flow-Assisted Motion Learning Network for Weakly-Supervised Group Activity Recognition
por: Nugroho, Muhammad Adi, et al.
Publicado: (2024)
por: Nugroho, Muhammad Adi, et al.
Publicado: (2024)
LLM4SGG: Large Language Models for Weakly Supervised Scene Graph Generation
por: Kim, Kibum, et al.
Publicado: (2023)
por: Kim, Kibum, et al.
Publicado: (2023)
Partial Weakly-Supervised Oriented Object Detection
por: Liu, Mingxin, et al.
Publicado: (2025)
por: Liu, Mingxin, et al.
Publicado: (2025)
Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioning
por: Choi, Seung hee, et al.
Publicado: (2026)
por: Choi, Seung hee, et al.
Publicado: (2026)
MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models
por: Ko, Dohwan, et al.
Publicado: (2026)
por: Ko, Dohwan, et al.
Publicado: (2026)
Cross-Class Feature Augmentation for Class Incremental Learning
por: Kim, Taehoon, et al.
Publicado: (2023)
por: Kim, Taehoon, et al.
Publicado: (2023)
INTRA: Interaction Relationship-aware Weakly Supervised Affordance Grounding
por: Jang, Ji Ha, et al.
Publicado: (2024)
por: Jang, Ji Ha, et al.
Publicado: (2024)
Constant Acceleration Flow
por: Park, Dogyun, et al.
Publicado: (2024)
por: Park, Dogyun, et al.
Publicado: (2024)
Retrieval-Augmented Open-Vocabulary Object Detection
por: Kim, Jooyeon, et al.
Publicado: (2024)
por: Kim, Jooyeon, et al.
Publicado: (2024)
Joint-Embedding Predictive Architecture for Self-Supervised Learning of Mask Classification Architecture
por: Kim, Dong-Hee, et al.
Publicado: (2024)
por: Kim, Dong-Hee, et al.
Publicado: (2024)
SPWOOD: Sparse Partial Weakly-Supervised Oriented Object Detection
por: Zhang, Wei, et al.
Publicado: (2026)
por: Zhang, Wei, et al.
Publicado: (2026)
DropGaussian: Structural Regularization for Sparse-view Gaussian Splatting
por: Park, Hyunwoo, et al.
Publicado: (2025)
por: Park, Hyunwoo, et al.
Publicado: (2025)
Group3D: MLLM-Driven Semantic Grouping for Open-Vocabulary 3D Object Detection
por: Kim, Youbin, et al.
Publicado: (2026)
por: Kim, Youbin, et al.
Publicado: (2026)
Human-Object Interaction Detection Collaborated with Large Relation-driven Diffusion Models
por: Li, Liulei, et al.
Publicado: (2024)
por: Li, Liulei, et al.
Publicado: (2024)
FIFO-Diffusion: Generating Infinite Videos from Text without Training
por: Kim, Jihwan, et al.
Publicado: (2024)
por: Kim, Jihwan, et al.
Publicado: (2024)
SparseVoxFormer: Sparse Voxel-based Transformer for Multi-modal 3D Object Detection
por: Son, Hyeongseok, et al.
Publicado: (2025)
por: Son, Hyeongseok, et al.
Publicado: (2025)
Weak-to-Strong Compositional Learning from Generative Models for Language-based Object Detection
por: Park, Kwanyong, et al.
Publicado: (2024)
por: Park, Kwanyong, et al.
Publicado: (2024)
ReduceFormer: Attention with Tensor Reduction by Summation
por: Yang, John, et al.
Publicado: (2024)
por: Yang, John, et al.
Publicado: (2024)
Weakly Supervised Test-Time Domain Adaptation for Object Detection
por: Doan, Anh-Dzung, et al.
Publicado: (2024)
por: Doan, Anh-Dzung, et al.
Publicado: (2024)
Self-Classification Enhancement and Correction for Weakly Supervised Object Detection
por: Yin, Yufei, et al.
Publicado: (2025)
por: Yin, Yufei, et al.
Publicado: (2025)
Detecting Unknown Objects via Energy-based Separation for Open World Object Detection
por: Heo, Jun-Woo, et al.
Publicado: (2026)
por: Heo, Jun-Woo, et al.
Publicado: (2026)
Incremental Human-Object Interaction Detection with Invariant Relation Representation Learning
por: Wei, Yana, et al.
Publicado: (2025)
por: Wei, Yana, et al.
Publicado: (2025)
Language-guided Learning for Object Detection Tackling Multiple Variations in Aerial Images
por: Park, Sungjune, et al.
Publicado: (2025)
por: Park, Sungjune, et al.
Publicado: (2025)
VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis
por: Kang, Donggoo, et al.
Publicado: (2024)
por: Kang, Donggoo, et al.
Publicado: (2024)
Efficient Human-Object-Interaction (EHOI) Detection via Interaction Label Coding and Conditional Decision
por: Yang, Tsung-Shan, et al.
Publicado: (2024)
por: Yang, Tsung-Shan, et al.
Publicado: (2024)
Ejemplares similares
-
Visual Diversity and Region-aware Prompt Learning for Zero-shot HOI Detection
por: Yang, Chanhyeong, et al.
Publicado: (2025) -
Super-class guided Transformer for Zero-Shot Attribute Classification
por: Kim, Sehyung, et al.
Publicado: (2025) -
Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization
por: Park, Jihwan, et al.
Publicado: (2025) -
Groupwise Query Specialization and Quality-Aware Multi-Assignment for Transformer-based Visual Relationship Detection
por: Kim, Jongha, et al.
Publicado: (2024) -
RegFormer++: An Efficient Large-Scale 3D LiDAR Point Registration Network with Projection-Aware 2D Transformer
por: Liu, Jiuming, et al.
Publicado: (2026)