Groupwise Query Specialization and Quality-Aware Multi-Assignment for Transformer-based Visual Relationship Detection
Fuente:
arXiv
Saved in:
| Main Authors: | Kim, Jongha, Park, Jihwan, Park, Jinyoung, Kim, Jinyoung, Kim, Sehyung, Kim, Hyunwoo J. |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning
by: Lee, Ji Soo, et al.
Published: (2025)
by: Lee, Ji Soo, et al.
Published: (2025)
Super-class guided Transformer for Zero-Shot Attribute Classification
by: Kim, Sehyung, et al.
Published: (2025)
by: Kim, Sehyung, et al.
Published: (2025)
RegFormer: Transferable Relational Grounding for Efficient Weakly-Supervised Human-Object Interaction Detection
by: Park, Jihwan, et al.
Published: (2026)
by: Park, Jihwan, et al.
Published: (2026)
DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
by: Park, Jinyoung, et al.
Published: (2025)
by: Park, Jinyoung, et al.
Published: (2025)
Prompt Learning via Meta-Regularization
by: Park, Jinyoung, et al.
Published: (2024)
by: Park, Jinyoung, et al.
Published: (2024)
Retrieval-Augmented Open-Vocabulary Object Detection
by: Kim, Jooyeon, et al.
Published: (2024)
by: Kim, Jooyeon, et al.
Published: (2024)
DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
by: Choi, Joonmyung, et al.
Published: (2026)
by: Choi, Joonmyung, et al.
Published: (2026)
Visual Diversity and Region-aware Prompt Learning for Zero-shot HOI Detection
by: Yang, Chanhyeong, et al.
Published: (2025)
by: Yang, Chanhyeong, et al.
Published: (2025)
Towards Efficient Vision State Space Models via Token Merging
by: Park, Jinyoung, et al.
Published: (2025)
by: Park, Jinyoung, et al.
Published: (2025)
Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
by: Kim, Jongha, et al.
Published: (2026)
by: Kim, Jongha, et al.
Published: (2026)
Robust Multimodal 3D Object Detection via Modality-Agnostic Decoding and Proximity-based Modality Ensemble
by: Cha, Juhan, et al.
Published: (2024)
by: Cha, Juhan, et al.
Published: (2024)
VideoMamba: Spatio-Temporal Selective State Space Model
by: Park, Jinyoung, et al.
Published: (2024)
by: Park, Jinyoung, et al.
Published: (2024)
FIFO-Diffusion: Generating Infinite Videos from Text without Training
by: Kim, Jihwan, et al.
Published: (2024)
by: Kim, Jihwan, et al.
Published: (2024)
MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models
by: Ko, Dohwan, et al.
Published: (2026)
by: Ko, Dohwan, et al.
Published: (2026)
CNG-SFDA:Clean-and-Noisy Region Guided Online-Offline Source-Free Domain Adaptation
by: Cho, Hyeonwoo, et al.
Published: (2024)
by: Cho, Hyeonwoo, et al.
Published: (2024)
TabFlash: Efficient Table Understanding with Progressive Question Conditioning and Token Focusing
by: Kim, Jongha, et al.
Published: (2025)
by: Kim, Jongha, et al.
Published: (2025)
Joint-Embedding Predictive Architecture for Self-Supervised Learning of Mask Classification Architecture
by: Kim, Dong-Hee, et al.
Published: (2024)
by: Kim, Dong-Hee, et al.
Published: (2024)
Holi-DETR: Holistic Fashion Item Detection Leveraging Contextual Information
by: Kwon, Youngchae, et al.
Published: (2025)
by: Kwon, Youngchae, et al.
Published: (2025)
Rethinking Garment Conditioning in Diffusion-based Virtual Try-On
by: Na, Kihyun, et al.
Published: (2025)
by: Na, Kihyun, et al.
Published: (2025)
Adaptive Self-training Framework for Fine-grained Scene Graph Generation
by: Kim, Kibum, et al.
Published: (2024)
by: Kim, Kibum, et al.
Published: (2024)
Weakly Supervised Video Scene Graph Generation via Natural Language Supervision
by: Kim, Kibum, et al.
Published: (2025)
by: Kim, Kibum, et al.
Published: (2025)
Item Region-based Style Classification Network (IRSN): A Fashion Style Classifier Based on Domain Knowledge of Fashion Experts
by: Choi, Jinyoung, et al.
Published: (2025)
by: Choi, Jinyoung, et al.
Published: (2025)
Multi-dimensional Preference Alignment by Conditioning Reward Itself
by: Jang, Jiho, et al.
Published: (2025)
by: Jang, Jiho, et al.
Published: (2025)
Difficulty-aware Balancing Margin Loss for Long-tailed Recognition
by: Son, Minseok, et al.
Published: (2024)
by: Son, Minseok, et al.
Published: (2024)
HiCM$^2$: Hierarchical Compact Memory Modeling for Dense Video Captioning
by: Kim, Minkuk, et al.
Published: (2024)
by: Kim, Minkuk, et al.
Published: (2024)
Do You Remember? Dense Video Captioning with Cross-Modal Memory Retrieval
by: Kim, Minkuk, et al.
Published: (2024)
by: Kim, Minkuk, et al.
Published: (2024)
Blockwise Flow Matching: Improving Flow Matching Models For Efficient High-Quality Generation
by: Park, Dogyun, et al.
Published: (2025)
by: Park, Dogyun, et al.
Published: (2025)
PECI-Net: Bolus segmentation from video fluoroscopic swallowing study images using preprocessing ensemble and cascaded inference
by: Park, Dougho, et al.
Published: (2024)
by: Park, Dougho, et al.
Published: (2024)
Perfecting Depth: Uncertainty-Aware Enhancement of Metric Depth
by: Jun, Jinyoung, et al.
Published: (2025)
by: Jun, Jinyoung, et al.
Published: (2025)
DropGaussian: Structural Regularization for Sparse-view Gaussian Splatting
by: Park, Hyunwoo, et al.
Published: (2025)
by: Park, Hyunwoo, et al.
Published: (2025)
Domain Aware Multi-Task Pretraining of 3D Swin Transformer for T1-weighted Brain MRI
by: Kim, Jonghun, et al.
Published: (2024)
by: Kim, Jonghun, et al.
Published: (2024)
Masked Spatial Propagation Network for Sparsity-Adaptive Depth Refinement
by: Jun, Jinyoung, et al.
Published: (2024)
by: Jun, Jinyoung, et al.
Published: (2024)
Long-term Pre-training for Temporal Action Detection with Transformers
by: Kim, Jihwan, et al.
Published: (2024)
by: Kim, Jihwan, et al.
Published: (2024)
Explainability of Deep Neural Networks for Brain Tumor Detection
by: Park, S., et al.
Published: (2024)
by: Park, S., et al.
Published: (2024)
LLM4SGG: Large Language Models for Weakly Supervised Scene Graph Generation
by: Kim, Kibum, et al.
Published: (2023)
by: Kim, Kibum, et al.
Published: (2023)
Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization
by: Park, Jihwan, et al.
Published: (2025)
by: Park, Jihwan, et al.
Published: (2025)
MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports
by: Kyung, Sunggu, et al.
Published: (2025)
by: Kyung, Sunggu, et al.
Published: (2025)
CoT-Segmenter: Enhancing OOD Detection in Dense Road Scenes via Chain-of-Thought Reasoning
by: Song, Jeonghyo, et al.
Published: (2025)
by: Song, Jeonghyo, et al.
Published: (2025)
Multi-criteria Token Fusion with One-step-ahead Attention for Efficient Vision Transformers
by: Lee, Sanghyeok, et al.
Published: (2024)
by: Lee, Sanghyeok, et al.
Published: (2024)
Learning an Ensemble Token from Task-driven Priors in Facial Analysis
by: Seo, Sunyong, et al.
Published: (2025)
by: Seo, Sunyong, et al.
Published: (2025)
Similar Items
-
VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning
by: Lee, Ji Soo, et al.
Published: (2025) -
Super-class guided Transformer for Zero-Shot Attribute Classification
by: Kim, Sehyung, et al.
Published: (2025) -
RegFormer: Transferable Relational Grounding for Efficient Weakly-Supervised Human-Object Interaction Detection
by: Park, Jihwan, et al.
Published: (2026) -
DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
by: Park, Jinyoung, et al.
Published: (2025) -
Prompt Learning via Meta-Regularization
by: Park, Jinyoung, et al.
Published: (2024)