Integrating Diverse Assignment Strategies into DETRs
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Yiwei, Gao, Jin, Wang, Hanshi, Ge, Fudong, Luo, Guan, Hu, Weiming, Zhang, Zhipeng |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models
by: Zhang, Yiwei, et al.
Published: (2026)
by: Zhang, Yiwei, et al.
Published: (2026)
MambaFusion: Height-Fidelity Dense Global Fusion for Multi-modal 3D Object Detection
by: Wang, Hanshi, et al.
Published: (2025)
by: Wang, Hanshi, et al.
Published: (2025)
Online Segment Any 3D Thing as Instance Tracking
by: Wang, Hanshi, et al.
Published: (2025)
by: Wang, Hanshi, et al.
Published: (2025)
BEV$^2$PR: BEV-Enhanced Visual Place Recognition with Structural Cues
by: Ge, Fudong, et al.
Published: (2024)
by: Ge, Fudong, et al.
Published: (2024)
VQ-Map: Bird's-Eye-View Map Layout Estimation in Tokenized Discrete Space via Vector Quantization
by: Zhang, Yiwei, et al.
Published: (2024)
by: Zhang, Yiwei, et al.
Published: (2024)
AutoPrune: Each Complexity Deserves a Pruning Policy
by: Wang, Hanshi, et al.
Published: (2025)
by: Wang, Hanshi, et al.
Published: (2025)
PFSD: A Multi-Modal Pedestrian-Focus Scene Dataset for Rich Tasks in Semi-Structured Environments
by: Liu, Yueting, et al.
Published: (2025)
by: Liu, Yueting, et al.
Published: (2025)
SoLA-Vision: Fine-grained Layer-wise Linear Softmax Hybrid Attention
by: Li, Ruibang, et al.
Published: (2026)
by: Li, Ruibang, et al.
Published: (2026)
Dual DETRs for Multi-Label Temporal Action Detection
by: Zhu, Yuhan, et al.
Published: (2024)
by: Zhu, Yuhan, et al.
Published: (2024)
MI-DETR: A Strong Baseline for Moving Infrared Small Target Detection with Bio-Inspired Motion Integration
by: Liu, Nian, et al.
Published: (2026)
by: Liu, Nian, et al.
Published: (2026)
Unbiased Regression Loss for DETRs
by: Edric, et al.
Published: (2024)
by: Edric, et al.
Published: (2024)
Ranking-based Adaptive Query Generation for DETRs in Crowded Pedestrian Detection
by: Gao, Feng, et al.
Published: (2023)
by: Gao, Feng, et al.
Published: (2023)
DETRs Beat YOLOs on Real-time Object Detection
by: Zhao, Yian, et al.
Published: (2023)
by: Zhao, Yian, et al.
Published: (2023)
Enhancing DETRs Variants through Improved Content Query and Similar Query Aggregation
by: Zhang, Yingying, et al.
Published: (2024)
by: Zhang, Yingying, et al.
Published: (2024)
D-FINE: Redefine Regression Task in DETRs as Fine-grained Distribution Refinement
by: Peng, Yansong, et al.
Published: (2024)
by: Peng, Yansong, et al.
Published: (2024)
The Blind Spot of Adaptation: Quantifying and Mitigating Forgetting in Fine-tuned Driving Models
by: Mao, Runhao, et al.
Published: (2026)
by: Mao, Runhao, et al.
Published: (2026)
CLoCKDistill: Consistent Location-and-Context-aware Knowledge Distillation for DETRs
by: Lan, Qizhen, et al.
Published: (2025)
by: Lan, Qizhen, et al.
Published: (2025)
Temporal Correlation Meets Embedding: Towards a 2nd Generation of JDE-based Real-Time Multi-Object Tracking
by: Zhang, Yunfei, et al.
Published: (2024)
by: Zhang, Yunfei, et al.
Published: (2024)
Arbitrary Ratio Feature Compression via Next Token Prediction
by: Liu, Yufan, et al.
Published: (2026)
by: Liu, Yufan, et al.
Published: (2026)
RFAssigner: A Generic Label Assignment Strategy for Dense Object Detection
by: Guan, Ziqian, et al.
Published: (2026)
by: Guan, Ziqian, et al.
Published: (2026)
SynCL: A Synergistic Training Strategy with Instance-Aware Contrastive Learning for End-to-End Multi-Camera 3D Tracking
by: Lin, Shubo, et al.
Published: (2024)
by: Lin, Shubo, et al.
Published: (2024)
Set Prediction Guided by Semantic Concepts for Diverse Video Captioning
by: Lu, Yifan, et al.
Published: (2023)
by: Lu, Yifan, et al.
Published: (2023)
Real-time Monocular Depth Estimation on Embedded Systems
by: Feng, Cheng, et al.
Published: (2023)
by: Feng, Cheng, et al.
Published: (2023)
MMPhysVideo: Scaling Physical Plausibility in Video Generation via Joint Multimodal Modeling
by: Lin, Shubo, et al.
Published: (2026)
by: Lin, Shubo, et al.
Published: (2026)
SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker
by: Su, Junbin, et al.
Published: (2026)
by: Su, Junbin, et al.
Published: (2026)
Animate3D: Animating Any 3D Model with Multi-view Video Diffusion
by: Jiang, Yanqin, et al.
Published: (2024)
by: Jiang, Yanqin, et al.
Published: (2024)
IPAD-CLIP: Teaching CLIP to Detect Image Local Perceptual Artifacts
by: Wang, Juan, et al.
Published: (2026)
by: Wang, Juan, et al.
Published: (2026)
An Experimental Study on Exploring Strong Lightweight Vision Transformers via Masked Image Modeling Pre-Training
by: Gao, Jin, et al.
Published: (2024)
by: Gao, Jin, et al.
Published: (2024)
Deterministic-to-Stochastic Diverse Latent Feature Mapping for Human Motion Synthesis
by: Hua, Yu, et al.
Published: (2025)
by: Hua, Yu, et al.
Published: (2025)
Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment
by: Chen, Jingkun, et al.
Published: (2026)
by: Chen, Jingkun, et al.
Published: (2026)
Adaptive Dual-Weighted Gravitational Point Cloud Denoising Method
by: Zhang, Ge, et al.
Published: (2025)
by: Zhang, Ge, et al.
Published: (2025)
PersonaTalk: Bring Attention to Your Persona in Visual Dubbing
by: Zhang, Longhao, et al.
Published: (2024)
by: Zhang, Longhao, et al.
Published: (2024)
Ensemble Quadratic Assignment Network for Graph Matching
by: Tan, Haoru, et al.
Published: (2024)
by: Tan, Haoru, et al.
Published: (2024)
Leader360V: The Large-scale, Real-world 360 Video Dataset for Multi-task Learning in Diverse Environment
by: Zhang, Weiming, et al.
Published: (2025)
by: Zhang, Weiming, et al.
Published: (2025)
Enhancing Vision-Language Models Generalization via Diversity-Driven Novel Feature Synthesis
by: Yan, Siyuan, et al.
Published: (2024)
by: Yan, Siyuan, et al.
Published: (2024)
ArtWeaver: Advanced Dynamic Style Integration via Diffusion Model
by: Xu, Chengming, et al.
Published: (2024)
by: Xu, Chengming, et al.
Published: (2024)
Vamba: Understanding Hour-Long Videos with Hybrid Mamba-Transformers
by: Ren, Weiming, et al.
Published: (2025)
by: Ren, Weiming, et al.
Published: (2025)
T2SMark: Balancing Robustness and Diversity in Noise-as-Watermark for Diffusion Models
by: Yang, Jindong, et al.
Published: (2025)
by: Yang, Jindong, et al.
Published: (2025)
OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation
by: Liu, Yexin, et al.
Published: (2025)
by: Liu, Yexin, et al.
Published: (2025)
How Far are Modern Trackers from UAV-Anti-UAV? A Million-Scale Benchmark and New Baseline
by: Zhang, Chunhui, et al.
Published: (2025)
by: Zhang, Chunhui, et al.
Published: (2025)
Similar Items
-
OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models
by: Zhang, Yiwei, et al.
Published: (2026) -
MambaFusion: Height-Fidelity Dense Global Fusion for Multi-modal 3D Object Detection
by: Wang, Hanshi, et al.
Published: (2025) -
Online Segment Any 3D Thing as Instance Tracking
by: Wang, Hanshi, et al.
Published: (2025) -
BEV$^2$PR: BEV-Enhanced Visual Place Recognition with Structural Cues
by: Ge, Fudong, et al.
Published: (2024) -
VQ-Map: Bird's-Eye-View Map Layout Estimation in Tokenized Discrete Space via Vector Quantization
by: Zhang, Yiwei, et al.
Published: (2024)