RT-DETRv2 Explained in 8 Illustrations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chua, Ethan Qi Yang, Tan, Jen Hong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Lightweight Can A Vision Transformer Be
par: Tan, Jen Hong
Publié: (2024)
par: Tan, Jen Hong
Publié: (2024)
RT-DETRv2: Improved Baseline with Bag-of-Freebies for Real-Time Detection Transformer
par: Lv, Wenyu, et autres
Publié: (2024)
par: Lv, Wenyu, et autres
Publié: (2024)
RT-DETRv4: Painlessly Furthering Real-Time Object Detection with Vision Foundation Models
par: Liao, Zijun, et autres
Publié: (2025)
par: Liao, Zijun, et autres
Publié: (2025)
HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers
par: Zhang, Jianke, et autres
Publié: (2024)
par: Zhang, Jianke, et autres
Publié: (2024)
RT-DEMT: A hybrid real-time acupoint detection model combining mamba and transformer
par: Yang, Shilong, et autres
Publié: (2025)
par: Yang, Shilong, et autres
Publié: (2025)
RT-DETRv3: Real-time End-to-End Object Detection with Hierarchical Dense Positive Supervision
par: Wang, Shuo, et autres
Publié: (2024)
par: Wang, Shuo, et autres
Publié: (2024)
AutoFigure-Edit: Generating Editable Scientific Illustration
par: Lin, Zhen, et autres
Publié: (2026)
par: Lin, Zhen, et autres
Publié: (2026)
SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model
par: Chang, Yifan, et autres
Publié: (2025)
par: Chang, Yifan, et autres
Publié: (2025)
Mixed Precision PointPillars for Efficient 3D Object Detection with TensorRT
par: Fuengfusin, Ninnart, et autres
Publié: (2026)
par: Fuengfusin, Ninnart, et autres
Publié: (2026)
Optimizing Few-Step Sampler for Diffusion Probabilistic Model
par: Huang, Jen-Yuan
Publié: (2024)
par: Huang, Jen-Yuan
Publié: (2024)
Moondream Segmentation: From Words to Masks
par: Reid, Ethan
Publié: (2026)
par: Reid, Ethan
Publié: (2026)
Cognitive Alignment At No Cost: Inducing Human Attention Biases For Interpretable Vision Transformers
par: Knights, Ethan
Publié: (2026)
par: Knights, Ethan
Publié: (2026)
RT-Pose: A 4D Radar Tensor-based 3D Human Pose Estimation and Localization Benchmark
par: Ho, Yuan-Hao, et autres
Publié: (2024)
par: Ho, Yuan-Hao, et autres
Publié: (2024)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
par: Jin, Zhe, et autres
Publié: (2025)
par: Jin, Zhe, et autres
Publié: (2025)
RT-VLM: Re-Thinking Vision Language Model with 4-Clues for Real-World Object Recognition Robustness
par: Park, Junghyun, et autres
Publié: (2025)
par: Park, Junghyun, et autres
Publié: (2025)
Gradient Map-Assisted Head and Neck Tumor Segmentation: A Pre-RT to Mid-RT Approach in MRI-Guided Radiotherapy
par: Ren, Jintao, et autres
Publié: (2024)
par: Ren, Jintao, et autres
Publié: (2024)
Generating Illustrated Instructions
par: Menon, Sachit, et autres
Publié: (2023)
par: Menon, Sachit, et autres
Publié: (2023)
On Explaining Visual Captioning with Hybrid Markov Logic Networks
par: Shah, Monika, et autres
Publié: (2025)
par: Shah, Monika, et autres
Publié: (2025)
Explaining 3D Computed Tomography Classifiers with Counterfactuals
par: Cohen, Joseph Paul, et autres
Publié: (2025)
par: Cohen, Joseph Paul, et autres
Publié: (2025)
Explaining Human Comparisons using Alignment-Importance Heatmaps
par: Truong, Nhut, et autres
Publié: (2024)
par: Truong, Nhut, et autres
Publié: (2024)
ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding
par: Hsieh, ZongHan, et autres
Publié: (2025)
par: Hsieh, ZongHan, et autres
Publié: (2025)
Sparks of Explainability: Recent Advancements in Explaining Large Vision Models
par: Fel, Thomas
Publié: (2025)
par: Fel, Thomas
Publié: (2025)
P-TAME: Explain Any Image Classifier with Trained Perturbations
par: Ntrougkas, Mariano V., et autres
Publié: (2025)
par: Ntrougkas, Mariano V., et autres
Publié: (2025)
Explaining multimodal LLMs via intra-modal token interactions
par: Liang, Jiawei, et autres
Publié: (2025)
par: Liang, Jiawei, et autres
Publié: (2025)
Explaining How Visual, Textual and Multimodal Encoders Share Concepts
par: Cornet, Clément, et autres
Publié: (2025)
par: Cornet, Clément, et autres
Publié: (2025)
Explaining raw data complexity to improve satellite onboard processing
par: Dorise, Adrien, et autres
Publié: (2025)
par: Dorise, Adrien, et autres
Publié: (2025)
Med-CAM: Minimal Evidence for Explaining Medical Decision Making
par: Suhail, Pirzada, et autres
Publié: (2026)
par: Suhail, Pirzada, et autres
Publié: (2026)
VerLM: Explaining Face Verification Using Natural Language
par: Hannan, Syed Abdul, et autres
Publié: (2026)
par: Hannan, Syed Abdul, et autres
Publié: (2026)
Language Models Can Explain Visual Features via Steering
par: Ferrando, Javier, et autres
Publié: (2026)
par: Ferrando, Javier, et autres
Publié: (2026)
Explain Before You Answer: A Survey on Compositional Visual Reasoning
par: Ke, Fucai, et autres
Publié: (2025)
par: Ke, Fucai, et autres
Publié: (2025)
Explaining Multi-modal Large Language Models by Analyzing their Vision Perception
par: Giulivi, Loris, et autres
Publié: (2024)
par: Giulivi, Loris, et autres
Publié: (2024)
Improving the Explain-Any-Concept by Introducing Nonlinearity to the Trainable Surrogate Model
par: Zaval, Mounes, et autres
Publié: (2024)
par: Zaval, Mounes, et autres
Publié: (2024)
Towards Safe Mobility: A Unified Transportation Foundation Model enabled by Open-Ended Vision-Language Dataset
par: Huang, Wenhui, et autres
Publié: (2026)
par: Huang, Wenhui, et autres
Publié: (2026)
Disentangling Masked Autoencoders for Unsupervised Domain Generalization
par: Zhang, An, et autres
Publié: (2024)
par: Zhang, An, et autres
Publié: (2024)
Benchmarking ResNet Backbones in RT-DETR: Impact of Depth and Regularization under environmental conditions
par: Barboza, Pamela, et autres
Publié: (2026)
par: Barboza, Pamela, et autres
Publié: (2026)
Concept Visualization: Explaining the CLIP Multi-modal Embedding Using WordNet
par: Giulivi, Loris, et autres
Publié: (2024)
par: Giulivi, Loris, et autres
Publié: (2024)
Suppressing Forgery-Specific Shortcuts for Generalizable Deepfake Detection
par: Wang, Yihui, et autres
Publié: (2026)
par: Wang, Yihui, et autres
Publié: (2026)
Long-Text-to-Image Generation via Compositional Prompt Decomposition
par: Huang, Jen-Yuan, et autres
Publié: (2026)
par: Huang, Jen-Yuan, et autres
Publié: (2026)
CoProNN: Concept-based Prototypical Nearest Neighbors for Explaining Vision Models
par: Chiaburu, Teodor, et autres
Publié: (2024)
par: Chiaburu, Teodor, et autres
Publié: (2024)
MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
par: Zhu, Fengbin, et autres
Publié: (2026)
par: Zhu, Fengbin, et autres
Publié: (2026)
Documents similaires
-
How Lightweight Can A Vision Transformer Be
par: Tan, Jen Hong
Publié: (2024) -
RT-DETRv2: Improved Baseline with Bag-of-Freebies for Real-Time Detection Transformer
par: Lv, Wenyu, et autres
Publié: (2024) -
RT-DETRv4: Painlessly Furthering Real-Time Object Detection with Vision Foundation Models
par: Liao, Zijun, et autres
Publié: (2025) -
HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers
par: Zhang, Jianke, et autres
Publié: (2024) -
RT-DEMT: A hybrid real-time acupoint detection model combining mamba and transformer
par: Yang, Shilong, et autres
Publié: (2025)