DUNE: Distilling a Universal Encoder from Heterogeneous 2D and 3D Teachers
Fuente:
arXiv
Salvato in:
| Autori principali: | Sariyildiz, Mert Bulent, Weinzaepfel, Philippe, Lucas, Thomas, de Jorge, Pau, Larlus, Diane, Kalantidis, Yannis |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UNIC: Universal Classification Models via Multi-teacher Distillation
di: Sariyildiz, Mert Bulent, et al.
Pubblicazione: (2024)
di: Sariyildiz, Mert Bulent, et al.
Pubblicazione: (2024)
Weatherproofing Retrieval for Localization with Generative AI and Geometric Consistency
di: Kalantidis, Yannis, et al.
Pubblicazione: (2024)
di: Kalantidis, Yannis, et al.
Pubblicazione: (2024)
Task Alignment: A simple and effective proxy for model merging in computer vision
di: de Jorge, Pau, et al.
Pubblicazione: (2026)
di: de Jorge, Pau, et al.
Pubblicazione: (2026)
Kinaema: a recurrent sequence model for memory and pose in motion
di: Sariyildiz, Mert Bulent, et al.
Pubblicazione: (2025)
di: Sariyildiz, Mert Bulent, et al.
Pubblicazione: (2025)
PoseScript: Linking 3D Human Poses and Natural Language
di: Delmas, Ginger, et al.
Pubblicazione: (2022)
di: Delmas, Ginger, et al.
Pubblicazione: (2022)
Layered Motion Fusion: Lifting Motion Segmentation to 3D in Egocentric Videos
di: Tschernezki, Vadim, et al.
Pubblicazione: (2025)
di: Tschernezki, Vadim, et al.
Pubblicazione: (2025)
On Good Practices for Task-Specific Distillation of Large Pretrained Visual Models
di: Marrie, Juliette, et al.
Pubblicazione: (2024)
di: Marrie, Juliette, et al.
Pubblicazione: (2024)
Mesh4D: 4D Mesh Reconstruction and Tracking from Monocular Video
di: Jiang, Zeren, et al.
Pubblicazione: (2026)
di: Jiang, Zeren, et al.
Pubblicazione: (2026)
LUDVIG: Learning-Free Uplifting of 2D Visual Features to Gaussian Splatting Scenes
di: Marrie, Juliette, et al.
Pubblicazione: (2024)
di: Marrie, Juliette, et al.
Pubblicazione: (2024)
Label Propagation for Zero-shot Classification with Vision-Language Models
di: Stojnić, Vladan, et al.
Pubblicazione: (2024)
di: Stojnić, Vladan, et al.
Pubblicazione: (2024)
Win-Win: Training High-Resolution Vision Transformers from Two Windows
di: Leroy, Vincent, et al.
Pubblicazione: (2023)
di: Leroy, Vincent, et al.
Pubblicazione: (2023)
PoseFix: Correcting 3D Human Poses with Natural Language
di: Delmas, Ginger, et al.
Pubblicazione: (2023)
di: Delmas, Ginger, et al.
Pubblicazione: (2023)
Cross-view and Cross-pose Completion for 3D Human Understanding
di: Armando, Matthieu, et al.
Pubblicazione: (2023)
di: Armando, Matthieu, et al.
Pubblicazione: (2023)
Pow3R: Empowering Unconstrained 3D Reconstruction with Camera and Scene Priors
di: Jang, Wonbong, et al.
Pubblicazione: (2025)
di: Jang, Wonbong, et al.
Pubblicazione: (2025)
PoseEmbroider: Towards a 3D, Visual, Semantic-aware Human Pose Representation
di: Delmas, Ginger, et al.
Pubblicazione: (2024)
di: Delmas, Ginger, et al.
Pubblicazione: (2024)
Geo4D: Leveraging Video Generators for Geometric 4D Scene Reconstruction
di: Jiang, Zeren, et al.
Pubblicazione: (2025)
di: Jiang, Zeren, et al.
Pubblicazione: (2025)
ELViS: Efficient Visual Similarity from Local Descriptors that Generalizes Across Domains
di: Suma, Pavel, et al.
Pubblicazione: (2026)
di: Suma, Pavel, et al.
Pubblicazione: (2026)
HAMSt3R: Human-Aware Multi-view Stereo 3D Reconstruction
di: Rojas, Sara, et al.
Pubblicazione: (2025)
di: Rojas, Sara, et al.
Pubblicazione: (2025)
EPIC Fields: Marrying 3D Geometry and Video Understanding
di: Tschernezki, Vadim, et al.
Pubblicazione: (2023)
di: Tschernezki, Vadim, et al.
Pubblicazione: (2023)
LPOSS: Label Propagation Over Patches and Pixels for Open-vocabulary Semantic Segmentation
di: Stojnić, Vladan, et al.
Pubblicazione: (2025)
di: Stojnić, Vladan, et al.
Pubblicazione: (2025)
What could go wrong? Discovering and describing failure modes in computer vision
di: Csurka, Gabriela, et al.
Pubblicazione: (2024)
di: Csurka, Gabriela, et al.
Pubblicazione: (2024)
What does really matter in image goal navigation?
di: Monaci, Gianluca, et al.
Pubblicazione: (2025)
di: Monaci, Gianluca, et al.
Pubblicazione: (2025)
Purposer: Putting Human Motion Generation in Context
di: Ugrinovic, Nicolas, et al.
Pubblicazione: (2024)
di: Ugrinovic, Nicolas, et al.
Pubblicazione: (2024)
Syn4D: A Multiview Synthetic 4D Dataset
di: Jiang, Zeren, et al.
Pubblicazione: (2026)
di: Jiang, Zeren, et al.
Pubblicazione: (2026)
DinoComplete: 3D Shape Completion with Distilled Semantic Priors and State Space Models
di: Algan, Furkan Mert, et al.
Pubblicazione: (2026)
di: Algan, Furkan Mert, et al.
Pubblicazione: (2026)
CondiMen: Conditional Multi-Person Mesh Recovery
di: Romain, Brégier, et al.
Pubblicazione: (2024)
di: Romain, Brégier, et al.
Pubblicazione: (2024)
Multi-HMR: Multi-Person Whole-Body Human Mesh Recovery in a Single Shot
di: Baradel, Fabien, et al.
Pubblicazione: (2024)
di: Baradel, Fabien, et al.
Pubblicazione: (2024)
3D Gaussian Point Encoders
di: James, Jim, et al.
Pubblicazione: (2025)
di: James, Jim, et al.
Pubblicazione: (2025)
MASt3R-SfM: a Fully-Integrated Solution for Unconstrained Structure-from-Motion
di: Duisterhof, Bardienus, et al.
Pubblicazione: (2024)
di: Duisterhof, Bardienus, et al.
Pubblicazione: (2024)
Radiology Report Conditional 3D CT Generation with Multi Encoder Latent diffusion Model
di: Amirrajab, Sina, et al.
Pubblicazione: (2025)
di: Amirrajab, Sina, et al.
Pubblicazione: (2025)
Human Mesh Modeling for Anny Body
di: Brégier, Romain, et al.
Pubblicazione: (2025)
di: Brégier, Romain, et al.
Pubblicazione: (2025)
3D Open-Vocabulary Panoptic Segmentation with 2D-3D Vision-Language Distillation
di: Xiao, Zihao, et al.
Pubblicazione: (2024)
di: Xiao, Zihao, et al.
Pubblicazione: (2024)
Distilling Adversarial Robustness Using Heterogeneous Teachers
di: Deng, Jieren, et al.
Pubblicazione: (2024)
di: Deng, Jieren, et al.
Pubblicazione: (2024)
HOSt3R: Keypoint-free Hand-Object 3D Reconstruction from RGB images
di: Swamy, Anilkumar, et al.
Pubblicazione: (2025)
di: Swamy, Anilkumar, et al.
Pubblicazione: (2025)
Automatic Segmentation of 3D CT scans with SAM2 using a zero-shot approach
di: Escoriza, Miquel Lopez, et al.
Pubblicazione: (2026)
di: Escoriza, Miquel Lopez, et al.
Pubblicazione: (2026)
Farm3D: Learning Articulated 3D Animals by Distilling 2D Diffusion
di: Jakab, Tomas, et al.
Pubblicazione: (2023)
di: Jakab, Tomas, et al.
Pubblicazione: (2023)
Distilled-3DGS:Distilled 3D Gaussian Splatting
di: Xiang, Lintao, et al.
Pubblicazione: (2025)
di: Xiang, Lintao, et al.
Pubblicazione: (2025)
StyleMe3D: Stylization with Disentangled Priors by Multiple Encoders on 3D Gaussians
di: Zhuang, Cailin, et al.
Pubblicazione: (2025)
di: Zhuang, Cailin, et al.
Pubblicazione: (2025)
Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs
di: Li, Haoyuan, et al.
Pubblicazione: (2025)
di: Li, Haoyuan, et al.
Pubblicazione: (2025)
LFA: Layer Feature Attention for Run-Time Introspection of 2D Object Detectors in Automated Driving
di: Keser, Mert, et al.
Pubblicazione: (2026)
di: Keser, Mert, et al.
Pubblicazione: (2026)
Documenti analoghi
-
UNIC: Universal Classification Models via Multi-teacher Distillation
di: Sariyildiz, Mert Bulent, et al.
Pubblicazione: (2024) -
Weatherproofing Retrieval for Localization with Generative AI and Geometric Consistency
di: Kalantidis, Yannis, et al.
Pubblicazione: (2024) -
Task Alignment: A simple and effective proxy for model merging in computer vision
di: de Jorge, Pau, et al.
Pubblicazione: (2026) -
Kinaema: a recurrent sequence model for memory and pose in motion
di: Sariyildiz, Mert Bulent, et al.
Pubblicazione: (2025) -
PoseScript: Linking 3D Human Poses and Natural Language
di: Delmas, Ginger, et al.
Pubblicazione: (2022)