Efficient Universal Perception Encoder
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Chenchen, Suri, Saksham, Jose, Cijo, Oquab, Maxime, Szafraniec, Marc, Wen, Wei, Xiong, Yunyang, Labatut, Patrick, Bojanowski, Piotr, Krishnamoorthi, Raghuraman, Chandra, Vikas |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
You Don't Need Domain-Specific Data Augmentations When Scaling Self-Supervised Learning
por: Moutakanni, Théo, et al.
Publicado: (2024)
por: Moutakanni, Théo, et al.
Publicado: (2024)
Efficient Track Anything
por: Xiong, Yunyang, et al.
Publicado: (2024)
por: Xiong, Yunyang, et al.
Publicado: (2024)
EdgeTAM: On-Device Track Anything Model
por: Zhou, Chong, et al.
Publicado: (2025)
por: Zhou, Chong, et al.
Publicado: (2025)
DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language Alignment
por: Jose, Cijo, et al.
Publicado: (2024)
por: Jose, Cijo, et al.
Publicado: (2024)
Vision Transformers Need Registers
por: Darcet, Timothée, et al.
Publicado: (2023)
por: Darcet, Timothée, et al.
Publicado: (2023)
SqueezeSAM: User friendly mobile interactive segmentation
por: Varadarajan, Balakrishnan, et al.
Publicado: (2023)
por: Varadarajan, Balakrishnan, et al.
Publicado: (2023)
PathFusion: Path-consistent Lidar-Camera Deep Feature Fusion
por: Wu, Lemeng, et al.
Publicado: (2022)
por: Wu, Lemeng, et al.
Publicado: (2022)
Small Vision-Language Models are Smart Compressors for Long Video Understanding
por: Fei, Junjie, et al.
Publicado: (2026)
por: Fei, Junjie, et al.
Publicado: (2026)
Automatic Data Curation for Self-Supervised Learning: A Clustering-Based Approach
por: Vo, Huy V., et al.
Publicado: (2024)
por: Vo, Huy V., et al.
Publicado: (2024)
Cluster and Predict Latent Patches for Improved Masked Image Modeling
por: Darcet, Timothée, et al.
Publicado: (2025)
por: Darcet, Timothée, et al.
Publicado: (2025)
Disentangling the Factors of Convergence between Brains and Computer Vision Models
por: Raugel, Joséphine, et al.
Publicado: (2025)
por: Raugel, Joséphine, et al.
Publicado: (2025)
Back to the Features: DINO as a Foundation for Video World Models
por: Baldassarre, Federico, et al.
Publicado: (2025)
por: Baldassarre, Federico, et al.
Publicado: (2025)
Misalignment Between Backpropagation and the Hierarchy of Brain Responses to Images
por: Raugel, Joséphine, et al.
Publicado: (2026)
por: Raugel, Joséphine, et al.
Publicado: (2026)
VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice
por: Liu, Shuming, et al.
Publicado: (2026)
por: Liu, Shuming, et al.
Publicado: (2026)
DINOv3
por: Siméoni, Oriane, et al.
Publicado: (2025)
por: Siméoni, Oriane, et al.
Publicado: (2025)
MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases
por: Liu, Zechun, et al.
Publicado: (2024)
por: Liu, Zechun, et al.
Publicado: (2024)
Diversify, Don't Fine-Tune: Scaling Up Visual Recognition Training with Synthetic Images
por: Yu, Zhuoran, et al.
Publicado: (2023)
por: Yu, Zhuoran, et al.
Publicado: (2023)
Agent-as-a-Judge: Evaluate Agents with Agents
por: Zhuge, Mingchen, et al.
Publicado: (2024)
por: Zhuge, Mingchen, et al.
Publicado: (2024)
MobileMoE: Scaling On-Device Mixture of Experts
por: Chen, Yanbei, et al.
Publicado: (2026)
por: Chen, Yanbei, et al.
Publicado: (2026)
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
por: Shen, Xiaoqian, et al.
Publicado: (2024)
por: Shen, Xiaoqian, et al.
Publicado: (2024)
Mixture-of-Supernets: Improving Weight-Sharing Supernet Training with Architecture-Routed Mixture-of-Experts
por: Jawahar, Ganesh, et al.
Publicado: (2023)
por: Jawahar, Ganesh, et al.
Publicado: (2023)
DepthShrinker: A New Compression Paradigm Towards Boosting Real-Hardware Efficiency of Compact Neural Networks
por: Fu, Yonggan, et al.
Publicado: (2022)
por: Fu, Yonggan, et al.
Publicado: (2022)
UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders
por: Walmer, Matthew, et al.
Publicado: (2026)
por: Walmer, Matthew, et al.
Publicado: (2026)
SpinQuant: LLM quantization with learned rotations
por: Liu, Zechun, et al.
Publicado: (2024)
por: Liu, Zechun, et al.
Publicado: (2024)
Advancing human-centric AI for robust X-ray analysis through holistic self-supervised learning
por: Moutakanni, Théo, et al.
Publicado: (2024)
por: Moutakanni, Théo, et al.
Publicado: (2024)
MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes
por: Zhao, Changsheng, et al.
Publicado: (2025)
por: Zhao, Changsheng, et al.
Publicado: (2025)
DINOv2: Learning Robust Visual Features without Supervision
por: Oquab, Maxime, et al.
Publicado: (2023)
por: Oquab, Maxime, et al.
Publicado: (2023)
ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization
por: Liu, Zechun, et al.
Publicado: (2025)
por: Liu, Zechun, et al.
Publicado: (2025)
Communication Efficient Distributed Training with Distributed Lion
por: Liu, Bo, et al.
Publicado: (2024)
por: Liu, Bo, et al.
Publicado: (2024)
VGGT-$Ω$
por: Wang, Jianyuan, et al.
Publicado: (2026)
por: Wang, Jianyuan, et al.
Publicado: (2026)
LiFT: A Surprisingly Simple Lightweight Feature Transform for Dense ViT Descriptors
por: Suri, Saksham, et al.
Publicado: (2024)
por: Suri, Saksham, et al.
Publicado: (2024)
Numerical analysis of a non-clamped dynamic thermoviscoelastic contact problem
por: Bartman, Piotr, et al.
Publicado: (2019)
por: Bartman, Piotr, et al.
Publicado: (2019)
dTRPO: Trajectory Reduction in Policy Optimization of Diffusion Large Language Models
por: Zhang, Wenxuan, et al.
Publicado: (2026)
por: Zhang, Wenxuan, et al.
Publicado: (2026)
LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior
por: Wang, Hanyu, et al.
Publicado: (2024)
por: Wang, Hanyu, et al.
Publicado: (2024)
Going Down Memory Lane: Scaling Tokens for Video Stream Understanding with Dynamic KV-Cache Memory
por: Agarwal, Vatsal, et al.
Publicado: (2026)
por: Agarwal, Vatsal, et al.
Publicado: (2026)
Convergence of a double step scheme for a class of second order Clarke subdifferential inclusions
por: Bartosz, Krzysztof, et al.
Publicado: (2023)
por: Bartosz, Krzysztof, et al.
Publicado: (2023)
Better (pseudo-)labels for semi-supervised instance segmentation
por: Porcher, François, et al.
Publicado: (2024)
por: Porcher, François, et al.
Publicado: (2024)
CHMv2: Improvements in Global Canopy Height Mapping using DINOv3
por: Brandt, John, et al.
Publicado: (2026)
por: Brandt, John, et al.
Publicado: (2026)
Microstructural Study and Wear Optimization of Squeeze Stir Casted Al6061/FA/CSA/Graphite Composite Material
por: Vikas Chandra, et al.
Publicado: (2025)
por: Vikas Chandra, et al.
Publicado: (2025)
ESAM++: Efficient Online 3D Perception on the Edge
por: Liu, Qin, et al.
Publicado: (2026)
por: Liu, Qin, et al.
Publicado: (2026)
Ejemplares similares
-
You Don't Need Domain-Specific Data Augmentations When Scaling Self-Supervised Learning
por: Moutakanni, Théo, et al.
Publicado: (2024) -
Efficient Track Anything
por: Xiong, Yunyang, et al.
Publicado: (2024) -
EdgeTAM: On-Device Track Anything Model
por: Zhou, Chong, et al.
Publicado: (2025) -
DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language Alignment
por: Jose, Cijo, et al.
Publicado: (2024) -
Vision Transformers Need Registers
por: Darcet, Timothée, et al.
Publicado: (2023)