Efficient Masked Autoencoders with Self-Consistency
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Zhaowen, Zhu, Yousong, Chen, Zhiyang, Li, Wei, Zhao, Chaoyang, Zhao, Rui, Tang, Ming, Wang, Jinqiao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Seeing to Predicting: A Vision-Language Framework for Trajectory Forecasting and Controlled Video Generation
por: Yang, Fan, et al.
Publicado: (2025)
por: Yang, Fan, et al.
Publicado: (2025)
TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
por: Yang, Fan, et al.
Publicado: (2026)
por: Yang, Fan, et al.
Publicado: (2026)
Griffon: Spelling out All Object Locations at Any Granularity with Large Language Models
por: Zhan, Yufei, et al.
Publicado: (2023)
por: Zhan, Yufei, et al.
Publicado: (2023)
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
por: Zhan, Yufei, et al.
Publicado: (2024)
por: Zhan, Yufei, et al.
Publicado: (2024)
FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
por: Yang, Fan, et al.
Publicado: (2025)
por: Yang, Fan, et al.
Publicado: (2025)
Griffon v2: Advancing Multimodal Perception with High-Resolution Scaling and Visual-Language Co-Referring
por: Zhan, Yufei, et al.
Publicado: (2024)
por: Zhan, Yufei, et al.
Publicado: (2024)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
por: Zheng, Shurong, et al.
Publicado: (2026)
por: Zheng, Shurong, et al.
Publicado: (2026)
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
por: Zhan, Yufei, et al.
Publicado: (2025)
por: Zhan, Yufei, et al.
Publicado: (2025)
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
por: Zhan, Yufei, et al.
Publicado: (2025)
por: Zhan, Yufei, et al.
Publicado: (2025)
FOCUS: Fine-grained Optimization with Semantic Guided Understanding for Pedestrian Attributes Recognition
por: An, Hongyan, et al.
Publicado: (2025)
por: An, Hongyan, et al.
Publicado: (2025)
VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?
por: Yu, Jiachen, et al.
Publicado: (2025)
por: Yu, Jiachen, et al.
Publicado: (2025)
PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability
por: Zhou, Weijie, et al.
Publicado: (2025)
por: Zhou, Weijie, et al.
Publicado: (2025)
Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time
por: Zhou, Weijie, et al.
Publicado: (2026)
por: Zhou, Weijie, et al.
Publicado: (2026)
PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
por: Zhou, Weijie, et al.
Publicado: (2025)
por: Zhou, Weijie, et al.
Publicado: (2025)
Self-Guided Masked Autoencoder
por: Shin, Jeongwoo, et al.
Publicado: (2025)
por: Shin, Jeongwoo, et al.
Publicado: (2025)
Efficient Self-supervised Vision Pretraining with Local Masked Reconstruction
por: Chen, Jun, et al.
Publicado: (2022)
por: Chen, Jun, et al.
Publicado: (2022)
SelfMedHPM: Self Pre-training With Hard Patches Mining Masked Autoencoders For Medical Image Segmentation
por: Lv, Yunhao, et al.
Publicado: (2025)
por: Lv, Yunhao, et al.
Publicado: (2025)
Masked Autoencoders are Robust Data Augmentors
por: Xu, Haohang, et al.
Publicado: (2022)
por: Xu, Haohang, et al.
Publicado: (2022)
Improving Masked Autoencoders by Learning Where to Mask
por: Chen, Haijian, et al.
Publicado: (2023)
por: Chen, Haijian, et al.
Publicado: (2023)
Masked Autoencoders are Parameter-Efficient Federated Continual Learners
por: He, Yuchen, et al.
Publicado: (2024)
por: He, Yuchen, et al.
Publicado: (2024)
Quality-Aware Language-Conditioned Local Auto-Regressive Anomaly Synthesis and Detection
por: Qian, Long, et al.
Publicado: (2025)
por: Qian, Long, et al.
Publicado: (2025)
MathPhys-Guided Coarse-to-Fine Anomaly Synthesis with SQE-Driven Bi-Level Optimization for Anomaly Detection
por: Qian, Long, et al.
Publicado: (2025)
por: Qian, Long, et al.
Publicado: (2025)
MASA: Motion-aware Masked Autoencoder with Semantic Alignment for Sign Language Recognition
por: Zhao, Weichao, et al.
Publicado: (2024)
por: Zhao, Weichao, et al.
Publicado: (2024)
Text-Guided Video Masked Autoencoder
por: Fan, David, et al.
Publicado: (2024)
por: Fan, David, et al.
Publicado: (2024)
MARMOT: Masked Autoencoder for Modeling Transient Imaging
por: Shen, Siyuan, et al.
Publicado: (2025)
por: Shen, Siyuan, et al.
Publicado: (2025)
AnomalyMoE: Towards a Language-free Generalist Model for Unified Visual Anomaly Detection
por: Gu, Zhaopeng, et al.
Publicado: (2025)
por: Gu, Zhaopeng, et al.
Publicado: (2025)
Contrastive Masked Autoencoders are Stronger Vision Learners
por: Huang, Zhicheng, et al.
Publicado: (2022)
por: Huang, Zhicheng, et al.
Publicado: (2022)
FiLo++: Zero-/Few-Shot Anomaly Detection by Fused Fine-Grained Descriptions and Deformable Localization
por: Gu, Zhaopeng, et al.
Publicado: (2025)
por: Gu, Zhaopeng, et al.
Publicado: (2025)
UniVAD: A Training-free Unified Model for Few-shot Visual Anomaly Detection
por: Gu, Zhaopeng, et al.
Publicado: (2024)
por: Gu, Zhaopeng, et al.
Publicado: (2024)
Gaussian Masked Autoencoders
por: Rajasegaran, Jathushan, et al.
Publicado: (2025)
por: Rajasegaran, Jathushan, et al.
Publicado: (2025)
MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing
por: Wang, Langyu, et al.
Publicado: (2025)
por: Wang, Langyu, et al.
Publicado: (2025)
Exploring Semantic Masked Autoencoder for Self-supervised Point Cloud Understanding
por: Zha, Yixin, et al.
Publicado: (2025)
por: Zha, Yixin, et al.
Publicado: (2025)
Bringing Masked Autoencoders Explicit Contrastive Properties for Point Cloud Self-Supervised Learning
por: Ren, Bin, et al.
Publicado: (2024)
por: Ren, Bin, et al.
Publicado: (2024)
ESearch-R1: Learning Cost-Aware MLLM Agents for Interactive Embodied Search via Reinforcement Learning
por: Zhou, Weijie, et al.
Publicado: (2025)
por: Zhou, Weijie, et al.
Publicado: (2025)
R-MAE: Regions Meet Masked Autoencoders
por: Nguyen, Duy-Kien, et al.
Publicado: (2023)
por: Nguyen, Duy-Kien, et al.
Publicado: (2023)
SupMAE: Supervised Masked Autoencoders Are Efficient Vision Learners
por: Liang, Feng, et al.
Publicado: (2022)
por: Liang, Feng, et al.
Publicado: (2022)
Optimization of Prompt Learning via Multi-Knowledge Representation for Vision-Language Models
por: Zhang, Enming, et al.
Publicado: (2024)
por: Zhang, Enming, et al.
Publicado: (2024)
Continual Self-Supervised Learning with Masked Autoencoders in Remote Sensing
por: Möllenbrok, Lars, et al.
Publicado: (2025)
por: Möllenbrok, Lars, et al.
Publicado: (2025)
Masked Autoencoder Self Pre-Training for Defect Detection in Microelectronics
por: Röhrich, Nikolai, et al.
Publicado: (2025)
por: Röhrich, Nikolai, et al.
Publicado: (2025)
A Two-Stage Masked Autoencoder Based Network for Indoor Depth Completion
por: Sun, Kailai, et al.
Publicado: (2024)
por: Sun, Kailai, et al.
Publicado: (2024)
Ejemplares similares
-
From Seeing to Predicting: A Vision-Language Framework for Trajectory Forecasting and Controlled Video Generation
por: Yang, Fan, et al.
Publicado: (2025) -
TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
por: Yang, Fan, et al.
Publicado: (2026) -
Griffon: Spelling out All Object Locations at Any Granularity with Large Language Models
por: Zhan, Yufei, et al.
Publicado: (2023) -
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
por: Zhan, Yufei, et al.
Publicado: (2024) -
FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
por: Yang, Fan, et al.
Publicado: (2025)