Summer-22B: A Systematic Approach to Dataset Engineering and Training at Scale for Video Foundation Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Ryu, Simo, Han, Chunghwan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Training Video Foundation Models with NVIDIA NeMo
por: Patel, Zeeshan, et al.
Publicado: (2025)
por: Patel, Zeeshan, et al.
Publicado: (2025)
Scale Efficient Training for Large Datasets
por: Zhou, Qing, et al.
Publicado: (2025)
por: Zhou, Qing, et al.
Publicado: (2025)
Scaling Laws for Robust Comparison of Open Foundation Language-Vision Models and Datasets
por: Nezhurina, Marianna, et al.
Publicado: (2025)
por: Nezhurina, Marianna, et al.
Publicado: (2025)
EgoMAGIC- An Egocentric Video Field Medicine Dataset for Training Perception Algorithms
por: VanVoorst, Brian, et al.
Publicado: (2026)
por: VanVoorst, Brian, et al.
Publicado: (2026)
Adaptive Training Meets Progressive Scaling: Elevating Efficiency in Diffusion Models
por: Li, Wenhao, et al.
Publicado: (2023)
por: Li, Wenhao, et al.
Publicado: (2023)
Masked Self-Supervised Pre-Training for Text Recognition Transformers on Large-Scale Datasets
por: Kišš, Martin, et al.
Publicado: (2025)
por: Kišš, Martin, et al.
Publicado: (2025)
PRISM: Video Dataset Condensation with Progressive Refinement and Insertion for Sparse Motion
por: Choi, Jaehyun, et al.
Publicado: (2025)
por: Choi, Jaehyun, et al.
Publicado: (2025)
Dataset Distillation for Pre-Trained Self-Supervised Vision Models
por: Cazenavette, George, et al.
Publicado: (2025)
por: Cazenavette, George, et al.
Publicado: (2025)
Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
por: Arkhipkin, Vladimir, et al.
Publicado: (2025)
por: Arkhipkin, Vladimir, et al.
Publicado: (2025)
VideoGuide: Improving Video Diffusion Models without Training Through a Teacher's Guide
por: Lee, Dohun, et al.
Publicado: (2024)
por: Lee, Dohun, et al.
Publicado: (2024)
Architecture, Dataset and Model-Scale Agnostic Data-free Meta-Learning
por: Hu, Zixuan, et al.
Publicado: (2023)
por: Hu, Zixuan, et al.
Publicado: (2023)
Bridging Remote Sensors with Multisensor Geospatial Foundation Models
por: Han, Boran, et al.
Publicado: (2024)
por: Han, Boran, et al.
Publicado: (2024)
Video Reasoning without Training
por: Sridhar, Deepak, et al.
Publicado: (2025)
por: Sridhar, Deepak, et al.
Publicado: (2025)
World Simulation with Video Foundation Models for Physical AI
por: NVIDIA, et al.
Publicado: (2025)
por: NVIDIA, et al.
Publicado: (2025)
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
por: Lai, Zhengfeng, et al.
Publicado: (2024)
por: Lai, Zhengfeng, et al.
Publicado: (2024)
QoQ-Med: Building Multimodal Clinical Foundation Models with Domain-Aware GRPO Training
por: Dai, Wei, et al.
Publicado: (2025)
por: Dai, Wei, et al.
Publicado: (2025)
VESSA: Video-based objEct-centric Self-Supervised Adaptation for Visual Foundation Models
por: Barreto, Jesimon, et al.
Publicado: (2025)
por: Barreto, Jesimon, et al.
Publicado: (2025)
Uni4D: Unifying Visual Foundation Models for 4D Modeling from a Single Video
por: Yao, David Yifan, et al.
Publicado: (2025)
por: Yao, David Yifan, et al.
Publicado: (2025)
VideoNSA: Native Sparse Attention Scales Video Understanding
por: Song, Enxin, et al.
Publicado: (2025)
por: Song, Enxin, et al.
Publicado: (2025)
A Foundation Model for General Moving Object Segmentation in Medical Images
por: Yan, Zhongnuo, et al.
Publicado: (2023)
por: Yan, Zhongnuo, et al.
Publicado: (2023)
Scaling Spatial Intelligence with Multimodal Foundation Models
por: Cai, Zhongang, et al.
Publicado: (2025)
por: Cai, Zhongang, et al.
Publicado: (2025)
PhiNet v2: A Mask-Free Brain-Inspired Vision Foundation Model from Video
por: Yamada, Makoto, et al.
Publicado: (2025)
por: Yamada, Makoto, et al.
Publicado: (2025)
Peer-Ranked Precision: Creating a Foundational Dataset for Fine-Tuning Vision Models from DataSeeds' Annotated Imagery
por: Abdoli, Sajjad, et al.
Publicado: (2025)
por: Abdoli, Sajjad, et al.
Publicado: (2025)
Foundational Model for Electron Micrograph Analysis: Instruction-Tuning Small-Scale Language-and-Vision Assistant for Enterprise Adoption
por: Srinivas, Sakhinana Sagar, et al.
Publicado: (2024)
por: Srinivas, Sakhinana Sagar, et al.
Publicado: (2024)
Video Understanding by Design: How Datasets Shape Architectures and Insights
por: Wang, Lei, et al.
Publicado: (2025)
por: Wang, Lei, et al.
Publicado: (2025)
CLIMB: Data Foundations for Large Scale Multimodal Clinical Foundation Models
por: Dai, Wei, et al.
Publicado: (2025)
por: Dai, Wei, et al.
Publicado: (2025)
Soft Label Pruning and Quantization for Large-Scale Dataset Distillation
por: Lingao, Xiao, et al.
Publicado: (2026)
por: Lingao, Xiao, et al.
Publicado: (2026)
A Survey on Video Diffusion Models
por: Xing, Zhen, et al.
Publicado: (2023)
por: Xing, Zhen, et al.
Publicado: (2023)
Kaputt: A Large-Scale Dataset for Visual Defect Detection
por: Höfer, Sebastian, et al.
Publicado: (2025)
por: Höfer, Sebastian, et al.
Publicado: (2025)
OVR: A Dataset for Open Vocabulary Temporal Repetition Counting in Videos
por: Dwibedi, Debidatta, et al.
Publicado: (2024)
por: Dwibedi, Debidatta, et al.
Publicado: (2024)
Towards Precise Scaling Laws for Video Diffusion Transformers
por: Yin, Yuanyang, et al.
Publicado: (2024)
por: Yin, Yuanyang, et al.
Publicado: (2024)
Scaling Robot Policy Learning via Zero-Shot Labeling with Foundation Models
por: Blank, Nils, et al.
Publicado: (2024)
por: Blank, Nils, et al.
Publicado: (2024)
Advances in Multimodal Adaptation and Generalization: From Traditional Approaches to Foundation Models
por: Dong, Hao, et al.
Publicado: (2025)
por: Dong, Hao, et al.
Publicado: (2025)
Diffusion Adversarial Post-Training for One-Step Video Generation
por: Lin, Shanchuan, et al.
Publicado: (2025)
por: Lin, Shanchuan, et al.
Publicado: (2025)
Conditioning GAN Without Training Dataset
por: Mekonnen, Kidist Amde
Publicado: (2024)
por: Mekonnen, Kidist Amde
Publicado: (2024)
Leveraging Foundation Models for Causal Generative Modeling
por: Komanduri, Aneesh, et al.
Publicado: (2026)
por: Komanduri, Aneesh, et al.
Publicado: (2026)
Revisiting Model Stitching In the Foundation Model Era
por: Mai, Zheda, et al.
Publicado: (2026)
por: Mai, Zheda, et al.
Publicado: (2026)
Accelerating Large-Scale Dataset Distillation via Exploration-Exploitation Optimization
por: Alahmadi, Muhammad J., et al.
Publicado: (2026)
por: Alahmadi, Muhammad J., et al.
Publicado: (2026)
Aneumo: A Large-Scale Comprehensive Synthetic Dataset of Aneurysm Hemodynamics
por: Li, Xigui, et al.
Publicado: (2025)
por: Li, Xigui, et al.
Publicado: (2025)
FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling
por: Li, Yitong, et al.
Publicado: (2026)
por: Li, Yitong, et al.
Publicado: (2026)
Ejemplares similares
-
Training Video Foundation Models with NVIDIA NeMo
por: Patel, Zeeshan, et al.
Publicado: (2025) -
Scale Efficient Training for Large Datasets
por: Zhou, Qing, et al.
Publicado: (2025) -
Scaling Laws for Robust Comparison of Open Foundation Language-Vision Models and Datasets
por: Nezhurina, Marianna, et al.
Publicado: (2025) -
EgoMAGIC- An Egocentric Video Field Medicine Dataset for Training Perception Algorithms
por: VanVoorst, Brian, et al.
Publicado: (2026) -
Adaptive Training Meets Progressive Scaling: Elevating Efficiency in Diffusion Models
por: Li, Wenhao, et al.
Publicado: (2023)