Efficient Training for Human Video Generation with Entropy-Guided Prioritized Progressive Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Changlin, Zhang, Jiawei, Liu, Shuhao, Lin, Sihao, Shi, Zeyi, Li, Zhihui, Chang, Xiaojun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Which Layer Causes Distribution Deviation? Entropy-Guided Adaptive Pruning for Diffusion and Flow Models
par: Li, Changlin, et autres
Publié: (2025)
par: Li, Changlin, et autres
Publié: (2025)
Efficient Training of Large Vision Models via Advanced Automated Progressive Learning
par: Li, Changlin, et autres
Publié: (2024)
par: Li, Changlin, et autres
Publié: (2024)
Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions
par: Zhang, Kecheng, et autres
Publié: (2026)
par: Zhang, Kecheng, et autres
Publié: (2026)
CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation
par: Hao, Haihong, et autres
Publié: (2025)
par: Hao, Haihong, et autres
Publié: (2025)
Learning A Zero-shot Occupancy Network from Vision Foundation Models via Self-supervised Adaptation
par: Lin, Sihao, et autres
Publié: (2025)
par: Lin, Sihao, et autres
Publié: (2025)
Token Painter: Training-Free Text-Guided Image Inpainting via Mask Autoregressive Models
par: Jiang, Longtao, et autres
Publié: (2025)
par: Jiang, Longtao, et autres
Publié: (2025)
Progressive Supernet Training for Efficient Visual Autoregressive Modeling
par: Chen, Xiaoyue, et autres
Publié: (2025)
par: Chen, Xiaoyue, et autres
Publié: (2025)
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
par: Hao, Haihong, et autres
Publié: (2026)
par: Hao, Haihong, et autres
Publié: (2026)
Entropy-Guided k-Guard Sampling for Long-Horizon Autoregressive Video Generation
par: Han, Yizhao, et autres
Publié: (2026)
par: Han, Yizhao, et autres
Publié: (2026)
From Ideal to Real: Unified and Data-Efficient Dense Prediction for Real-World Scenarios
par: Xia, Changliang, et autres
Publié: (2025)
par: Xia, Changliang, et autres
Publié: (2025)
VideoScan: Enabling Efficient Streaming Video Understanding via Frame-level Semantic Carriers
par: Li, Ruanjun, et autres
Publié: (2025)
par: Li, Ruanjun, et autres
Publié: (2025)
GeoSense: Internalizing Geometric Necessity Perception for Multimodal Reasoning
par: Liu, Ruiheng, et autres
Publié: (2026)
par: Liu, Ruiheng, et autres
Publié: (2026)
Mettle: Meta-Token Learning for Memory-Efficient Audio-Visual Adaptation
par: Zhou, Jinxing, et autres
Publié: (2025)
par: Zhou, Jinxing, et autres
Publié: (2025)
VTinker: Guided Flow Upsampling and Texture Mapping for High-Resolution Video Frame Interpolation
par: Wu, Chenyang, et autres
Publié: (2025)
par: Wu, Chenyang, et autres
Publié: (2025)
See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation
par: Dai, Tingjun, et autres
Publié: (2026)
par: Dai, Tingjun, et autres
Publié: (2026)
DNA Family: Boosting Weight-Sharing NAS with Block-Wise Supervisions
par: Wang, Guangrun, et autres
Publié: (2024)
par: Wang, Guangrun, et autres
Publié: (2024)
MLP Can Be A Good Transformer Learner
par: Lin, Sihao, et autres
Publié: (2024)
par: Lin, Sihao, et autres
Publié: (2024)
Do Vision Models Develop Human-Like Progressive Difficulty Understanding?
par: Huang, Zeyi, et autres
Publié: (2025)
par: Huang, Zeyi, et autres
Publié: (2025)
DiffuTraj: A Stochastic Vessel Trajectory Prediction Approach via Guided Diffusion Process
par: Li, Changlin, et autres
Publié: (2024)
par: Li, Changlin, et autres
Publié: (2024)
Beyond Dense Futures: World Models as Structured Planners for Robotic Manipulation
par: Jin, Minghao, et autres
Publié: (2026)
par: Jin, Minghao, et autres
Publié: (2026)
ContactHandover: Contact-Guided Robot-to-Human Object Handover
par: Wang, Zixi, et autres
Publié: (2024)
par: Wang, Zixi, et autres
Publié: (2024)
DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation
par: Liu, Jiawei, et autres
Publié: (2025)
par: Liu, Jiawei, et autres
Publié: (2025)
Unified Static and Dynamic Network: Efficient Temporal Filtering for Video Grounding
par: Hu, Jingjing, et autres
Publié: (2024)
par: Hu, Jingjing, et autres
Publié: (2024)
Spectral Progressive Diffusion for Efficient Image and Video Generation
par: Xiao, Howard, et autres
Publié: (2026)
par: Xiao, Howard, et autres
Publié: (2026)
Knowledge Distillation via the Target-aware Transformer
par: Lin, Sihao, et autres
Publié: (2022)
par: Lin, Sihao, et autres
Publié: (2022)
VRMDiff: Text-Guided Video Referring Matting Generation of Diffusion
par: Yang, Lehan, et autres
Publié: (2025)
par: Yang, Lehan, et autres
Publié: (2025)
IntentionNav: A Benchmark for Intent-Driven Object Navigation from Implicit Human Instruction
par: Qian, Lin, et autres
Publié: (2026)
par: Qian, Lin, et autres
Publié: (2026)
Decoupled Video Generation with Chain of Training-free Diffusion Model Experts
par: Li, Wenhao, et autres
Publié: (2024)
par: Li, Wenhao, et autres
Publié: (2024)
ContentV: Efficient Training of Video Generation Models with Limited Compute
par: Lin, Wenfeng, et autres
Publié: (2025)
par: Lin, Wenfeng, et autres
Publié: (2025)
A Video is Worth 256 Bases: Spatial-Temporal Expectation-Maximization Inversion for Zero-Shot Video Editing
par: Li, Maomao, et autres
Publié: (2023)
par: Li, Maomao, et autres
Publié: (2023)
Perception-Oriented Video Frame Interpolation via Asymmetric Blending
par: Wu, Guangyang, et autres
Publié: (2024)
par: Wu, Guangyang, et autres
Publié: (2024)
ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation
par: Peng, Bo, et autres
Publié: (2023)
par: Peng, Bo, et autres
Publié: (2023)
GPD: Guided Progressive Distillation for Fast and High-Quality Video Generation
par: Liang, Xiao, et autres
Publié: (2026)
par: Liang, Xiao, et autres
Publié: (2026)
Contrastive Learning with Counterfactual Explanations for Radiology Report Generation
par: Li, Mingjie, et autres
Publié: (2024)
par: Li, Mingjie, et autres
Publié: (2024)
Light-A-Video: Training-free Video Relighting via Progressive Light Fusion
par: Zhou, Yujie, et autres
Publié: (2025)
par: Zhou, Yujie, et autres
Publié: (2025)
Sitcom-Crafter: A Plot-Driven Human Motion Generation System in 3D Scenes
par: Chen, Jianqi, et autres
Publié: (2024)
par: Chen, Jianqi, et autres
Publié: (2024)
LongVLM: Efficient Long Video Understanding via Large Language Models
par: Weng, Yuetian, et autres
Publié: (2024)
par: Weng, Yuetian, et autres
Publié: (2024)
Training-free and Adaptive Sparse Attention for Efficient Long Video Generation
par: Xia, Yifei, et autres
Publié: (2025)
par: Xia, Yifei, et autres
Publié: (2025)
Flexiffusion: Training-Free Segment-Wise Neural Architecture Search for Efficient Diffusion Models
par: Huang, Hongtao, et autres
Publié: (2025)
par: Huang, Hongtao, et autres
Publié: (2025)
Learning Streaming Video Representation via Multitask Training
par: Yan, Yibin, et autres
Publié: (2025)
par: Yan, Yibin, et autres
Publié: (2025)
Documents similaires
-
Which Layer Causes Distribution Deviation? Entropy-Guided Adaptive Pruning for Diffusion and Flow Models
par: Li, Changlin, et autres
Publié: (2025) -
Efficient Training of Large Vision Models via Advanced Automated Progressive Learning
par: Li, Changlin, et autres
Publié: (2024) -
Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions
par: Zhang, Kecheng, et autres
Publié: (2026) -
CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation
par: Hao, Haihong, et autres
Publié: (2025) -
Learning A Zero-shot Occupancy Network from Vision Foundation Models via Self-supervised Adaptation
par: Lin, Sihao, et autres
Publié: (2025)