GigaVideo-1: Advancing Video Generation via Automatic Feedback with 4 GPU-Hours Fine-Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Bao, Xiaoyi, Lv, Jindi, Wang, Xiaofeng, Zhu, Zheng, Chen, Xinze, Zhou, YuKun, Lv, Jiancheng, Wang, Xingang, Huang, Guan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation
di: Zhao, Guosheng, et al.
Pubblicazione: (2024)
di: Zhao, Guosheng, et al.
Pubblicazione: (2024)
Multi-Path Collaborative Reasoning via Reinforcement Learning
di: Lv, Jindi, et al.
Pubblicazione: (2025)
di: Lv, Jindi, et al.
Pubblicazione: (2025)
ViVa: A Video-Generative Value Model for Robot Reinforcement Learning
di: Lv, Jindi, et al.
Pubblicazione: (2026)
di: Lv, Jindi, et al.
Pubblicazione: (2026)
EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation
di: Wang, Xiaofeng, et al.
Pubblicazione: (2024)
di: Wang, Xiaofeng, et al.
Pubblicazione: (2024)
DynImg: Key Frames with Visual Prompts are Good Representation for Multi-Modal Video Understanding
di: Bao, Xiaoyi, et al.
Pubblicazione: (2025)
di: Bao, Xiaoyi, et al.
Pubblicazione: (2025)
Deploying Models to Non-participating Clients in Federated Learning without Fine-tuning: A Hypernetwork-based Approach
di: Zhou, Yuhao, et al.
Pubblicazione: (2025)
di: Zhou, Yuhao, et al.
Pubblicazione: (2025)
WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens
di: Wang, Xiaofeng, et al.
Pubblicazione: (2024)
di: Wang, Xiaofeng, et al.
Pubblicazione: (2024)
GigaWorld-Policy: An Efficient Action-Centered World--Action Model
di: Ye, Angen, et al.
Pubblicazione: (2026)
di: Ye, Angen, et al.
Pubblicazione: (2026)
GigaBrain-0.5M*: a VLA That Learns From World Model-Based Reinforcement Learning
di: GigaBrain Team, et al.
Pubblicazione: (2026)
di: GigaBrain Team, et al.
Pubblicazione: (2026)
HumanDreamer: Generating Controllable Human-Motion Videos via Decoupled Generation
di: Wang, Boyuan, et al.
Pubblicazione: (2025)
di: Wang, Boyuan, et al.
Pubblicazione: (2025)
HyperNAS: Enhancing Architecture Representation for NAS Predictor via Hypernetwork
di: Lv, Jindi, et al.
Pubblicazione: (2025)
di: Lv, Jindi, et al.
Pubblicazione: (2025)
GigaAPI for GPU Parallelization
di: Suvarna, M., et al.
Pubblicazione: (2025)
di: Suvarna, M., et al.
Pubblicazione: (2025)
VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation
di: He, Xuan, et al.
Pubblicazione: (2024)
di: He, Xuan, et al.
Pubblicazione: (2024)
GigaBrain-0: A World Model-Powered Vision-Language-Action Model
di: GigaBrain Team, et al.
Pubblicazione: (2025)
di: GigaBrain Team, et al.
Pubblicazione: (2025)
DriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene Representation
di: Zhao, Guosheng, et al.
Pubblicazione: (2024)
di: Zhao, Guosheng, et al.
Pubblicazione: (2024)
VideoGigaGAN: Towards Detail-rich Video Super-Resolution
di: Xu, Yiran, et al.
Pubblicazione: (2024)
di: Xu, Yiran, et al.
Pubblicazione: (2024)
GigaWorld-0: World Models as Data Engine to Empower Embodied AI
di: GigaWorld Team, et al.
Pubblicazione: (2025)
di: GigaWorld Team, et al.
Pubblicazione: (2025)
ReconPhys: Reconstruct Appearance and Physical Attributes from Single Video
di: Wang, Boyuan, et al.
Pubblicazione: (2026)
di: Wang, Boyuan, et al.
Pubblicazione: (2026)
GPS: Distilling Compact Memories via Grid-based Patch Sampling for Efficient Online Class-Incremental Learning
di: Ma, Mingchuan, et al.
Pubblicazione: (2025)
di: Ma, Mingchuan, et al.
Pubblicazione: (2025)
Ferret: An Efficient Online Continual Learning Framework under Varying Memory Constraints
di: Zhou, Yuhao, et al.
Pubblicazione: (2025)
di: Zhou, Yuhao, et al.
Pubblicazione: (2025)
Giga-scale Kernel Matrix Vector Multiplication on GPU
di: Hu, Robert, et al.
Pubblicazione: (2022)
di: Hu, Robert, et al.
Pubblicazione: (2022)
VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis
di: Lang, Xiaolei, et al.
Pubblicazione: (2026)
di: Lang, Xiaolei, et al.
Pubblicazione: (2026)
VAU-R1: Advancing Video Anomaly Understanding via Reinforcement Fine-Tuning
di: Zhu, Liyun, et al.
Pubblicazione: (2025)
di: Zhu, Liyun, et al.
Pubblicazione: (2025)
EmbodieDreamer: Advancing Real2Sim2Real Transfer for Policy Training via Embodied World Modeling
di: Wang, Boyuan, et al.
Pubblicazione: (2025)
di: Wang, Boyuan, et al.
Pubblicazione: (2025)
Application of Artificial Intelligence in Hand Gesture Recognition with Virtual Reality: Survey and Analysis of Hand Gesture Hardware Selection
di: Wang, Jindi
Pubblicazione: (2024)
di: Wang, Jindi
Pubblicazione: (2024)
ReconDreamer++: Harmonizing Generative and Reconstructive Models for Driving Scene Representation
di: Zhao, Guosheng, et al.
Pubblicazione: (2025)
di: Zhao, Guosheng, et al.
Pubblicazione: (2025)
VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
di: Wang, Qi, et al.
Pubblicazione: (2025)
di: Wang, Qi, et al.
Pubblicazione: (2025)
Paper2Video: Automatic Video Generation from Scientific Papers
di: Zhu, Zeyu, et al.
Pubblicazione: (2025)
di: Zhu, Zeyu, et al.
Pubblicazione: (2025)
Advancing Video Quality Assessment for AIGC
di: Yue, Xinli, et al.
Pubblicazione: (2024)
di: Yue, Xinli, et al.
Pubblicazione: (2024)
Trajectory Attention for Fine-grained Video Motion Control
di: Xiao, Zeqi, et al.
Pubblicazione: (2024)
di: Xiao, Zeqi, et al.
Pubblicazione: (2024)
Identification and mitigation of unexplained dose attenuation caused by sub‐table water accumulation in an MR‐Linac (Elekta Unity)
di: Jinhu Chen, et al.
Pubblicazione: (2025)
di: Jinhu Chen, et al.
Pubblicazione: (2025)
Improving Video Generation with Human Feedback
di: Liu, Jie, et al.
Pubblicazione: (2025)
di: Liu, Jie, et al.
Pubblicazione: (2025)
Frequency-aware Neural Representation for Videos
di: Zhu, Jun, et al.
Pubblicazione: (2026)
di: Zhu, Jun, et al.
Pubblicazione: (2026)
ReCapture: Generative Video Camera Controls for User-Provided Videos using Masked Video Fine-Tuning
di: Zhang, David Junhao, et al.
Pubblicazione: (2024)
di: Zhang, David Junhao, et al.
Pubblicazione: (2024)
Text-guided Fine-Grained Video Anomaly Understanding
di: Gu, Jihao, et al.
Pubblicazione: (2025)
di: Gu, Jihao, et al.
Pubblicazione: (2025)
Video Compression with Hierarchical Temporal Neural Representation
di: Zhu, Jun, et al.
Pubblicazione: (2026)
di: Zhu, Jun, et al.
Pubblicazione: (2026)
RB-FT: Rationale-Bootstrapped Fine-Tuning for Video Classification
di: Xu, Meilong, et al.
Pubblicazione: (2025)
di: Xu, Meilong, et al.
Pubblicazione: (2025)
Characterizing the set of quantum correlations in prepare-and-measure quantum chain-shaped networks
di: Jia, Yanning, et al.
Pubblicazione: (2024)
di: Jia, Yanning, et al.
Pubblicazione: (2024)
Yan: Foundational Interactive Video Generation
di: Ye, Deheng, et al.
Pubblicazione: (2025)
di: Ye, Deheng, et al.
Pubblicazione: (2025)
DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion
di: Wang, Weijie, et al.
Pubblicazione: (2025)
di: Wang, Weijie, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation
di: Zhao, Guosheng, et al.
Pubblicazione: (2024) -
Multi-Path Collaborative Reasoning via Reinforcement Learning
di: Lv, Jindi, et al.
Pubblicazione: (2025) -
ViVa: A Video-Generative Value Model for Robot Reinforcement Learning
di: Lv, Jindi, et al.
Pubblicazione: (2026) -
EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation
di: Wang, Xiaofeng, et al.
Pubblicazione: (2024) -
DynImg: Key Frames with Visual Prompts are Good Representation for Multi-Modal Video Understanding
di: Bao, Xiaoyi, et al.
Pubblicazione: (2025)