Saved in:
| Main Authors: | Li, Zongjian, Liu, Zheyuan, Zhang, Qihui, Lin, Bin, Wu, Feize, Yuan, Shenghai, Yan, Zhiyuan, Ye, Yang, Yu, Wangbo, Niu, Yuwei, Wang, Shaodong, Cheng, Xinhua, Yuan, Li |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2510.16888 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation
by: Lin, Bin, et al.
Published: (2025)
by: Lin, Bin, et al.
Published: (2025)
WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model
by: Li, Zongjian, et al.
Published: (2024)
by: Li, Zongjian, et al.
Published: (2024)
ImgEdit: A Unified Image Editing Dataset and Benchmark
by: Ye, Yang, et al.
Published: (2025)
by: Ye, Yang, et al.
Published: (2025)
OD-VAE: An Omni-dimensional Video Compressor for Improving Latent Video Diffusion Model
by: Chen, Liuhan, et al.
Published: (2024)
by: Chen, Liuhan, et al.
Published: (2024)
Look-Back: Implicit Visual Re-focusing in MLLM Reasoning
by: Yang, Shuo, et al.
Published: (2025)
by: Yang, Shuo, et al.
Published: (2025)
Helios: Real Real-Time Long Video Generation Model
by: Yuan, Shenghai, et al.
Published: (2026)
by: Yuan, Shenghai, et al.
Published: (2026)
FlashI2V: Fourier-Guided Latent Shifting Prevents Conditional Image Leakage in Image-to-Video Generation
by: Ge, Yunyang, et al.
Published: (2025)
by: Ge, Yunyang, et al.
Published: (2025)
HoloTime: Taming Video Diffusion Models for Panoramic 4D Scene Generation
by: Zhou, Haiyang, et al.
Published: (2025)
by: Zhou, Haiyang, et al.
Published: (2025)
HoloDreamer: Holistic 3D Panoramic World Generation from Text Descriptions
by: Zhou, Haiyang, et al.
Published: (2024)
by: Zhou, Haiyang, et al.
Published: (2024)
Jacquard V2: Refining Datasets using the Human In the Loop Data Correction Method
by: Li, Qiuhao, et al.
Published: (2024)
by: Li, Qiuhao, et al.
Published: (2024)
Does Understanding Inform Generation in Unified Multimodal Models? From Analysis to Path Forward
by: Niu, Yuwei, et al.
Published: (2025)
by: Niu, Yuwei, et al.
Published: (2025)
RoomPainter: View-Integrated Diffusion for Consistent Indoor Scene Texturing
by: Huang, Zhipeng, et al.
Published: (2024)
by: Huang, Zhipeng, et al.
Published: (2024)
DeblurNVS: Geometric Latent Diffusion for Novel View Synthesis from Sparse Motion-Blurred Images
by: Shi, Changyue, et al.
Published: (2026)
by: Shi, Changyue, et al.
Published: (2026)
Cycle3D: High-quality and Consistent Image-to-3D Generation via Generation-Reconstruction Cycle
by: Tang, Zhenyu, et al.
Published: (2024)
by: Tang, Zhenyu, et al.
Published: (2024)
Learning and Optimization of Implicit Negative Feedback for Industrial Short-video Recommender System
by: Pan, Yunzhu, et al.
Published: (2023)
by: Pan, Yunzhu, et al.
Published: (2023)
CoT-lized Diffusion: Let's Reinforce T2I Generation Step-by-step
by: Liu, Zheyuan, et al.
Published: (2025)
by: Liu, Zheyuan, et al.
Published: (2025)
Open-Sora Plan: Open-Source Large Video Generation Model
by: Lin, Bin, et al.
Published: (2024)
by: Lin, Bin, et al.
Published: (2024)
AE-NeRF: Augmenting Event-Based Neural Radiance Fields for Non-ideal Conditions and Larger Scene
by: Feng, Chaoran, et al.
Published: (2025)
by: Feng, Chaoran, et al.
Published: (2025)
MagicTime: Time-lapse Video Generation Models as Metamorphic Simulators
by: Yuan, Shenghai, et al.
Published: (2024)
by: Yuan, Shenghai, et al.
Published: (2024)
CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance
by: Deng, Yufan, et al.
Published: (2025)
by: Deng, Yufan, et al.
Published: (2025)
NeuralGS: Bridging Neural Fields and 3D Gaussian Splatting for Compact 3D Representations
by: Tang, Zhenyu, et al.
Published: (2025)
by: Tang, Zhenyu, et al.
Published: (2025)
iFSQ: Improving FSQ for Image Generation with 1 Line of Code
by: Lin, Bin, et al.
Published: (2026)
by: Lin, Bin, et al.
Published: (2026)
HERO: Human-Feedback Efficient Reinforcement Learning for Online Diffusion Model Finetuning
by: Hiranaka, Ayano, et al.
Published: (2024)
by: Hiranaka, Ayano, et al.
Published: (2024)
UNICBench: UNIfied Counting Benchmark for MLLM
by: Rong, Chenggang, et al.
Published: (2026)
by: Rong, Chenggang, et al.
Published: (2026)
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
by: Yuan, Shenghai, et al.
Published: (2025)
by: Yuan, Shenghai, et al.
Published: (2025)
Structured Task Solving via Modular Embodied Intelligence: A Case Study on Rubik's Cube
by: Fan, Chongshan, et al.
Published: (2025)
by: Fan, Chongshan, et al.
Published: (2025)
Effective Training Data Synthesis for Improving MLLM Chart Understanding
by: Yang, Yuwei, et al.
Published: (2025)
by: Yang, Yuwei, et al.
Published: (2025)
AEOS: Active Environment-aware Optimal Scanning Control for UAV LiDAR-Inertial Odometry in Complex Scenes
by: Li, Jianping, et al.
Published: (2025)
by: Li, Jianping, et al.
Published: (2025)
Diffusion Implicit Policy for Unpaired Scene-aware Motion Synthesis
by: Gong, Jingyu, et al.
Published: (2024)
by: Gong, Jingyu, et al.
Published: (2024)
RPMS: Enhancing LLM-Based Embodied Planning through Rule-Augmented Memory Synergy
by: Yuan, Zhenhang, et al.
Published: (2026)
by: Yuan, Zhenhang, et al.
Published: (2026)
OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning
by: Ge, Yunyang, et al.
Published: (2026)
by: Ge, Yunyang, et al.
Published: (2026)
Decouple-Then-Merge: Finetune Diffusion Models as Multi-Task Learning
by: Ma, Qianli, et al.
Published: (2024)
by: Ma, Qianli, et al.
Published: (2024)
Rota-Baxter groups with weight zero and integration on topological groups
by: Gao, Xing, et al.
Published: (2024)
by: Gao, Xing, et al.
Published: (2024)
Bringing Diversity from Diffusion Models to Semantic-Guided Face Asset Generation
by: Cai, Yunxuan, et al.
Published: (2025)
by: Cai, Yunxuan, et al.
Published: (2025)
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
by: Yuan, Shenghai, et al.
Published: (2024)
by: Yuan, Shenghai, et al.
Published: (2024)
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
by: Yang, Hao, et al.
Published: (2026)
by: Yang, Hao, et al.
Published: (2026)
Chatlaw: A Multi-Agent Collaborative Legal Assistant with Knowledge Graph Enhanced Mixture-of-Experts Large Language Model
by: Cui, Jiaxi, et al.
Published: (2023)
by: Cui, Jiaxi, et al.
Published: (2023)
Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing
by: Li, Yan, et al.
Published: (2026)
by: Li, Yan, et al.
Published: (2026)
Implicit In-Context Learning: Evidence from Artificial Language Experiments
by: Ma, Xiaomeng, et al.
Published: (2025)
by: Ma, Xiaomeng, et al.
Published: (2025)
Process Reinforcement through Implicit Rewards
by: Cui, Ganqu, et al.
Published: (2025)
by: Cui, Ganqu, et al.
Published: (2025)
Similar Items
-
UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation
by: Lin, Bin, et al.
Published: (2025) -
WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model
by: Li, Zongjian, et al.
Published: (2024) -
ImgEdit: A Unified Image Editing Dataset and Benchmark
by: Ye, Yang, et al.
Published: (2025) -
OD-VAE: An Omni-dimensional Video Compressor for Improving Latent Video Diffusion Model
by: Chen, Liuhan, et al.
Published: (2024) -
Look-Back: Implicit Visual Re-focusing in MLLM Reasoning
by: Yang, Shuo, et al.
Published: (2025)