Salvato in:
| Autori principali: | Zhu, Bingwen, Jiang, Yudong, Xu, Baohan, Yang, Siqian, Yin, Mingyu, Wu, Yidi, Sun, Huyang, Wu, Zuxuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2504.10044 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AniSora: Exploring the Frontiers of Animation Video Generation in the Sora Era
di: Jiang, Yudong, et al.
Pubblicazione: (2024)
di: Jiang, Yudong, et al.
Pubblicazione: (2024)
GenRec: Unifying Video Generation and Recognition with Diffusion Models
di: Weng, Zejia, et al.
Pubblicazione: (2024)
di: Weng, Zejia, et al.
Pubblicazione: (2024)
Preference Score Distillation: Leveraging 2D Rewards to Align Text-to-3D Generation with Human Preference
di: Leng, Jiaqi, et al.
Pubblicazione: (2026)
di: Leng, Jiaqi, et al.
Pubblicazione: (2026)
AnimeDL-2M: Million-Scale AI-Generated Anime Image Detection and Localization in Diffusion Era
di: Zhu, Chenyang, et al.
Pubblicazione: (2025)
di: Zhu, Chenyang, et al.
Pubblicazione: (2025)
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
di: Wang, Junke, et al.
Pubblicazione: (2024)
di: Wang, Junke, et al.
Pubblicazione: (2024)
AnimeAdapter: Fine-grained and Consistent Zero-shot Anime Character Generation
di: Han, Yixuan
Pubblicazione: (2026)
di: Han, Yixuan
Pubblicazione: (2026)
E-comIQ-ZH: A Human-Aligned Dataset and Benchmark for Fine-Grained Evaluation of E-commerce Posters with Chain-of-Thought
di: Sun, Meiqi, et al.
Pubblicazione: (2026)
di: Sun, Meiqi, et al.
Pubblicazione: (2026)
VMBench: A Benchmark for Perception-Aligned Video Motion Generation
di: Ling, Xinran, et al.
Pubblicazione: (2025)
di: Ling, Xinran, et al.
Pubblicazione: (2025)
GEditBench v2: A Human-Aligned Benchmark for General Image Editing
di: Jiang, Zhangqi, et al.
Pubblicazione: (2026)
di: Jiang, Zhangqi, et al.
Pubblicazione: (2026)
OmniVid: A Generative Framework for Universal Video Understanding
di: Wang, Junke, et al.
Pubblicazione: (2024)
di: Wang, Junke, et al.
Pubblicazione: (2024)
WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors
di: Wu, Keming, et al.
Pubblicazione: (2026)
di: Wu, Keming, et al.
Pubblicazione: (2026)
Seg-R1: Segmentation Can Be Surprisingly Simple with Reinforcement Learning
di: You, Zuyao, et al.
Pubblicazione: (2025)
di: You, Zuyao, et al.
Pubblicazione: (2025)
AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation
di: Qiu, Lu, et al.
Pubblicazione: (2025)
di: Qiu, Lu, et al.
Pubblicazione: (2025)
Learning Accurate Segmentation Purely from Self-Supervision
di: You, Zuyao, et al.
Pubblicazione: (2026)
di: You, Zuyao, et al.
Pubblicazione: (2026)
REDUCIO! Generating 1K Video within 16 Seconds using Extremely Compressed Motion Latents
di: Tian, Rui, et al.
Pubblicazione: (2024)
di: Tian, Rui, et al.
Pubblicazione: (2024)
AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction
di: Cheng, Junhao, et al.
Pubblicazione: (2025)
di: Cheng, Junhao, et al.
Pubblicazione: (2025)
Video-Bench: Human-Aligned Video Generation Benchmark
di: Han, Hui, et al.
Pubblicazione: (2025)
di: Han, Hui, et al.
Pubblicazione: (2025)
VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
di: Shi, Jiapeng, et al.
Pubblicazione: (2026)
di: Shi, Jiapeng, et al.
Pubblicazione: (2026)
Repeating Words for Video-Language Retrieval with Coarse-to-Fine Objectives
di: Zhao, Haoyu, et al.
Pubblicazione: (2025)
di: Zhao, Haoyu, et al.
Pubblicazione: (2025)
EgoSound: Benchmarking Sound Understanding in Egocentric Videos
di: Zhu, Bingwen, et al.
Pubblicazione: (2026)
di: Zhu, Bingwen, et al.
Pubblicazione: (2026)
DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation
di: Zhao, Haoyu, et al.
Pubblicazione: (2026)
di: Zhao, Haoyu, et al.
Pubblicazione: (2026)
Zero-shot High-fidelity and Pose-controllable Character Animation
di: Zhu, Bingwen, et al.
Pubblicazione: (2024)
di: Zhu, Bingwen, et al.
Pubblicazione: (2024)
Facial Expression Generation Aligned with Human Preference for Natural Dyadic Interaction
di: Chen, Xu, et al.
Pubblicazione: (2026)
di: Chen, Xu, et al.
Pubblicazione: (2026)
AnimeColor: Reference-based Animation Colorization with Diffusion Transformers
di: Zhang, Yuhong, et al.
Pubblicazione: (2025)
di: Zhang, Yuhong, et al.
Pubblicazione: (2025)
Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation
di: Tu, Shuyuan, et al.
Pubblicazione: (2026)
di: Tu, Shuyuan, et al.
Pubblicazione: (2026)
NOVA-3D: Non-overlapped Views for 3D Anime Character Reconstruction
di: Wang, Hongsheng, et al.
Pubblicazione: (2024)
di: Wang, Hongsheng, et al.
Pubblicazione: (2024)
MagDiff: Multi-Alignment Diffusion for High-Fidelity Video Generation and Editing
di: Zhao, Haoyu, et al.
Pubblicazione: (2023)
di: Zhao, Haoyu, et al.
Pubblicazione: (2023)
StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
di: Tu, Shuyuan, et al.
Pubblicazione: (2025)
di: Tu, Shuyuan, et al.
Pubblicazione: (2025)
UniHand: A Unified Model for Diverse Controlled 4D Hand Motion Modeling
di: Sun, Zhihao, et al.
Pubblicazione: (2026)
di: Sun, Zhihao, et al.
Pubblicazione: (2026)
Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization
di: Liu, Zhuohan, et al.
Pubblicazione: (2026)
di: Liu, Zhuohan, et al.
Pubblicazione: (2026)
Aligning Vision Models with Human Aesthetics in Retrieval: Benchmarks and Algorithms
di: Zhang, Miaosen, et al.
Pubblicazione: (2024)
di: Zhang, Miaosen, et al.
Pubblicazione: (2024)
Aligning Human Motion Generation with Human Perceptions
di: Wang, Haoru, et al.
Pubblicazione: (2024)
di: Wang, Haoru, et al.
Pubblicazione: (2024)
Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning
di: He, Zhihao, et al.
Pubblicazione: (2025)
di: He, Zhihao, et al.
Pubblicazione: (2025)
RefAlign: Representation Alignment for Reference-to-Video Generation
di: Wang, Lei, et al.
Pubblicazione: (2026)
di: Wang, Lei, et al.
Pubblicazione: (2026)
AGHI-QA: A Subjective-Aligned Dataset and Metric for AI-Generated Human Images
di: Li, Yunhao, et al.
Pubblicazione: (2025)
di: Li, Yunhao, et al.
Pubblicazione: (2025)
Improving Video Generation with Human Feedback
di: Liu, Jie, et al.
Pubblicazione: (2025)
di: Liu, Jie, et al.
Pubblicazione: (2025)
Attention Itself Could Retrieve.RetrieveVGGT: Training-Free Long Context Streaming 3D Reconstruction via Query-Key Similarity Retrieval
di: Zou, Zichen, et al.
Pubblicazione: (2026)
di: Zou, Zichen, et al.
Pubblicazione: (2026)
Multi-Prompt Alignment for Multi-Source Unsupervised Domain Adaptation
di: Chen, Haoran, et al.
Pubblicazione: (2022)
di: Chen, Haoran, et al.
Pubblicazione: (2022)
GeoGS3D: Single-view 3D Reconstruction via Geometric-aware Diffusion Model and Gaussian Splatting
di: Feng, Qijun, et al.
Pubblicazione: (2024)
di: Feng, Qijun, et al.
Pubblicazione: (2024)
CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization
di: Chen, Yitong, et al.
Pubblicazione: (2026)
di: Chen, Yitong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
AniSora: Exploring the Frontiers of Animation Video Generation in the Sora Era
di: Jiang, Yudong, et al.
Pubblicazione: (2024) -
GenRec: Unifying Video Generation and Recognition with Diffusion Models
di: Weng, Zejia, et al.
Pubblicazione: (2024) -
Preference Score Distillation: Leveraging 2D Rewards to Align Text-to-3D Generation with Human Preference
di: Leng, Jiaqi, et al.
Pubblicazione: (2026) -
AnimeDL-2M: Million-Scale AI-Generated Anime Image Detection and Localization in Diffusion Era
di: Zhu, Chenyang, et al.
Pubblicazione: (2025) -
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
di: Wang, Junke, et al.
Pubblicazione: (2024)