Salvato in:
| Autori principali: | Zheng, Zangwei, Peng, Xiangyu, Yang, Tianji, Shen, Chenhui, Li, Shenggui, Liu, Hongxin, Zhou, Yukun, Li, Tianyi, You, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2412.20404 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
How Does the Textual Information Affect the Retrieval of Multimodal In-Context Learning?
di: Luo, Yang, et al.
Pubblicazione: (2024)
di: Luo, Yang, et al.
Pubblicazione: (2024)
Open-Sora Plan: Open-Source Large Video Generation Model
di: Lin, Bin, et al.
Pubblicazione: (2024)
di: Lin, Bin, et al.
Pubblicazione: (2024)
Sora Generates Videos with Stunning Geometrical Consistency
di: Li, Xuanyi, et al.
Pubblicazione: (2024)
di: Li, Xuanyi, et al.
Pubblicazione: (2024)
Omni-Video: Democratizing Unified Video Understanding and Generation
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
Safe-Sora: Safe Text-to-Video Generation via Graphical Watermarking
di: Su, Zihan, et al.
Pubblicazione: (2025)
di: Su, Zihan, et al.
Pubblicazione: (2025)
Simple Visual Artifact Detection in Sora-Generated Videos
di: Sugiyama, Misora, et al.
Pubblicazione: (2025)
di: Sugiyama, Misora, et al.
Pubblicazione: (2025)
Sora as a World Model? A Complete Survey on Text-to-Video Generation
di: Puspitasari, Fachrina Dewi, et al.
Pubblicazione: (2024)
di: Puspitasari, Fachrina Dewi, et al.
Pubblicazione: (2024)
SurgSora: Object-Aware Diffusion Model for Controllable Surgical Video Generation
di: Chen, Tong, et al.
Pubblicazione: (2024)
di: Chen, Tong, et al.
Pubblicazione: (2024)
WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs
di: Yang, Deshun, et al.
Pubblicazione: (2024)
di: Yang, Deshun, et al.
Pubblicazione: (2024)
Is Sora a World Simulator? A Comprehensive Survey on General World Models and Beyond
di: Zhu, Zheng, et al.
Pubblicazione: (2024)
di: Zhu, Zheng, et al.
Pubblicazione: (2024)
OneVOS: Unifying Video Object Segmentation with All-in-One Transformer Framework
di: Li, Wanyun, et al.
Pubblicazione: (2024)
di: Li, Wanyun, et al.
Pubblicazione: (2024)
From Sora What We Can See: A Survey of Text-to-Video Generation
di: Sun, Rui, et al.
Pubblicazione: (2024)
di: Sun, Rui, et al.
Pubblicazione: (2024)
SafeSora: Towards Safety Alignment of Text2Video Generation via a Human Preference Dataset
di: Dai, Josef, et al.
Pubblicazione: (2024)
di: Dai, Josef, et al.
Pubblicazione: (2024)
Not All Inputs Are Valid: Towards Open-Set Video Moment Retrieval Using Language
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs
di: Deng, Jinhong, et al.
Pubblicazione: (2025)
di: Deng, Jinhong, et al.
Pubblicazione: (2025)
More Than Positive and Negative: Communicating Fine Granularity in Medical Diagnosis
di: Peng, Xiangyu, et al.
Pubblicazione: (2024)
di: Peng, Xiangyu, et al.
Pubblicazione: (2024)
On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices
di: Kim, Bosung, et al.
Pubblicazione: (2025)
di: Kim, Bosung, et al.
Pubblicazione: (2025)
On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices
di: Kim, Bosung, et al.
Pubblicazione: (2025)
di: Kim, Bosung, et al.
Pubblicazione: (2025)
OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding
di: Zheng, Minghang, et al.
Pubblicazione: (2026)
di: Zheng, Minghang, et al.
Pubblicazione: (2026)
OneThinker: All-in-one Reasoning Model for Image and Video
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
di: An, Xiang, et al.
Pubblicazione: (2025)
di: An, Xiang, et al.
Pubblicazione: (2025)
Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models
di: Chu, Zhixuan, et al.
Pubblicazione: (2024)
di: Chu, Zhixuan, et al.
Pubblicazione: (2024)
RobustSora: De-Watermarked Benchmark for Robust AI-Generated Video Detection
di: Wang, Zhuo, et al.
Pubblicazione: (2025)
di: Wang, Zhuo, et al.
Pubblicazione: (2025)
ESOM: Efficiently Understanding Streaming Video Anomalies with Open-world Dynamic Definitions
di: Liu, Zihao, et al.
Pubblicazione: (2026)
di: Liu, Zihao, et al.
Pubblicazione: (2026)
FFA Sora, video generation as fundus fluorescein angiography simulator
di: Wu, Xinyuan, et al.
Pubblicazione: (2024)
di: Wu, Xinyuan, et al.
Pubblicazione: (2024)
AllTracker: Efficient Dense Point Tracking at High Resolution
di: Harley, Adam W., et al.
Pubblicazione: (2025)
di: Harley, Adam W., et al.
Pubblicazione: (2025)
MPJudge: Towards Perceptual Assessment of Music-Induced Paintings
di: Jiang, Shiqi, et al.
Pubblicazione: (2025)
di: Jiang, Shiqi, et al.
Pubblicazione: (2025)
Multi-Modal Fusion of In-Situ Video Data and Process Parameters for Online Forecasting of Cookie Drying Readiness
di: Li, Shichen, et al.
Pubblicazione: (2025)
di: Li, Shichen, et al.
Pubblicazione: (2025)
Towards Real-World HDR Video Reconstruction: A Large-Scale Benchmark Dataset and A Two-Stage Alignment Network
di: Shu, Yong, et al.
Pubblicazione: (2024)
di: Shu, Yong, et al.
Pubblicazione: (2024)
Efficient Redundancy Reduction for Open-Vocabulary Semantic Segmentation
di: Chen, Lin, et al.
Pubblicazione: (2025)
di: Chen, Lin, et al.
Pubblicazione: (2025)
Technical Report: Competition Solution For Modelscope-Sora
di: Chen, Shengfu, et al.
Pubblicazione: (2024)
di: Chen, Shengfu, et al.
Pubblicazione: (2024)
PRNet: Original Information Is All You Have
di: Zheng, PeiHuang, et al.
Pubblicazione: (2025)
di: Zheng, PeiHuang, et al.
Pubblicazione: (2025)
Interspatial Attention for Efficient 4D Human Video Generation
di: Shao, Ruizhi, et al.
Pubblicazione: (2025)
di: Shao, Ruizhi, et al.
Pubblicazione: (2025)
FlexSelect: Flexible Token Selection for Efficient Long Video Understanding
di: Zhang, Yunzhu, et al.
Pubblicazione: (2025)
di: Zhang, Yunzhu, et al.
Pubblicazione: (2025)
Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation
di: Cheng, Zesen, et al.
Pubblicazione: (2024)
di: Cheng, Zesen, et al.
Pubblicazione: (2024)
Part-aware Prompted Segment Anything Model for Adaptive Segmentation
di: Zhao, Chenhui, et al.
Pubblicazione: (2024)
di: Zhao, Chenhui, et al.
Pubblicazione: (2024)
Resource-Efficient Motion Control for Video Generation via Dynamic Mask Guidance
di: Feng, Sicong, et al.
Pubblicazione: (2025)
di: Feng, Sicong, et al.
Pubblicazione: (2025)
Open-Vocabulary Video Anomaly Detection
di: Wu, Peng, et al.
Pubblicazione: (2023)
di: Wu, Peng, et al.
Pubblicazione: (2023)
CeRF: Convolutional Neural Radiance Fields for New View Synthesis with Derivatives of Ray Modeling
di: Yang, Xiaoyan, et al.
Pubblicazione: (2023)
di: Yang, Xiaoyan, et al.
Pubblicazione: (2023)
Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation
di: Luo, Zhuoyan, et al.
Pubblicazione: (2024)
di: Luo, Zhuoyan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
How Does the Textual Information Affect the Retrieval of Multimodal In-Context Learning?
di: Luo, Yang, et al.
Pubblicazione: (2024) -
Open-Sora Plan: Open-Source Large Video Generation Model
di: Lin, Bin, et al.
Pubblicazione: (2024) -
Sora Generates Videos with Stunning Geometrical Consistency
di: Li, Xuanyi, et al.
Pubblicazione: (2024) -
Omni-Video: Democratizing Unified Video Understanding and Generation
di: Tan, Zhiyu, et al.
Pubblicazione: (2025) -
Safe-Sora: Safe Text-to-Video Generation via Graphical Watermarking
di: Su, Zihan, et al.
Pubblicazione: (2025)