Enregistré dans:
| Auteurs principaux: | Zheng, Zangwei, Peng, Xiangyu, Yang, Tianji, Shen, Chenhui, Li, Shenggui, Liu, Hongxin, Zhou, Yukun, Li, Tianyi, You, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2412.20404 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Does the Textual Information Affect the Retrieval of Multimodal In-Context Learning?
par: Luo, Yang, et autres
Publié: (2024)
par: Luo, Yang, et autres
Publié: (2024)
Open-Sora Plan: Open-Source Large Video Generation Model
par: Lin, Bin, et autres
Publié: (2024)
par: Lin, Bin, et autres
Publié: (2024)
Sora Generates Videos with Stunning Geometrical Consistency
par: Li, Xuanyi, et autres
Publié: (2024)
par: Li, Xuanyi, et autres
Publié: (2024)
Omni-Video: Democratizing Unified Video Understanding and Generation
par: Tan, Zhiyu, et autres
Publié: (2025)
par: Tan, Zhiyu, et autres
Publié: (2025)
Safe-Sora: Safe Text-to-Video Generation via Graphical Watermarking
par: Su, Zihan, et autres
Publié: (2025)
par: Su, Zihan, et autres
Publié: (2025)
Simple Visual Artifact Detection in Sora-Generated Videos
par: Sugiyama, Misora, et autres
Publié: (2025)
par: Sugiyama, Misora, et autres
Publié: (2025)
Sora as a World Model? A Complete Survey on Text-to-Video Generation
par: Puspitasari, Fachrina Dewi, et autres
Publié: (2024)
par: Puspitasari, Fachrina Dewi, et autres
Publié: (2024)
SurgSora: Object-Aware Diffusion Model for Controllable Surgical Video Generation
par: Chen, Tong, et autres
Publié: (2024)
par: Chen, Tong, et autres
Publié: (2024)
WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs
par: Yang, Deshun, et autres
Publié: (2024)
par: Yang, Deshun, et autres
Publié: (2024)
Is Sora a World Simulator? A Comprehensive Survey on General World Models and Beyond
par: Zhu, Zheng, et autres
Publié: (2024)
par: Zhu, Zheng, et autres
Publié: (2024)
OneVOS: Unifying Video Object Segmentation with All-in-One Transformer Framework
par: Li, Wanyun, et autres
Publié: (2024)
par: Li, Wanyun, et autres
Publié: (2024)
From Sora What We Can See: A Survey of Text-to-Video Generation
par: Sun, Rui, et autres
Publié: (2024)
par: Sun, Rui, et autres
Publié: (2024)
SafeSora: Towards Safety Alignment of Text2Video Generation via a Human Preference Dataset
par: Dai, Josef, et autres
Publié: (2024)
par: Dai, Josef, et autres
Publié: (2024)
Not All Inputs Are Valid: Towards Open-Set Video Moment Retrieval Using Language
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs
par: Deng, Jinhong, et autres
Publié: (2025)
par: Deng, Jinhong, et autres
Publié: (2025)
More Than Positive and Negative: Communicating Fine Granularity in Medical Diagnosis
par: Peng, Xiangyu, et autres
Publié: (2024)
par: Peng, Xiangyu, et autres
Publié: (2024)
On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices
par: Kim, Bosung, et autres
Publié: (2025)
par: Kim, Bosung, et autres
Publié: (2025)
On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices
par: Kim, Bosung, et autres
Publié: (2025)
par: Kim, Bosung, et autres
Publié: (2025)
OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding
par: Zheng, Minghang, et autres
Publié: (2026)
par: Zheng, Minghang, et autres
Publié: (2026)
OneThinker: All-in-one Reasoning Model for Image and Video
par: Feng, Kaituo, et autres
Publié: (2025)
par: Feng, Kaituo, et autres
Publié: (2025)
LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
par: An, Xiang, et autres
Publié: (2025)
par: An, Xiang, et autres
Publié: (2025)
Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models
par: Chu, Zhixuan, et autres
Publié: (2024)
par: Chu, Zhixuan, et autres
Publié: (2024)
RobustSora: De-Watermarked Benchmark for Robust AI-Generated Video Detection
par: Wang, Zhuo, et autres
Publié: (2025)
par: Wang, Zhuo, et autres
Publié: (2025)
ESOM: Efficiently Understanding Streaming Video Anomalies with Open-world Dynamic Definitions
par: Liu, Zihao, et autres
Publié: (2026)
par: Liu, Zihao, et autres
Publié: (2026)
FFA Sora, video generation as fundus fluorescein angiography simulator
par: Wu, Xinyuan, et autres
Publié: (2024)
par: Wu, Xinyuan, et autres
Publié: (2024)
AllTracker: Efficient Dense Point Tracking at High Resolution
par: Harley, Adam W., et autres
Publié: (2025)
par: Harley, Adam W., et autres
Publié: (2025)
MPJudge: Towards Perceptual Assessment of Music-Induced Paintings
par: Jiang, Shiqi, et autres
Publié: (2025)
par: Jiang, Shiqi, et autres
Publié: (2025)
Multi-Modal Fusion of In-Situ Video Data and Process Parameters for Online Forecasting of Cookie Drying Readiness
par: Li, Shichen, et autres
Publié: (2025)
par: Li, Shichen, et autres
Publié: (2025)
Towards Real-World HDR Video Reconstruction: A Large-Scale Benchmark Dataset and A Two-Stage Alignment Network
par: Shu, Yong, et autres
Publié: (2024)
par: Shu, Yong, et autres
Publié: (2024)
Efficient Redundancy Reduction for Open-Vocabulary Semantic Segmentation
par: Chen, Lin, et autres
Publié: (2025)
par: Chen, Lin, et autres
Publié: (2025)
Technical Report: Competition Solution For Modelscope-Sora
par: Chen, Shengfu, et autres
Publié: (2024)
par: Chen, Shengfu, et autres
Publié: (2024)
PRNet: Original Information Is All You Have
par: Zheng, PeiHuang, et autres
Publié: (2025)
par: Zheng, PeiHuang, et autres
Publié: (2025)
Interspatial Attention for Efficient 4D Human Video Generation
par: Shao, Ruizhi, et autres
Publié: (2025)
par: Shao, Ruizhi, et autres
Publié: (2025)
FlexSelect: Flexible Token Selection for Efficient Long Video Understanding
par: Zhang, Yunzhu, et autres
Publié: (2025)
par: Zhang, Yunzhu, et autres
Publié: (2025)
Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation
par: Cheng, Zesen, et autres
Publié: (2024)
par: Cheng, Zesen, et autres
Publié: (2024)
Part-aware Prompted Segment Anything Model for Adaptive Segmentation
par: Zhao, Chenhui, et autres
Publié: (2024)
par: Zhao, Chenhui, et autres
Publié: (2024)
Resource-Efficient Motion Control for Video Generation via Dynamic Mask Guidance
par: Feng, Sicong, et autres
Publié: (2025)
par: Feng, Sicong, et autres
Publié: (2025)
Open-Vocabulary Video Anomaly Detection
par: Wu, Peng, et autres
Publié: (2023)
par: Wu, Peng, et autres
Publié: (2023)
CeRF: Convolutional Neural Radiance Fields for New View Synthesis with Derivatives of Ray Modeling
par: Yang, Xiaoyan, et autres
Publié: (2023)
par: Yang, Xiaoyan, et autres
Publié: (2023)
Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation
par: Luo, Zhuoyan, et autres
Publié: (2024)
par: Luo, Zhuoyan, et autres
Publié: (2024)
Documents similaires
-
How Does the Textual Information Affect the Retrieval of Multimodal In-Context Learning?
par: Luo, Yang, et autres
Publié: (2024) -
Open-Sora Plan: Open-Source Large Video Generation Model
par: Lin, Bin, et autres
Publié: (2024) -
Sora Generates Videos with Stunning Geometrical Consistency
par: Li, Xuanyi, et autres
Publié: (2024) -
Omni-Video: Democratizing Unified Video Understanding and Generation
par: Tan, Zhiyu, et autres
Publié: (2025) -
Safe-Sora: Safe Text-to-Video Generation via Graphical Watermarking
par: Su, Zihan, et autres
Publié: (2025)