Guardado en:
| Autores principales: | Zheng, Zangwei, Peng, Xiangyu, Yang, Tianji, Shen, Chenhui, Li, Shenggui, Liu, Hongxin, Zhou, Yukun, Li, Tianyi, You, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2412.20404 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
How Does the Textual Information Affect the Retrieval of Multimodal In-Context Learning?
por: Luo, Yang, et al.
Publicado: (2024)
por: Luo, Yang, et al.
Publicado: (2024)
Open-Sora Plan: Open-Source Large Video Generation Model
por: Lin, Bin, et al.
Publicado: (2024)
por: Lin, Bin, et al.
Publicado: (2024)
Sora Generates Videos with Stunning Geometrical Consistency
por: Li, Xuanyi, et al.
Publicado: (2024)
por: Li, Xuanyi, et al.
Publicado: (2024)
Omni-Video: Democratizing Unified Video Understanding and Generation
por: Tan, Zhiyu, et al.
Publicado: (2025)
por: Tan, Zhiyu, et al.
Publicado: (2025)
Safe-Sora: Safe Text-to-Video Generation via Graphical Watermarking
por: Su, Zihan, et al.
Publicado: (2025)
por: Su, Zihan, et al.
Publicado: (2025)
Simple Visual Artifact Detection in Sora-Generated Videos
por: Sugiyama, Misora, et al.
Publicado: (2025)
por: Sugiyama, Misora, et al.
Publicado: (2025)
Sora as a World Model? A Complete Survey on Text-to-Video Generation
por: Puspitasari, Fachrina Dewi, et al.
Publicado: (2024)
por: Puspitasari, Fachrina Dewi, et al.
Publicado: (2024)
SurgSora: Object-Aware Diffusion Model for Controllable Surgical Video Generation
por: Chen, Tong, et al.
Publicado: (2024)
por: Chen, Tong, et al.
Publicado: (2024)
WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs
por: Yang, Deshun, et al.
Publicado: (2024)
por: Yang, Deshun, et al.
Publicado: (2024)
Is Sora a World Simulator? A Comprehensive Survey on General World Models and Beyond
por: Zhu, Zheng, et al.
Publicado: (2024)
por: Zhu, Zheng, et al.
Publicado: (2024)
OneVOS: Unifying Video Object Segmentation with All-in-One Transformer Framework
por: Li, Wanyun, et al.
Publicado: (2024)
por: Li, Wanyun, et al.
Publicado: (2024)
From Sora What We Can See: A Survey of Text-to-Video Generation
por: Sun, Rui, et al.
Publicado: (2024)
por: Sun, Rui, et al.
Publicado: (2024)
SafeSora: Towards Safety Alignment of Text2Video Generation via a Human Preference Dataset
por: Dai, Josef, et al.
Publicado: (2024)
por: Dai, Josef, et al.
Publicado: (2024)
Not All Inputs Are Valid: Towards Open-Set Video Moment Retrieval Using Language
por: Fang, Xiang, et al.
Publicado: (2026)
por: Fang, Xiang, et al.
Publicado: (2026)
SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs
por: Deng, Jinhong, et al.
Publicado: (2025)
por: Deng, Jinhong, et al.
Publicado: (2025)
More Than Positive and Negative: Communicating Fine Granularity in Medical Diagnosis
por: Peng, Xiangyu, et al.
Publicado: (2024)
por: Peng, Xiangyu, et al.
Publicado: (2024)
On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices
por: Kim, Bosung, et al.
Publicado: (2025)
por: Kim, Bosung, et al.
Publicado: (2025)
On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices
por: Kim, Bosung, et al.
Publicado: (2025)
por: Kim, Bosung, et al.
Publicado: (2025)
OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding
por: Zheng, Minghang, et al.
Publicado: (2026)
por: Zheng, Minghang, et al.
Publicado: (2026)
OneThinker: All-in-one Reasoning Model for Image and Video
por: Feng, Kaituo, et al.
Publicado: (2025)
por: Feng, Kaituo, et al.
Publicado: (2025)
LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
por: An, Xiang, et al.
Publicado: (2025)
por: An, Xiang, et al.
Publicado: (2025)
Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models
por: Chu, Zhixuan, et al.
Publicado: (2024)
por: Chu, Zhixuan, et al.
Publicado: (2024)
RobustSora: De-Watermarked Benchmark for Robust AI-Generated Video Detection
por: Wang, Zhuo, et al.
Publicado: (2025)
por: Wang, Zhuo, et al.
Publicado: (2025)
ESOM: Efficiently Understanding Streaming Video Anomalies with Open-world Dynamic Definitions
por: Liu, Zihao, et al.
Publicado: (2026)
por: Liu, Zihao, et al.
Publicado: (2026)
FFA Sora, video generation as fundus fluorescein angiography simulator
por: Wu, Xinyuan, et al.
Publicado: (2024)
por: Wu, Xinyuan, et al.
Publicado: (2024)
AllTracker: Efficient Dense Point Tracking at High Resolution
por: Harley, Adam W., et al.
Publicado: (2025)
por: Harley, Adam W., et al.
Publicado: (2025)
MPJudge: Towards Perceptual Assessment of Music-Induced Paintings
por: Jiang, Shiqi, et al.
Publicado: (2025)
por: Jiang, Shiqi, et al.
Publicado: (2025)
Multi-Modal Fusion of In-Situ Video Data and Process Parameters for Online Forecasting of Cookie Drying Readiness
por: Li, Shichen, et al.
Publicado: (2025)
por: Li, Shichen, et al.
Publicado: (2025)
Towards Real-World HDR Video Reconstruction: A Large-Scale Benchmark Dataset and A Two-Stage Alignment Network
por: Shu, Yong, et al.
Publicado: (2024)
por: Shu, Yong, et al.
Publicado: (2024)
Efficient Redundancy Reduction for Open-Vocabulary Semantic Segmentation
por: Chen, Lin, et al.
Publicado: (2025)
por: Chen, Lin, et al.
Publicado: (2025)
Technical Report: Competition Solution For Modelscope-Sora
por: Chen, Shengfu, et al.
Publicado: (2024)
por: Chen, Shengfu, et al.
Publicado: (2024)
PRNet: Original Information Is All You Have
por: Zheng, PeiHuang, et al.
Publicado: (2025)
por: Zheng, PeiHuang, et al.
Publicado: (2025)
Interspatial Attention for Efficient 4D Human Video Generation
por: Shao, Ruizhi, et al.
Publicado: (2025)
por: Shao, Ruizhi, et al.
Publicado: (2025)
FlexSelect: Flexible Token Selection for Efficient Long Video Understanding
por: Zhang, Yunzhu, et al.
Publicado: (2025)
por: Zhang, Yunzhu, et al.
Publicado: (2025)
Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation
por: Cheng, Zesen, et al.
Publicado: (2024)
por: Cheng, Zesen, et al.
Publicado: (2024)
Part-aware Prompted Segment Anything Model for Adaptive Segmentation
por: Zhao, Chenhui, et al.
Publicado: (2024)
por: Zhao, Chenhui, et al.
Publicado: (2024)
Resource-Efficient Motion Control for Video Generation via Dynamic Mask Guidance
por: Feng, Sicong, et al.
Publicado: (2025)
por: Feng, Sicong, et al.
Publicado: (2025)
Open-Vocabulary Video Anomaly Detection
por: Wu, Peng, et al.
Publicado: (2023)
por: Wu, Peng, et al.
Publicado: (2023)
CeRF: Convolutional Neural Radiance Fields for New View Synthesis with Derivatives of Ray Modeling
por: Yang, Xiaoyan, et al.
Publicado: (2023)
por: Yang, Xiaoyan, et al.
Publicado: (2023)
Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation
por: Luo, Zhuoyan, et al.
Publicado: (2024)
por: Luo, Zhuoyan, et al.
Publicado: (2024)
Ejemplares similares
-
How Does the Textual Information Affect the Retrieval of Multimodal In-Context Learning?
por: Luo, Yang, et al.
Publicado: (2024) -
Open-Sora Plan: Open-Source Large Video Generation Model
por: Lin, Bin, et al.
Publicado: (2024) -
Sora Generates Videos with Stunning Geometrical Consistency
por: Li, Xuanyi, et al.
Publicado: (2024) -
Omni-Video: Democratizing Unified Video Understanding and Generation
por: Tan, Zhiyu, et al.
Publicado: (2025) -
Safe-Sora: Safe Text-to-Video Generation via Graphical Watermarking
por: Su, Zihan, et al.
Publicado: (2025)