Technical Report: Competition Solution For Modelscope-Sora
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Shengfu, Liu, Hailong, Wei, Wenzhao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OccSora: 4D Occupancy Generation Models as World Simulators for Autonomous Driving
par: Wang, Lening, et autres
Publié: (2024)
par: Wang, Lening, et autres
Publié: (2024)
FFA Sora, video generation as fundus fluorescein angiography simulator
par: Wu, Xinyuan, et autres
Publié: (2024)
par: Wu, Xinyuan, et autres
Publié: (2024)
RobustSora: De-Watermarked Benchmark for Robust AI-Generated Video Detection
par: Wang, Zhuo, et autres
Publié: (2025)
par: Wang, Zhuo, et autres
Publié: (2025)
Open-Sora Plan: Open-Source Large Video Generation Model
par: Lin, Bin, et autres
Publié: (2024)
par: Lin, Bin, et autres
Publié: (2024)
From Sora What We Can See: A Survey of Text-to-Video Generation
par: Sun, Rui, et autres
Publié: (2024)
par: Sun, Rui, et autres
Publié: (2024)
Ovis-Image Technical Report
par: Wang, Guo-Hua, et autres
Publié: (2025)
par: Wang, Guo-Hua, et autres
Publié: (2025)
Qwen3-VL Technical Report
par: Bai, Shuai, et autres
Publié: (2025)
par: Bai, Shuai, et autres
Publié: (2025)
Ovis-U1 Technical Report
par: Wang, Guo-Hua, et autres
Publié: (2025)
par: Wang, Guo-Hua, et autres
Publié: (2025)
Seed1.5-VL Technical Report
par: Guo, Dong, et autres
Publié: (2025)
par: Guo, Dong, et autres
Publié: (2025)
HunyuanOCR Technical Report
par: Hunyuan Vision Team, et autres
Publié: (2025)
par: Hunyuan Vision Team, et autres
Publié: (2025)
Dolphin v1.0 Technical Report
par: Weng, Taohan, et autres
Publié: (2025)
par: Weng, Taohan, et autres
Publié: (2025)
Baichuan-Omni Technical Report
par: Li, Yadong, et autres
Publié: (2024)
par: Li, Yadong, et autres
Publié: (2024)
Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models
par: Liu, Yixin, et autres
Publié: (2024)
par: Liu, Yixin, et autres
Publié: (2024)
SafeSora: Towards Safety Alignment of Text2Video Generation via a Human Preference Dataset
par: Dai, Josef, et autres
Publié: (2024)
par: Dai, Josef, et autres
Publié: (2024)
Technical Approach for the EMI Challenge in the 8th Affective Behavior Analysis in-the-Wild Competition
par: Yu, Jun, et autres
Publié: (2025)
par: Yu, Jun, et autres
Publié: (2025)
SurgSora: Object-Aware Diffusion Model for Controllable Surgical Video Generation
par: Chen, Tong, et autres
Publié: (2024)
par: Chen, Tong, et autres
Publié: (2024)
MASSeg : 2nd Technical Report for 4th PVUW MOSE Track
par: Cao, Xuqiang, et autres
Publié: (2025)
par: Cao, Xuqiang, et autres
Publié: (2025)
GR-3 Technical Report
par: Cheang, Chilam, et autres
Publié: (2025)
par: Cheang, Chilam, et autres
Publié: (2025)
WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs
par: Yang, Deshun, et autres
Publié: (2024)
par: Yang, Deshun, et autres
Publié: (2024)
MARS: Technical Report for the CASTLE Challenge at EgoVis 2026
par: Zhang, Haoyu, et autres
Publié: (2026)
par: Zhang, Haoyu, et autres
Publié: (2026)
MedGemma Technical Report
par: Sellergren, Andrew, et autres
Publié: (2025)
par: Sellergren, Andrew, et autres
Publié: (2025)
Motif-Video 2B: Technical Report
par: Lim, Junghwan, et autres
Publié: (2026)
par: Lim, Junghwan, et autres
Publié: (2026)
AEMIM: Adversarial Examples Meet Masked Image Modeling
par: Xiang, Wenzhao, et autres
Publié: (2024)
par: Xiang, Wenzhao, et autres
Publié: (2024)
MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns
par: Zhang, Jiarui, et autres
Publié: (2025)
par: Zhang, Jiarui, et autres
Publié: (2025)
ZAYA1-VL-8B Technical Report
par: Shapourian, Hassan, et autres
Publié: (2026)
par: Shapourian, Hassan, et autres
Publié: (2026)
PLaMo 2.1-VL Technical Report
par: Kerola, Tommi, et autres
Publié: (2026)
par: Kerola, Tommi, et autres
Publié: (2026)
AndesVL Technical Report: An Efficient Mobile-side Multimodal Large Language Model
par: Jin, Zhiwei, et autres
Publié: (2025)
par: Jin, Zhiwei, et autres
Publié: (2025)
Ovis2.5 Technical Report
par: Lu, Shiyin, et autres
Publié: (2025)
par: Lu, Shiyin, et autres
Publié: (2025)
Phi-4-reasoning-vision-15B Technical Report
par: Aneja, Jyoti, et autres
Publié: (2026)
par: Aneja, Jyoti, et autres
Publié: (2026)
Technical Report for Ego4D Long-Term Action Anticipation Challenge 2025
par: Chu, Qiaohui, et autres
Publié: (2025)
par: Chu, Qiaohui, et autres
Publié: (2025)
PhysBrain 1.0 Technical Report
par: Lian, Shijie, et autres
Publié: (2026)
par: Lian, Shijie, et autres
Publié: (2026)
iFlyBot-VLA Technical Report
par: Zhang, Yuan, et autres
Publié: (2025)
par: Zhang, Yuan, et autres
Publié: (2025)
Gender Bias in Text-to-Video Generation Models: A case study of Sora
par: Nadeem, Mohammad, et autres
Publié: (2024)
par: Nadeem, Mohammad, et autres
Publié: (2024)
ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
par: Chu, Zedong, et autres
Publié: (2026)
par: Chu, Zedong, et autres
Publié: (2026)
Sora as a World Model? A Complete Survey on Text-to-Video Generation
par: Puspitasari, Fachrina Dewi, et autres
Publié: (2024)
par: Puspitasari, Fachrina Dewi, et autres
Publié: (2024)
VISTA: Technical Report for the Ego4D Short-Term Object Interaction Anticipation at EgoVis 2026
par: Chu, Qiaohui, et autres
Publié: (2026)
par: Chu, Qiaohui, et autres
Publié: (2026)
GaussianToken: An Effective Image Tokenizer with 2D Gaussian Splatting
par: Dong, Jiajun, et autres
Publié: (2025)
par: Dong, Jiajun, et autres
Publié: (2025)
ProtoArgNet: Interpretable Image Classification with Super-Prototypes and Argumentation [Technical Report]
par: Ayoobi, Hamed, et autres
Publié: (2023)
par: Ayoobi, Hamed, et autres
Publié: (2023)
Phoenix-VL 1.5 Medium Technical Report
par: Phoenix, Team, et autres
Publié: (2026)
par: Phoenix, Team, et autres
Publié: (2026)
ICCV23 Visual-Dialog Emotion Explanation Challenge: SEU_309 Team Technical Report
par: Yuan, Yixiao, et autres
Publié: (2024)
par: Yuan, Yixiao, et autres
Publié: (2024)
Documents similaires
-
OccSora: 4D Occupancy Generation Models as World Simulators for Autonomous Driving
par: Wang, Lening, et autres
Publié: (2024) -
FFA Sora, video generation as fundus fluorescein angiography simulator
par: Wu, Xinyuan, et autres
Publié: (2024) -
RobustSora: De-Watermarked Benchmark for Robust AI-Generated Video Detection
par: Wang, Zhuo, et autres
Publié: (2025) -
Open-Sora Plan: Open-Source Large Video Generation Model
par: Lin, Bin, et autres
Publié: (2024) -
From Sora What We Can See: A Survey of Text-to-Video Generation
par: Sun, Rui, et autres
Publié: (2024)