Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Yixin, Zhang, Kai, Li, Yuan, Yan, Zhiling, Gao, Chujie, Chen, Ruoxi, Yuan, Zhengqing, Huang, Yue, Sun, Hanchi, Gao, Jianfeng, He, Lifang, Sun, Lichao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPU
por: Yuan, Zhengqing, et al.
Publicado: (2026)
por: Yuan, Zhengqing, et al.
Publicado: (2026)
ViT-1.58b: Mobile Vision Transformers in the 1-bit Era
por: Yuan, Zhengqing, et al.
Publicado: (2024)
por: Yuan, Zhengqing, et al.
Publicado: (2024)
TTT-Unet: Enhancing U-Net with Test-Time Training Layers for Biomedical Image Segmentation
por: Zhou, Rong, et al.
Publicado: (2024)
por: Zhou, Rong, et al.
Publicado: (2024)
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
por: Yuan, Zhengqing, et al.
Publicado: (2023)
por: Yuan, Zhengqing, et al.
Publicado: (2023)
Expert Threshold Routing for Autoregressive Language Modeling with Dynamic Computation Allocation and Load Balancing
por: Sun, Hanchi, et al.
Publicado: (2026)
por: Sun, Hanchi, et al.
Publicado: (2026)
Biomedical SAM 2: Segment Anything in Biomedical Images and Videos
por: Yan, Zhiling, et al.
Publicado: (2024)
por: Yan, Zhiling, et al.
Publicado: (2024)
Horizon-LM: A RAM-Centric Architecture for LLM Training
por: Yuan, Zhengqing, et al.
Publicado: (2026)
por: Yuan, Zhengqing, et al.
Publicado: (2026)
EfficientLLM: Efficiency in Large Language Models
por: Yuan, Zhengqing, et al.
Publicado: (2025)
por: Yuan, Zhengqing, et al.
Publicado: (2025)
MLP-KAN: Unifying Deep Representation and Function Learning
por: He, Yunhong, et al.
Publicado: (2024)
por: He, Yunhong, et al.
Publicado: (2024)
Mora: Enabling Generalist Video Generation via A Multi-Agent Framework
por: Yuan, Zhengqing, et al.
Publicado: (2024)
por: Yuan, Zhengqing, et al.
Publicado: (2024)
TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
por: Yuan, Zhengqing, et al.
Publicado: (2023)
por: Yuan, Zhengqing, et al.
Publicado: (2023)
Medical Unlearnable Examples: Securing Medical Data from Unauthorized Training via Sparsity-Aware Local Masking
por: Sun, Weixiang, et al.
Publicado: (2024)
por: Sun, Weixiang, et al.
Publicado: (2024)
Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination
por: Zheng, Haojie, et al.
Publicado: (2024)
por: Zheng, Haojie, et al.
Publicado: (2024)
Bora: Biomedical Generalist Video Generation Model
por: Sun, Weixiang, et al.
Publicado: (2024)
por: Sun, Weixiang, et al.
Publicado: (2024)
DataGen: Unified Synthetic Dataset Generation via Large Language Models
por: Huang, Yue, et al.
Publicado: (2024)
por: Huang, Yue, et al.
Publicado: (2024)
3D4D: An Interactive, Editable, 4D World Model via 3D Video Generation
por: He, Yunhong, et al.
Publicado: (2025)
por: He, Yunhong, et al.
Publicado: (2025)
Rethinking and Red-Teaming Protective Perturbation in Personalized Diffusion Models
por: Liu, Yixin, et al.
Publicado: (2024)
por: Liu, Yixin, et al.
Publicado: (2024)
BLURR: A Boosted Low-Resource Inference for Vision-Language-Action Models
por: Ma, Xiaoyu, et al.
Publicado: (2025)
por: Ma, Xiaoyu, et al.
Publicado: (2025)
FakeGPT: Fake News Generation, Explanation and Detection of Large Language Models
por: Huang, Yue, et al.
Publicado: (2023)
por: Huang, Yue, et al.
Publicado: (2023)
HonestLLM: Toward an Honest and Helpful Large Language Model
por: Gao, Chujie, et al.
Publicado: (2024)
por: Gao, Chujie, et al.
Publicado: (2024)
LLM-as-a-Coauthor: Can Mixed Human-Written and Machine-Generated Text Be Detected?
por: Zhang, Qihui, et al.
Publicado: (2024)
por: Zhang, Qihui, et al.
Publicado: (2024)
Virtual Context: Enhancing Jailbreak Attacks with Special Token Injection
por: Zhou, Yuqi, et al.
Publicado: (2024)
por: Zhou, Yuqi, et al.
Publicado: (2024)
MedGPT-oss: Training a General-Purpose Vision-Language Model for Biomedicine
por: Zhang, Kai, et al.
Publicado: (2026)
por: Zhang, Kai, et al.
Publicado: (2026)
Social Science Meets LLMs: How Reliable Are Large Language Models in Social Simulations?
por: Huang, Yue, et al.
Publicado: (2024)
por: Huang, Yue, et al.
Publicado: (2024)
MetaAgents: Large Language Model Based Agents for Decision-Making on Teaming
por: Li, Yuan, et al.
Publicado: (2023)
por: Li, Yuan, et al.
Publicado: (2023)
TransMed: Large Language Models Enhance Vision Transformer for Biomedical Image Classification
por: Zheng, Kaipeng, et al.
Publicado: (2023)
por: Zheng, Kaipeng, et al.
Publicado: (2023)
Can Large Language Models Automatically Jailbreak GPT-4V?
por: Wu, Yuanwei, et al.
Publicado: (2024)
por: Wu, Yuanwei, et al.
Publicado: (2024)
EditShield: Protecting Unauthorized Image Editing by Instruction-guided Diffusion Models
por: Chen, Ruoxi, et al.
Publicado: (2023)
por: Chen, Ruoxi, et al.
Publicado: (2023)
AniSora: Exploring the Frontiers of Animation Video Generation in the Sora Era
por: Jiang, Yudong, et al.
Publicado: (2024)
por: Jiang, Yudong, et al.
Publicado: (2024)
I Think, Therefore I am: Benchmarking Awareness of Large Language Models Using AwareBench
por: Li, Yuan, et al.
Publicado: (2024)
por: Li, Yuan, et al.
Publicado: (2024)
Empirical Perturbation Analysis of Linear System Solvers from a Data Poisoning Perspective
por: Liu, Yixin, et al.
Publicado: (2024)
por: Liu, Yixin, et al.
Publicado: (2024)
Tailoring Manganese‐Based Electrocatalysts: A Comprehensive Review on Synthesis Strategies, Structural Engineering, Mechanistic Insights, and Emerging Applications in Energy and Environmental Technologies
por: Ze Wang, et al.
Publicado: (2025)
por: Ze Wang, et al.
Publicado: (2025)
Evaluating Large Language Models with Psychometrics
por: Li, Yuan, et al.
Publicado: (2024)
por: Li, Yuan, et al.
Publicado: (2024)
Open-Sora Plan: Open-Source Large Video Generation Model
por: Lin, Bin, et al.
Publicado: (2024)
por: Lin, Bin, et al.
Publicado: (2024)
NodeRAG: Structuring Graph-based RAG with Heterogeneous Nodes
por: Xu, Tianyang, et al.
Publicado: (2025)
por: Xu, Tianyang, et al.
Publicado: (2025)
Fortifying Ethical Boundaries in AI: Advanced Strategies for Enhancing Security in Large Language Models
por: He, Yunhong, et al.
Publicado: (2024)
por: He, Yunhong, et al.
Publicado: (2024)
Towards a Medical AI Scientist
por: Wu, Hongtao, et al.
Publicado: (2026)
por: Wu, Hongtao, et al.
Publicado: (2026)
Improving Interpretation Faithfulness for Vision Transformers
por: Hu, Lijie, et al.
Publicado: (2023)
por: Hu, Lijie, et al.
Publicado: (2023)
Watermarking Text Data on Large Language Models for Dataset Copyright
por: Liu, Yixin, et al.
Publicado: (2023)
por: Liu, Yixin, et al.
Publicado: (2023)
1+1>2: Can Large Language Models Serve as Cross-Lingual Knowledge Aggregators?
por: Huang, Yue, et al.
Publicado: (2024)
por: Huang, Yue, et al.
Publicado: (2024)
Ejemplares similares
-
MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPU
por: Yuan, Zhengqing, et al.
Publicado: (2026) -
ViT-1.58b: Mobile Vision Transformers in the 1-bit Era
por: Yuan, Zhengqing, et al.
Publicado: (2024) -
TTT-Unet: Enhancing U-Net with Test-Time Training Layers for Biomedical Image Segmentation
por: Zhou, Rong, et al.
Publicado: (2024) -
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
por: Yuan, Zhengqing, et al.
Publicado: (2023) -
Expert Threshold Routing for Autoregressive Language Modeling with Dynamic Computation Allocation and Load Balancing
por: Sun, Hanchi, et al.
Publicado: (2026)