Sora是一个文本到视频的生成式AI模型,由OpenAI在2024年2月发布。该模型被训练用于从文本指令生成现实或想象场景的视频,并展示了在模拟物理世界方面的潜力。基于公开的技术报告和逆向工程,本文对该模型的背景、相关技术、应用、现存挑战以及文本到视频AI模型的未来发展方向进行了全面综述。我们首先追溯Sora的发展,并研究用于构建这个“世界模拟器”的底层技术。然后,我们详细描述了Sora在从电影制作和教育到营销等多个行业的应用及潜在影响。我们讨论了需要解决的主要挑战和限制,以广泛部署Sora,例如确保安全且无偏见的视频生成。最后,我们讨论了Sora和一般视频生成模型的未来发展,以及该领域的进步如何能够启用新的人工智能交互方式,提升视频生成的生产力和创造力。