“大语言模型为 AI 产业带来新的生机,然而语言模型的应用场景有限。要全面打开生成式 AI 的想象力,还是要依托多模态大模型。”IDC 中国研究总监卢言霞近日表示。Sora在文生视频领域真正迈出了第一步,真正做到生成式 AI 驱动生成短视频。接下来也将刺激其他科技巨头加快在该领域的技术攻关力度以及产品发布速度。
哪些公司有潜力快速推出类似产品呢?根据卢言霞的判断,几个最有潜力的群体包括,在大模型以及 AI 领域投入最为领先的科技巨头,如 BAT、科大讯飞等;在计算机视觉领域拥有深厚积累的公司,比如商汤、海康一类的公司;以及短视频类公司;更可大胆想象,也或许会培训出多模态大模型的全新创企。
多模态大模型将率先在短视频、广告、互娱、影视、媒体等领域采用,辅助人类员工生成视频,既可以提高生产速度又可以提高生产数量,还可以创造全新的视觉感受,能够帮助企业真正实现降本增效、提升用户体验。
根据预测,未来 5 年,生成式 AI 生成的文本类文件、图像类文件、视频类文件、软件代码类文件数量将会越来越平均。而这其中,与图像文件相关的数据量可能是文本文件的 100 倍,视频文件是图像文件的 10 倍。整体来看,由于 GenAI 的采用和使用日益增多,近期和远期所创建数据的增长速度都将快于近几年。
卢言霞指出,多模态大模型行业发展的挑战在于:
• 高质量数据的稀缺:图像、视频类数据掌握在少数公司手中。这些数据也需要标注,甚至重新采集,才能用于大模型的训练。
• 多模态大模型对算力的消耗更高,算力的可获取性以及成本将是挑战之一。
• 顶尖的大模型研发人才,也是行业发展的稀缺资源。
此外,多模态大模型将带来更严峻的安全方面的挑战。一方面多模态大模型将读取更多的图像、视频类数据,这些图像视频数据是否合规是否安全,需要得到保障;另一方面,生成的视频与真实世界之间的差异,是否会影响到人身安全、社会稳定、企业安全等,也需要注意。
当前 Sora 生成的是1分钟的视频,对于行业已经是重大突破,何时能生成2分钟、5分钟以上的视频还未知,无论如何多模态大模型的应用都将是颠覆性的。
声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。
举报投诉
相关推荐
多模态大模型的核心思想是将不同媒体数据(如文本、图像、音频和视频等)进行融合,通过学习不同模态之间的关联,实现更加智能化的信息处理。简单来说,多
发表于 10-18 09:39
•236次阅读
大模型在不同行业领域的应用前景;7月19日, “依图科技多模态大模型伙伴CTO精研班”在杭州圆满举办,让更多的伙伴们深度体验了依图多
发表于 07-23 15:16
•367次阅读
电子发烧友网报道(文/梁浩斌)今年春节期间,OpenAI的AI文字生成视频模型Sora惊艳全世界,极高的视频生成效果、长达60秒的视频生成长度,让过去Pika Labs推出的Pika 1.0、去年
发表于 06-17 09:07
•3278次阅读
Sora短期不会向公众开放 还处于反馈获取阶段 据外媒报道Sora核心团队在一次采访中透露,Sora短期不会向公众开放,
发表于 03-14 14:55
•623次阅读
。 Sora是一种扩散模型,具备从噪声中生成完整视频的能力,它生成的视频一开始看起来像静态噪音,通过多个步骤逐渐去除噪声后,视频也从最初的随机像素转化为清晰的图像场景 ,其能够
发表于 02-22 16:52
•3083次阅读
sora模型的上市公司目前没有相关官方的报道,因此无法给出准确的回答。 Sora能够获取现有视频并对其进行扩展或填充缺失的帧,这一功能在视频编辑、电影特效等领域具有应用前景,可以帮助用
发表于 02-22 16:46
•1061次阅读
美国当地时间2024年2月15日 ,OpenAI正式发布文生视频模型Sora ,并发布了48个文生视频案例和技术报告 ,正式入局视频生成领域 。Sora能够根据提示词生成60s的连贯视频,“碾压”了
发表于 02-22 16:42
•1103次阅读
有推出“中文版sora” 有字节跳动相关人士透露Boximator是视频生成领域控制对象运动的技术方法研究项目,Boximator确实可以通过文本精准控制生成视频中人物或物体的动作;但是目前还不能作为一个完善的产品直接落地。 但是虽然说Boximator
发表于 02-21 17:29
•812次阅读
奥特曼发布王炸模型Sora OpenAI首个文生视频模型Sora正式亮相 2月16日凌晨OpenAI的首个文生视频模型
发表于 02-18 17:41
•922次阅读
全球人工智能领域的佼佼者OpenAI近日发布了一款名为Sora的短视频生成模型,该模型能够根据文字指令即时生成高质量短视频,引起了业界的广泛关注。
发表于 02-18 10:16
•1271次阅读
ByteDance Research 基于开源的多模态语言视觉大模型 OpenFlamingo 开发了开源、易用的 RoboFlamingo 机器人操作模型,只用单机就可以训练。
发表于 01-19 11:43
•345次阅读
多模态大语言模型(MLLM) 最近引起了广泛的关注,其将 LLM 的推理能力与图像、视频和音频数据相结合,通过多模态对齐使它们能够更高效地执行各种任务,包括图像分类、将文本与相应的视频
发表于 12-28 11:45
•479次阅读
前段时间Google推出Gemini多模态大模型,展示了不凡的对话能力和多模态能力,其表现究竟如何呢?
发表于 12-28 11:19
•1151次阅读
我们知道,预训练LLM已经取得了诸多惊人的成就, 然而其明显的劣势是不支持其他模态(包括图像、语音、视频模态)的输入和输出,那么如何在预训练LLM的基础上引入跨模态的信息,让其变得更强大、更通用呢?本节将介绍“大
发表于 12-13 13:55
•1576次阅读
不同于单模态模型编辑,多模态模型编辑需要考虑更多的模态信息。文章出发点依然从单
发表于 11-09 14:53
•466次阅读
评论