0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
会员中心
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

性能超越开源模型标杆Llama2-70B,书生·浦语大模型InternLM-20B开源发布

商汤科技SenseTime 来源:未知 2023-09-20 16:45 次阅读
今日,商汤科技与上海人工智能实验室联合香港中文大学和复旦大学正式推出书生·浦语大模型(InternLM)200亿参数版本InternLM-20B,并在阿里云魔搭社区(ModelScope)开源首发。

同时,书生·浦语面向大模型研发与应用的全链条工具链全线升级,与InternLM-20B一同继续全面开放,向企业和开发者提供免费商用授权

今年6月首次发布以来,书生·浦语历多轮升级,在开源社区和产业界产生广泛影响。InternLM-20B模型性能先进且应用便捷,以不足三分之一的参数量,达到当前被视为开源模型标杆的Llama2-70B的能力水

代码库

https://github.com/InternLM/InternLM

魔搭社区

https://modelscope.cn/organization/Shanghai_AI_Laboratory

16e52c5e-5791-11ee-939d-92fbcf53809c.png  

书生·浦语“增强版”

增的不只是量

相比国内社区之前陆续开源的7B和13B规格模型,20B量级模型具备更强大的综合能力,在复杂推理和反思能力上尤为突出,因此对于实际应用能够带来更有力的性能支持。

另一方面,20B量级模型可以在单卡上进行推理,经过低比特量化后,可以运行在单块消费级GPU,给实际使用带来很大的便利。

InternLM-20B是基于2.3T Tokens预训练语料从头训练的中量级语言大模型。相较于InternLM-7B,训练语料经过更高水平的多层次清洗,补充了高知识密度和用于强化理解及推理能力的训练数据。

在理解能力、推理能力、数学能力、编程能力等考验语言模型技术水平方面,InternLM-20B与此前已开源模型相比,性能显著增强:优异的综合性能,通过更高水平的数据清洗和高知识密度的数据补充,以及更优的模型架构设计和训练,显著提升了模型的理解、推理、数学与编程能力。

InternLM-20B全面领先量级相近的开源模型,使之以不足三分之一的参数量,评测成绩达到了被视为开源模型的标杆Llama2-70B水平。
  • 拥有强大的工具调用能力,实现大模型与现实场景的有效连接,并具备代码解释和反思修正能力,为智能体(Agent)的构建提供了良好的技术基础。

  • 支持更长语境,支持长度达16K的语境窗口,更有效地支撑长文理解、长文生成和超长对话,长语境同时成为支撑在InternLM-20B之上打造智能体(Agent)的关键技术基础。

  • 具备更安全的价值对齐,书生·浦语团队对InternLM-20B进行了基于SFT(监督微调)和RLHF(基于人类反馈的强化学习方式)两阶段价值对齐以及专家红队的对抗训练,当面对带有偏见的提问时,它能够给出正确引导。

16fbe250-5791-11ee-939d-92fbcf53809c.png基于OpenCompass的InternLM-20B及相近量级开源模型测评结果

全链条工具体系再巩固

各环节全面升级

今年7月,商汤科技与上海AI实验室联合发布书生·浦语的同时,在业内率先开源了覆盖数据、预训练、微调、部署和评测的全链条工具体系

历经数月升级,书生·浦语全链条开源工具体系巩固升级,并向全社会提供免费商用

全面升级的全链条工具体系

数据-OpenDataLab开源“书生·万卷”预训练语料

书生·万卷是开源的多模态语料库,包含文本数据集、图文数据集、视频数据集三部分,数据总量超过2TB。

目前,书生·万卷1.0已被应用于书生·多模态、书生·浦语的训练,为模型性能提升起到重要作用。

预训练-InternLM高效预训练框架

除了大模型外,InternLM仓库也开源了预训练框架InternLM-Train。深度整合了Transformer模型算子,使训练效率得到提升,并提出了独特的Hybrid Zero技术,使训练过程中的通信效率显著提升,实现了高效率千卡并行,训练性能达行业领先水平。

微调-InternLM全参数微调、XTuner轻量级微调

InternLM支持对模型进行全参数微调,支持丰富的下游应用。同时,低成本大模型微调工具箱XTuner也在近期开源,支持多种大模型及LoRA、QLoRA等微调算法

通过XTuner,最低仅需 8GB 显存即可对7B模型进行低成本微调,在24G显存的消费级显卡上就能完成20B模型的微调。

部署-LMDeploy支持十亿到千亿参数语言模型的高效推理

LMDeploy涵盖了大模型的全套轻量化、推理部署和服务解决方案,支持了从十亿到千亿级参数的高效模型推理,在吞吐量等性能上超过FasterTransformer、vLLM和Deepspeed等社区主流开源项目。

评测-OpenCompass一站式、全方位大模型评测平台

OpenCompass大模型评测平台构建了包含学科、语言、知识、理解、推理五大维度的评测体系,支持超过50个评测数据集和30万道评测题目,支持零样本、小样本及思维链评测,是目前最全面的开源评测平台。

自7月发布以来,受到学术界和产业界广泛关注,目前已为阿里巴巴、腾讯、清华大学等数十所企业及科研机构广泛应用于大模型研发。

应用-Lagent轻量灵活的智能体框架

书生·浦语团队同时开源了智能体框架,支持用户快速将一个大语言模型转变为多种类型的智能体,并提供典型工具为大语言模型赋能。

Lagent集合了ReAct、AutoGPT 及ReWoo等多种类型的智能体能力,支持智能体调用大语言模型进行规划推理和工具调用,并可在执行中及时进行反思和自我修正。


基于书生·浦语大模型,目前已经发展出更丰富的下游应用,将于近期陆续向学术及产业界分享。

面向大模型掀起的新一轮创新浪潮,商汤科技坚持原创技术研究,通过前瞻性打造新型人工智能基础设施,建立大模型及研发体系,持续推动AI创新和落地,引领人工智能进入工业化发展阶段,同时赋能整个AI社区生态的繁荣发展。全链条工具体系开源链接

“书生·万卷”预训练语料

https://github.com/opendatalab/WanJuan1.0

InternLM预训练框架

https://github.com/InternLM/InternLM

XTuner微调工具箱

https://github.com/InternLM/xtuner

LMDeploy推理工具链

https://github.com/InternLM/lmdeploy

OpenCompas大模型评测平台

https://github.com/open-compass/opencompass

Lagent智能体框架

https://github.com/InternLM/lagent

171a704e-5791-11ee-939d-92fbcf53809c.gif

相关阅读,戳这里

《AI考生今日抵达,商汤与上海AI实验室等发布“书生·浦语”大型》

《大语言模型“书生·浦语”多项专业评测拔头筹》

172516d4-5791-11ee-939d-92fbcf53809c.jpg


原文标题:性能超越开源模型标杆Llama2-70B,书生·浦语大模型InternLM-20B开源发布

文章出处:【微信公众号:商汤科技SenseTime】欢迎添加关注!文章转载请注明出处。


声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • 商汤科技
    +关注

    关注

    8

    文章

    520

    浏览量

    36208

原文标题:性能超越开源模型标杆Llama2-70B,书生·浦语大模型InternLM-20B开源发布

文章出处:【微信号:SenseTime2017,微信公众号:商汤科技SenseTime】欢迎添加关注!文章转载请注明出处。

收藏 人收藏

    评论

    相关推荐

    在算力魔方上本地部署Phi-4模型

    ​作者:算力魔方创始人/英特尔边缘计算创新大使 刘力 前面我们分享了《Meta重磅发布Llama 3.3 70B开源AI模型的新里程碑》,
    的头像 发表于 01-15 11:05 159次阅读
    在算力魔方上本地部署Phi-4<b class='flag-5'>模型</b>

    Meta重磅发布Llama 3.3 70B开源AI模型的新里程碑

    ​在人工智能领域,Meta的最新动作再次引起了全球的关注。今天,我们见证了Meta发布Llama 3.3 70B 模型,这是一个开源的人
    的头像 发表于 12-18 16:46 247次阅读
    Meta重磅<b class='flag-5'>发布</b><b class='flag-5'>Llama</b> 3.3 <b class='flag-5'>70B</b>:<b class='flag-5'>开源</b>AI<b class='flag-5'>模型</b>的新里程碑

    Meta推出Llama 3.3 70B,AI大模型竞争白热化

    Llama 3.3 70B模型性能上表现出色,与同行业的其他大模型相比毫不逊色。更重要的是,其在成本上展现出了更强的竞争力,使得更多的企
    的头像 发表于 12-09 14:50 489次阅读

    Meta发布Llama 3.2量化版模型

    近日,Meta在开源Llama 3.2的1B与3B模型后,再次为人工智能领域带来了新进展。10月24日,Meta正式推出了这两个
    的头像 发表于 10-29 11:05 500次阅读

    Llama 3 与开源AI模型的关系

    在人工智能(AI)的快速发展中,开源AI模型扮演着越来越重要的角色。它们不仅推动了技术的创新,还促进了全球开发者社区的合作。Llama 3,作为一个新兴的AI项目,与开源AI
    的头像 发表于 10-27 14:42 452次阅读

    英伟达发布AI模型 Llama-3.1-Nemotron-51B AI模型

    英伟达公司宣布推出 Llama-3.1-Nemotron-51B AI 模型,这个AI大模型是源自 Meta 公司的 Llama-3.1-70B 大
    的头像 发表于 09-26 17:30 669次阅读

    Meta发布全新开源模型Llama 3.1

    科技巨头Meta近期震撼发布了其最新的开源人工智能(AI)模型——Llama 3.1,这一举措标志着Meta在AI领域的又一重大突破。Meta创始人马克·扎克伯格亲自站台,盛赞
    的头像 发表于 07-24 18:25 1511次阅读

    Meta即将发布超强开源AI模型Llama 3-405B

    在人工智能领域的激烈竞争中,Meta公司再次掷出重磅炸弹,宣布将于7月23日正式发布其最新力作——Llama 3-405B,一个拥有惊人4050亿参数的开源
    的头像 发表于 07-18 09:58 1089次阅读

    Optimum Intel三步完成Llama3在算力魔方的本地量化和部署

    Llama3 是Meta最新发布开源大语言模型(LLM), 当前已开源8B
    的头像 发表于 05-10 10:34 1213次阅读
    Optimum Intel三步完成<b class='flag-5'>Llama</b>3在算力魔方的本地量化和部署

    Meta Llama 3基础模型现已在亚马逊云科技正式可用

    亚马逊云科技近日宣布,Meta公司最新发布的两款Llama 3基础模型——Llama 3 8BLlam
    的头像 发表于 05-09 10:39 463次阅读

    百度智能云国内首家支持Llama3全系列训练推理!

    4月18日,Meta 正式发布 Llama 3,包括8B70B 参数的大模型,官方号称有史以来最强大的
    的头像 发表于 04-20 09:20 455次阅读
    百度智能云国内首家支持<b class='flag-5'>Llama</b>3全系列训练推理!

    Meta推出最强开源模型Llama 3 要挑战GPT

    公司这次开源Llama 3 8B70B两款不同规模的模型,开发者可以免费使用,而Meta公司还将陆续推出一系列具备多模态、多语言对话、更
    的头像 发表于 04-19 17:00 915次阅读

    谷歌开源70亿参数大语言模型,全方位超越Meta Llama-2

    基于Gemini打造的开源模型Gemma。   谷歌加入AI模型开源阵营,Gemma横空出世   根据谷歌的介绍,Gemma是由谷歌DeepMind以及其他团队开发,由Gemini启发
    的头像 发表于 02-23 00:15 3600次阅读
    谷歌<b class='flag-5'>开源</b><b class='flag-5'>70</b>亿参数大语言<b class='flag-5'>模型</b>,全方位<b class='flag-5'>超越</b>Meta <b class='flag-5'>Llama-2</b>?

    谷歌发布全球最强开源模型Gemma

    谷歌近日宣布,其全新开源模型Gemma正式亮相。Gemma被誉为全球性能最强大、同时也是最轻量级的模型系列,分为2B
    的头像 发表于 02-22 14:51 900次阅读

    LLaMA 2是什么?LLaMA 2背后的研究工作

    Meta 发布LLaMA 2,是新的 sota 开源大型语言模型 (LLM)。LLaMA
    的头像 发表于 02-21 16:00 1287次阅读