0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
会员中心
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

再现辉煌:瑞典国家图书馆运用 AI 解析数百年数据

NVIDIA英伟达企业解决方案 来源:未知 2023-02-15 16:10 次阅读

瑞典国家图书馆正在使用五百年来的瑞典语文本训练最先进的 AI 模型,以支持历史、语言学、媒体研究等方面的人文研究。

从价值连城的中世纪手稿到今天的披萨店菜单,瑞典国家图书馆在过去 500 年中收藏了几乎所有瑞典语出版物。

由于瑞典法律要求一切瑞典语出版物都要上交副本至瑞典国家图书馆(也称为瑞典皇家图书馆),因此该图书馆的藏品涵盖了各清晰度的书籍、报纸、无线广播、电视广播、互联网内容、博士论文、明信片、菜单和电子游戏。这个内容丰富的收藏集含近 26 PB 的数据,是训练尖端 AI 的最佳选择。

瑞典国家图书馆数据实验室 KBLab 的负责人 Love Börjeson 表示:“我们有最好的数据,所以我们可以构建最先进的瑞典语 AI 模型。”

该团队使用 NVIDIA DGX 系统开发了二十多个可在 Hugging Face 上使用的开源 Transformer 模型。这些模型推动了图书馆和其他学术机构的研究,每月的开发者下载量多达 20 万。

Börjeson 表示:“在我们的实验室成立前,研究者无法在图书馆访问数据集,他们每次只能查阅一个对象。因此,为帮助那些需要大量查阅资料的研究者,创建图书馆的数据集十分必要。”

这样,研究者很快就能创建专门的数据集。例如,调出所有描绘教堂的瑞典明信片、所有特定风格的文本或是所有提到某一历史人物的书籍、报纸文章及电视广播。

从图书馆档案到 AI 训练数据

瑞典国家图书馆的数据集涵盖了瑞典语的所有变体,包括各种正式和非正式变体、地区方言以及随着时间的推移而产生的变化。

Börjeson 表示:“数据还在持续不断地涌入并增长,我们每个月都会增加超过 50 TB 的新数据。在处理成倍增长的数据的同时,我们还要将数百年前的实物藏品转换成数据录入,所以我们一直在不断扩大我们的数据集。”

2019 年 KBLab 成立后不久,Börjeson 就看到了运用庞大的图书馆档案训练 Transformer 语言模型的潜力。谷歌早期的多语言自然语言处理模型含有 5GB 瑞典语文本,他从此受到了启发。

KBLab 的第一个模型使用了谷歌多语言自然语言处理模型 4 倍之多的数据——Börjeson 团队的目标是使用至少 1 TB 的瑞典语文本训练模型。在发现多语言数据集可能提高 AI 的性能之后,这座实验室开始进行实验,在其数据集中添加荷兰语、德语和挪威语内容。

NVIDIA AI 和 GPU 加速模型开发

该实验室一开始使用的是消费级 NVIDIA GPU,但 Börjeson 很快发现他的团队需要数据中心规模的计算来训练更大的模型。

Börjeson 表示:“我们意识到在小型工作站上无法完成这项工作,所以 NVIDIA DGX 是明智之选。我们很多的工作离不开 DGX 系统。”

该实验室使用两套来自瑞典供应商 AddPro 的 NVIDIA DGX 系统进行本地 AI 开发。这些系统用于处理敏感数据、开展大规模实验和微调模型。它们还准备在全欧盟搭载 GPU 的大型超级计算机上进行更大规模的运行,其中包括卢森堡的 MeluXina 系统。

Börjeson 表示:“我们在 DGX 系统上的工作至关重要,因为我们希望能够在高性能计算环境中做到最好,这必须将超级计算机的作用发挥到极致。”

该团队还采用了用于训练大型语言模型的 PyTorch 框架 NVIDIA NeMo Megatron。其内置的 NVIDIA CUDA 和 NVIDIA NCCL 库可优化 GPU 在多节点系统中的使用。

Börjeson 表示:“我们十分依赖 NVIDIA 的框架。因为我们实验室的规模较小,无法派出 50 名工程师优化每个项目的 AI 训练,NVIDIA 的优势在这就十分明显了。”

利用多模态数据开展人文科学研究

除了能够理解瑞典语文本的 Transformer 模型外,KBLab 还有一个能将声音转换成文本的 AI 工具。这使得图书馆能够将其大量的无线广播收藏转换成数据集,以便研究者能够搜索录音中的具体内容。

KBLab 还在开发生成式文本模型,同时还在研究一个可以处理视频并自动生成内容描述的 AI 模型。

Börjeson 表示:“我们还希望将各种模态的数据联系起来。当你在图书馆数据库中搜索一个特定的词语时,系统将能够返回包括文本、音频和视频在内的结果。”

KBLab 与哥德堡大学的研究者开展了合作。这些研究者正在使用该 KBLab 的模型开发用于语言学研究的下游应用程序。项目之一是帮助瑞典学院升级用于创建瑞典语词典的数据驱动技术。

Börjeson 表示:“这些模型的社会效益远远超出了我们的最初预想。”

9aac0100-ad07-11ed-bfe3-dac502259ad0.png      

点击“阅读原文”扫描下方海报二维码,即可免费注册 GTC 23,切莫错过这场 AI 和元宇宙时代的技术大会


原文标题:再现辉煌:瑞典国家图书馆运用 AI 解析数百年数据

文章出处:【微信公众号:NVIDIA英伟达企业解决方案】欢迎添加关注!文章转载请注明出处。


声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • 英伟达
    +关注

    关注

    22

    文章

    3718

    浏览量

    90628

原文标题:再现辉煌:瑞典国家图书馆运用 AI 解析数百年数据

文章出处:【微信号:NVIDIA-Enterprise,微信公众号:NVIDIA英伟达企业解决方案】欢迎添加关注!文章转载请注明出处。

收藏 人收藏

    评论

    相关推荐

    智慧图书馆能耗监测优化管理系统方案

    优化管理系统方案,旨在通过智能化手段实现对图书馆能耗的全面监测、精准分析与高效管理,有效减少能耗成本并提高能源利用效率。 通过在图书馆各区域配电室内部署物通博联工业智能网关,实时采集智能电表数据,如电量、电压
    的头像 发表于 09-11 13:41 243次阅读

    荣耀参展百年IFA,折叠新品Magic V3海外正式发布

    、荣耀笔记本MagicBook Art 14等全场景旗舰设备亮相,同时带来AI离焦护眼等多项端侧AI创新技术,为这一消费电子行业盛会的百年诞辰奉上特殊的创新之礼。
    的头像 发表于 09-07 09:14 813次阅读

    聚徽-什么是智能图书馆

    智能图书馆(Intelligent Library,简称 IL)是把智能技术运用图书馆建设之中形成的一种现代化建筑,是智能建筑与高度自动化管理的数字图书馆的有机结合和创新。它应同时具
    的头像 发表于 08-05 09:51 185次阅读

    OBOO鸥柏智能化卧式触控查询一体机在大学图书馆的创新应用案例展览展示

    OBOO鸥柏卧式红外触控一体机图书馆应用随着信息技术的飞速发展,校园大学图书馆正经历着一场由传统向科技化的现代、由单一向多元化的智慧便民的变革。在这场导览展览展示的变革中,OBOO鸥柏红外卧式触
    的头像 发表于 07-29 11:15 237次阅读
    OBOO鸥柏智能化卧式触控查询一体机在大学<b class='flag-5'>图书馆</b>的创新应用案例展览展示

    雷拓科技云广播助力江西省芦溪县新图书馆打造沉浸式观展体验!

     芦溪县图书馆新馆位于江西省萍乡市芦溪县古城山公园袁河西路,占地8亩,建筑面积1.1万平方米,严格按照国家一级图书馆标准设计,集智能化、数字化、平台化为一体,设立了自助办证、借还一体机、智能书架
    的头像 发表于 07-01 09:59 255次阅读
    雷拓科技云广播助力江西省芦溪县新<b class='flag-5'>图书馆</b>打造沉浸式观展体验!

    如果通过物联网技术提升学校图书馆管理水平

    通过物联网技术提升学校图书馆管理水平是一个非常具有前景的方向。以下是一些通过物联网技术实现图书馆管理水平提升的可能方法: 1.智能化监控与安全:在图书馆内部安装传感器和监控摄像头,实时监测人流量
    的头像 发表于 03-22 14:36 550次阅读

    RFID智能书架:图书馆智能化管理的新趋势

    的基本信息和借还记录,通过RFID读写器和RFID天线,实现对图书的自动识别和管理。RFID技术的成功应用,让图书管理变得更加智能化、高效化,大大提高了图书馆的服务质量和读者体验,为图书馆
    的头像 发表于 03-20 16:53 511次阅读

    浅谈限流式保护器在高校图书馆电气火灾预防中的应用

    程瑜 安科瑞电气股份有限公司 上海嘉定 201801 【摘要】高校图书馆是高校文化建设的重点,是知识密集、人才集中的特定场所,是人类文化传承和创新的基础性设施。但因读者群体多为师生和部分社会群众
    的头像 发表于 02-05 15:26 502次阅读
    浅谈限流式保护器在高校<b class='flag-5'>图书馆</b>电气火灾预防中的应用

    上海交通大学徐汇校区包兆龙图书馆修缮工程电气火灾监控系统 Acrelsale1

    安科瑞 程瑜  基本信息: 项目名称:上海交通大学徐汇校区包兆龙图书馆修 缮工程电气火灾监控系统 项目地点:上海市徐汇区 实施时间:2015 项目简介: 香港著名
    的头像 发表于 02-05 14:47 334次阅读
    上海交通大学徐汇校区包兆龙<b class='flag-5'>图书馆</b>修缮工程电气火灾监控系统 Acrelsale1

    基于智能定位功能的座位预约卡 解决图书馆找座难题的理想方案

    图书馆,公共资源没有得到合理分配的现象相信很多人都遇到过:一边是背着书包到处寻觅座位的读者,一边是被各种书本、背包、衣服花式占掉的空座,读者时间成本和有限座位资源被大量浪费……基于智能定位功能
    的头像 发表于 01-26 08:16 370次阅读
    基于智能定位功能的座位预约卡  解决<b class='flag-5'>图书馆</b>找座难题的理想方案

    汽车ADAS进化的百年历史(一)

    汽车ADAS进化的百年历史(一)
    的头像 发表于 12-06 17:41 577次阅读
    汽车ADAS进化的<b class='flag-5'>百年</b>历史(一)

    RFID图书智能管理技术增进流通速率

    随着时代的快速进步,学习的文化愈加发达,知识经济现象也日益显著,各种图书馆已成为咨询服务的常去之地。而由于图书种类繁多、数量巨大、借阅周转快捷等各大现象困扰着工作人员。RFID图书智能管理技术是采用
    的头像 发表于 11-26 11:33 1740次阅读

    接收器百年创新史选编

    电子发烧友网站提供《接收器百年创新史选编.pdf》资料免费下载
    发表于 11-23 14:43 0次下载
    接收器<b class='flag-5'>百年</b>创新史选编

    无需管理底层基础设施,亚马逊云科技向量数据库轻松创建ML增强的搜索体验和应用程序

    当我们进入一家图书馆时,图书馆的入口处会有几台电脑供你检索相关的书籍,你可以检索你想要的书籍的名字例如:《百年孤独》、《悲惨世界》等等,你也可以检索作者例如:川端康成、鲁迅、加缪等等,当然你也可以
    的头像 发表于 11-15 11:11 568次阅读
    无需管理底层基础设施,亚马逊云科技向量<b class='flag-5'>数据</b>库轻松创建ML增强的搜索体验和应用程序

    施耐德电气为傅雷图书馆打造“光伏+公共建筑”开发应用的领先标杆

    作为第二季的首期栏目,施耐德电气邀请上海固特安能捷低碳科技有限公司(简称固特安能捷)的代表畅聊企业发展历程,分享“智能微网及能碳管理系统助力傅雷图书馆获LEED净零碳认证”的成功案例。 点击收看本期
    的头像 发表于 11-08 09:26 955次阅读