自然语言处理(Natural Language Processing,简称NLP)可能是当前数据科学中最受关注的子领域。
NLP不仅有趣、有前途,而且还可以改变我们看待技术的方式。不仅是技术,它还可以改变我们理解人类语言的方式。
自然语言处理是人类语言与技术的结合,如今该项技术在研究和行业领域受到的关注越来越多。自从第一台计算机诞生以来,人们就憧憬着创造出能够理解人类语言的计算机程序。
机器学习与人工智能领域的进步推动了自然语言处理的发展,以及人们持续高涨的兴趣。随着自然语言处理为我们的日常生活带来越来越多的便利,人们的兴趣也会越来越高。亚马逊的 Alexa、苹果的 Siri 以及 Google 助手等一系列技术产品的问世,充分表明了这项技术掀起的热浪。
事实上,自然语言处理也是我进入数据科学的缘由。我一直着迷于语言本身及其随着人类的经验和时间的发展。我想了解如何教计算机理解我们的语言,不仅如此,而且我还希望计算机能够使用人类的语言来和我们交流,并理解我们。
在本文中,我将介绍 6 种自然语言处理的基本技术,如果你也想涉足该领域,则应该掌握这些技术。
词形还原与词干提取
数据准备是所有 NLP 项目都必不可少的工作,常见的方式有两种:词形还原与词干提取,你可以选择其中一个方式。它们代表了该领域的核心概念,是你成为 NLP 大师需要学习的第一项技术。
初学者往往会混淆这两种技术。虽然二者有相似之处,但是有很大不同。
词干提取(Stemming):词干提取是去除词缀得到词根的过程,即得到单词最一般的写法,比如:argue、argued、argues、arguing 和 argus 的词干为“argu”。执行词干提取的算法有很多,这些算法需要考虑单词常见的前缀与后缀。英语中常用的算法是 Porter 词干提取器,该算法包含 5 个阶段,需要按顺序进行,最终获取单词的词根。
词形还原(Lemmatization):词形还原是指将一个单词还原为一般形式(能表达完整语义)。比如:“walk”、“walked”、“walks”以及“walking”的一般形式为“walk”。为了克服词干提取的缺点,人们设计了词形还原。这些算法需要了解语言与语法的知识,才能在提取单词词元的时候做出更好的决定。为了词形还原算法执行的准确率,它们需要提取每个单词的词元。因此,通常它们需要语言的词典,才能正确地分类每个单词。
根据这些定义,你应该可以看出词形还原比词干提取更加复杂,而且实现这种算法也需要更多的时间。但是,词形还原更加准确,而且最终分析结果的噪声也更少。
关键字提取
关键字提取,有时又称之为关键字检测或关键字分析,这是一种文本分析的 NLP 技术。这种技术的主要目的是自动地从文本的正文中提取出现频率最高的单词与词组。这种技术常常作为生成本文摘要的第一步,提取文本的主旨。
关键字提取算法借助了机器学习与人工智能的强大力量。这种算法使用神经网络来提取和简化文本,以方便计算机理解。这种算法适合任何类型的文本,从学术文本到社交媒体帖子中常用的口语化文本。
关键字提取在当今世界中有很多应用,包括社交媒体监控、客户服务/反馈、产品分析以及搜索引擎优化。
命名实体识别(NER)
词干提取、词形还原、命名实体识别(Named Entity Recognition,简称NER)是最基本以及核心的 NLP 技术。
NER 是一项从文本的正文中提取实体的技术,这里的实体主要包括人名、地名、机构名、专有名词等,以及时间、数量、货币、比例数值等文字。
NER 算法主要包含两大步骤。第一步,检测文本中的实体;第二步,将实体分类到一个类别集合。NER 的表现极大地依赖于开发模型时使用的训练数据。训练数据越接近真实的数据,最终的结果就越准确。
关系到 NER 模型准确性的另一个因素是构建模型时使用的语言知识。话虽如此,网上有很多预训练的 NER 平台,可供随时使用。
NER 可以应用到多种领域,比如构建推荐系统,在医疗保健中为患者提供更好的服务,以及在学术界中帮助学生获得相关的研究材料。
主题建模
你可以使用提取关键字的方式,将大段的文本压缩成几个主要的关键词和概念。然后在此基础上,提炼出文本的主题。
另外,还有一种更先进的识别文本主题的方式:主题建模。主题建模构建于非监督机器学习的基础之上,这类机器学习的训练不需要带标签的数据。
文本的主题建模算法有很多种,比如相似主题模型(Correlated Topic Model,CTM)、潜在狄利克雷分布(Latent Dirichlet Allocation,LDA)以及潜在语义分析(Latent Semantic Analysis,LSA),其中最常用的方法是 LDA。这种方法可以分析文本,并将文本分解成单词和语句,然后从这些单词和语句中提取不同的主题。你需要做的只是为算法提供文本,接下来的工作全部由算法完成。
文本摘要
还有一个非常实用,且前景非常看好的 NLP 应用,那就是文本摘要。这种算法可以将大段文本压缩成一小块只包含文本大意的文字。这种技术常用于提炼长篇新闻文章,以及提取研究论文的摘要。
文本摘要是一项先进的技术,它使用了上述我们提到的技术(比如主题建模以及关键字提取等)来完成目标工作。这种方法通常包含两大步骤:提取和抽象。
在提取阶段,算法会根据单词在文本中出现的频率,提取文本的主要部分。接着,算法会生成摘要,即通过一段全新的文本来传达原文的主旨。文本摘要的算法有很多种,比如 LexRank 与 TextRank。
LexRank 算法通过一个排名模型来分类文本中的句子。这种排名依据的是句子之间的相似性,某个句子与其余文本的相似性越高,它的排名就越高。
情感分析
情感分析(Sentiment Analysis)是人气最高、知名度最广的 NLP 技术之一。这种技术的核心功能是通过分析文本包含的单词,提取文本所表达的情感。
这项技术最简单的结果是一项表示积极、消极和中性的评分,该结果用数字表示。如果结果是负数,则代表文本背后的情绪为消极;如果结果为正数,则表示文本表达了积极的观点。
情感分析是机器学习技术的广泛应用之一。它可以通过监督学习实现,也可以通过非监督学习实现。最常见的通过监督学习实现的情感分析是使用朴素贝叶斯算法。还有其他机器学习算法也可用于情感分析的实现,比如梯度提升(Gradient Boosting)以及随机森林。
总结
人类对于计算理解自然语言,并使用自然语言与我们交流的渴望由来已久。随着技术与机器学习算法的飞速发展,这种想法已不只是一种憧憬。我们已经可以在日常生活中看到和体验这种技术。这种想法是自然语言处理的核心。
自然语言处理是当今的热门话题之一,也是非常有潜力的领域之一。各大公司和研究机构都在竞相创建能够完全理解并使用人类语言的计算机程序。自从 1960 年代虚拟代理问世以来,这项技术已获得了飞速的发展。
尽管自然语言处理可以执行的任务不同,但为了进军该领域,并建立自己的项目,你必须熟练掌握该领域基本的六大核心技术。
这些技术是所有自然语言处理模型的基础。如果你已经理解了这些技术,并知道何时使用何种技术,那么自然语言处理的大门就会向你敞开。
审核编辑 :李倩
-
机器学习
+关注
关注
66文章
8482浏览量
133925 -
自然语言处理
+关注
关注
1文章
625浏览量
13954 -
nlp
+关注
关注
1文章
490浏览量
22439
原文标题:数据科学家必会的六大 NLP 技术!
文章出处:【微信号:5G通信,微信公众号:5G通信】欢迎添加关注!文章转载请注明出处。
发布评论请先 登录
TI科学家谈浮点DSP未来发展
美科学家推出多种波动描记传感器
通往数据科学家的崎岖道路
哪些才是对数据科学家最迫切的技能呢?
什么是数据科学家?需要认证吗?
企业如何解决数据科学家短缺详细方法什么
采访资深数据科学家:成为数据科学家应具有的品质
数据科学家和数据工程师能合二为一吗?
中国联通AI科学家廉士国入选全球前2%顶尖科学家榜单

瑞萨RA8系列教程 | 基于 RASC 生成 Keil 工程
对于不习惯用 e2 studio 进行开发的同学,可以借助 RASC 生成 Keil 工程,然后在 Keil 环境下愉快的完成开发任务。

共赴之约 | 第二十七届中国北京国际科技产业博览会圆满落幕
作为第二十七届北京科博会的参展方,芯佰微有幸与800余家全球科技同仁共赴「科技引领创享未来」之约!文章来源:北京贸促5月11日下午,第二十七届中国北京国际科技产业博览会圆满落幕。本届北京科博会主题为“科技引领创享未来”,由北京市人民政府主办,北京市贸促会,北京市科委、中关村管委会,北京市经济和信息化局,北京市知识产权局和北辰集团共同承办。5万平方米的展览云集

道生物联与巍泰技术联合发布 RTK 无线定位系统:TurMass™ 技术与厘米级高精度定位的深度融合
道生物联与巍泰技术联合推出全新一代 RTK 无线定位系统——WTS-100(V3.0 RTK)。该系统以巍泰技术自主研发的 RTK(实时动态载波相位差分)高精度定位技术为核心,深度融合道生物联国产新兴窄带高并发 TurMass™ 无线通信技术,为室外大规模定位场景提供厘米级高精度、广覆盖、高并发、低功耗、低成本的一站式解决方案,助力行业智能化升级。

智能家居中的清凉“智”选,310V无刷吊扇驱动方案--其利天下
炎炎夏日,如何营造出清凉、舒适且节能的室内环境成为了大众关注的焦点。吊扇作为一种经典的家用电器,以其大风量、长寿命、低能耗等优势,依然是众多家庭的首选。而随着智能控制技术与无刷电机技术的不断进步,吊扇正朝着智能化、高效化、低噪化的方向发展。那么接下来小编将结合目前市面上的指标,详细为大家讲解其利天下有限公司推出的无刷吊扇驱动方案。▲其利天下无刷吊扇驱动方案一

电源入口处防反接电路-汽车电子硬件电路设计
一、为什么要设计防反接电路电源入口处接线及线束制作一般人为操作,有正极和负极接反的可能性,可能会损坏电源和负载电路;汽车电子产品电性能测试标准ISO16750-2的4.7节包含了电压极性反接测试,汽车电子产品须通过该项测试。二、防反接电路设计1.基础版:二极管串联二极管是最简单的防反接电路,因为电源有电源路径(即正极)和返回路径(即负极,GND),那么用二极

半导体芯片需要做哪些测试
首先我们需要了解芯片制造环节做⼀款芯片最基本的环节是设计->流片->封装->测试,芯片成本构成⼀般为人力成本20%,流片40%,封装35%,测试5%(对于先进工艺,流片成本可能超过60%)。测试其实是芯片各个环节中最“便宜”的一步,在这个每家公司都喊着“CostDown”的激烈市场中,人力成本逐年攀升,晶圆厂和封装厂都在乙方市场中“叱咤风云”,唯独只有测试显

解决方案 | 芯佰微赋能示波器:高速ADC、USB控制器和RS232芯片——高性能示波器的秘密武器!
示波器解决方案总述:示波器是电子技术领域中不可或缺的精密测量仪器,通过直观的波形显示,将电信号随时间的变化转化为可视化图形,使复杂的电子现象变得清晰易懂。无论是在科研探索、工业检测还是通信领域,示波器都发挥着不可替代的作用,帮助工程师和技术人员深入剖析电信号的细节,精准定位问题所在,为创新与发展提供坚实的技术支撑。一、技术瓶颈亟待突破性能指标受限:受模拟前端

硬件设计基础----运算放大器
1什么是运算放大器运算放大器(运放)用于调节和放大模拟信号,运放是一个内含多级放大电路的集成器件,如图所示:左图为同相位,Vn端接地或稳定的电平,Vp端电平上升,则输出端Vo电平上升,Vp端电平下降,则输出端Vo电平下降;右图为反相位,Vp端接地或稳定的电平,Vn端电平上升,则输出端Vo电平下降,Vn端电平下降,则输出端Vo电平上升2运算放大器的性质理想运算

ElfBoard技术贴|如何调整eMMC存储分区
ELF 2开发板基于瑞芯微RK3588高性能处理器设计,拥有四核ARM Cortex-A76与四核ARM Cortex-A55的CPU架构,主频高达2.4GHz,内置6TOPS算力的NPU,这一设计让它能够轻松驾驭多种深度学习框架,高效处理各类复杂的AI任务。

米尔基于MYD-YG2LX系统启动时间优化应用笔记
1.概述MYD-YG2LX采用瑞萨RZ/G2L作为核心处理器,该处理器搭载双核Cortex-A55@1.2GHz+Cortex-M33@200MHz处理器,其内部集成高性能3D加速引擎Mail-G31GPU(500MHz)和视频处理单元(支持H.264硬件编解码),16位的DDR4-1600/DDR3L-1333内存控制器、千兆以太网控制器、USB、CAN、

运放技术——基本电路分析
虚短和虚断的概念由于运放的电压放大倍数很大,一般通用型运算放大器的开环电压放大倍数都在80dB以上。而运放的输出电压是有限的,一般在10V~14V。因此运放的差模输入电压不足1mV,两输入端近似等电位,相当于“短路”。开环电压放大倍数越大,两输入端的电位越接近相等。“虚短”是指在分析运算放大器处于线性状态时,可把两输入端视为等电位,这一特性称为虚假短路,简称

飞凌嵌入式携手中移物联,谱写全国产化方案新生态
4月22日,飞凌嵌入式“2025嵌入式及边缘AI技术论坛”在深圳成功举办。中移物联网有限公司(以下简称“中移物联”)携OneOS操作系统与飞凌嵌入式共同推出的工业级核心板亮相会议展区,操作系统产品部高级专家严镭受邀作《OneOS工业操作系统——助力国产化智能制造》主题演讲。

ATA-2022B高压放大器在螺栓松动检测中的应用
实验名称:ATA-2022B高压放大器在螺栓松动检测中的应用实验方向:超声检测实验设备:ATA-2022B高压放大器、函数信号发生器,压电陶瓷片,数据采集卡,示波器,PC等实验内容:本研究基于振动声调制的螺栓松动检测方法,其中低频泵浦波采用单频信号,而高频探测波采用扫频信号,利用泵浦波和探测波在接触面的振动声调制响应对螺栓的松动程度进行检测。通过螺栓松动检测

MOS管驱动电路——电机干扰与防护处理
此电路分主电路(完成功能)和保护功能电路。MOS管驱动相关知识:1、跟双极性晶体管相比,一般认为使MOS管导通不需要电流,只要GS电压(Vbe类似)高于一定的值,就可以了。MOS管和晶体管向比较c,b,e—–>d(漏),g(栅),s(源)。2、NMOS的特性,Vgs大于一定的值就会导通,适合用于源极接地时的情况(低端驱动),只要栅极电压达到4V或10V就可以

压敏(MOV)在电机上的应用剖析
一前言有刷直流电机是一种较为常见的直流电机。它的主要特点包括:1.结构相对简单,由定子、转子、电刷和换向器等组成;2.通过电刷与换向器的接触来实现电流的换向,从而使电枢绕组中的电流方向周期性改变,保证电机持续运转;3.具有调速性能较好等优点,可以通过改变电压等方式较为方便地调节转速。有刷直流电机在许多领域都有应用,比如一些电动工具、玩具、小型机械等。但它也存
评论