0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
会员中心
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

匿名和去识别化在数据隐私保护方面的重要性

如意 来源:读芯术微信公众号 作者:读芯术微信公众号 2020-09-16 15:14 次阅读

匿名化是为了确保数据的隐私性,公司用它来保护敏感数据。这类数据包括:

私人数据

业务信息,如财务信息或商业秘密

机密信息,如军事机密或政府信息

匿名化为遵循个人数据相关隐私条例提供了范例,个人数据和业务数据的重合之处就是客户信息所在。但并非所有的业务数据都受监管,本文将重点讨论个人数据的保护。

匿名和去识别化在数据隐私保护方面的重要性

敏感数据类型示例

在欧洲,监管机构将任何与某人(如你的名字)有关的信息定义为“个人数据”。不论形式,任何关联到此人的信息都符合上述定义。从上世纪起,个人数据收集逐渐民主化,数据匿名化问题开始出现。随着隐私条例在世界各地开始生效,这件事尤显重要。

什么是数据匿名化,为何要关注它?

我们从经典定义开始。欧盟的《通用数据保护条例》(GDPR)是这样定义对匿名信息的:“与识别或可识别自然人无关的信息,或以数据主体不能或不再可识别的方式匿名提供的个人信息。”

其中,“可识别”和“不再”至关重要。这不仅意味着你的名字不应再出现在数据中,也意味着不能从剩余数据中发现你是谁,这与再认同(有时也叫去匿名化)过程有关。

同样,GDPR(契约中)陈述了一个重要事实:“……因此,数据保护不应适用于匿名信息”。所以,若你设法匿名数据,就不再受GDPR数据保护法的约束。

你可以执行任何处理操作,如分析或数据货币化。这带来了大量机会:

出售数据显然是首选用途。在世界各地,隐私保护法正在限制个人数据交易,而匿名数据为公司提供了另一种选择。

它带来了合作机会。许多公司为了创新或研究而共享数据,匿名数据有助于降低风险。

它还为数据分析和机器学习创造了机会。在保持兼容性的同时运行敏感数据的操作正变得越来越复杂,匿名数据为统计分析和模型训练提供了安全的原材料,前景一片光明。但实际上真正的匿名数据往往并不如愿。

数据隐私保护机制的范围

数据的隐私保护有一个范围。多年来,专家们研发了一系列集方法、机制和工具为一体的技术。这些技术生成了具有不同的匿名级别和不同再识别风险等级的数据。可以说,其范围涵盖了个人可识别数据乃至真正的匿名数据。

匿名和去识别化在数据隐私保护方面的重要性

数据隐私的范围

左端,有包含直接个人识别码的数据。通过这些元素,可以识别你的姓名、地址或电话号码。另一端,则是GDPR引用的匿名数据。

如你所见,这些数据有一个中间范畴。它处于可识别数据和匿名数据之间,即假名数据和去识别数据。请注意,其界定仍有争议。有些报告认为假名化是去识别化的一部分, 而另一些报告则将其排除在外。

生成这种“中间数据”的技术本身并无问题。它们能有效地将数据最小化。根据用例需求,它们将彼此关联,发挥用处。但切记,它们无法生成真正的匿名数据,它们的机制无法保证阻止再识别,所以将其生成的数据称为“匿名数据”是一种误导。

匿名和“匿名”

假名化和去识别化确实能在某些方面保护数据隐私。但根据GDPR的定义,它们无法生成匿名数据。

假名化技术从数据中删除或替换直接个人标识码,例如,从数据集中删除所有名称和电子邮件,你无法直接从假名数据中识别某人,不过可以间接识别。实际上,剩余数据通常会保留间接识别码,组合这些信息后,就能创建直接识别码,如出生日期,邮编,性别等。

就此而言,假名化在GDPR框架中有一个单独定义:“……以以下方式处理个人数据,即在不使用附加信息的情况下,数据不再可以归因于特定数据主体”。与匿名数据相反,假名数据符合GDPR的要求。

去识别化技术从数据中去除直接和间接的个人身份识别码。理论上,去识别化数据和匿名化数据之间的界限很简单。最新消息表明:有技术可保障永远无法再识别数据。这是一种“疑罪从无”的情况,去识别化数据在未识别之前是匿名的。每当专家设法重新识别那些最初未识别出的数据时,他们都进一步推动了发展。

数据重新识别不断重新定义匿名

上述机制类型对隐私保护没有同等效力,因此如何处理这些数据很重要。公司定期发布或出售他们声称“匿名”的数据,但当他们使用的方法不能保证“匿名”时,就会带来隐患。

众多事件表明,假名化数据这种隐私保护机制仍有缺陷。数据中的间接识别码会带来巨大的再识别风险。随着可用数据量的增长,相互参照数据集的机会也在增加:

1990年,麻省理工学院的研究生从去识别化医疗数据中重新确认了马萨诸塞州州长的身份,她将这些信息与公用人口普查数据相互参照来确定患者身份。

2006年,作为研究计划的一部分,美国在线公司(AOL)共享了去识别化搜索数据,研究人员能够将搜索查询与背后的个人联系起来。

2009年,作为比赛的一部分,网飞(Netflix)发布了一个匿名电影评级数据集,德克萨斯州的研究人员成功重新识别了用户。

同是2009年,研究人员仅利用公开信息就能预测出一个人的社会保险号。

最近研究表明,去识别化数据实际上可以被重新识别。比利时新鲁汶大学和伦敦帝国理工学院的研究人员发现:“使用15个人口统计属性,在任何数据集中,99.98%的美国人都能被正确地重新识别。”

另一项针对匿名手机数据的研究表明:“四个时空点就足以唯一识别95%的个体用户”。

技术日益进步,更多的数据正在被创建,研究人员正在努力划定去识别化数据和匿名数据之间的界限。2017年,研究人员发表论文称:“网络浏览历史只能通过公开数据链接到社交媒体上的个人资料。”

另一个令人担忧的问题是个人资料的泄露,越来越多的个人信息遭到泄露。ForgeRock消费者身份泄露报告预测,2020年的信息泄露数量将超过去年,仅美国,2020年第一季度就有超过16亿的客户记录被泄露。

分开处理的数据集无法重新识别,但与泄露数据结合起来,它会造成更大的威胁。哈佛大学的学生能够利用泄露的数据重新识别去识别化数据。

总之,那些我们所认为的“匿名数据”往往并不是真正的匿名数据。并非所有的数据净化方法都会生成真正的匿名数据。事事都各有优点,但没有一种能提供与匿名同等级别的隐私。随着数据量的不断增长,创建真正的匿名数据也越来越难,公司发布潜在可重新识别的个人数据的风险也在增加。
责编AJX

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • 数据
    +关注

    关注

    8

    文章

    7003

    浏览量

    88944
  • 匿名
    +关注

    关注

    0

    文章

    6

    浏览量

    6782
  • 隐私保护
    +关注

    关注

    0

    文章

    298

    浏览量

    16440
收藏 人收藏

    评论

    相关推荐

    浪涌保护在数据中心的重要性

    中心的设备造成严重损害。 1. 浪涌保护器的定义和作用 浪涌保护器是一种用于限制电气浪涌电压的装置,它能够吸收多余的电压或电流,保护连接的设备不受损害。在数据中心中,浪涌
    的头像 发表于 12-05 10:18 121次阅读

    康谋分享 | 数据隐私匿名:PIPL与GDPR下,如何确保数据合规?(二)

    自动驾驶技术飞速发展,但数据隐私安全成拦路虎?别担心,本文带您深入剖析PIPL与GDPR在数据处理行为及基础合法方面的异同之处,帮助您准确
    的头像 发表于 10-30 09:30 1063次阅读
    康谋分享 | <b class='flag-5'>数据</b><b class='flag-5'>隐私</b>和<b class='flag-5'>匿名</b><b class='flag-5'>化</b>:PIPL与GDPR下,如何确保<b class='flag-5'>数据</b>合规?(二)

    数据分析在数字化中的作用

    重要性 数据分析是指使用统计和逻辑方法对数据进行处理和解释的过程。它涉及到数据的收集、清洗、转换、建模和解释,目的是发现数据中的模式、趋势
    的头像 发表于 10-27 17:35 544次阅读

    变电所继电保护的作用与重要性

    。本文将详细探讨变电所继电保护的功能、常见类型。 1. 继电保护的作用与重要性 迅速隔离故障:在电力系统中,任何形式的故障如不即时处理都可能导致设备的损坏及广泛的供电中断。继电保护装置
    的头像 发表于 10-04 14:24 345次阅读

    康谋分享 | 数据隐私匿名:PIPL与GDPR下,如何确保数据合规?(一)

    自动驾驶技术的快速发展伴随着数据隐私保护的严峻挑战。PIPL和GDPR为自动驾驶数据合规设立了高标准。本篇文章将带大家深入探讨PIPL与GDPR的异同点,期望能够帮助车企更好地理解并应
    的头像 发表于 09-29 10:28 1392次阅读
    康谋分享 | <b class='flag-5'>数据</b><b class='flag-5'>隐私</b>和<b class='flag-5'>匿名</b><b class='flag-5'>化</b>:PIPL与GDPR下,如何确保<b class='flag-5'>数据</b>合规?(一)

    动态代理IP的匿名和透明度,为主要考虑关键!

    动态代理IP的匿名和透明度是用户选择代理服务时需要考虑的关键因素。根据用户的需求和场景,可以选择不同匿名级别和透明度的代理服务来平衡隐私保护
    的头像 发表于 09-20 07:36 272次阅读
    动态代理IP的<b class='flag-5'>匿名</b><b class='flag-5'>性</b>和透明度,为主要考虑关键!

    工业智能网关在数据上云方面的作用、优势以及实施策略

    的管理效率、安全和智能水平。本文将详细探讨工业智能网关在数据上云方面的作用、优势以及实施策略。 工业智能网关概述 工业智能网关是一种用于工业环境中的设备,能够连接多种网络和设备,实
    的头像 发表于 09-03 13:15 268次阅读

    工业物联网网关在数据融合与边缘智能方面的作用

    在当今数字转型的浪潮中,工业物联网作为推动制造业智能、自动的关键力量,正深刻改变着传统工业的生产模式与管理方式。而工业物联网网关,作为连接物理世界与数字世界的桥梁,其重要性日益凸
    的头像 发表于 08-09 17:44 334次阅读

    平衡创新与伦理:AI时代的隐私保护和算法公平

    。为此,开发者应采用多元数据源,并定期进行算法公平的评估和调整。在就业筛选等敏感领域,透明度和公平的结合尤为重要,这需要确保筛选过程
    发表于 07-16 15:07

    蓝牙模块的安全隐私保护

    传输过程中的安全性问题,分析隐私保护方面的挑战和解决方案,并介绍一些提高蓝牙模块安全隐私保护
    的头像 发表于 06-14 16:06 538次阅读

    求助,ADC接地的重要性

    ADC接地的重要性
    发表于 06-04 07:56

    论RISC-V的MCU中UART接口的重要性

    RISC-V的MCU(微控制器单元)中UART(通用异步收发器)接口的重要性主要体现在以下几个方面: 广泛的适用 : UART接口是一种用于连接两个计算机设备的接口,允许一个设备向另一个设备发送
    发表于 05-27 15:52

    集成芯片的重要性和必要

    集成芯片在现代科技和工业中占据着至关重要的地位,其重要性和必要主要体现在以下几个方面
    的头像 发表于 03-18 15:17 1119次阅读

    PLC网关的重要性

    的关键组件。 一、PLC网关简介 PLC网关是一种能够连接PLC设备和物联网系统的硬件设备。它一方面提供与PLC设备的通信接口,另一方面具备联网功能,能够将PLC设备的数据上传到物联网云平台,实现设备的远程监控和管理。 二、PL
    的头像 发表于 01-30 15:50 573次阅读
    PLC网关的<b class='flag-5'>重要性</b>

    一眼看懂鸿蒙OS 应用隐私保护

    随着移动终端及其相关业务(如移动支付、终端云等)的普及,用户隐私保护重要性愈发突出。应用开发者在产品设计阶段就需要考虑保护的用户隐私,提高
    的头像 发表于 01-26 17:04 844次阅读
    一眼看懂鸿蒙OS 应用<b class='flag-5'>隐私</b><b class='flag-5'>保护</b>