0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
会员中心
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

内核并发消杀器KCSAN技术分析

Linux阅码场 来源:内核工匠 2023-02-25 09:12 次阅读

一、KCSAN介绍

KCSAN(Kernel Concurrency Sanitizer)是一种动态竞态检测器,它依赖于编译时插装,并使用基于观察点的采样方法来检测竞态,其主要目的是检测数据竞争。

KCSAN是一种检测LKMM(Linux内核内存一致性模型)定义的数据竞争(data race)的工具,同时它也可以控制报告哪种类型的数据竞争。

KCSAN知道LKMM定义的所有标记原子操作,以及LKMM尚未提到的操作,例如原子位掩码操作(bit mask)。

KCSAN扩展了LKMM,例如通过提供data_race()标记,来表示存在数据竞争和缺乏原子可能性。

1.1 LKMM(Linux内核内存一致性模型)

Linux内核内存模型目前在源代码树中的memory-barrier.txt和atomic_ops.txt文件中有非正式的定义。包含以下组成部分:

变量访问(Variable Access)

使用READ_ONCE()、WRITE_ONCE()和ACCESS_ONCE()宏来保护从共享(但非原子)变量的加载和存储;

内存屏障(Memory Barriers)

一类同步屏障指令,是CPU或编译器在对内存随机访问的操作中的一个同步点,使得此点之前的所有读写操作都执行后才可以开始执行此点之后的操作。比如barrier、smp_mb/smp_wmb/smp_rmb等;

锁操作(Locking Operations)

原子操作(Atomic Operations)

控制依赖(Control Dependencies)

Linux内核提供了一个有限的控件依赖的概念,在某些情况下对依赖控件的存储进行优先加载;

RCU宽限期授权关系(Grace-Period Relationships)

允许更新者等待所有已经存在的读侧临界区完成,再回收旧的资源;

C11原子原语 (C11 Atomics)

将原子原语的实现委托给编译器;如果多个体系结构采用这种方法,将减少体系结构特定代码的数量。

1.2 数据竞争

为什么要关心数据竞争?

C语言的发展独立于并发性。如果给定的变量或访问没有任何特别之处,则变量只会在响应当前线程的存储时发生变化。

C语言和编译器的进化对并发性不敏感

优化编译器正变得越来越丰富

因此,编译器可以并且使用各种优化,包括负载融合、代码重新排序和许多其他可能导致并发算法故障的优化。

读取拆分(单次访问多次读取)

存储拆分(单次访问多次写入)读取融合(编译器直接使用上一次对这个变量的load结果,而不是真正再去load一次)

存储融合(编译器优化写入变量流程,不再真实写入)

代码重排(把一些类似的计算归在一起,节省占用的寄存器,改善现代超标量微处理器里面各个运算单元的利用效率)

虚拟读取(编译器优化会导致多次读取,导致后续加载异常)

虚拟存储(编译器优化会导致多次存储,导致后续存储异常)

.....

因此需要告诉编译器并发代码,Linux提供内存一致性模型,也提供检查方法解决此类问题。

1.2.1 访问方式

普通访问

标记访问

5917632a-b463-11ed-bfe3-dac502259ad0.png

1.2.2 同步冲突访问的检测条件

在访问同一个地方并且至少有一个是写操作

至少有一个是普通访问(比如x+42)

以下线程打钩的是标准做法;打叉的是可能存在数据竞争的情况。

592bf27c-b463-11ed-bfe3-dac502259ad0.png

1.2.3 哪些不属于数据竞争

例如:使用不对称的锁机制,并且使用READ_ONCE/WRITE_ONCE标记访问。

5958056a-b463-11ed-bfe3-dac502259ad0.png

二、依赖与配置方案

2.1 版本支持

KCSAN支持GCC/CLANG编译,需要GCC版本11,CLANG 12以上版本。

x86_64: >=5.8 ARM64: >=5.17

597262a2-b463-11ed-bfe3-dac502259ad0.png

599f2a3a-b463-11ed-bfe3-dac502259ad0.png

2.2 KCSAN工具链支持

cc-option,-fsanitize=thread --param tsan-distinguish-volatile=1

59ae3822-b463-11ed-bfe3-dac502259ad0.png

2.3 配置选项支持

59d02af4-b463-11ed-bfe3-dac502259ad0.png

三、工作原理与触发条件

3.1 使用方式

检查未标记读取是否写入竞争,会持续扫描内核的主要分支,在访问的内存位置上设置观察点,挑出导致数据争用的数据,并将其报告给内核日志。

●用“软观察点”查找竞争

〇设置观察点和失速通道;

〇如果监测点已经存在,那么竞争检查将照常进行;

〇如果值改变了--> 竞争;

〇失速通道随机延迟,增加观察竞争状态的机会;

默认值:任务[1,80]us,中断[1,20]us。

●为所有检测内存访问设置观察点

〇 注释标记访问,仅用于检查非标记访问是否存在观察点;

KCSAN从不在标记的访问上设置观察点;

如果对并发访问的变量的所有访问都正确地标记了,KCSAN将永远不会触发观察点,因此永远不会报告访问。

●采样: 周期性建立观察点

〇默认值:平均2000次访问。

3.2 KCSAN软观测点

基于地址页索引

〇可以溢出到相邻槽。

〇使用索引确保报告元数据给匹配的生产者/消费者。

具有灵活、可缩放的特点,以数组的形式存放。

59e492a0-b463-11ed-bfe3-dac502259ad0.png

代码片段如下:

入口函数check_access,在check_access数据地址、长度、类型;在check_access函数执行find_watchpoint判断。需要检测的ptr已经插桩编译。

5a0b8e8c-b463-11ed-bfe3-dac502259ad0.png

3.3 KCSAN 运行流程

进入check_access函数,格式描述包含数据指针、长度、读写类型;

确认是否需要观测,需要满足至少一个写操作且为普通访问;

如果判定需要观测,加入观察列表;

延时一段时长,查看是否有访问、变更数据等情况;如果有,则生产数据表,并打印数据到控制台;如果没有则退出;

在步骤3,如果未发现合适的观测点,则该数据运行流程退出

5a1fad18-b463-11ed-bfe3-dac502259ad0.png

3.4 ASSERT检测机制

KCSAN提供有一种断言检测机制,检查在数据竞争模型以外的情况下提供竞争检测;

5a442b5c-b463-11ed-bfe3-dac502259ad0.png5a5947e4-b463-11ed-bfe3-dac502259ad0.png

3.4.1 ASSERT集合

5a671eaa-b463-11ed-bfe3-dac502259ad0.png

3.5 KCSAN特点

5a792366-b463-11ed-bfe3-dac502259ad0.png

四、测试套件

4.1 KUNIT测试模型

KCSAN提供KUNIT的支持

创建多个access_thread线程用于测试用例函数的调用接口

挂接console跟踪点,该跟踪点监控串口输出数据;如果有数据竞争报错,可以捕获并判断;

启动测试用例接口函数,实现测试函数的挂接并提供超时判定(缺省执行500毫秒);

在执行超时以后,判断输出是否与预想一致;并给出判断结果。

5a977a00-b463-11ed-bfe3-dac502259ad0.png

4.2 测试条件

1. 配置CONFIG_KCSAN_KUNIT_TEST=y使能KUNIT

2. KCSAN功能正常开启

4.3 测试环境

QEMU Linux 6.11 core 4 GCC11

测试覆盖:

1. 不同条件下的数据竞争data_race

5ab9ae04-b463-11ed-bfe3-dac502259ad0.png

2.断言函数数据竞争assert_exclusive_x

5ad080c0-b463-11ed-bfe3-dac502259ad0.png

3. barrier/lock判定

5ae3eeda-b463-11ed-bfe3-dac502259ad0.png

五、过程与案例分析

5.1 KCSAN启动过程

1. 在完成KCSAN配置后,系统启动时有“kcsan:enable early”打印:

5b0313aa-b463-11ed-bfe3-dac502259ad0.png

2.后台会实时进行观测点的监控与比对,如果比中会有”BUG:KCSAN”控制台打印来描述数据竞争的信息;这些信息包括调用函数、数据竞争地址、CPU号、进程号等;可在不同的测试场景进行压力测试;

5b11b540-b463-11ed-bfe3-dac502259ad0.png

3.在运行过程中,查看“KCSAN kernel debug”节点查看当前的状态,这些状态信息包括观测点、数据竞争、ASSERT报错等一系列信息;

5b223af0-b463-11ed-bfe3-dac502259ad0.png

5.2 案例一

描述:IGMP协议timer超时与事件函数在读写mr_ifc_count变量的数据竞争

net: igmp: fix data-race in igmp_ifc_timer_expire()

5b4449d8-b463-11ed-bfe3-dac502259ad0.png

解决办法:

1. igmp_ifc_event/ igmp_ifc_timer_expire函数在读写mr_ifc_count变量存在数据竞争,需要使用LLKM 访问保护;

2. 修改调用mr_ifc_count点,使用READ_ONCE/WRITE_ONCE保证编译器的一致性;

3. mr_ifc_count和in_dev->mr_ifc_count值不等时启动重传机制;

5b5f548a-b463-11ed-bfe3-dac502259ad0.png

5.3 案例二

描述:在taskstats_exit()中分配和测试任务统计时,会有一个竞争在读写sig->stats

When assiging and testing taskstats in taskstats_exit() there's a race when writing and reading sig->stats

5b6e8482-b463-11ed-bfe3-dac502259ad0.png

解决办法:

1. 结构体成员sig->stats存在数据竞争,需要使用LLKM访问保护;

2. smp_load_acquire/smp_store_release函数解决CPU数据同步和编译器同步问题,适用于同一个函数内部的数据竞争;

5b854ef6-b463-11ed-bfe3-dac502259ad0.png

六、总结

本文从工作原理、运行流程、测试方式等多个方面介绍了KCSAN,旨在让读者能够对KCSAN运行有一个直观的认识,利用KCSAN在产品中解决一些数据竞争问题;数据竞争是一个复杂问题,用KCSAN能帮助大家快速找到数据竞争问题,进而寻找方法解决或规避,本文更多传递是一种发现和解决此类问题的思路。

消杀器技术在不断地迭代和更新,也让大家多一份探寻世界、改变世界的机会;借此机会,站在巨人的肩膀上,让大家看得更远、走得更远,愿大家都有一个美好的明天。






审核编辑:刘清

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • C语言
    +关注

    关注

    180

    文章

    7606

    浏览量

    137064
  • 编译器
    +关注

    关注

    1

    文章

    1635

    浏览量

    49169
  • LINUX内核
    +关注

    关注

    1

    文章

    316

    浏览量

    21671
  • rcu
    rcu
    +关注

    关注

    0

    文章

    21

    浏览量

    5455

原文标题:内核并发消杀器(KCSAN)技术分析

文章出处:【微信号:LinuxDev,微信公众号:Linux阅码场】欢迎添加关注!文章转载请注明出处。

收藏 人收藏

    评论

    相关推荐

    零传播、零扩散,EHIGH恒高UWB技术疫情防控系统!

    。UWB技术如何做好密集区域预防措施?人员密集区热力图分析:对于人员较为密集、流动性大的区域进行重点以及加强通风换气和垃圾处理,最大限度切断一切飞沫传播及接触式传播的可能。 UWB
    发表于 02-21 19:36

    Linux环境并发服务设计技术研究

    讲述并发服务设计的主要技术,包括多进程服务、多线程服务和I/ O 复用服务,同时对以上服
    发表于 04-24 10:02 16次下载

    内核并发通信的研究

    提出了一种内核并发消息通信机制。该机制采用对象传送协议和动态线程池技术,并通过会话控制完成数据的收发过程,将线程池设计为二级阻塞队列来暂缓线程的撤销过程,
    发表于 05-26 21:08 6次下载

    雷达回程误差分析隙设计

    本文提出一种采用电技术减小回程误差的方法。通过对回程误差进行分析,从结构和电路两方面分别介绍减小回程误差的措施,并结合船载雷达设备重点对电
    发表于 04-28 10:46 38次下载
    雷达回程误差<b class='flag-5'>分析</b>及<b class='flag-5'>消</b>隙设计

    并发程序动态分析基础技术综述

    并发错误难触发、难调试、难检测.为应对这一挑战,已有动态程序分析技术通过观测或控制并发程序执 行实现其质量保障.由于并发程序不确定性主要来自
    发表于 12-30 17:37 0次下载

    音圈马达无人机助力防疫工作

    音圈马达无人机助力防疫工作。近段时间,由于防控需要,很多村庄都是实施人员管控和工作。在延庆区旧县镇古城村,一台黑色的“大家伙”蓄势待飞,它足有2立方米大小,飞行平台上装载着30
    发表于 08-19 14:28 357次阅读

    类产品介绍 冰箱杀菌除味设计说明

    在2020年新冠肺炎疫情影响下,全国医疗机构及其他公共场所需大范围、长时间、高频次消毒,产品需求量骤升以及群众的居家消毒意识提高,催生了对消产品的巨大需求。
    的头像 发表于 11-29 14:54 2274次阅读
    <b class='flag-5'>消</b><b class='flag-5'>杀</b>类产品介绍 冰箱杀菌除味<b class='flag-5'>器</b>设计说明

    技术技术的区别

    ,又叫免杀毒技术,是反病毒,反间谍的对立面,是一种能使病毒或木马免于被杀毒软件查杀的软件。
    的头像 发表于 07-08 10:49 1615次阅读

    技术层面分析微机的工作原理

    技术层面分析微机的工作原理,由于电力系统容量的扩大,高压电缆使用增加,同步电机使用,电力变压等感性负载增加。使系统的容性负载和感性
    的头像 发表于 11-15 10:20 1032次阅读

    鲸启智能雾化杀机器人,助力防疫工作

    国庆后,国内疫情形势严峻,疫情防控工作更显得尤为重要,很多企业、公共场所把目光聚焦在了智能机器人身上,中国智能杀机器人的应用场景也更加多样化。 比起安排工作人员进行,使用消毒机器人会更加
    的头像 发表于 05-11 11:37 434次阅读

    广和通5G模组助推5G数字小坦克“霸气出街”、科技抗疫

    、智能小坦克、AR眼镜和5G边缘计算盒相结合,利用信息“云边端”三步处理,实现智能化、安全化、可控化的数字化。​5G云防疫小坦克展现“神威”得益于5G低时延大宽带的特性,5G
    的头像 发表于 03-25 16:58 480次阅读
    广和通5G模组助推5G数字<b class='flag-5'>消</b><b class='flag-5'>杀</b>小坦克“霸气出街”、科技抗疫

    病毒怎样才能更全面?移动消毒站组网解决方案

    人群中的病毒做工作。然而,对大范围区域进行全面杀毒工作,耗时大,耗资大,自然是不能成为常态,在这种情况下,基于工业级路由,快速搭建无线移动消毒站则显得十分重
    的头像 发表于 09-19 10:07 452次阅读
    病毒<b class='flag-5'>消</b><b class='flag-5'>杀</b>怎样才能更全面?移动消毒站组网解决方案

    微机谐的使用条件

    的使用条件。 首先,我们来了解一下什么是微机谐。微机谐是一种基于数字信号处理的电力谐波处理技术,主要通过实时监测和分析电力信号的频谱,识别并分离出谐波成分,然后通过滤波
    的头像 发表于 07-25 09:11 542次阅读

    类产品中的冰箱杀菌除味设计

    在2020年新冠肺炎疫情影响下,全国医疗机构及其他公共场所需大范围、长时间、高频次消毒,产品需求量骤升以及群众的居家消毒意识提高,催生了对消产品的巨大需求。
    的头像 发表于 11-29 17:03 508次阅读
    <b class='flag-5'>消</b><b class='flag-5'>杀</b>类产品中的冰箱杀菌除味<b class='flag-5'>器</b>设计

    广明源的SafeGlo感控解决方案市场潜力巨大

    8月29日,2023深圳国际医用消毒及感控设备展览会在深圳国际会展中心正式拉开帷幕。在这场为期3天的消毒领域盛会中,广明源将全面展示光科技在感控领域中的创新应用,共同促进全球消毒产业稳步发展
    的头像 发表于 08-30 09:04 752次阅读