使用OpenCV中的universal intrinsics为算法提速 (三)-电子发烧友网

本文作者：于仕琪（OpenCV团队）

OpenCV 4.x中提供了强大的统一向量指令（universal intrinsics），使用这些指令可以方便地为算法提速。所有的计算密集型任务皆可使用这套指令加速，非计算机视觉算法也可。目前OpenCV的代码加速实现基本上都基于这套指令。

前序文章：
使用OpenCV中的universal intrinsics为算法提速 (1)
使用OpenCV中的universal intrinsics为算法提速 (2)

前序文章1介绍了怎么编写C语言代码使用OpenCV中的universal intrinsics来加速；文章2介绍了编译器的选项。

本文使用一个向量点乘的例子，来展示universal intrinsics的的提速。

我们有两个向量vec1和vec2，将对应元素相乘，然后累加起来。计算公式为：

sum=vec1[0]*vec2[0] + vec1[1]*vec2[1]+ ... + vec1[n]*vec2[n].

如果采用纯C语言，两个行向量的点乘实现如下（如代码显示不完整，可以左右滑动；或横屏阅读）

float dotproduct_c_float(Mat vec1, Mat vec2)
{
    float * pV1 = vec1.ptr(0);
    float * pV2 = vec2.ptr(0);
    float sum = 0.0f;
    for (size_t c = 0; c < vec1.cols; c++)
    {
        sum += pV1[c] * pV2[c];            
    }
    return sum;
}

如果采用OpenCV的universal intrinsics，两个行向量的点乘实现如下：

（注意：下面函数仅为展示原理，未考虑数组长度不是16（32或64）字节倍数情况）

float dotproduct_simd_float(Mat vec1, Mat vec2)
{
    float * pV1 = vec1.ptr(0);
    float * pV2 = vec2.ptr(0);
    size_t step = sizeof(v_float32)/sizeof(float);

    //向量元素全部初始化为零
    v_float32 v_sum = vx_setzero_f32();
    for (size_t c = 0; c < vec1.cols; c+=step)
    {
        v_float32 v1 = vx_load(pV1+c);
        v_float32 v2 = vx_load(pV2+c);
        //把乘积累加
        v_sum += v1 * v2; 
    }
    //把向量里的所有元素求和
    float sum = v_reduce_sum(v_sum);

    return sum;
}

例程使用OPEN AI LAB的EAIDK-310开发板，OpenCV4.2.0，CPU型号为是RK3228H，采用ARM四核64位处理器，四核Cortex-A53，最高1.3GHz。

两个例子的编译命令分别如下（注意：皆采用了-O3选项以提速）：

g++ dotproduct-c.cpp -o dotproduct-c -O3 -I/usr/local/include/opencv4 -lopencv_core

g++ dotproduct-simd.cpp -o dotproduct-simd -O3 -I/usr/local/include/opencv4 -lopencv_core

从两个函数的耗时可以看出，采用OpenCV的universal intrinsics后耗时仅为一半，速度翻倍。

两个例程的完整源代码如下。首先是C语言版本的dotproduct-c.cpp：


#include 

using namespace cv;

float dotproduct_c_float(Mat vec1, Mat vec2)
{
    float * pV1 = vec1.ptr(0);
    float * pV2 = vec2.ptr(0);
    float sum = 0.0f;
    for (size_t c = 0; c < vec1.cols; c++)
    {
        sum += pV1[c] * pV2[c];            
    }
    return sum;
}

int main(int argc, char ** argv)
{

    Mat vec1(1, 16*1024*1024, CV_32FC1);
    Mat vec2(1, 16*1024*1024, CV_32FC1);

    vec1.ptr(0)[2]=3.3f;
    vec2.ptr(0)[2]=2.0f;

    double t = 0.0;
    t = (double)getTickCount();

    float sum = dotproduct_c_float(vec1, vec2);

    t = ((double)getTickCount() - t) / (double)getTickFrequency() * 1000; 
    printf("C time = %gms/n", t);
    printf("sum=%g/n", sum);

    return 0;
}

dotproduct-simd.cpp如下：

#include 
#include 
#include 
using namespace cv;

float dotproduct_simd_float(Mat vec1, Mat vec2)
{
    float * pV1 = vec1.ptr(0);
    float * pV2 = vec2.ptr(0);
    size_t step = sizeof(v_float32)/sizeof(float);

    //向量元素全部初始化为零
    v_float32 v_sum = vx_setzero_f32();
    for (size_t c = 0; c < vec1.cols; c+=step)
    {
        v_float32 v1 = vx_load(pV1+c);
        v_float32 v2 = vx_load(pV2+c);
        //把乘积累加
        v_sum += v1 * v2; 
    }
    //把向量里的所有元素求和
    float sum = v_reduce_sum(v_sum);

    return sum;
}

int main(int argc, char ** argv)
{

    Mat vec1(1, 16*1024*1024, CV_32FC1);
    Mat vec2(1, 16*1024*1024, CV_32FC1);

    vec1.ptr(0)[2]=3.3f;
    vec2.ptr(0)[2]=2.0f;

    double t = 0.0;
    t = (double)getTickCount();

    float sum = dotproduct_simd_float(vec1, vec2);

    t = ((double)getTickCount() - t) / (double)getTickFrequency() * 1000; 
    printf("SIMD time = %gms/n", t);

    printf("sum=%g/n", sum);

    return 0;
}

OpenCV中国团队由深圳市人工智能与机器人研究院支持，是一个非营利的开源团队，致力于OpenCV的开发、维护和推广工作。

获取OpenCV最新动态，长按下方二维码关注

本文转载自公众号： OpenCV团队

审核编辑黄昊宇

声明：本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人，不代表电子发烧友网立场。文章及其配图仅供工程师学习之用，如有内容侵权或者其他违规问题，请联系本站处理。举报投诉

人工智能

人工智能

+关注

关注
1791

文章
47274

浏览量
238467
OpenCV

OpenCV

+关注

关注
31

文章
635

浏览量
41347

intrinsics.h出错问题

在iccavr中运行，出现cannot #include file "intrinsics.h", file not found，请问要怎么解决？求原因和方法

发表于 09-20 10:00

【NanoPi NEO试用体验】OpenCV使用篇

“opencv”和“opencv2”两个文件夹，文件夹中为一些头文件，在编写程序的时候需要用到。三、软件编写1.

发表于 12-03 20:56

新手求助，HLS实现opencv算法加速的IP在vivado的使用

我照着xapp1167文档，用HLS实现fast_corners的opencv算法,并生成IP。然后想把这个算法塞到第三季的CH05_AXI_DMA_OV5640_HDMI上，这个de

发表于 01-16 09:22

基于QT+OpenCv的目标跟踪算法实现

视频目标跟踪，本文将首先向大家介绍常用的粒子滤波视频目标跟踪算法，对其原理进行简单的分析，为后续进一步选择和应用算法实现目标跟踪提供基础。一、机器视觉及相关理论及OpenCv 机器视觉

发表于 09-21 10:42

OpenCV中自带组件HighGUI怎么使用？

将介绍OpenCV中自带组件HighGUI的简单使用。当我们在测试算法，查看算法效果的时候，需要用到可视化，动态调参的界面，也可能需要监听鼠标，键盘等的动作，这时，HighGUI就发挥

发表于 11-05 06:54

移植OpenCV-4.3.0的过程

OpenCV-4.3.0是较新的OpenCV版本，最新的版本是OpenCV-4.4.0，由于GitHub太慢总是下载失败，不得已就移植OpenCV-4.3.0这个版本用着先。在

发表于 11-04 08:51

NEON汇编与NEON intrinsics编程的优缺点比较

的硬件资源不同，即使用intrinsics，有时我们也需要两套代码。Ne10中FFT实现就是一个例子：上述代码描述了32位浮点复数FFT算法的基本元——基4蝶形运算。从代码中我们可以看

发表于 03-30 10:46

[译]在RISC-V CPU上运行OpenCV

正在准备推出。尽管不同的CPU架构具有不同的矢量指令，但OpenCV中许多时间关键的内核都使用我们自己的跨平台Wide Universal Intrinsics进行优化——轻量级内联

发表于 06-22 18:54

opencv 白平衡算法

白平衡就是图片中最亮的部分为白色，最暗的部分为黑色，其余部分进行拉伸。下文将详细介绍OpenCV实现的灰度世界算法。

发表于 01-17 09:05 •7817次阅读

OpenCV白平衡算法之灰度世界法_OpenCV实现马赛克和毛玻璃滤镜效果

OpenCV白平衡算法之灰度世界法（消除RGB受光照影响）在用OpenCV对图像进行处理时，利用颜色定位是常常会接触到的方法，但RGB受光照影响比较严重，转换到HSV XYZ等空间也解决不了

发表于 01-17 09:34 •6821次阅读

如何在OpenCV中实现CUDA加速

OpenCV4.x中关于CUDA加速的内容主要有两个部分，第一部分是之前OpenCV支持的图像处理与对象检测传统算法的CUDA加速；第二部分是Ope

发表于 09-05 10:03 •5065次阅读

对比NEON汇编与NEON Intrinsics编程的优缺点

对于初学者来说，Intrinsics比较易学易用。但是对于有汇编经验的开发者来说，可能更熟悉NEON汇编编程，切换到Intrinsics反倒需要有个适应过程。下文列出了实际开发中的一些问题。

发表于 12-14 09:20 •1210次阅读

OpenCV边缘模板匹配算法原理详解

OpenCV中自带的模板匹配算法，完全是像素基本的模板匹配，特别容易受到光照影响，光照稍微有所不同，该方法就会歇菜了！搞得很多OpenCV初学者刚学习到该方法时候很开心，一用该方法马上

发表于 12-07 10:56 •1397次阅读

opencv图像识别有什么算法

OpenCV（Open Source Computer Vision Library）是一个开源的计算机视觉和机器学习软件库，提供了大量的图像处理和计算机视觉相关的算法。以下是一些常见的OpenCV

发表于 07-16 10:40 •1043次阅读

搜索历史

使用OpenCV中的universal intrinsics为算法提速 (三)

评论