ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

CANN/GE算子编译接口

CANN/GE算子编译接口 aclopCompile【免费下载链接】geGEGraph Engine是面向昇腾的图编译器和执行器提供了计算图优化、多流并行、内存复用和模型下沉等技术手段加速模型执行效率减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的友好接入能力并同时支持 onnx、pb 等主流模型格式的解析与编译。项目地址: https://gitcode.com/cann/ge产品支持情况Ascend 950PR/Ascend 950DT不支持Atlas A3 训练系列产品/Atlas A3 推理系列产品支持Atlas A2 训练系列产品/Atlas A2 推理系列产品支持Atlas 200I/500 A2 推理产品支持Atlas 推理系列产品支持Atlas 训练系列产品支持IPV350不支持功能说明编译指定算子。在编译算子前可以调用aclSetCompileopt接口设置编译选项。每个算子的输入、输出组织不同在调用接口时严格按照算子输入、输出参数来组织算子用户在调用aclopCompile时接口会根据optype、输入tensor的描述、输出tensor的描述、attr等信息查找对应的任务再编译算子。函数原型aclError aclopCompile(const char *opType, int numInputs, const aclTensorDesc *const inputDesc[], int numOutputs, const aclTensorDesc *const outputDesc[], const aclopAttr *attr, aclopEngineType engineType, aclopCompileType compileFlag, const char *opPath)参数说明参数名输入/输出说明opType输入算子类型名称的指针。numInputs输入算子输入tensor的数量。inputDesc输入算子输入tensor的描述的指针数组。类型定义请参见aclTensorDesc。需提前调用aclCreateTensorDesc接口创建aclTensorDesc类型。inputDesc数组中的元素个数必须与numInputs参数值保持一致。numOutputs输入算子输出tensor的数量。outputDesc输入算子输出tensor的描述的指针数组。类型定义请参见aclTensorDesc。需提前调用aclCreateTensorDesc接口创建aclTensorDesc类型。outputDesc数组中的元素个数必须与numOutputs参数值保持一致。attr输入算子属性的指针。类型定义请参见aclopAttr。需提前调用aclopCreateAttr接口创建aclopAttr类型。engineType输入算子执行引擎。类型定义请参见aclopEngineType。compileFlag输入算子编译标识。类型定义请参见aclopCompileType。opPath输入算子实现文件*.py的路径的指针不包含文件名。预留参数当前仅支持设置为nullptr。返回值说明返回0表示成功返回其他值表示失败请参见aclError。约束说明编译动态Shape的算子时如果Shape具体值不明确但Shape范围明确则在调用aclCreateTensorDesc接口创建aclTensorDesc类型时需要将dims数组的表示动态维度的元素值设置为-1再调用aclSetTensorShapeRange接口设置tensor的各个维度的取值范围如果Shape具体值以及Shape范围都不明确该场景预留则在调用aclCreateTensorDesc接口创建aclTensorDesc类型时需要将dims数组的值设置为-2例如int64_t dims[] {-2}。编译有可选输入的算子时如果可选输入不使用则需调用aclCreateTensorDesc(ACL_DT_UNDEFINED, 0, nullptr, ACL_FORMAT_UNDEFINED)接口创建aclTensorDesc类型的数据将数据类型设置为ACL_DT_UNDEFINED将Format设置为ACL_FORMAT_UNDEFINED将Shape信息设置为nullptr。编译有constant输入的算子时需要先调用aclSetTensorConst接口设置constant输入。调用aclopCompile接口、aclopExecuteV2接口前设置的constant输入数据必须保持一致。【免费下载链接】geGEGraph Engine是面向昇腾的图编译器和执行器提供了计算图优化、多流并行、内存复用和模型下沉等技术手段加速模型执行效率减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的友好接入能力并同时支持 onnx、pb 等主流模型格式的解析与编译。项目地址: https://gitcode.com/cann/ge创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表