尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
CANN/GE性能调优参数文档
性能调优【免费下载链接】geGEGraph Engine是面向昇腾的图编译器和执行器提供了计算图优化、多流并行、内存复用和模型下沉等技术手段加速模型执行效率减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的友好接入能力并同时支持 onnx、pb 等主流模型格式的解析与编译。项目地址: https://gitcode.com/cann/gege.exec.op_precision_mode设置指定算子内部处理时的精度模式支持指定一个算子或多个算子。通过该参数传入自定义的精度模式配置文件op_precision.ini可以为不同的算子设置不同的精度模式。ini文件中按照算子类型、节点名称设置精度模式每一行设置一个算子类型或节点名称的精度模式按节点名称设置精度模式的优先级高于按算子类型。配置文件中支持设置如下精度模式high_precision表示高精度。high_performance表示高性能。enable_float_32_execution算子内部处理时使用FP32数据类型功能该场景下FP32数据类型不会自动转换为HF32数据类型若使用HF32计算精度损失超过预期时可启用该配置指定部分算子内部计算时使用FP32保持精度。该选项仅支持以下产品类型Ascend 950PR/Ascend 950DTAtlas A2 训练系列产品/Atlas A2 推理系列产品Atlas A3 训练系列产品/Atlas A3 推理系列产品enable_hi_float_32_execution算子内部处理时使用HF32数据类型功能启用此配置后FP32数据类型自动转换为HF32数据类型该机制可以降低数据所占空间大小实现性能提升。当前版本该选项暂不支持。support_out_of_bound_index表示对gather、scatter和segment类算子的indices输入进行越界校验校验会降低算子的执行性能。keep_fp16算子内部处理时使用FP16数据类型功能该场景下FP16数据类型不会自动转换为FP32数据类型若使用FP32计算时性能不满足预期同时精度要求不高情况下可以选择keep_fp16模式牺牲精度提升性能不建议使用该低精度模式。super_performance表示超高性能和高性能相比在算法计算公式上进行了优化。具体某个算子支持配置的精度/性能模式取值可以通过CANN软件安装后文件存储路径的opp/built-in/op_impl/ai_core/tbe/impl_mode/all_ops_impl_mode.ini文件查看。op_precision.ini配置样例如下[ByOpType] optype1high_precision optype2high_performance optype3enable_hi_float_32_execution optype4support_out_of_bound_index [ByNodeName] nodename1high_precision nodename2high_performance nodename3enable_hi_float_32_execution nodename4support_out_of_bound_index配置示例{ge.exec.op_precision_mode, $HOME/conf/op_precision.ini};必选/可选可选生效级别全局ge.exec.variable_acc是否开启变量格式优化。参数取值True默认值开启。False关闭。为了提高训练效率在网络执行的变量初始化过程中将变量转换成更适合在AI处理器上运行的数据格式。但在用户特殊要求场景下可以选择关闭该功能开关。使用约束开启时不能同时将ge.AllowMultiGraphParallelCompile配置为1否则会校验报错。配置示例{ge.exec.variable_acc, True};必选/可选可选生效级别全局/session/graphge.graphMaxParallelModelNum图执行模式下同一个图可以在同一个device上被多个模型并行加载执行该参数用于控制允许并行加载的最大模型数目。参数取值1~INT32_MAX默认为8。配置示例{ge.graphMaxParallelModelNum, 8};必选/可选可选生效级别全局/session/graphge.tiling_schedule_optimizeTiling下沉调度优化开关。由于NPU中AI Core内部存储无法完全容纳算子输入输出的所有数据需要每次搬运一部分输入数据进行计算然后搬出再搬运下一部分输入数据进行计算该过程称之为Tiling根据算子的shape等信息来确定数据切分算法相关参数比如每次搬运的块大小以及总共循环多少次的计算程序称之为Tiling实现。由于Tiling实现中完成的均为标量计算AI Core并不擅长故一般在Host侧CPU上执行但是满足下述条件Tiling实现会下沉到Device侧执行模型为静态shape。模型中的算子支持Tiling下沉比如FusedInferAttentionScore、IncreFlashAttention等融合算子。支持Tiling下沉的算子值有依赖需要满足前一个算子的值有device的执行结果如果依赖的值是Const则不需要下沉执行Tiling编译时会完成Tiling。该参数仅支持以下产品Atlas A2 训练系列产品/Atlas A2 推理系列产品Atlas A3 训练系列产品/Atlas A3 推理系列产品Atlas 推理系列产品参数取值0默认值关闭Tiling下沉。1开启Tiling下沉。配置示例{ge.tiling_schedule_optimize, 0};必选/可选可选生效级别全局/session/graph【免费下载链接】geGEGraph Engine是面向昇腾的图编译器和执行器提供了计算图优化、多流并行、内存复用和模型下沉等技术手段加速模型执行效率减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的友好接入能力并同时支持 onnx、pb 等主流模型格式的解析与编译。项目地址: https://gitcode.com/cann/ge创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

Budibase 客户端组件清单(manifest.json)深度解析:builder 与 client 之间的组件契约

Budibase 客户端组件清单(manifest.json)深度解析:builder 与 client 之间的组件契约

Budibase 客户端组件清单(manifest.json)深度解析:builder 与 client 之间的组件契约 【免费下载链接】budibase AI agents, automations and apps that run your operations. Model agnostic. 项目地址: https://gitcode.com/GitHub_Trend…

📅 2026/9/10 20:31:56
西门子博途V19 WinCC RT Advanced上位机开发实战

西门子博途V19 WinCC RT Advanced上位机开发实战

1. 西门子博途V19 Wincc RT Advanced上位机项目概述在工业自动化领域,上位机系统作为人机交互的核心枢纽,承担着数据监控、设备控制和系统管理的关键职能。西门子TIA Portal(博途)平台集成了WinCC RT Advanced这一专业级上位机开发…

📅 2026/9/10 20:31:56
CANN/GE图引擎API:AddGraphWithCopy

CANN/GE图引擎API:AddGraphWithCopy

AddGraphWithCopy 【免费下载链接】ge GE(Graph Engine)是面向昇腾的图编译器和执行器,提供了计算图优化、多流并行、内存复用和模型下沉等技术手段,加速模型执行效率,减少模型内存占用。 GE 提供对 PyTorch、TensorFl…

📅 2026/9/10 20:31:56
MORE NEWS

更多资讯

📰

CANN/GE异步模型执行API

aclmdlExecuteAsyncV2 【免费下载链接】ge GE(Graph Engine)是面向昇腾的图编译器和执行器,提供了计算图优化、多流并行、内存复用和模型下沉等技术手段,加速模型执行效率,减少模型内存占用。 GE 提供对 PyTorch、Tens…

📰

Langfuse 数据删除最佳实践:用轻量删除、ReplacingMergeTree 与 DROP PARTITION 取代 ALTER TABLE DELETE 突变

Langfuse 数据删除最佳实践:用轻量删除、ReplacingMergeTree 与 DROP PARTITION 取代 ALTER TABLE DELETE 突变 【免费下载链接】langfuse 🪢 Open source AI engineering platform: LLM evals, observability, metrics, prompt management, playground,…

📰

软文和新闻稿哪里发布?有什么区别?

软文通常通过知识、场景或观点自然带出品牌;新闻稿更强调事实,需要交代主体、时间、地点和事件。企业常见的问题是把新闻稿写成广告,使用大量口号却缺少实际信息。从稿件写法的角度看,企业最容易出现的误区,是先决定“发哪里”,再回头考虑“为什么发”。实际上,传播的顺序应该相…

📰

如何启用 Impeller 渲染后端并在 Skia 与 Impeller 之间切换来确认回归

如何启用 Impeller 渲染后端并在 Skia 与 Impeller 之间切换来确认回归 【免费下载链接】flutter Flutter makes it easy and fast to build beautiful apps for mobile and beyond 项目地址: https://gitcode.com/GitHub_Trending/flutter41/flutter 如果你在启用 Impe…

📰

宜宾买床上用品哪家店好

宜宾买家纺不用到处找,南岸这家博洋家纺一站式配齐不少宜宾朋友常问:宜宾买床上用品哪家好?宜宾哪里能买到高性价比蚕丝被、鹅绒被?备婚选陪嫁床品、乔迁换新、团购家纺,去哪更省心?答案就在南岸莱茵博洋家…

📰

Python股票量化分析工作流:从数据获取到回测验证

简介:本资源是一套高完成度的毕业设计项目,面向计算机及相关专业本科生、研究生及机器学习初学者,聚焦股票价格预测与量化分析实战场景,提供从数据获取、特征工程、模型训练到结果可视化的完整技术链路。压缩包共2000个文件&#…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬