ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

PyPTO SIM 模式调试指南:正确理解仿真执行的边界、限制与 NPU 验证策略

PyPTO SIM 模式调试指南:正确理解仿真执行的边界、限制与 NPU 验证策略 PyPTO SIM 模式调试指南正确理解仿真执行的边界、限制与 NPU 验证策略【免费下载链接】pypto-gymPyPTO-Gym 是基于 PyPTO 编程框架构建的算子与模型样例仓库项目地址: https://gitcode.com/cann/pypto-gymSIMSimulation模式是 PyPTO 编程框架提供的一种内核仿真执行方式开发者无需真实 NPU 硬件即可快速验证内核的编译与基本执行流程。然而在 PyPTO-Gym 仓库的算子开发实践中尤其是 GDR、softmax、attention 等真实算子团队反复确认了一个关键事实SIM 模式只能用于结构验证不能用于精度验证——动态 shape 处理、Cube tile 配置与内存操作是它的三个天然短板会造成 10^20 量级的“垃圾数值”而同一份内核在真实 NPU 上可能完全正常。本文以 sim-mode.md 为核心骨架结合 pypto-general-debug 技能包中 DEBUG_GUIDEBOOK.md、npu-launch-failures.md、checklist-and-api.md 等参考文档以及 tests 目录下的真实测试用例系统讲解 SIM 模式的三大已知缺陷、对应报错信息的排查方法并给出“SIM 验结构 NPU 验精度”的正确验证工作流。读完本文你将能够准确定位 SIM 模式下的典型失败场景判断哪些问题属于仿真器固有局限而应直接转向 NPU 验证并掌握在真实硬件上完成精度验证的标准代码骨架。一、SIM 模式在 PyPTO 调试体系中的定位1.1 调试路由先查指南再读叶子文档在 PyPTO-Gym 仓库中pypto-general-debug 是整个调试技能包的路由器它把全部调试经验按主题拆分为references/下的多个叶子文件调试时应先打开 DEBUG_GUIDEBOOK.md依据其“situation → leaf file”快速映射表选择唯一匹配的叶子文档而不是一次性读取所有参考文件。SIM 模式相关问题在路由表中的位置非常明确SectionTopicFile§9.6SIM mode limitationssim-mode.md在“situation → leaf file”映射中SIM mode produces garbage / fails but NPU works这一症状同样指向 sim-mode.md。这意味着当你在仿真运行中发现数值异常或报错时第一反应不应是怀疑内核算法本身而应先意识到这可能是 SIM 模式的已知局限。1.2 SIM 模式的职责边界结构验证而非精度验证综合 sim-mode.md 与 npu-launch-failures.md 中的经验记录可以得出 SIM 模式的职责定位能做验证内核能否编译通过、能否无崩溃地完成基本执行structural validation——即“kernel compiles, no crashes”不能做精度验证precision validation。SIM 模式下view/assemble等内存操作可能产生不正确的数据寻址导致输出与真实结果完全无关。这一结论在 checklist-and-api.md 的调试检查表§9.9与测试策略§9.10中被进一步固化§9.9 检查表SIM mode → Accept limitations, test on NPU§9.10 测试策略① 语法检查python -m py_compile module.py→ ② 与 PyTorch 参考实现做 golden 对比 → ③ SIM 模式只做基本执行 → ④ NPU 模式做真正的精度验证。二、已知问题一SIM 模式产生垃圾数值这是 SIM 模式最经典、也最容易被误判的现象。2.1 症状与根因症状SIM 模式下误差达到 10^20 以上量级10^20数值完全不可信但同一份内核放到真实 NPU 上可能工作正常。根因SIM 模式在以下三个方面存在根本性局限动态 shape 处理dynamic shape handling能力不足Cube tile 配置cube tile configuration无法被仿真器正确还原内存操作memory operations如view/assemble在仿真中的寻址可能与硬件实际行为不一致。2.2 解决方案三步走参考 sim-mode.md 给出的解决方案对 golden reference 验证数学正确性先把算法的数学步骤在 PyTorch 参考实现中跑通确保公式本身无误在真实 NPU 硬件上测试把内核切到 NPU 运行模式用真实硬件结果作为最终裁决不要依赖 SIM 模式做精度验证仿真数值仅供流程调试参考。2.3 正确的运行模式配置在 PyPTO 中运行模式通过 JIT 装饰器的runtime_options指定pypto.frontend.jit(runtime_options{run_mode: pypto.RunMode.NPU}) def kernel(...): ...pypto.RunMode枚举提供两个关键值见 checklist-and-api.md §9.12pypto.RunMode.NPU在真实 NPU 硬件上运行是精度验证的唯一有效模式pypto.RunMode.SIM仿真模式运行功能受限仅适合结构验证。需要特别提醒的是decorator 绑定时机问题参考 examples-debug.md §8.1 的经验pypto.frontend.jit(runtime_options{run_mode: global_run_mode})中的global_run_mode在模块导入时就被绑定。因此若想用命令行参数如python3 script.py --run_mode sim切换模式必须使用模块级的_peek_run_mode_from_argv惯用法提前解析参数而不能只在main()内部解析——否则装饰器仍会绑定到 import 时的默认模式出现“--run_mode sim被忽略”的假象。三、已知问题二operand1 dim[0] -13.1 症状与原因症状在 SIM 模式使用动态 shape时维度信息变成-1operand1 dim[0] -1。原因仿真器无法为动态符号化维度推导出具体数值导致形状解析失败。这条报错在 checklist-and-api.md §9.11 的错误速查表中被归入 SIM 模式动态 shape 问题operand1 dim[0] -1→ SIM mode dynamic shape issue → Test on NPU。3.2 解决方案优先方案SIM 模式测试时使用静态 shapestatic shapes让所有维度在编译期可确定备选方案如果算子必须处理动态 shape则接受 SIM 模式对该场景的限制直接转向 NPU 验证。值得注意的是动态 shape 本身是一个更大的调试主题在 DEBUG_GUIDEBOOK.md 的路由表中§9.2 “Dynamic shapes,pypto.loop, symbolic indexing, view dimension matching” 指向 dynamic-shapes.md。如果 SIM 报错背后是符号维度未能在 tile 配置中具体化Not concrete value/Cannot convert symbols to int应当先按该文档排查动态 shape 的写法而不是把问题全部归咎于仿真器。四、已知问题三Invalid tile values: kL00, kL1a0...4.1 症状与原因症状SIM 模式下 Cube 方向的 tile 校验失败报错形如Invalid tile values: kL00, kL1a0...tile 关键维度为 0。原因这是 SIM 模式的仿真局限——仿真器无法正确解析/校验 Cube tile 配置。4.2 解决方案与问题二类似这类错误不代表内核本身有问题内核在真实 NPU 硬件上可能可以正常工作。正确做法是在真实 NPU 上运行同一份内核确认是否复现若 NPU 正常则确认该报错为 SIM 局限直接采用 NPU 验证流程。需要区分的是tile 配置问题并非全部都是 SIM 局限。在 DEBUG_GUIDEBOOK.md 路由表中tile-shape 类失败L0A/L0B/L0C/L1 size exceeded、tile 未对齐、tile shape not set、enable_split_k、lint OL48 标记set_cube_tile_shapes误用应路由到 tile-shapes.md 排查而“仿真时校验失败、NPU 正常”这一特定模式才属于 SIM 局限。判断的关键在于是否换到 NPU 后问题消失。五、跨文档印证同一教训在已交付算子中的复现SIM 模式的这一教训并非孤例。在 npu-launch-failures.md 中专门有一条针对已交付算子的记录Issue: SIM mode shows precision failure but NPU works fineRoot Cause:SIM mode cannot validate precision — only structure. SIM mode memory operations (view/assemble) may produce incorrect data addressing.Fix:Use SIM mode only for structural validation (kernel compiles, no crashes). Always validate precision on real NPU hardware. Seesim-mode.md.该文档的验证范围覆盖了scale_add、softmax、relu、gelu、sigmoidfwdbwd、rmsnorm、matmul2D GEMM首个 cube-pipe以及attention非因果 SDPA首个混合 cubevecT 验证到 4096等已交付算子说明“SIM 精度失败但 NPU 正常”是跨算子反复出现、已经用真机验证过的普遍规律而非某个算子的偶发问题。六、正确的验证工作流SIM 验结构NPU 验精度综合 sim-mode.md、npu-launch-failures.md 与 checklist-and-api.md推荐的验证流程如下语法与静态检查python -m py_compile module.py快速排除语法错误§9.10 第一步数学正确性验证与 PyTorch golden reference 对比确认算法数学步骤无误SIM 结构验证切到pypto.RunMode.SIM确认内核能编译、能无崩溃执行——只看结构不看数值NPU 精度验证切到pypto.RunMode.NPU在真实硬件上对比 golden这是精度结论的唯一来源。在真实算子测试中这一流程的具体形态可以参考 tests/ops/arctic/test_sum_lstm.py 的测试骨架该用例同时实现了sum_lstm_goldenPyTorch golden reference与精度对比逻辑并通过 CLI 参数--run_mode可选npu/sim切换运行模式。值得注意的是其设计细节parser.add_argument(--run_mode, typestr, defaultnpu, choices[npu, sim]) ... if args.run_mode npu: import torch_npu # noqa: F401 torch.npu.set_device(device_id)仅 NPU 模式才导入torch_npuSIM 模式不需要 NPU 设备驱动这样可以保持仿真环境纯净TILE_FWK_DEVICE_ID环境变量指定设备device_id int(os.environ.get(TILE_FWK_DEVICE_ID, 0))与 npu-launch-failures.md 中“用TILE_FWK_DEVICE_ID指定 NPU 设备、在模块加载期调用torch.npu.set_device(device_id)”的建议一致性能测试仅在 NPU 模式下执行if args.run_mode npu: run_performance_test(...)仿真模式直接跳过——再次印证 SIM 模式只承担结构验证职责精度对比使用assert_allclose且给定合理容差rtol0.001, atol5e-3。对照 npu-launch-failures.md 中“真实 NPU 上 softmax 的 diff 约为 5.96e-08”的记录真实的 NPU 精度误差是小且非零的若你在 SIM 模式下看到 10^20 量级的误差、切到 NPU 后变成 10^-7 量级这正是仿真局限而非内核缺陷的典型信号。七、NPU 精度验证的标准内核骨架当 SIM 结构验证通过后如何在 NPU 上完成精度验证npu-launch-failures.md 给出了一个经过验证的最小内核模式simple vector ops 场景配合 pypto-op-develop 的模板约束可以组成完整的可运行骨架import os, torch, pypto, torch_npu DEVICE_ID int(os.environ.get(TILE_FWK_DEVICE_ID, 0)) torch.npu.set_device(DEVICE_ID) DEVICE fnpu:{DEVICE_ID} def _impl(inp, out, B_t, T_t, H_t, K_t): pypto.set_vec_tile_shapes(B_t, T_t, H_t, K_t) for _ in pypto.loop(1): # required by layout check CI out[:] pypto.some_op(inp, ...) def jit_entry( inp: pypto.Tensor([], pypto.DT_FP32), out: pypto.Tensor([], pypto.DT_FP32), B_t: int, T_t: int, H_t: int, K_t: int, ): # NO - None _impl(inp, out, B_t, T_t, H_t, K_t) kernel pypto.frontend.jit( runtime_options{run_mode: pypto.RunMode.NPU} )(jit_entry) def host_wrapper(x): B, T, H, K x.shape x_npu x.to(DEVICE) y_npu torch.empty_like(x_npu) kernel(x_npu, y_npu, 1, min(T,16), min(H,4), min(K,16)) return y_npu.cpu()这段骨架同时体现了多条与 SIM/NPU 模式相关的关键纪律runtime_options{run_mode: pypto.RunMode.NPU}是简单 vector 算子的唯一 JIT 选项不要在简单算子中混入stitch_function_*等选项它们会破坏 stream context导致编译通过但 launch 失败Errcode: FFFFFF! launch aicpu failed: 107003tile 值必须整除对应维度如pypto.set_vec_tile_shapes(8, 8, 8, 8)在 B1 或 H4 时会失败骨架中min(T,16)、min(H,4)、min(K,16)就是为了保证 tile 与维度整除JIT 函数不要写返回注解- None会触发ValueError: Return annotation is not allowed不要在 JIT 内解构 shapeB, T, H, K input_tensor.shape会因 shape proxy 不可迭代而报TypeError: Tensor is not iterableshape 应在 host 侧解析并以具体int参数传入不要用 try/except 兜底 golden如果 JIT 失败被 try/except 吞掉并回退到 golden会出现“max_diff0.0但内核根本没跑”的假通过golden 对比 golden。应移除所有 golden 回退路径让 JIT 失败显式崩溃。八、常见错误速查下表整理自 checklist-and-api.md §9.11其中两条 SIM 相关错误已在前文详解其余列在此处便于速查ErrorCauseSolutionNon-tensor parameter x must not be a torch.TensorString annotationsRemovefrom __future__ import annotationsNot concrete valueSymbolic in tile shapesUse concrete constantsCannot convert symbols to intSymbolic in loop/indexingUsepypto.viewwith offsetsValueError: Invalid value typeSymbolic inpypto.loopPass loop bounds as concrete int parametersErrcode: F21004 tile shape not setMissingset_vec_tile_shapesbefore opsCallset_vec_tile_shapesfirstErrcode: F21004 Their size actually are X and Ypypto.viewshape/offsets mismatchEnsurelen(shape) len(offsets)operand1 dim[0] -1SIM mode dynamic shape issueTest on NPUInvalid tile valuesSIM mode tiling issueTest on NPU九、进一步阅读sim-mode.mdSIM 模式局限的权威汇总本文主体npu-launch-failures.mdNPU 启动失败与“SIM 精度失败但 NPU 正常”的已交付算子实证DEBUG_GUIDEBOOK.md调试路由总索引按症状定位叶子文档checklist-and-api.md调试检查表、测试策略与常见错误速查examples-debug.md示例内核的调试实践含--run_mode sim与_peek_run_mode_from_argv惯用法tile-shapes.mdtile 配置失败的专项排查与 SIM 局限相区分pypto-op-develop/templates/impl_template.py.tmpl算子实现模板含 Layer G–K 分层与 lint 约束tests/ops/arctic/test_sum_lstm.pySIM/NPU 双模式测试骨架的完整参考用例。【免费下载链接】pypto-gymPyPTO-Gym 是基于 PyPTO 编程框架构建的算子与模型样例仓库项目地址: https://gitcode.com/cann/pypto-gym创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表