2. 概述

本文档面向已完成模型部署、需要进一步验证模型精度和优化推理性能的用户,提供模型推理部署后的精度评估、性能评估、问题定位和调优方法。通过本文档,用户可了解如何根据模型类型选择合适的评估工具,如何判断精度或性能问题来源,以及如何通过量化策略、编译参数、计算图优化、主机侧优化和系统配置优化等方式完成调优闭环。

在阅读本文档前,建议用户已具备以下基础:

  • 已完成后摩设备硬件安装、驱动安装、固件升级和软件环境部署。

  • 已了解模型量化、模型编译和模型推理的基本流程。

  • 已能够使用模型转换与评估工具、模型推理性能评测工具或 LLM 推理性能评测工具完成基础评测。

  • 已具备基本的模型输入输出、预处理、后处理、batch、上下文长度、Prefill、Decode 等概念理解。

2.1. 文档目标

本文档旨在帮助用户完成以下任务:

  • 建立模型部署后的精度和性能评估流程。

  • 根据模型类型选择合适的精度评估工具和性能评测工具。

  • 判断模型精度问题来源,包括量化阶段、编译阶段、推理处理阶段和评测阶段。

  • 判断模型性能瓶颈类型,包括主机/数据传输性能瓶颈、模型计算性能瓶颈、系统资源问题和测试配置问题。

  • 针对不同瓶颈选择对应优化方法,例如量化策略优化、编译参数调优、计算图优化、输入输出优化、数据预拷贝、buffer 复用和系统资源优化。

  • 在优化后重新执行精度评估和性能评测,确认调优效果并避免引入精度回退或性能回退。

本文档重点说明模型部署后的精度问题定位、性能瓶颈分析和调优闭环,帮助用户在模型已能正常运行的基础上,进一步提升推理结果一致性、运行效率和端到端性能。

2.2. 目标读者

本文档适用于以下用户:

  • 模型部署工程师:需要将模型部署到后摩M50设备,并验证模型精度和性能。

  • 算法工程师:需要分析量化、编译或推理处理对模型精度的影响。

  • 性能优化工程师:需要定位推理链路中的性能瓶颈,并选择合适的优化策略。

  • 应用开发工程师:需要优化业务端到端推理体验,例如降低首token延迟、提升生成速度或提高端到端吞吐。

  • 技术支持工程师:需要根据用户提供的评测结果、日志、模型文件和配置,进一步分析复杂模型或特殊场景问题。

2.3. 适用场景

本文档适用于以下场景:

  • 模型已完成量化、编译或部署,但需要验证编译后模型精度是否满足预期。

  • 模型在后摩M50设备上可以正常运行,但推理速度、吞吐率或端到端延迟不达预期。

  • 小模型推理过程中 InputOutputInferenceEnd2Endqps 指标异常。

  • LLM/VLM 推理过程中 TTFTTPOTPrefill SpeedDecode SpeedE2E TPS 不达预期。

  • 需要区分性能问题来自主机侧前后处理、数据传输、模型计算、系统资源,还是测试配置不一致。

  • 调整量化策略、编译参数或图优化配置后,需要重新验证性能和精度结果。

  • 需要将性能评测结果、Profiler 数据、模型文件和编译配置提供给技术支持工程师进一步分析。